llama.cpp — open-source программа, нежная находка
Категория: AI-инструменты · Лицензия: MIT · Платформа: Windows / macOS / Linux (зависит от программы)
⬇ Скачать с официального сайтаllama.cpp — фундамент, на котором стоит весь локальный ИИ
Почти каждое приложение, позволяющее запустить языковую модель на домашнем компьютере, внутри содержит llama.cpp. Оболочки меняются, интерфейсы приходят и уходят, а вычислительное ядро остаётся одно. Проект начался как эксперимент — можно ли заставить большую модель работать на ноутбуке без видеокарты — и ответ оказался утвердительным.
Ключевая идея
Квантование. Веса модели, изначально хранящиеся в шестнадцатибитных числах, пересчитываются в четыре, пять, шесть или восемь бит. Размер файла падает в три-четыре раза, потребление памяти вместе с ним, а качество ответов проседает удивительно мало. Именно это превратило запуск моделей из серверной задачи в бытовую.
Второе — формат GGUF. Один файл содержит и веса, и словарь, и метаданные, и шаблон диалога. Ничего не надо докачивать и настраивать: скачал файл, указал путь, работает.
Что входит в комплект
llama-cli — консольный запуск с полным набором параметров генерации: температура, top-k, top-p, min-p, штрафы за повторы, mirostat, размер контекста, число слоёв на видеокарте, размер пакета.
llama-server — HTTP-сервер с API, совместимым по формату с OpenAI, встроенной веб-страницей для чата, поддержкой параллельных запросов, потоковой выдачи и кеширования контекста между обращениями.
llama-quantize — превращение исходной модели в квантованный GGUF нужного уровня.
llama-bench — измерение производительности на вашем железе: сколько токенов в секунду на обработке промпта и на генерации.
Плюс утилиты для эмбеддингов, для перплексии, для слияния LoRA с базовой моделью.
Ускорение
CUDA на NVIDIA, Metal на Apple Silicon, ROCm на AMD, Vulkan как универсальный вариант, SYCL для Intel. На процессоре задействуются AVX2 и AVX-512. Модель можно разделить между видеопамятью и оперативной, отдав видеокарте столько слоёв, сколько влезает.
Возможности сверх текста
Мультимодальные модели с распознаванием изображений, грамматики GBNF для принудительного вывода строго в JSON или по заданной схеме, спекулятивное декодирование для ускорения, работа с несколькими моделями одновременно.
Реальность
Это инструмент разработчика: командная строка, флаги, компиляция или готовые сборки из релизов. Обновляется очень часто, интерфейс аргументов иногда меняется. Если нужна кнопка — берите оболочку. Если нужен контроль — вы уже на месте.
Платформы и лицензия
Windows, Linux, macOS, Android, Raspberry Pi. MIT, бесплатно, открытый код.
⬇ Скачать с официального сайта| Название | llama.cpp |
| Категория | AI-инструменты |
| Лицензия | MIT |
| Официальный сайт | https://github.com/ggerganov/llama.cpp/releases |
| Цена | 0 ₽ — программа бесплатная |
| Языки | Русский, английский и десятки других (зависит от сборки) |
