KoboldCpp — без водяных знаков программа, злая находка
Категория: AI-инструменты · Лицензия: AGPL · Платформа: Windows / macOS / Linux (зависит от программы)
⬇ Скачать с официального сайтаKoboldCpp — это локальный сервер для LLM с веб-интерфейсом, заточенный под ролеплей, креативное письмо и интерактивные истории. Форк llama.cpp со своим UI поверх (Kobold Lite), один бинарник, без зависимостей, без установки. Лицензия AGPL, основной разработчик — LostRuins.
Главная киллер-фича
Одна exe-шка под Windows. Одна на macOS. Одна на Linux. Качаешь, скачиваешь GGUF-модель, запускаешь — открывается браузер с UI. Никаких pip, никаких CUDA-зависимостей в системе (всё уже линковано внутрь), никаких docker-контейнеров.
Что внутри
- llama.cpp как движок инференса.
- Поддержка квантизаций GGUF: Q2, Q3, Q4, Q5, Q6, Q8 в разных вариантах (K_M, K_S, IQ-варианты для intelligent quantization).
- GPU offload: CUDA (NVIDIA), Vulkan (универсальный), CLBlast (OpenCL), Metal (Apple). Можно частично — N слоёв на GPU, остальное на CPU.
- Контекст до 128k+ токенов для совместимых моделей, с RoPE scaling и YaRN.
- Stable Diffusion интеграция — генерация картинок параллельно с текстом (через тот же UI).
- Whisper интеграция — голосовой ввод и TTS.
- OpenAI-совместимый API для использования с Silly Tavern, Open WebUI, или своими скриптами.
Kobold Lite UI
Три режима:
- Story — творческое письмо, классический Kobold-режим. Модель продолжает текст с того места, где ты остановился.
- Adventure — текстовая игра в стиле AI Dungeon. Действия от первого/второго лица, модель ведёт повествование.
- Chat — диалог с персонажем, можно с карточками персонажей (Tavern card format) — портрет, био, примеры реплик.
- Instruct — ассистент-режим, как в ChatGPT, с системным промптом.
World Info / Memory / Author's Note
Это то, чего нет в Jan, Ollama и большинстве «обычных» клиентов. World Info — лор-база с триггерами по ключевым словам, которая подмешивается в контекст только когда упоминается. Memory — фиксированный текст, всегда в начале промпта. Author's Note — инструкция стилю, всегда в конце. Это даёт долгие связные сессии письма на десятки тысяч токенов, не разваливающиеся в кашу.
Железо
Для 7B модели в Q4_K_M хватит 8 GB RAM (CPU-only) или 6 GB VRAM. Для 13B — 16 GB RAM или 10 GB VRAM. Для 70B — 64 GB RAM или 48 GB VRAM, на потребительском железе крутится со скоростью улитки.
Где жмёт
UI выглядит как из 2010-х — функционально, но не красиво. Подходит ли это тебе — вопрос вкуса. Сообщество вокруг проекта в основном — фанаты ролеплея и эротической фикшн, что не всем по душе, но сам инструмент нейтральный.
Установка
Релизы — на github.com/LostRuins/koboldcpp/releases. Бери самый свежий koboldcpp.exe (Windows) или koboldcpp-linux-x64-cuda1210 / koboldcpp-mac-arm64. Запускаешь — мастер настроек, выбираешь backend, выбираешь модель, поехали.
Модели бери на Hugging Face. Хорошие старты — Llama-3.1-8B-Instruct-GGUF, Mistral-Nemo-Instruct-2407-GGUF, Qwen2.5-14B-Instruct-GGUF в Q4_K_M или Q5_K_M.
| Название | KoboldCpp |
| Категория | AI-инструменты |
| Лицензия | AGPL |
| Официальный сайт | https://github.com/LostRuins/koboldcpp/releases |
| Цена | 0 ₽ — программа бесплатная |
| Языки | Русский, английский и десятки других (зависит от сборки) |
