Запуск языковой модели на своём компьютере — приватность, офлайн-режим и никаких лимитов запросов. Разбираем минимальный старт.
Что понадобится
- 8 ГБ RAM — модели 3–7B в квантованном виде (Q4);
- 16 ГБ RAM — комфортная работа с моделями 7–13B;
- видеокарта ускоряет генерацию, но не обязательна.
Самый простой путь: Ollama
Ollama ставится одной командой и тянет модели по аналогии с docker pull:
# установка (Linux)
curl -fsSL https://ollama.com/install.sh | sh
# загрузить и запустить модель
ollama run llama3.1:8b
# список локальных моделей
ollama list
После запуска модель доступна и через API на http://localhost:11434 — её можно подключать к своим скриптам и редакторам.
Альтернативы
- LM Studio — графический интерфейс, удобно для первого знакомства;
- llama.cpp — максимальный контроль и производительность на CPU;
- Open WebUI — веб-интерфейс поверх Ollama, похож на ChatGPT.
С чего начать
Возьмите модель 7–8B в квантовании Q4 — это разумный баланс качества и требований. Дальше подбирайте под задачу: для кода — специализированные модели, для текста — универсальные.