Запуск языковой модели на своём компьютере — приватность, офлайн-режим и никаких лимитов запросов. Разбираем минимальный старт.

Что понадобится

  • 8 ГБ RAM — модели 3–7B в квантованном виде (Q4);
  • 16 ГБ RAM — комфортная работа с моделями 7–13B;
  • видеокарта ускоряет генерацию, но не обязательна.

Самый простой путь: Ollama

Ollama ставится одной командой и тянет модели по аналогии с docker pull:

# установка (Linux)
curl -fsSL https://ollama.com/install.sh | sh

# загрузить и запустить модель
ollama run llama3.1:8b

# список локальных моделей
ollama list

После запуска модель доступна и через API на http://localhost:11434 — её можно подключать к своим скриптам и редакторам.

Альтернативы

  • LM Studio — графический интерфейс, удобно для первого знакомства;
  • llama.cpp — максимальный контроль и производительность на CPU;
  • Open WebUI — веб-интерфейс поверх Ollama, похож на ChatGPT.

С чего начать

Возьмите модель 7–8B в квантовании Q4 — это разумный баланс качества и требований. Дальше подбирайте под задачу: для кода — специализированные модели, для текста — универсальные.