Как запустить Llama 3 локально: полный гайд с Ollama
Мета-описание: Пошаговый гайд по запуску Llama 3 локально через Ollama на Linux, macOS и Windows. Требования к железу, установка, настройка API, удалённый сервер — всё в одной статье.
Локальный запуск больших языковых моделей перестал быть уделом исследователей с серверными стойками. Сегодня Llama 3.1 8B спокойно работает на ноутбуке с 16 ГБ RAM, а Llama 3.3 70B — на домашнем ПК с RTX 4090. Разберём всё по шагам: от проверки железа до первого запроса через API.
Содержание
- Что такое Llama 3 и зачем запускать её локально
- Требования к железу — VRAM, RAM, процессор
- Что такое Ollama и почему именно она
- Установка Ollama: Linux, macOS, Windows
- Скачиваем и запускаем модель
- Выбор нужной версии: 8B, 70B, квантизация
- Работа через командную строку
- API-сервер: подключаемся из своих приложений
- Запуск на удалённом сервере и доступ с телефона
- Полезные команды и настройки
- Частые проблемы и их решения
1. Что такое Llama 3 и зачем запускать её локально
Llama 3 — семейство открытых языковых моделей от Meta. В отличие от GPT-4 или Claude, веса моделей Llama распространяются свободно: скачать, запустить, модифицировать можно без подписок и API-ключей.
Актуальное семейство на 2026 год:
- Llama 3.2 1B / 3B — сверхлёгкие модели для слабого железа и edge-устройств
- Llama 3.1 8B — рабочая лошадка. Отлично работает на большинстве современных ноутбуков
- Llama 3.3 70B — уровень GPT-4o для большинства задач, но требует серьёзного железа
- Llama 3.1 405B — топ открытого рынка, нужен GPU-кластер
Зачем запускать локально, а не через API?
- Приватность — данные не покидают ваш компьютер. Особенно важно при работе с корпоративными документами, кодом, личными данными
- Стоимость — нулевая цена за токены. Можно гонять модель сутками без счёта
- Офлайн — работает без интернета, в самолёте, на даче, на изолированном сервере
- Контроль — сами выбираете модель, квантизацию, параметры генерации
- Задержка — на хорошем железе локальный инференс быстрее, чем ждать ответа от перегруженного API
2. Требования к железу
Перед установкой важно понять, какая модель реально запустится на вашем железе. Ключевой параметр — VRAM (память видеокарты) или RAM (для Apple Silicon, где память унифицирована).
Простое правило: модель должна целиком поместиться в VRAM. Если не помещается — Ollama выгрузит часть слоёв в RAM, инференс замедлится в 5–20 раз.
Примерные требования для Llama 3 при квантизации Q5_K_M:
| Модель | VRAM / RAM |
|---|---|
| Llama 3.2 1B | ~1.5 ГБ |
| Llama 3.2 3B | ~2.5 ГБ |
| Llama 3.1 8B | ~5.5 ГБ |
| Llama 3.3 70B | ~48 ГБ |
| Llama 3.1 405B | ~270 ГБ |
Точные цифры для любой модели и квантизации — считает AI Hardware Calculator. Введите модель, выберите квантизацию — получите точный расчёт VRAM, KV-кэша и рекомендации по железу.
Что подойдёт для Llama 3.1 8B:
- Любая видеокарта с 8+ ГБ VRAM: RTX 3060 12GB, RTX 4060, RX 7700 XT
- Apple Silicon: M1/M2/M3 с 8+ ГБ unified memory
- Можно запустить и на CPU — медленно, но работает
Что подойдёт для Llama 3.3 70B:
- RTX 3090 / 4090 (24 ГБ) — не хватит, модель частично уйдёт в RAM
- Apple M2 Ultra / M3 Ultra (64–192 ГБ) — идеально
- 2× RTX 3090 в NVLink — 48 ГБ, почти влезает при Q4
- RTX A6000 48GB — влезает при Q4_K_M
3. Что такое Ollama
Ollama — инструмент командной строки, который берёт на себя всю сложность запуска LLM: скачивает модели из реестра, управляет квантизацией, запускает HTTP-сервер с OpenAI-совместимым API, следит за использованием GPU.
По сути это Docker, но для языковых моделей.
Почему Ollama, а не llama.cpp напрямую?
llama.cpp — низкоуровневый движок, на котором Ollama и работает под капотом. Разница в удобстве: с llama.cpp нужно самому компилировать бинарник, вручную скачивать GGUF-файлы, прописывать флаги запуска. Ollama делает это одной командой. Для production и максимальной производительности llama.cpp даёт чуть больше контроля, но для большинства задач Ollama — правильный выбор.
4. Установка Ollama
Linux
Официальный скрипт установки — одна команда:
curl -fsSL https://ollama.com/install.sh | sh
Скрипт автоматически определит наличие CUDA (NVIDIA) или ROCm (AMD) и установит нужные компоненты. После установки Ollama запускается как systemd-сервис и стартует автоматически при загрузке системы.
Проверяем:
ollama --version
systemctl status ollama
NVIDIA GPU: убедитесь, что установлены драйверы NVIDIA версии 525+ и CUDA Toolkit. Ollama сам подтянет нужные библиотеки, но драйвер должен быть на месте.
nvidia-smi # проверяем что GPU виден
AMD GPU (ROCm): поддерживается начиная с RX 6000-й серии. Установка та же, Ollama автоматически определит ROCm.
Без GPU (CPU only): работает, но медленно — 1–5 токенов в секунду для 8B модели. Для тестирования подойдёт.
macOS
Скачайте приложение с официального сайта ollama.com — это обычный .dmg-файл. После установки Ollama живёт в строке меню и запускает фоновый сервис автоматически.
Или через Homebrew:
brew install ollama
ollama serve # запустить сервер вручную
На Apple Silicon (M1/M2/M3/M4) Ollama использует Metal для ускорения через GPU и работает с унифицированной памятью. Это значит, что если у вас MacBook Pro M2 с 32 ГБ RAM — эти 32 ГБ доступны модели как VRAM.
Windows
Скачайте установщик OllamaSetup.exe с ollama.com. Поддерживается Windows 10/11. После установки Ollama появится в трее.
Для GPU-ускорения нужны актуальные драйверы NVIDIA (CUDA) или AMD.
В WSL2 Ollama тоже работает — при этом видит GPU хоста через CUDA в WSL.
5. Скачиваем и запускаем первую модель
После установки — одна команда для запуска:
ollama run llama3.1
Ollama скачает модель (8B в формате Q4_K_M, ~4.7 ГБ) и сразу откроет интерактивный чат в терминале. Первый запуск занимает время — ждём загрузки.
>>> Привет! Что умеешь?
Привет! Я языковая модель Llama 3.1...
Для выхода из чата — /bye или Ctrl+D.
Если модель уже скачана — запускается мгновенно, без повторной загрузки.
6. Выбор версии и квантизации
Доступные варианты Llama 3 в реестре Ollama
ollama run llama3.2:1b # 1B — минимальные требования
ollama run llama3.2:3b # 3B — быстрая, лёгкая
ollama run llama3.1:8b # 8B — оптимальный выбор для большинства
ollama run llama3.3:70b # 70B — высокое качество
ollama run llama3.1:405b # 405B — максимум, нужен кластер
Посмотреть все доступные теги:
ollama show llama3.1 --modelinfo
Квантизация: что выбрать
По умолчанию Ollama скачивает Q4_K_M. Если хотите другой уровень — указывайте явно:
ollama run llama3.1:8b-instruct-q5_K_M # Q5 — лучше качество
ollama run llama3.1:8b-instruct-q8_0 # Q8 — почти без потерь
ollama run llama3.1:8b-instruct-fp16 # FP16 — полное качество, 16 ГБ VRAM
Практический совет: для повседневных задач Q5_K_M — оптимальный выбор. Разница с FP16 в качестве ответов минимальна, а размер модели на 38% меньше. Q4_K_M берите если VRAM в обрез. Q8 и FP16 — только если задача критична к точности и железо позволяет.
Точный расчёт памяти для любой комбинации модели и квантизации — AI Hardware Calculator.
Посмотреть скачанные модели
ollama list
Удалить модель
ollama rm llama3.1:8b
7. Работа через командную строку
Одиночный запрос без интерактивного чата
ollama run llama3.1:8b "Объясни разницу между TCP и UDP за 3 предложения"
Передача текста через pipe
cat README.md | ollama run llama3.1:8b "Напиши краткое резюме этого документа"
git diff HEAD~1 | ollama run llama3.1:8b "Проверь этот diff на очевидные ошибки"
Системный промпт
ollama run llama3.1:8b --system "Ты опытный Linux-администратор. Отвечай кратко и по делу, приводи конкретные команды." "Как найти процесс который занимает больше всего памяти?"
Параметры генерации
ollama run llama3.1:8b \
--temperature 0.2 \ # меньше = детерминированнее, больше = креативнее
--num-predict 500 \ # максимум токенов в ответе
--ctx-size 8192 \ # размер контекстного окна
"Напиши функцию на Python для парсинга JSON с обработкой ошибок"
Создание кастомного Modelfile
Если нужна модель с фиксированным системным промптом и параметрами — создайте Modelfile:
FROM llama3.1:8b
SYSTEM """
Ты — ассистент для написания кода. Всегда объясняй что делает код.
Предпочитай простые решения сложным. Язык: русский.
"""
PARAMETER temperature 0.3
PARAMETER num_predict 2048
ollama create my-coder -f Modelfile
ollama run my-coder "Напиши скрипт для резервного копирования директории"
8. API-сервер: подключаемся из своих приложений
Ollama автоматически запускает HTTP-сервер на порту 11434. API полностью совместим с форматом OpenAI — большинство библиотек и инструментов работают без изменений, просто меняете base URL.
Прямой запрос через curl
curl http://localhost:11434/api/generate \
-d '{
"model": "llama3.1:8b",
"prompt": "Что такое Docker?",
"stream": false
}'
OpenAI-совместимый endpoint
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3.1:8b",
"messages": [
{"role": "system", "content": "Отвечай кратко"},
{"role": "user", "content": "Что такое квантизация модели?"}
]
}'
Python — через openai библиотеку
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # обязательный параметр, но значение не важно
)
response = client.chat.completions.create(
model="llama3.1:8b",
messages=[
{"role": "user", "content": "Напиши hello world на Go"}
]
)
print(response.choices[0].message.content)
JavaScript / Node.js
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "http://localhost:11434/v1",
apiKey: "ollama",
});
const response = await client.chat.completions.create({
model: "llama3.1:8b",
messages: [{ role: "user", content: "Привет!" }],
});
console.log(response.choices[0].message.content);
Подключение сторонних инструментов
Большинство LLM-инструментов поддерживают Ollama из коробки или через смену base URL:
- Continue (плагин для VS Code/JetBrains) — автодополнение кода локально
- Open WebUI — веб-интерфейс в стиле ChatGPT, запускается в Docker
- LangChain / LlamaIndex — есть нативный Ollama-провайдер
- Cursor — через custom API endpoint
9. Запуск на удалённом сервере и доступ с телефона
Часто имеет смысл держать Ollama на мощном домашнем сервере или VPS, а обращаться к нему с ноутбука или телефона.
Настройка Ollama для приёма внешних запросов
По умолчанию Ollama слушает только localhost. Чтобы принимать запросы с других машин:
# Linux — через systemd
sudo systemctl edit ollama
Добавляем в открывшийся файл:
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload
sudo systemctl restart ollama
Или через переменную окружения при ручном запуске:
OLLAMA_HOST=0.0.0.0:11434 ollama serve
Безопасный доступ через SSH-туннель
Открывать порт 11434 напрямую в интернет — плохая идея, никакой авторизации нет. Правильный способ — SSH-туннель:
ssh -L 11434:localhost:11434 user@your-server.com
После этого на локальной машине http://localhost:11434 работает как если бы Ollama была запущена локально — но трафик идёт через зашифрованный SSH-туннель.
Мониторинг сервера и управление Ollama с телефона
Если Ollama крутится на удалённом Linux-сервере — удобно иметь мобильный доступ к нему. ChibyooShell решает это из коробки: SSH-терминал, мониторинг CPU/RAM/диска в реальном времени, управление Docker-контейнерами — всё с iPhone.
Типичный сценарий: запустил на сервере ollama run llama3.3:70b для долгой задачи, закрыл ноутбук, проверяешь загрузку GPU и статус через ChibyooShell прямо из телефона.
Docker-запуск Ollama
Если предпочитаете контейнеры:
# NVIDIA GPU
docker run -d \
--gpus=all \
-v ollama:/root/.ollama \
-p 11434:11434 \
--name ollama \
ollama/ollama
# CPU only
docker run -d \
-v ollama:/root/.ollama \
-p 11434:11434 \
--name ollama \
ollama/ollama
После запуска контейнера — команды выполняем внутри:
docker exec -it ollama ollama run llama3.1:8b
10. Полезные команды и настройки
Управление моделями
ollama list # список скачанных моделей
ollama ps # запущенные модели (сколько VRAM занимают)
ollama show llama3.1:8b # детали модели
ollama pull llama3.1:8b # скачать без запуска
ollama rm llama3.1:8b # удалить модель
ollama cp llama3.1:8b my-model # скопировать как базу для кастомной
Переменные окружения
OLLAMA_HOST=0.0.0.0:11434 # адрес и порт сервера
OLLAMA_MODELS=/data/ollama # путь для хранения моделей (по умолчанию ~/.ollama/models)
OLLAMA_NUM_PARALLEL=4 # параллельные запросы
OLLAMA_MAX_LOADED_MODELS=2 # сколько моделей держать в памяти одновременно
OLLAMA_GPU_OVERHEAD=512 # резерв VRAM в МБ (полезно если модель не влезает)
Где хранятся модели
Linux/macOS: ~/.ollama/models/
Windows: C:\Users\<user>\.ollama\models\
Можно перенести на другой диск через переменную OLLAMA_MODELS — удобно если системный диск маленький.
Проверка использования GPU
# NVIDIA
nvidia-smi
# Или через ollama
ollama ps
# Покажет: модель, размер, процент использования GPU
11. Частые проблемы и решения
Модель не видит GPU, работает на CPU
# Проверяем что Ollama видит GPU
ollama run llama3.1:8b
# В начале вывода должно быть что-то вроде:
# nvidia: found 1 device(s)
# Если нет — проверяем драйверы
nvidia-smi
На Linux убедитесь что пользователь, от которого запущена Ollama, имеет доступ к устройствам GPU. Обычно достаточно добавить в группу render и video:
sudo usermod -aG render,video $USER
Не хватает VRAM — модель тормозит
Ollama автоматически выгрузит часть слоёв в RAM. Это работает, но медленно. Варианты решения:
- Выбрать более агрессивную квантизацию (Q4 вместо Q5, Q3 в крайнем случае)
- Взять меньшую модель (8B вместо 70B)
- Уменьшить размер контекста:
--ctx-size 4096вместо 32768 - Добавить
OLLAMA_GPU_OVERHEAD=256чтобы Ollama точнее считала доступную VRAM
Рассчитать точные требования до запуска: AI Hardware Calculator.
Ошибка «context length exceeded»
# Увеличиваем контекстное окно
ollama run llama3.1:8b --ctx-size 32768 "очень длинный промпт..."
Помните что каждый токен контекста занимает VRAM в KV-кэше. При 32K контексте для 8B модели нужно дополнительно ~3 ГБ VRAM.
Медленная генерация на Apple Silicon
Убедитесь что Ollama использует Metal (GPU), а не CPU:
ollama run llama3.1:8b
# В выводе должно быть: metal: enabled
Если Metal не используется — переустановите Ollama из официального .dmg, не через brew.
Порт 11434 уже занят
# Проверяем что занимает порт
lsof -i :11434
# Меняем порт
OLLAMA_HOST=0.0.0.0:11435 ollama serve
Ollama не запускается как сервис на Linux
# Смотрим логи
journalctl -u ollama -f
# Перезапускаем
sudo systemctl restart ollama
# Если сервис не создан — создаём вручную
sudo tee /etc/systemd/system/ollama.service << 'SERVICE'
[Unit]
Description=Ollama Service
After=network-online.target
[Service]
ExecStart=/usr/local/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
[Install]
WantedBy=default.target
SERVICE
sudo systemctl daemon-reload
sudo systemctl enable --now ollama
Итого
Мы прошли полный путь: от проверки железа до работающего API-сервера с доступом с мобильного. Ollama делает запуск Llama 3 максимально простым — большинство сложностей (компиляция, управление GGUF-файлами, GPU-оффлоадинг) скрыты за одной командой.
Быстрый старт для нетерпеливых:
# Установка (Linux)
curl -fsSL https://ollama.com/install.sh | sh
# Первый запуск
ollama run llama3.1:8b
Дальше — экспериментируйте с моделями. Llama 3.1 8B подходит для большинства повседневных задач: написание кода, объяснение документации, суммаризация текстов. Для более сложных задач — пробуйте Llama 3.3 70B или Qwen 2.5 32B если позволяет железо.
Не знаете какая модель влезет в ваш GPU? AI Hardware Calculator посчитает точные требования к VRAM и RAM для любой модели и квантизации.
Держите Ollama на удалённом сервере и хотите удобный мобильный мониторинг? ChibyooShell — SSH-клиент и монитор серверов для iPhone с Docker-управлением и SFTP.