Back to apps
ChibyooShell — SSH & Server Monitor

Last updated: сентябрь 1, 2026

Как запустить Llama 3 локально: полный гайд с Ollama

Мета-описание: Пошаговый гайд по запуску Llama 3 локально через Ollama на Linux, macOS и Windows. Требования к железу, установка, настройка API, удалённый сервер — всё в одной статье.


Локальный запуск больших языковых моделей перестал быть уделом исследователей с серверными стойками. Сегодня Llama 3.1 8B спокойно работает на ноутбуке с 16 ГБ RAM, а Llama 3.3 70B — на домашнем ПК с RTX 4090. Разберём всё по шагам: от проверки железа до первого запроса через API.


Содержание

  1. Что такое Llama 3 и зачем запускать её локально
  2. Требования к железу — VRAM, RAM, процессор
  3. Что такое Ollama и почему именно она
  4. Установка Ollama: Linux, macOS, Windows
  5. Скачиваем и запускаем модель
  6. Выбор нужной версии: 8B, 70B, квантизация
  7. Работа через командную строку
  8. API-сервер: подключаемся из своих приложений
  9. Запуск на удалённом сервере и доступ с телефона
  10. Полезные команды и настройки
  11. Частые проблемы и их решения

1. Что такое Llama 3 и зачем запускать её локально

Llama 3 — семейство открытых языковых моделей от Meta. В отличие от GPT-4 или Claude, веса моделей Llama распространяются свободно: скачать, запустить, модифицировать можно без подписок и API-ключей.

Актуальное семейство на 2026 год:

  • Llama 3.2 1B / 3B — сверхлёгкие модели для слабого железа и edge-устройств
  • Llama 3.1 8B — рабочая лошадка. Отлично работает на большинстве современных ноутбуков
  • Llama 3.3 70B — уровень GPT-4o для большинства задач, но требует серьёзного железа
  • Llama 3.1 405B — топ открытого рынка, нужен GPU-кластер

Зачем запускать локально, а не через API?

  • Приватность — данные не покидают ваш компьютер. Особенно важно при работе с корпоративными документами, кодом, личными данными
  • Стоимость — нулевая цена за токены. Можно гонять модель сутками без счёта
  • Офлайн — работает без интернета, в самолёте, на даче, на изолированном сервере
  • Контроль — сами выбираете модель, квантизацию, параметры генерации
  • Задержка — на хорошем железе локальный инференс быстрее, чем ждать ответа от перегруженного API

2. Требования к железу

Перед установкой важно понять, какая модель реально запустится на вашем железе. Ключевой параметр — VRAM (память видеокарты) или RAM (для Apple Silicon, где память унифицирована).

Простое правило: модель должна целиком поместиться в VRAM. Если не помещается — Ollama выгрузит часть слоёв в RAM, инференс замедлится в 5–20 раз.

Примерные требования для Llama 3 при квантизации Q5_K_M:

Модель VRAM / RAM
Llama 3.2 1B ~1.5 ГБ
Llama 3.2 3B ~2.5 ГБ
Llama 3.1 8B ~5.5 ГБ
Llama 3.3 70B ~48 ГБ
Llama 3.1 405B ~270 ГБ

Точные цифры для любой модели и квантизации — считает AI Hardware Calculator. Введите модель, выберите квантизацию — получите точный расчёт VRAM, KV-кэша и рекомендации по железу.

Что подойдёт для Llama 3.1 8B:

  • Любая видеокарта с 8+ ГБ VRAM: RTX 3060 12GB, RTX 4060, RX 7700 XT
  • Apple Silicon: M1/M2/M3 с 8+ ГБ unified memory
  • Можно запустить и на CPU — медленно, но работает

Что подойдёт для Llama 3.3 70B:

  • RTX 3090 / 4090 (24 ГБ) — не хватит, модель частично уйдёт в RAM
  • Apple M2 Ultra / M3 Ultra (64–192 ГБ) — идеально
  • 2× RTX 3090 в NVLink — 48 ГБ, почти влезает при Q4
  • RTX A6000 48GB — влезает при Q4_K_M

3. Что такое Ollama

Ollama — инструмент командной строки, который берёт на себя всю сложность запуска LLM: скачивает модели из реестра, управляет квантизацией, запускает HTTP-сервер с OpenAI-совместимым API, следит за использованием GPU.

По сути это Docker, но для языковых моделей.

Почему Ollama, а не llama.cpp напрямую?

llama.cpp — низкоуровневый движок, на котором Ollama и работает под капотом. Разница в удобстве: с llama.cpp нужно самому компилировать бинарник, вручную скачивать GGUF-файлы, прописывать флаги запуска. Ollama делает это одной командой. Для production и максимальной производительности llama.cpp даёт чуть больше контроля, но для большинства задач Ollama — правильный выбор.


4. Установка Ollama

Linux

Официальный скрипт установки — одна команда:

curl -fsSL https://ollama.com/install.sh | sh

Скрипт автоматически определит наличие CUDA (NVIDIA) или ROCm (AMD) и установит нужные компоненты. После установки Ollama запускается как systemd-сервис и стартует автоматически при загрузке системы.

Проверяем:

ollama --version
systemctl status ollama

NVIDIA GPU: убедитесь, что установлены драйверы NVIDIA версии 525+ и CUDA Toolkit. Ollama сам подтянет нужные библиотеки, но драйвер должен быть на месте.

nvidia-smi  # проверяем что GPU виден

AMD GPU (ROCm): поддерживается начиная с RX 6000-й серии. Установка та же, Ollama автоматически определит ROCm.

Без GPU (CPU only): работает, но медленно — 1–5 токенов в секунду для 8B модели. Для тестирования подойдёт.


macOS

Скачайте приложение с официального сайта ollama.com — это обычный .dmg-файл. После установки Ollama живёт в строке меню и запускает фоновый сервис автоматически.

Или через Homebrew:

brew install ollama
ollama serve  # запустить сервер вручную

На Apple Silicon (M1/M2/M3/M4) Ollama использует Metal для ускорения через GPU и работает с унифицированной памятью. Это значит, что если у вас MacBook Pro M2 с 32 ГБ RAM — эти 32 ГБ доступны модели как VRAM.


Windows

Скачайте установщик OllamaSetup.exe с ollama.com. Поддерживается Windows 10/11. После установки Ollama появится в трее.

Для GPU-ускорения нужны актуальные драйверы NVIDIA (CUDA) или AMD.

В WSL2 Ollama тоже работает — при этом видит GPU хоста через CUDA в WSL.


5. Скачиваем и запускаем первую модель

После установки — одна команда для запуска:

ollama run llama3.1

Ollama скачает модель (8B в формате Q4_K_M, ~4.7 ГБ) и сразу откроет интерактивный чат в терминале. Первый запуск занимает время — ждём загрузки.

>>> Привет! Что умеешь?
Привет! Я языковая модель Llama 3.1...

Для выхода из чата — /bye или Ctrl+D.

Если модель уже скачана — запускается мгновенно, без повторной загрузки.


6. Выбор версии и квантизации

Доступные варианты Llama 3 в реестре Ollama

ollama run llama3.2:1b       # 1B — минимальные требования
ollama run llama3.2:3b       # 3B — быстрая, лёгкая
ollama run llama3.1:8b       # 8B — оптимальный выбор для большинства
ollama run llama3.3:70b      # 70B — высокое качество
ollama run llama3.1:405b     # 405B — максимум, нужен кластер

Посмотреть все доступные теги:

ollama show llama3.1 --modelinfo

Квантизация: что выбрать

По умолчанию Ollama скачивает Q4_K_M. Если хотите другой уровень — указывайте явно:

ollama run llama3.1:8b-instruct-q5_K_M   # Q5 — лучше качество
ollama run llama3.1:8b-instruct-q8_0     # Q8 — почти без потерь
ollama run llama3.1:8b-instruct-fp16     # FP16 — полное качество, 16 ГБ VRAM

Практический совет: для повседневных задач Q5_K_M — оптимальный выбор. Разница с FP16 в качестве ответов минимальна, а размер модели на 38% меньше. Q4_K_M берите если VRAM в обрез. Q8 и FP16 — только если задача критична к точности и железо позволяет.

Точный расчёт памяти для любой комбинации модели и квантизации — AI Hardware Calculator.

Посмотреть скачанные модели

ollama list

Удалить модель

ollama rm llama3.1:8b

7. Работа через командную строку

Одиночный запрос без интерактивного чата

ollama run llama3.1:8b "Объясни разницу между TCP и UDP за 3 предложения"

Передача текста через pipe

cat README.md | ollama run llama3.1:8b "Напиши краткое резюме этого документа"
git diff HEAD~1 | ollama run llama3.1:8b "Проверь этот diff на очевидные ошибки"

Системный промпт

ollama run llama3.1:8b --system "Ты опытный Linux-администратор. Отвечай кратко и по делу, приводи конкретные команды." "Как найти процесс который занимает больше всего памяти?"

Параметры генерации

ollama run llama3.1:8b \
  --temperature 0.2 \   # меньше = детерминированнее, больше = креативнее
  --num-predict 500 \   # максимум токенов в ответе
  --ctx-size 8192 \     # размер контекстного окна
  "Напиши функцию на Python для парсинга JSON с обработкой ошибок"

Создание кастомного Modelfile

Если нужна модель с фиксированным системным промптом и параметрами — создайте Modelfile:

FROM llama3.1:8b

SYSTEM """
Ты — ассистент для написания кода. Всегда объясняй что делает код.
Предпочитай простые решения сложным. Язык: русский.
"""

PARAMETER temperature 0.3
PARAMETER num_predict 2048
ollama create my-coder -f Modelfile
ollama run my-coder "Напиши скрипт для резервного копирования директории"

8. API-сервер: подключаемся из своих приложений

Ollama автоматически запускает HTTP-сервер на порту 11434. API полностью совместим с форматом OpenAI — большинство библиотек и инструментов работают без изменений, просто меняете base URL.

Прямой запрос через curl

curl http://localhost:11434/api/generate \
  -d '{
    "model": "llama3.1:8b",
    "prompt": "Что такое Docker?",
    "stream": false
  }'

OpenAI-совместимый endpoint

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1:8b",
    "messages": [
      {"role": "system", "content": "Отвечай кратко"},
      {"role": "user", "content": "Что такое квантизация модели?"}
    ]
  }'

Python — через openai библиотеку

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",  # обязательный параметр, но значение не важно
)

response = client.chat.completions.create(
    model="llama3.1:8b",
    messages=[
        {"role": "user", "content": "Напиши hello world на Go"}
    ]
)

print(response.choices[0].message.content)

JavaScript / Node.js

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "http://localhost:11434/v1",
  apiKey: "ollama",
});

const response = await client.chat.completions.create({
  model: "llama3.1:8b",
  messages: [{ role: "user", content: "Привет!" }],
});

console.log(response.choices[0].message.content);

Подключение сторонних инструментов

Большинство LLM-инструментов поддерживают Ollama из коробки или через смену base URL:

  • Continue (плагин для VS Code/JetBrains) — автодополнение кода локально
  • Open WebUI — веб-интерфейс в стиле ChatGPT, запускается в Docker
  • LangChain / LlamaIndex — есть нативный Ollama-провайдер
  • Cursor — через custom API endpoint

9. Запуск на удалённом сервере и доступ с телефона

Часто имеет смысл держать Ollama на мощном домашнем сервере или VPS, а обращаться к нему с ноутбука или телефона.

Настройка Ollama для приёма внешних запросов

По умолчанию Ollama слушает только localhost. Чтобы принимать запросы с других машин:

# Linux — через systemd
sudo systemctl edit ollama

Добавляем в открывшийся файл:

[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload
sudo systemctl restart ollama

Или через переменную окружения при ручном запуске:

OLLAMA_HOST=0.0.0.0:11434 ollama serve

Безопасный доступ через SSH-туннель

Открывать порт 11434 напрямую в интернет — плохая идея, никакой авторизации нет. Правильный способ — SSH-туннель:

ssh -L 11434:localhost:11434 user@your-server.com

После этого на локальной машине http://localhost:11434 работает как если бы Ollama была запущена локально — но трафик идёт через зашифрованный SSH-туннель.

Мониторинг сервера и управление Ollama с телефона

Если Ollama крутится на удалённом Linux-сервере — удобно иметь мобильный доступ к нему. ChibyooShell решает это из коробки: SSH-терминал, мониторинг CPU/RAM/диска в реальном времени, управление Docker-контейнерами — всё с iPhone.

Типичный сценарий: запустил на сервере ollama run llama3.3:70b для долгой задачи, закрыл ноутбук, проверяешь загрузку GPU и статус через ChibyooShell прямо из телефона.

Docker-запуск Ollama

Если предпочитаете контейнеры:

# NVIDIA GPU
docker run -d \
  --gpus=all \
  -v ollama:/root/.ollama \
  -p 11434:11434 \
  --name ollama \
  ollama/ollama

# CPU only
docker run -d \
  -v ollama:/root/.ollama \
  -p 11434:11434 \
  --name ollama \
  ollama/ollama

После запуска контейнера — команды выполняем внутри:

docker exec -it ollama ollama run llama3.1:8b

10. Полезные команды и настройки

Управление моделями

ollama list                    # список скачанных моделей
ollama ps                      # запущенные модели (сколько VRAM занимают)
ollama show llama3.1:8b        # детали модели
ollama pull llama3.1:8b        # скачать без запуска
ollama rm llama3.1:8b          # удалить модель
ollama cp llama3.1:8b my-model # скопировать как базу для кастомной

Переменные окружения

OLLAMA_HOST=0.0.0.0:11434      # адрес и порт сервера
OLLAMA_MODELS=/data/ollama     # путь для хранения моделей (по умолчанию ~/.ollama/models)
OLLAMA_NUM_PARALLEL=4          # параллельные запросы
OLLAMA_MAX_LOADED_MODELS=2     # сколько моделей держать в памяти одновременно
OLLAMA_GPU_OVERHEAD=512        # резерв VRAM в МБ (полезно если модель не влезает)

Где хранятся модели

Linux/macOS:  ~/.ollama/models/
Windows:      C:\Users\<user>\.ollama\models\

Можно перенести на другой диск через переменную OLLAMA_MODELS — удобно если системный диск маленький.

Проверка использования GPU

# NVIDIA
nvidia-smi

# Или через ollama
ollama ps
# Покажет: модель, размер, процент использования GPU

11. Частые проблемы и решения

Модель не видит GPU, работает на CPU

# Проверяем что Ollama видит GPU
ollama run llama3.1:8b
# В начале вывода должно быть что-то вроде:
# nvidia: found 1 device(s)

# Если нет — проверяем драйверы
nvidia-smi

На Linux убедитесь что пользователь, от которого запущена Ollama, имеет доступ к устройствам GPU. Обычно достаточно добавить в группу render и video:

sudo usermod -aG render,video $USER

Не хватает VRAM — модель тормозит

Ollama автоматически выгрузит часть слоёв в RAM. Это работает, но медленно. Варианты решения:

  1. Выбрать более агрессивную квантизацию (Q4 вместо Q5, Q3 в крайнем случае)
  2. Взять меньшую модель (8B вместо 70B)
  3. Уменьшить размер контекста: --ctx-size 4096 вместо 32768
  4. Добавить OLLAMA_GPU_OVERHEAD=256 чтобы Ollama точнее считала доступную VRAM

Рассчитать точные требования до запуска: AI Hardware Calculator.

Ошибка «context length exceeded»

# Увеличиваем контекстное окно
ollama run llama3.1:8b --ctx-size 32768 "очень длинный промпт..."

Помните что каждый токен контекста занимает VRAM в KV-кэше. При 32K контексте для 8B модели нужно дополнительно ~3 ГБ VRAM.

Медленная генерация на Apple Silicon

Убедитесь что Ollama использует Metal (GPU), а не CPU:

ollama run llama3.1:8b
# В выводе должно быть: metal: enabled

Если Metal не используется — переустановите Ollama из официального .dmg, не через brew.

Порт 11434 уже занят

# Проверяем что занимает порт
lsof -i :11434

# Меняем порт
OLLAMA_HOST=0.0.0.0:11435 ollama serve

Ollama не запускается как сервис на Linux

# Смотрим логи
journalctl -u ollama -f

# Перезапускаем
sudo systemctl restart ollama

# Если сервис не создан — создаём вручную
sudo tee /etc/systemd/system/ollama.service << 'SERVICE'
[Unit]
Description=Ollama Service
After=network-online.target

[Service]
ExecStart=/usr/local/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3

[Install]
WantedBy=default.target
SERVICE

sudo systemctl daemon-reload
sudo systemctl enable --now ollama

Итого

Мы прошли полный путь: от проверки железа до работающего API-сервера с доступом с мобильного. Ollama делает запуск Llama 3 максимально простым — большинство сложностей (компиляция, управление GGUF-файлами, GPU-оффлоадинг) скрыты за одной командой.

Быстрый старт для нетерпеливых:

# Установка (Linux)
curl -fsSL https://ollama.com/install.sh | sh

# Первый запуск
ollama run llama3.1:8b

Дальше — экспериментируйте с моделями. Llama 3.1 8B подходит для большинства повседневных задач: написание кода, объяснение документации, суммаризация текстов. Для более сложных задач — пробуйте Llama 3.3 70B или Qwen 2.5 32B если позволяет железо.

Не знаете какая модель влезет в ваш GPU? AI Hardware Calculator посчитает точные требования к VRAM и RAM для любой модели и квантизации.

Держите Ollama на удалённом сервере и хотите удобный мобильный мониторинг? ChibyooShell — SSH-клиент и монитор серверов для iPhone с Docker-управлением и SFTP.