Главная › Как запустить LLM локально
Руководство · практика

Как запустить LLM локально: Llama 70B и модели до 120B на своём сервере

Локальная нейросеть — это приватность, отсутствие оплаты за токены и работа без интернета. Разбираем по шагам: сколько нужно видеопамяти, какой движок выбрать и какую скорость реально ждать — на цифрах с наших сборок.

NextGen-PC · практическое руководство · 27.06.2026

Коротко: чтобы запустить большую модель локально, нужны три вещи — достаточно VRAM (для 70B в 4-bit ~40–48 ГБ, для 120B ~65–80 ГБ), файл модели (GGUF или safetensors) и движок (LM Studio / Ollama для старта, vLLM для продакшена). Одна игровая видеокарта большие модели не тянет — нужна многокарточная сборка. Наши связки 4× Tesla V100 и 4× A100 несут по 128 ГБ и запускают модели вплоть до 120B+.

«Локальный запуск» значит, что модель работает на вашем железе, а не в чужом облаке. Для бизнеса это три понятные выгоды: данные не уходят наружу (важно для юристов, медицины, финансов), нет платы за каждый токен, и система работает даже без интернета. Минус один — нужно железо с достаточной видеопамятью. Разберёмся, какое именно и как всё запустить.

Шаг 1. Посчитайте VRAM под модель

Главное ограничение — видеопамять (VRAM). Модель должна целиком поместиться в память видеокарт, плюс нужен запас под контекст (историю диалога). Ориентир для квантованных 4-bit моделей:

МодельНужно VRAM (≈4-bit)Что запустит
7–8B (лёгкая)~6–8 ГБпочти любая современная видеокарта
32–35B~20–24 ГБодна мощная карта или сборка
70B (Llama 3 70B)~40–48 ГБмногокарточная сборка
120–122B (MoE)~65–80 ГБсборка 4× V100 / A100 (128 ГБ)

Отсюда вывод: на одной потребительской карте (даже 24 ГБ) серьёзную модель не запустить — упрётесь в нехватку памяти (OOM). Нужна сборка с несколькими GPU и общим пулом памяти. Подробнее про выбор между картами — в нашем сравнении Tesla V100 и A100.

Шаг 2. Выберите движок

Движок — это программа, которая загружает модель в видеопамять и генерирует ответы. Три рабочих варианта:

LM Studio — самый простой старт

Графическое приложение: выбрал модель из каталога, скачал, передвинул ползунок выгрузки слоёв на GPU на максимум, включил Flash Attention — и общаешься. Формат GGUF. Идеален для одного пользователя и знакомства с локальными моделями.

Ollama — запуск из командной строки

Минималистичный инструмент: ollama run llama3 — и модель уже отвечает. Удобен, когда нужно быстро поднять модель и дёргать её по API из своего кода.

vLLM — для продакшена и многих пользователей

Серверный движок с максимальной пропускной способностью. Умеет раздавать одну модель на несколько GPU (tensor-parallel) и держать десятки одновременных запросов, отдаёт OpenAI-совместимый API. Именно на vLLM сделаны наши замеры скорости. Если планируете сервис или внутренний ИИ на всю компанию — это ваш выбор.

Шаг 3. Запустите модель

На примере многокарточной сборки. В LM Studio достаточно интерфейса: загрузить модель и выставить выгрузку всех слоёв на GPU. Для vLLM запуск на 4 картах выглядит так:

# раздать модель на 4 GPU, контекст 8k, OpenAI-совместимый API на порту 8000
vllm serve Qwen/Qwen2.5-32B-Instruct-AWQ \
  --tensor-parallel-size 4 \
  --max-model-len 8192

После старта к серверу можно обращаться как к обычному OpenAI API — подменив только адрес на свой локальный. Дальше подключаете любой интерфейс чата или встраиваете в свои сервисы.

Какую скорость ждать

Это реальные замеры на наших сборках (не теория):

Для сравнения: комфортная скорость чтения человека — около 10–15 токенов/с. То есть даже «бюджетная» сборка V100 на гигантской 120B-модели выдаёт ответ заметно быстрее, чем вы успеваете читать.

Частые проблемы

Модель не помещается (ошибка Out of Memory)

Возьмите более сжатый квант (например, 4-bit вместо 8-bit) или добавьте видеопамяти — больше карт в сборке. Уменьшите длину контекста, если он выставлен слишком большим.

Генерирует медленно

Убедитесь, что все слои модели выгружены на GPU, а не считаются на процессоре, и включён Flash Attention. Если часть модели ушла в обычную ОЗУ — скорость падает в разы. По оптимизации локального инференса у нас есть отдельная экспертиза — поможем настроить под ваше железо.

Нужно обслуживать много пользователей

Переходите с LM Studio на vLLM: он спроектирован под параллельные запросы и масштабируется до сотен/тысяч токенов в секунду суммарно.

4× Tesla V100

Готовая сборка под локальный ИИ. 128 ГБ, запускает модели до 120B+.
от 150 000
Смотреть V100 →

4× Tesla A100

~2× скорость, водяное охлаждение — для продакшена и многих пользователей.
790 000
Смотреть A100 →