Коротко: чтобы запустить большую модель локально, нужны три вещи — достаточно VRAM (для 70B в 4-bit ~40–48 ГБ, для 120B ~65–80 ГБ), файл модели (GGUF или safetensors) и движок (LM Studio / Ollama для старта, vLLM для продакшена). Одна игровая видеокарта большие модели не тянет — нужна многокарточная сборка. Наши связки 4× Tesla V100 и 4× A100 несут по 128 ГБ и запускают модели вплоть до 120B+.
«Локальный запуск» значит, что модель работает на вашем железе, а не в чужом облаке. Для бизнеса это три понятные выгоды: данные не уходят наружу (важно для юристов, медицины, финансов), нет платы за каждый токен, и система работает даже без интернета. Минус один — нужно железо с достаточной видеопамятью. Разберёмся, какое именно и как всё запустить.
Шаг 1. Посчитайте VRAM под модель
Главное ограничение — видеопамять (VRAM). Модель должна целиком поместиться в память видеокарт, плюс нужен запас под контекст (историю диалога). Ориентир для квантованных 4-bit моделей:
| Модель | Нужно VRAM (≈4-bit) | Что запустит |
|---|---|---|
| 7–8B (лёгкая) | ~6–8 ГБ | почти любая современная видеокарта |
| 32–35B | ~20–24 ГБ | одна мощная карта или сборка |
| 70B (Llama 3 70B) | ~40–48 ГБ | многокарточная сборка |
| 120–122B (MoE) | ~65–80 ГБ | сборка 4× V100 / A100 (128 ГБ) |
Отсюда вывод: на одной потребительской карте (даже 24 ГБ) серьёзную модель не запустить — упрётесь в нехватку памяти (OOM). Нужна сборка с несколькими GPU и общим пулом памяти. Подробнее про выбор между картами — в нашем сравнении Tesla V100 и A100.
Шаг 2. Выберите движок
Движок — это программа, которая загружает модель в видеопамять и генерирует ответы. Три рабочих варианта:
LM Studio — самый простой старт
Графическое приложение: выбрал модель из каталога, скачал, передвинул ползунок выгрузки слоёв на GPU на максимум, включил Flash Attention — и общаешься. Формат GGUF. Идеален для одного пользователя и знакомства с локальными моделями.
Ollama — запуск из командной строки
Минималистичный инструмент: ollama run llama3 — и модель уже отвечает. Удобен, когда нужно быстро поднять модель и дёргать её по API из своего кода.
vLLM — для продакшена и многих пользователей
Серверный движок с максимальной пропускной способностью. Умеет раздавать одну модель на несколько GPU (tensor-parallel) и держать десятки одновременных запросов, отдаёт OpenAI-совместимый API. Именно на vLLM сделаны наши замеры скорости. Если планируете сервис или внутренний ИИ на всю компанию — это ваш выбор.
Шаг 3. Запустите модель
На примере многокарточной сборки. В LM Studio достаточно интерфейса: загрузить модель и выставить выгрузку всех слоёв на GPU. Для vLLM запуск на 4 картах выглядит так:
# раздать модель на 4 GPU, контекст 8k, OpenAI-совместимый API на порту 8000
vllm serve Qwen/Qwen2.5-32B-Instruct-AWQ \
--tensor-parallel-size 4 \
--max-model-len 8192
После старта к серверу можно обращаться как к обычному OpenAI API — подменив только адрес на свой локальный. Дальше подключаете любой интерфейс чата или встраиваете в свои сервисы.
Какую скорость ждать
Это реальные замеры на наших сборках (не теория):
- 4× Tesla V100 на крупной модели gpt-oss 120B: 45 токенов/с в один поток, до 433 токенов/с при 16 параллельных запросах, и скорость почти не падает на контексте 100 000 токенов.
- 4× Tesla A100 на Qwen 35B: 95 токенов/с в поток и до 1826 токенов/с при 64 запросах — это десятки одновременных пользователей.
Для сравнения: комфортная скорость чтения человека — около 10–15 токенов/с. То есть даже «бюджетная» сборка V100 на гигантской 120B-модели выдаёт ответ заметно быстрее, чем вы успеваете читать.
Частые проблемы
Возьмите более сжатый квант (например, 4-bit вместо 8-bit) или добавьте видеопамяти — больше карт в сборке. Уменьшите длину контекста, если он выставлен слишком большим.
Убедитесь, что все слои модели выгружены на GPU, а не считаются на процессоре, и включён Flash Attention. Если часть модели ушла в обычную ОЗУ — скорость падает в разы. По оптимизации локального инференса у нас есть отдельная экспертиза — поможем настроить под ваше железо.
Переходите с LM Studio на vLLM: он спроектирован под параллельные запросы и масштабируется до сотен/тысяч токенов в секунду суммарно.