Локальный запуск
Сколько памяти нужно, чтобы запустить открытую модель у себя. Таблица считает требования по числу параметров модели (веса + небольшой запас), а не по документации разработчика — это оценка, реальные требования зависят от движка, длины контекста и батча. Подтверждённые разработчиком требования хранятся отдельно в поле карточки модели и появятся, когда будут собраны с источниками.
Как читать таблицу: fp16 — полная точность, int8 и int4 — квантизация (меньше памяти, обычно чуть ниже качество).
Запас в 2 ГБ покрывает служебные расходы движка, но не контекст: длинные промпты требуют больше памяти.
| Модель | Компания | Параметров, млрд | fp16, ГБ | int8, ГБ | int4, ГБ |
|---|---|---|---|---|---|
| MiniMax M | MiniMax | 456 | 914 | 458 | 230 |
| Hunyuan / Hy | Tencent (Hunyuan) | 389 | 780 | 391 | 197 |
| Nemotron | NVIDIA | 340 | 682 | 342 | 172 |
| Falcon | TII (Falcon) | 180 | 362 | 182 | 92 |
| Command | Cohere | 104 | 210 | 106 | 54 |
| Jamba | AI21 Labs | 52 | 106 | 54 | 28 |
| OLMo | Allen Institute for AI (Ai2) | 32 | 66 | 34 | 18 |
| Phi | Microsoft AI | 14 | 30 | 16 | 9 |
| MiMo | Xiaomi (MiMo) | 7 | 16 | 9 | 6 |
| LFM | Liquid AI | 2.6 | 8 | 5 | 4 |
Чем запускать
- Ollama — самый простой путь: одна команда на модель, автоматическая квантизация, подходит для первого знакомства.
- llama.cpp — максимум контроля над квантизацией и памятью, хорошо работает на процессоре и на Apple Silicon.
- vLLM — для серверного вывода с высокой пропускной способностью и параллельными запросами.
- LM Studio — графический интерфейс для настольных машин, без командной строки.
Экономика: локальный запуск экономит на оплате за токены, но требует собственного железа и электричества. Для разовых задач API обычно дешевле; для постоянного большого объёма — наоборот.