LLM Atlas

Локальный запуск

Сколько памяти нужно, чтобы запустить открытую модель у себя. Таблица считает требования по числу параметров модели (веса + небольшой запас), а не по документации разработчика — это оценка, реальные требования зависят от движка, длины контекста и батча. Подтверждённые разработчиком требования хранятся отдельно в поле карточки модели и появятся, когда будут собраны с источниками.

Как читать таблицу: fp16 — полная точность, int8 и int4 — квантизация (меньше памяти, обычно чуть ниже качество). Запас в 2 ГБ покрывает служебные расходы движка, но не контекст: длинные промпты требуют больше памяти.
Модель Компания Параметров, млрд fp16, ГБ int8, ГБ int4, ГБ
MiniMax M MiniMax 456 914 458 230
Hunyuan / Hy Tencent (Hunyuan) 389 780 391 197
Nemotron NVIDIA 340 682 342 172
Falcon TII (Falcon) 180 362 182 92
Command Cohere 104 210 106 54
Jamba AI21 Labs 52 106 54 28
OLMo Allen Institute for AI (Ai2) 32 66 34 18
Phi Microsoft AI 14 30 16 9
MiMo Xiaomi (MiMo) 7 16 9 6
LFM Liquid AI 2.6 8 5 4

Чем запускать

Экономика: локальный запуск экономит на оплате за токены, но требует собственного железа и электричества. Для разовых задач API обычно дешевле; для постоянного большого объёма — наоборот.