Глоссарий
Термины, без которых не читается ни одна карточка модели: архитектура, контекст, лицензии, режимы рассуждений. Определения намеренно короткие — по существу.
- MoE (Mixture of Experts)
- Архитектура, где на каждый токен активируется лишь часть параметров модели (экспертов). Позволяет иметь очень большой общий размер модели при умеренных затратах на инференс: важны два числа — всего параметров и активных на токен.
- RLHF
- Обучение с подкреплением на основе обратной связи людей: этап дообучения, на котором модель подстраивают под предпочтения пользователей.
- Депрекация (отключение модели)
- Прекращение поддержки версии модели: обычно объявляется заранее, затем модель перестаёт отвечать на запросы. Ведёт к необходимости миграции на новую версию.
- Квантизация
- Сжатие весов модели (например, до 4 или 8 бит) для запуска на меньшем объёме памяти. Снижает требования к железу, обычно с небольшой потерей качества.
- Контекстное окно
- Максимальное число токенов, которое модель принимает за один запрос (промпт + ответ). Размер окна и цена за токен определяют, сколько документов можно подать модели за раз.
- Открытые веса
- Модель, чьи параметры можно скачать и запустить самостоятельно. Не равно «open source»: лицензия может ограничивать коммерческое использование, число пользователей или регионы.
- Токен
- Единица текста, которой оперирует модель (часть слова). Цены на API считаются за миллион токенов, а контекст измеряется в токенах.
- Уровень рассуждений (reasoning effort)
- Параметр, задающий, сколько «размышлений» тратит модель перед ответом. Высокие уровни повышают качество на сложных задачах, но растут цена и задержка.