Глоссарий LLM
Основные понятия, которые встречаются при чтении рейтингов. Каждый термин — с кратким объяснением и ссылкой на связанную страницу.
Podium Score
Композитный рейтинг LLMPodium от 0 до 100: 0.35·Arena Elo + 0.30·среднее бенчмарков + 0.20·Индекс интеллекта + 0.15·LLM Stats, с min-max нормализацией и перераспределением веса отсутствующих сигналов. — смотреть данные
Рейтинг Elo
Система рейтинга из шахмат. В LLM-аренах модели получают Elo, выигрывая очные сравнения у людей; разница двух Elo предсказывает вероятность победы. — смотреть данные
Бенчмарк
Стандартизированный набор заданий с оценкой (математика, код, наука) для измерения конкретной способности модели в сопоставимых условиях. — смотреть данные
Токены
Субсловесные фрагменты, которые LLM читает и пишет. Примерно 1 токен ≈ 4 символа английского текста (≈0.5–1 слово русского); цены указываются за миллион (M) токенов.
Контекстное окно
Максимальный объём текста (в токенах), который модель может учесть за раз — промпт плюс ответ. У флагманов 2026 года от 128K до 1M токенов. — смотреть данные
TTFT (время до первого токена)
Задержка до прихода первого токена ответа. Определяет ощущаемую отзывчивость в чате; измеряется в миллисекундах. — смотреть данные
Скорость вывода (токенов/с)
Сколько токенов в секунду генерирует модель после первого токена. Определяет скорость потока длинных ответов. — смотреть данные
Mixture of Experts (MoE)
Архитектура, где на каждый токен активируется лишь подмножество параметров («экспертов»): большие знания при малых затратах на инференс — например Qwen3.8 Max или DeepSeek V4. — смотреть данные
Открытые веса
Модели, чьи обученные параметры опубликованы: их можно хостить у себя и дообучать (Kimi K3, GLM-5.2, Llama 4). Противоположность проприетарных API-моделей. — смотреть данные
Рассуждающая модель
Модель, обученная тратить дополнительные токены «размышлений» перед ответом: обменивает задержку на точность в сложных задачах (GPQA, HLE, олимпиадная математика). — смотреть данные
Галлюцинация
Уверенное, но необоснованное утверждение. Бенчмарки фактологичности вроде SimpleQA измеряют, как часто модель их избегает. — смотреть данные
SWE-Bench Verified
Решение реальных GitHub issues в реальных репозиториях с человеческой верификацией. Стандартный бенчмарк агентной разработки ПО. — смотреть данные
GPQA Diamond
Научные вопросы уровня аспирантуры, написанные экспертами и устойчивые к поиску в интернете; ключевой бенчмарк рассуждений. — смотреть данные
Humanity's Last Exam
Составленный экспертами набор вопросов на границе человеческих знаний; флагманские модели пока набирают 40–60%. — смотреть данные
MMLU-Pro
Усиленный преемник MMLU: 14 категорий и более сложные варианты ответов для проверки широких академических знаний. — смотреть данные
Min-max нормализация
Приведение любой сырой метрики к шкале 0–100 по всему набору отслеживаемых моделей, чтобы оценки из разных источников можно было смешивать. 80 всегда означает «80% пути от худшей к лучшей». — смотреть данные
Доверительный интервал (±CI)
Статистическая неопределённость Elo арены. Пересекающиеся интервалы означают, что модели практически равны. — смотреть данные
$/M токенов
Цена за миллион токенов, отдельно для входа и выхода. Выходные токены обычно в 3–5 раз дороже входных. — смотреть данные