Частые вопросы
Всё, что нужно знать о рейтингах, методологии и данных LLMPodium.
Каждая модель получает Podium Score (0–100): 35% arena Elo, 30% средний бенчмарк, 20% Intelligence Index от Artificial Analysis и 15% LLM Stats — нормализованные и объединённые на основе пяти независимых лидербордов.
Мы синхронизируем все пять источников еженедельно. Крупные релизы моделей запускают немедленное обновление. На каждой странице показана дата последнего обновления.
Мы агрегируем пять публичных лидербордов: Arena.ai (arena Elo), Artificial Analysis (индекс интеллекта и производительность), LLM Stats, Vellum и LLMBase. Цены берутся из документации провайдеров.
Podium Score — это средневзвешенное четырёх нормализованных сигналов: arena Elo (35%), средний бенчмарк (30%), индекс интеллекта (20%) и LLM Stats (15%). Недостающие сигналы перераспределяются между остальными источниками. Подробности на странице «Методология».
Не все модели протестированы на каждом бенчмарке — некоторые требуют особых возможностей (например, зрение для MMMU) или ещё не запускались на новых моделях. Мы показываем '—' для недоступных данных.
Да! Зайдите на страницу «Сравнение», выберите до 4 моделей и увидите детальное сравнение всех метрик: бенчмарки, цены, скорость и задержку.
Arena Elo — это рейтинг предпочтений, основанный на голосованиях людей: две анонимные модели отвечают на один запрос, люди голосуют, и голоса обновляют Elo-рейтинг с доверительными интервалами. Это самый большой сигнал в нашем рейтинге.
Мы показываем цену входных и выходных токенов за миллион, взятую напрямую с официальной страницы API-цен каждого провайдера. Категория Value объединяет обе цены — чем ниже, тем лучше.
Безусловно. Мы отслеживаем как проприетарные, так и open-weight модели: DeepSeek, Alibaba (Qwen), Moonshot AI (Kimi), Z.ai (GLM), MiniMax, Baidu и другие. Open-weight модели имеют собственный лидерборд на /leaderboard/open.
TTFT измеряет время от отправки запроса до получения первого токена ответа. Чем ниже, тем лучше. Это ключевая метрика для интерактивных приложений, где важна отзывчивость.
Данные лидерборда взяты из публичных бенчмарков. Проверяйте лицензии каждого бенчмарка для условий использования. Машиночитаемая сводка доступна на /llms.txt.
Когда провайдер обновляет модель, мы либо обновляем существующую запись, либо создаём новую в зависимости от значимости изменения. Модели, снятые с поддержки, сохраняют последний известный результат и получают бейдж 'legacy'.