Как мы оцениваем
Podium Score объединяет пять независимых лидербордов в одно сопоставимое число.
Формула Podium Score
Podium Score = 0.35·Arena + 0.30·Benchmarks + 0.20·Intelligence + 0.15·LLM Stats
- Arena (35%) — Elo-рейтинг из парных голосований пользователей (Arena.ai, 726 моделей, взвешенный по голосам, с доверительными интервалами).
- Benchmarks (30%) — среднее всех нормализованных результатов бенчмарков, которые мы отслеживаем для модели (всего 25 бенчмарков).
- Intelligence Index (20%) — композитный индекс интеллекта от Artificial Analysis.
- LLM Stats (15%) — композитный балл, публикуемый llm-stats.com.
Когда у источника нет значения для модели, его вес пропорционально перераспределяется между остальными источниками — модель никогда не наказывается за отсутствие в одном лидерборде.
Нормализация
Каждый сигнал нормализуется min-max до шкалы 0–100 по всем 700 отслеживаемым моделям, поэтому 80 всегда означает "80% пути между худшей и лучшей наблюдаемой моделью". Процентные бенчмарки используются как есть; Elo, индексы и цены нормализуются по своим диапазонам.
Категорийные баллы
Помимо общего рейтинга мы ведём 17 категорийных лидербордов, каждый из которых строится на наиболее релевантных для задачи бенчмарках:
- Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
- Math — AIME 2025, FrontierMath, MATH.
- Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
- Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
- Knowledge — SimpleQA, MMLU-Pro, MMMLU.
- Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
- Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
- Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
- Multilingual — Multilingual MMLU.
- Writing — IFBench, Arena Elo.
- Chat & Assistants — Arena Elo, IFBench.
- Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
- Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
- Long Context — MRCR v2, Context window.
- Speed — Output tokens/s.
- Value — Blended price /1M, Cost per task.
- Open Weights — Podium Score.
Источники данных
Все данные агрегируются из пяти публичных лидербордов:
- Arena.ai — last synced 2026-08-04.
- Artificial Analysis — last synced 2026-08-03.
- LLM Stats — last synced 2026-08-02.
- Vellum Leaderboard — last synced 2026-07-24.
- LLMBase — last synced 2026-08-04.
Частота обновления
Мы синхронизируем все источники еженедельно; крупные релизы моделей запускают немедленное обновление. Последнее полное обновление: 2026-09-16.
Ограничения
Ни один бенчмарк не идеален, и предпочтения в арене не равны пригодности для задач. Для решений по конкретным сценариям используйте категорийные лидерборды и инструмент «Сравнение». Модели в статусе preview помечены и могут смещаться по мере поступления новых голосов и результатов.