Como avaliamos
O Podium Score combina cinco leaderboards independentes em um único número comparável.
Fórmula do Podium Score
Podium Score = 0.35·Arena + 0.30·Benchmarks + 0.20·Inteligência + 0.15·LLM Stats
- Arena (35%) — Classificação Elo de votações paritárias de usuários (Arena.ai, 719 modelos, ponderado por votos, com intervalos de confiança).
- Benchmarks (30%) — média de todos os resultados de benchmarks normalizados que acompanhamos para o modelo (25 benchmarks no total).
- Intelligence Index (20%) — índice composto de inteligência da Artificial Analysis.
- LLM Stats (15%) — pontuação composta publicada pelo llm-stats.com.
Quando uma fonte não tem valor para um modelo, seu peso é redistribuído proporcionalmente entre as demais fontes — um modelo nunca é penalizado por estar ausente de um leaderboard.
Normalização
Cada sinal é normalizado por min-max para uma escala de 0–100 em todos os 673 modelos acompanhados, então 80 sempre significa "80% do caminho entre o pior e o melhor modelo observado". Benchmarks percentuais são usados como estão; Elo, índices e preços são normalizados por suas faixas.
Pontuações por categoria
Além do ranking geral, mantemos 17 leaderboards por categoria, cada um construído sobre os benchmarks mais relevantes para a tarefa:
- Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
- Math — AIME 2025, FrontierMath, MATH.
- Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
- Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
- Knowledge — SimpleQA, MMLU-Pro, MMMLU.
- Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
- Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
- Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
- Multilingual — Multilingual MMLU.
- Writing — IFBench, Arena Elo.
- Chat & Assistants — Arena Elo, IFBench.
- Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
- Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
- Long Context — MRCR v2, Context window.
- Speed — Output tokens/s.
- Value — Blended price /1M, Cost per task.
- Open Weights — Podium Score.
Fontes de dados
Todos os dados são agregados de cinco leaderboards públicos:
- Arena.ai — last synced 2026-08-04.
- Artificial Analysis — last synced 2026-08-03.
- LLM Stats — last synced 2026-08-02.
- Vellum Leaderboard — last synced 2026-07-24.
- LLMBase — last synced 2026-08-04.
Frequência de atualização
Sincronizamos todas as fontes semanalmente; grandes lançamentos de modelos disparam atualização imediata. Última atualização completa: 2026-08-05.
Limitações
Nenhum benchmark é perfeito, e preferência na arena não equivale a adequação à tarefa. Para decisões de cenários específicos, use os leaderboards por categoria e o ferramenta de comparação. Modelos em status de prévia são sinalizados e podem se mover conforme novos votos e resultados chegam.