Ranking de LLMs · Atualizado em 5 de ago. de 2026

The Definitive
LLM Leaderboard.

Comparando 673 modelos de linguagem em 25 benchmarks, votos de arena, preços e velocidade — agregando cinco leaderboards independentes.

Agregado de 5 leaderboards independentes:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
llmpodium eval --benchmark suite
$llmpodium compare claude-mythos-preview vs claude-fable-5
EvaluatingRunning SWE-Bench, AIME, GPQA & Arena Elo...
Claude Mythos Preview: Score 97.4 · 80 t/s · Rank #1
Claude Fable 5: Score 93.4 · 71 t/s · 1509 Elo
Podium VerdictClaude Mythos Preview leads overall composite index
$
Tracked AI Labs
OpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaiduOpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaidu
673+
Modelos
Flagship curated
25
Benchmarks
Rigorous evals
44
Provedores
Global AI labs
719
Modelos na arena
Human battle Elo
01 · Real-Time Rankings

Principais modelos

Ver todos →

Top 10 Models by Overall Podium Score

Ver todos →
#ModeloPodium ScoreElo de arenaCódigoVelocidadePreço (saída)
01
Claude Mythos Preview
Anthropic · Proprietary
97.4
80.980 t/s$15/M
02
Claude Fable 5
Anthropic · Proprietary
93.4
150984.171 t/s$50/M
03
Kimi K3
Moonshot AI · Open Weights
83.3
148561.537 t/s$15/M
4
Claude Opus 5
Anthropic · Proprietary
81.4
149270.460 t/s$25/M
5
GPT-5.6 Sol
OpenAI · Proprietary
80.8
148364.872 t/s$30/M
6
Qwen3.8 Max
Alibaba · Proprietary
79.8
149650.355 t/s$2/M
7
Claude Opus 4.8
Anthropic · Proprietary
76.0
148458.050 t/s$15/M
8
Claude Opus 4 6 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
9
Claude Opus 4 7 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
10
Claude Opus 5 Max
Anthropic · Unknown
75.0
50 t/s$15/M
02 · Evaluation Domains

Melhores por tarefa

Ver todos →
03 · Research & Analysis

Últimos artigos

Todos os artigos

Open LLM Intelligence Platform

Find the perfect model for your workflow.

Compare accuracy, price-per-token, latency, and real-world agent performance across 700+ language models in seconds.

04 · FAQ

Perguntas frequentes

Todo o FAQ
Cada modelo recebe um Podium Score (0–100) — uma mistura ponderada de quatro sinais: 35% Elo de arena de comparações humanas, 30% média de benchmarks, 20% Índice de Inteligência da Artificial Analysis e 15% pontuação do LLM Stats. Todos os sinais são normalizados para uma escala comum, então a pontuação é um meio-termo plausível entre cinco leaderboards independentes.
Claude Mythos Preview lidera com 97.4. Em seguida vêm Claude Fable 5 (93.4) e Kimi K3 (83.3). Os rankings mudam semanalmente conforme novos votos e resultados chegam.
Curamos 673 modelos flagship em 18 categorias (código, matemática, raciocínio, agentes, conhecimento, multimodal, contexto longo, velocidade, custo-benefício e pesos abertos), mais a tabela completa da arena com 719 modelos.
De cinco leaderboards públicos: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. Cada fonte é sincronizada semanalmente; a fórmula exata está na página de metodologia.