Perguntas frequentes
Tudo o que você precisa saber sobre os rankings, metodologia e dados do LLMPodium.
Cada modelo recebe um Podium Score (0–100): 35% Elo de arena, 30% média de benchmarks, 20% Índice de Inteligência da Artificial Analysis e 15% LLM Stats — normalizados e combinados a partir de cinco leaderboards independentes.
Sincronizamos as cinco fontes semanalmente. Grandes lançamentos de modelos disparam atualização imediata. Cada página mostra a data da última atualização.
Agregamos cinco leaderboards públicos: Arena.ai (Elo de arena), Artificial Analysis (índice de inteligência e desempenho), LLM Stats, Vellum e LLMBase. Os preços vêm da documentação dos provedores.
O Podium Score é uma média ponderada de quatro sinais normalizados: Elo de arena (35%), média de benchmarks (30%), Índice de Inteligência (20%) e LLM Stats (15%). Sinais ausentes são redistribuídos entre as demais fontes. Detalhes na página de metodologia.
Nem todos os modelos são testados em todos os benchmarks — alguns exigem recursos especiais (como visão para o MMMU) ou ainda não foram executados nos modelos mais novos. Mostramos “—” para dados indisponíveis.
Sim! Vá para a página de comparação, escolha até 4 modelos e veja uma comparação detalhada de todas as métricas: benchmarks, preços, velocidade e latência.
Arena Elo é uma classificação de preferência baseada em votos humanos: dois modelos anônimos respondem à mesma pergunta, as pessoas votam e os votos atualizam a classificação Elo com intervalos de confiança. É o maior sinal do nosso ranking.
Mostramos o preço de tokens de entrada e saída por milhão, obtido diretamente da página oficial de preços de API de cada provedor. A categoria Valor combina ambos os preços — quanto menor, melhor.
Com certeza. Acompanhamos modelos proprietários e de pesos abertos: DeepSeek, Alibaba (Qwen), Moonshot AI (Kimi), Z.ai (GLM), MiniMax, Baidu e outros. Modelos de pesos abertos têm seu próprio leaderboard em /leaderboard/open.
TTFT mede o tempo do envio da pergunta até o recebimento do primeiro token da resposta. Quanto menor, melhor. É uma métrica-chave para aplicações interativas, onde a capacidade de resposta importa.
Os dados do leaderboard vêm de benchmarks públicos. Verifique as licenças de cada benchmark para os termos de uso. Um resumo legível por máquina está disponível em /llms.txt.
Quando um provedor atualiza um modelo, atualizamos o registro existente ou criamos um novo, dependendo da importância da mudança. Modelos descontinuados mantêm o último resultado conhecido e recebem o selo “legado”.