Cómo Evaluamos
Nuestro Podium Score combina cinco clasificaciones independientes en un solo número comparable.
La fórmula del Podium Score
Podium Score = 0,35·Arena + 0,30·Benchmarks + 0,20·Intelligence + 0,15·LLM Stats
- Arena (35%) — Valoración Elo de batallas de preferencia humana cara a cara (Arena.ai, 726 modelos, ponderada por votos con intervalos de confianza).
- Benchmarks (30%) — el promedio de todos los resultados de benchmarks normalizados que rastreamos para el modelo (25 benchmarks en total).
- Intelligence Index (20%) — el índice compuesto de inteligencia de Artificial Analysis.
- LLM Stats (15%) — la puntuación compuesta publicada por llm-stats.com.
Cuando una fuente no tiene valor para un modelo, su peso se redistribuye proporcionalmente entre las fuentes restantes — así un modelo nunca se penaliza por no aparecer en un ranking.
Normalización
Cada señal se normaliza por min-max a una escala de 0–100 en todos los 700 modelos rastreados, por lo que un 80 significa siempre "80% del camino entre el peor y el mejor modelo observado". Los benchmarks basados en porcentajes se usan tal cual; Elo, índices y precios se normalizan frente a sus rangos observados.
Puntuaciones por categoría
Además del ranking general mantenemos 17 rankings por categoría, cada uno construido con los benchmarks más relevantes para la tarea:
- Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
- Math — AIME 2025, FrontierMath, MATH.
- Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
- Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
- Knowledge — SimpleQA, MMLU-Pro, MMMLU.
- Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
- Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
- Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
- Multilingual — Multilingual MMLU.
- Writing — IFBench, Arena Elo.
- Chat & Assistants — Arena Elo, IFBench.
- Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
- Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
- Long Context — MRCR v2, Context window.
- Speed — Output tokens/s.
- Value — Blended price /1M, Cost per task.
- Open Weights — Podium Score.
Fuentes de datos
Todos los datos se agregan a partir de cinco rankings públicos:
- Arena.ai — last synced 2026-08-04.
- Artificial Analysis — last synced 2026-08-03.
- LLM Stats — last synced 2026-08-02.
- Vellum Leaderboard — last synced 2026-07-24.
- LLMBase — last synced 2026-08-04.
Frecuencia de actualización
Resincronizamos todas las fuentes semanalmente; los lanzamientos importantes de modelos activan una actualización inmediata. Última actualización completa: 2026-09-16.
Limitaciones
Ningún benchmark es perfecto y la preferencia en la arena no equivale a la idoneidad para la tarea. Usa los rankings por categoría y el herramienta de Comparación para decidir casos de uso específicos. Los modelos en preview están marcados y pueden moverse a medida que llegan más votos y resultados.