Análisis independiente
de modelos de IA
Comprende el panorama de la IA de frontera para elegir el modelo base óptimo, el nivel de precios y el proveedor de inferencia multinube para tu caso de uso.
Destacados
Calidad e Inteligencia
Índice compuesto de calidad Podium · Mayor es mejor
Velocidad de salida
Tokens por segundo · Mayor es mejor
Coste por 1M de tokens
Precio combinado (3:1) · Menor es mejor
01 · Real-Time Rankings
Modelos Principales
Top 10 modelos por puntuación Podium
Ver Todos →| # | Modelo | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Claude Fable 5.1 Anthropic · Proprietary | 88.4 |
| 4 | GPT-6 Astra OpenAI · Proprietary | 86.2 |
| 5 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 6 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 7 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 8 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 9 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 10 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
Mejores por Caso de Uso
Código
Ingeniería de código a nivel de repositorio: SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
Líder: Claude Fable 5.1
Matemáticas
De matemática de competición a frontera: AIME, MATH, FrontierMath.
Líder: Claude Mythos Preview
Razonamiento
Razonamiento profundo y ciencia: GPQA Diamond, HLE, ARC-AGI-2.
Líder: Claude Mythos Preview
Agéntico
Uso autónomo de herramientas: OSWorld, Toolathlon, MCP Atlas, τ²-Bench.
Líder: Kimi K3
Conocimiento
Conocimiento factual y anti-alucinación: SimpleQA, MMLU-Pro, MMMLU.
Líder: Claude Mythos Preview
Multimodal
Comprensión visual y de documentos: MMMU, CharXiv, ScreenSpot-Pro.
Líder: Claude Mythos Preview
03 · Research & Analysis
Últimos Artículos
04 · FAQ
Preguntas Frecuentes
Cada modelo recibe un Podium Score (0–100): una combinación ponderada de cuatro señales: 35% Arena Elo de comparaciones humanas, 30% promedio de benchmarks, 20% índice de inteligencia de Artificial Analysis y 15% puntuación de LLM Stats.
Claude Mythos Preview lidera el podio con una puntuación de 97.4. Le siguen Claude Fable 5 (93.4) y Claude Fable 5.1 (88.4).
Curamos 700 modelos principales en 18 categorías, más la tabla completa de la arena con 726 modelos.
De cinco clasificaciones públicas: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. Cada fuente se resincroniza semanalmente.