Informe

Estado de los LLMs 2026: El Informe del Podio

Una fotografía del panorama de modelos a agosto de 2026, tomada completamente de los datos de nuestro ranking — 58 modelos rastreados, 25 benchmarks, cinco rankings fuente.

La cima del podio

Claude Mythos Preview mantiene el #1 con 97.4, seguido por Claude Fable 5 (93.4) y — el único modelo no Anthropic en el podio — Kimi K3 (83.3), que además es el mejor modelo de pesos abiertos que rastreamos. Anthropic ocupa cuatro de los cinco primeros puestos.

La brecha de pesos abiertos: 14 puntos y reduciéndose

Los 83.3 de Kimi K3 están unos 14 puntos Podium por debajo de la frontera propietaria. En LiveCodeBench supera a varios modelos cerrados que cuestan diez veces más. Tras los tres mejores modelos abiertos, sin embargo, las puntuaciones caen por debajo de 50 — el campo abierto tiene actualmente un solo laboratorio en la frontera.

Precios: una brecha de 178×

Los precios de salida van de $0.28/M (DeepSeek V4 Flash) a $50/M (Claude Fable 5). El mercado se segmentó en tres niveles: utilitario (<$1/M), de trabajo ($1–10/M) y frontera ($25–50/M). El ranking de valor muestra que el punto óptimo de inteligencia por dólar está en el nivel de trabajo.

Velocidad: la guerra de los flash

La familia Flash de Google domina el podio de velocidad — Gemini 3.5 Flash-Lite a 389 tokens/segundo — mientras Muse Spark 1.1 de Meta (208 t/s a $4.25/M) es la mejor historia de velocidad por dólar del año.

Qué definió 2026

Los benchmarks agénticos reemplazaron la preferencia de chat como campo de batalla: SWE-Bench Verified (Fable 5 con 95%) y Terminal-Bench separaron a los líderes, mientras Humanity's Last Exam sigue siendo el techo de la frontera — nadie lo resuelve con comodidad. Explora cualquier enfrentamiento en las nuevas páginas de comparación directa.

← Todos los Artículos