Noticias de IA

Lanzamientos, actualizaciones de benchmarks y análisis en un solo feed.

2026-08-05
artículo
Estado de los LLMs 2026: El Informe del Podio

Nuestra fotografía anual de datos: quién lidera el Podium Score, qué tan amplia es la brecha de pesos abiertos, dónde quedaron los precios y qué benchmarks definieron el año.

2026-08-03
artículo
Mejor LLM para Programación: Líderes de SWE-Bench, LiveCodeBench y Terminal-Bench

¿Qué modelos de IA escriben el mejor código en 2026? Comparamos Claude Fable 5, Claude Mythos Preview, GPT-5.6 Sol y Kimi K3 en SWE-Bench Verified, LiveCodeBench y Terminal-Bench.

2026-08-02
artículo
LLMs de Pesos Abiertos vs Propietarios en 2026: ¿Qué Tan Grande Es la Brecha?

Kimi K3 logra 83.3 de Podium Score — más cerca de los modelos propietarios de frontera que nunca. Cuantificamos la brecha de pesos abiertos de 2026 con datos agregados de rankings.

2026-08-01
artículo
Precios de LLMs Comparados: Tokens de Salida de $0.28 a $50 por Millón

Una brecha de 178×: los LLMs de frontera más baratos y más caros de 2026, análisis de precio por inteligencia y dónde está el punto óptimo de valor.

2026-08-01
lanzamiento
Anthropic releases Claude Mythos 5

Anthropic's next-generation model family, top-ranked on BenchLM with highest composite score.

2026-07-30
artículo
Los LLMs Más Rápidos en 2026: Velocidad de Salida y Latencia Comparadas

Gemini 3.5 Flash-Lite lidera con 389 tokens/segundo. Ranking completo de velocidad de modelos frontera y por qué la velocidad es el benchmark más subestimado.

2026-07-30
lanzamiento
DeepSeek releases DeepSeek V4 Flash

DeepSeek V4 Flash 0731 is a sparse mixture-of-experts model from DeepSeek, with 13B active parameters out of 284B total. This re-post-trained revision is suited for coding, reasoning, and agent workflows.

2026-07-29
lanzamiento
Thinking Machines releases Inkling Small

Compact Inkling variant for fast, cheap inference.

2026-07-29
lanzamiento
Anthropic releases Claude Mythos Preview

Research preview of Anthropic’s next-generation model family.

2026-07-28
modelo
Added Qwen 3 235B

Added Alibaba Qwen 3 235B MoE model with hybrid thinking mode to all leaderboards.

2026-07-25
benchmark
LiveCodeBench scores updated

Updated LiveCodeBench scores for all models with latest contamination-free results.

2026-07-24
lanzamiento
Alibaba releases Qwen3.8 Max

Alibaba’s newest hosted flagship, a fast riser on human preference arenas.

2026-07-23
lanzamiento
Anthropic releases Claude Opus 5

Anthropic frontier model with adaptive reasoning effort levels, leading agentic coding benchmarks.

2026-07-20
modelo
Added Llama 4 Maverick

Added Meta Llama 4 Maverick 400B MoE model with 1M context window support.

2026-07-20
lanzamiento
Google releases Gemini 3.5 Flash-Lite

Lowest-cost Gemini 3.5 tier for extremely high-throughput serving.

2026-07-20
lanzamiento
Google releases Gemini 3.6 Flash

Newest Flash-class Gemini, near-pro intelligence at 200+ tokens/s.

2026-07-15
actualización
Claude Opus 4 benchmark data

Added full benchmark suite for Claude Opus 4 including SWE-Bench and AIME scores.

2026-07-15
lanzamiento
Moonshot AI releases Kimi K3

Moonshot’s frontier MoE with 1M context, top-tier agentic benchmark results.

2026-07-14
lanzamiento
Thinking Machines releases Inkling

Thinking Machines’ first frontier model.

2026-07-10
artículo
¿Qué es una Arena LLM y por qué importa?

Entendiendo las arenas LLM: evaluaciones en vivo que revelan qué modelos prefiere la gente realmente.

2026-07-10
función
Multi-language support

LLMPodium now available in 10 languages: EN, ZH, JA, KO, TH, RU, DE, ES, IT, FR.

2026-07-08
lanzamiento
Meta releases Muse Spark 1.1

Meta’s proprietary frontier model line, top-10 on blind human preference.

2026-07-08
lanzamiento
OpenAI releases GPT-5.6 Luna

Fast, cheap GPT-5.6 variant built for high-volume production traffic.

2026-07-08
lanzamiento
OpenAI releases GPT-5.6 Terra

Mid-tier GPT-5.6 model balancing intelligence with very high throughput.

2026-07-08
lanzamiento
OpenAI releases GPT-5.6 Sol

Flagship of the GPT-5.6 series for complex reasoning, coding and multi-step agentic workflows.

2026-07-07
lanzamiento
xAI releases Grok 4.5

xAI flagship with real-time knowledge and strong agentic results.

2026-07-05
modelo
Added Gemini 2.5 Pro/Flash

Added Google Gemini 2.5 Pro and 2.5 Flash with thinking capabilities.

2026-07-05
lanzamiento
Tencent releases Hunyuan Hy3

Tencent’s latest Hunyuan generation model.

2026-07-01
artículo
Mejores Prácticas para Evaluación de LLM en 2026

Cómo evitar la contaminación de datos y construir evaluaciones confiables.

2026-07-01
actualización
Pricing data refresh

Updated pricing data for all models from official API documentation.

2026-06-29
lanzamiento
Anthropic releases Claude Sonnet 5

Balanced Claude tier with adaptive reasoning, strong speed-to-intelligence ratio.

2026-06-28
benchmark
SWE-Bench Verified scores

Updated SWE-Bench Verified scores for frontier models.

2026-06-20
modelo
Added DeepSeek R1

Added DeepSeek R1 reasoning model with chain-of-thought capabilities.

2026-06-15
artículo
Comprendiendo la Metodología de Evaluación de LLM

Cómo LLMPodium normaliza y pondera puntuaciones de múltiples clasificaciones.

2026-06-15
función
Arena page launched

New Arena page for side-by-side model comparison launched.

2026-06-15
lanzamiento
Z.ai releases GLM-5.2

Z.ai flagship with strong agent tool use and 150+ tokens/s.

2026-06-11
lanzamiento
Moonshot AI releases Kimi K2.7 Code

Code-specialized Kimi variant for repository-level engineering.

2026-06-08
lanzamiento
Anthropic releases Claude Fable 5

Anthropic flagship with adaptive reasoning and Opus-class fallback, tuned for the hardest open-ended and agentic tasks.

2026-06-03
lanzamiento
NVIDIA releases Nemotron 3 Ultra 550B

NVIDIA’s 550B open MoE built for enterprise reasoning pipelines.

2026-06-01
lanzamiento
Nex AGI releases Nex N2 Pro

Nex AGI’s efficiency-focused frontier model.