Glosario LLM

Los conceptos esenciales que encontrarás al leer los rankings. Cada término incluye una explicación breve y un enlace a la página relacionada.

Podium Score

La puntuación compuesta 0–100 de LLMPodium: 0.35·Elo de arena + 0.30·promedio de benchmarks + 0.20·Índice de Inteligencia + 0.15·LLM Stats, normalizada min-max con reponderación de señales ausentes. — ver datos en vivo

Rating Elo

Un sistema de puntuación tomado del ajedrez. En las arenas LLM, los modelos ganan Elo al vencer en duelos de preferencia humana; la diferencia entre dos Elo predice la probabilidad de victoria. — ver datos en vivo

Benchmark

Un conjunto de pruebas estandarizado con tareas puntuadas (matemáticas, código, ciencia) para medir una capacidad concreta del modelo en condiciones comparables. — ver datos en vivo

Tokens

Los fragmentos de subpalabras que los LLM leen y escriben. Aproximadamente 1 token ≈ 4 caracteres de texto en inglés; los precios se indican por millón (M) de tokens.

Ventana de contexto

La cantidad máxima de texto (en tokens) que un modelo puede considerar a la vez — prompt más respuesta. Los modelos frontera de 2026 van de 128K a 1M de tokens. — ver datos en vivo

TTFT (tiempo hasta el primer token)

La latencia hasta que llega el primer token de salida. Domina la capacidad de respuesta percibida en el chat; se mide en milisegundos. — ver datos en vivo

Rendimiento de salida (tokens/s)

Cuántos tokens por segundo genera un modelo tras el primer token. Determina la velocidad de las respuestas largas. — ver datos en vivo

Mixture of Experts (MoE)

Una arquitectura donde solo se activa un subconjunto de parámetros («expertos») por token: gran conocimiento con bajo coste de inferencia — p. ej. Qwen3.8 Max o DeepSeek V4. — ver datos en vivo

Pesos abiertos

Modelos cuyos parámetros entrenados se publican, permitiendo auto-alojamiento y fine-tuning (Kimi K3, GLM-5.2, Llama 4). En contraste con los modelos propietarios solo por API. — ver datos en vivo

Modelo de razonamiento

Un modelo entrenado para gastar tokens extra de «pensamiento» antes de responder: cambia latencia por precisión en problemas difíciles (GPQA, HLE, matemáticas de competición). — ver datos en vivo

Alucinación

Una afirmación segura pero sin fundamento. Benchmarks de factualidad como SimpleQA miden con qué frecuencia los modelos las evitan. — ver datos en vivo

SWE-Bench Verified

Resolver issues reales de GitHub en repositorios reales, verificado por humanos. El benchmark estándar de la ingeniería de software agéntica. — ver datos en vivo

GPQA Diamond

Preguntas científicas de nivel de posgrado escritas por expertos y «a prueba de buscadores»; un benchmark central de razonamiento. — ver datos en vivo

Humanity's Last Exam

Un conjunto de preguntas creadas por expertos para situarse en la frontera del conocimiento humano; los modelos frontera actuales aún puntúan 40–60%. — ver datos en vivo

MMLU-Pro

El sucesor endurecido de MMLU: 14 categorías y opciones más difíciles para medir conocimiento académico amplio. — ver datos en vivo

Normalización min-max

Reescalar cualquier métrica bruta a 0–100 en todo el conjunto de modelos seguidos, para poder mezclar puntuaciones de distintas fuentes. 80 siempre significa «80% del camino del peor al mejor». — ver datos en vivo

Intervalo de confianza (±CI)

La incertidumbre estadística de un Elo de arena. Intervalos superpuestos significan que dos modelos están prácticamente empatados. — ver datos en vivo

$/M tokens

Precio por millón de tokens, citado por separado para entrada y salida. Los tokens de salida suelen ser 3–5× más caros que los de entrada. — ver datos en vivo