Preguntas Frecuentes

Todo lo que necesitas saber sobre las clasificaciones, metodología y datos de LLMPodium.

Cada modelo recibe un Podium Score (0–100): 35 % arena Elo, 30 % promedio de benchmarks, 20 % Intelligence Index de Artificial Analysis y 15 % LLM Stats — normalizados y combinados a partir de cinco rankings independientes.

Sincronizamos las cinco fuentes semanalmente. Los lanzamientos importantes de modelos disparan una actualización inmediata. Cada página muestra la fecha de la última actualización.

Agregamos cinco rankings públicos: Arena.ai (arena Elo), Artificial Analysis (índice de inteligencia y rendimiento), LLM Stats, Vellum y LLMBase. Los precios provienen de la documentación de cada proveedor.

El Podium Score es una media ponderada de cuatro señales normalizadas: arena Elo (35 %), promedio de benchmarks (30 %), índice de inteligencia (20 %) y LLM Stats (15 %). Las señales faltantes se repesan entre las fuentes restantes. Ver la página de Metodología.

No todos los modelos se evalúan en cada benchmark — algunos requieren capacidades específicas (p. ej., visión para MMMU) o aún no se han ejecutado en modelos nuevos. Mostramos '—' para los datos no disponibles.

¡Sí! Visita la página de Comparación, selecciona hasta 4 modelos y verás un desglose en paralelo de todas las métricas: benchmarks, precios, velocidad y latencia.

Arena Elo es una calificación de preferencia basada en votos humanos en batallas cara a cara: dos modelos anónimos responden el mismo prompt, las personas votan y los votos actualizan una calificación tipo Elo con intervalos de confianza. Es la señal más grande de nuestro ranking.

Mostramos el precio de entrada y salida por millón de tokens, tomado directamente de la página de precios oficial de cada proveedor. La categoría Value combina ambos precios — cuanto menor, mejor.

Por supuesto. Rastreamos tanto modelos propietarios como de pesos abiertos: DeepSeek, Alibaba (Qwen), Moonshot AI (Kimi), Z.ai (GLM), MiniMax, Baidu y otros. Los modelos de pesos abiertos tienen su propio ranking en /leaderboard/open.

TTFT mide cuánto tarda en llegar el primer token de la respuesta tras enviar la solicitud. Cuanto menor, mejor. Es una métrica clave para aplicaciones interactivas donde importa la capacidad de respuesta.

Nuestros datos provienen de benchmarks públicos. Revisa las licencias de cada benchmark para las condiciones de reutilización. Hay un resumen legible por máquina en /llms.txt.

Cuando un proveedor actualiza un modelo, actualizamos la entrada existente o creamos una nueva según la importancia del cambio. Los modelos retirados conservan sus últimas puntuaciones y reciben una insignia 'legacy'.
0 / 4