Come Valutiamo

Il nostro Podium Score combina cinque classifiche indipendenti in un unico numero comparabile.

La formula del Podium Score

Podium Score = 0,35·Arena + 0,30·Benchmarks + 0,20·Intelligence + 0,15·LLM Stats

  • Arena (35%) — Valutazione Elo da battaglie di preferenza umana testa a testa (Arena.ai, 726 modelli, ponderata per voti con intervalli di confidenza).
  • Benchmarks (30%) — la media di tutti i risultati benchmark normalizzati che monitoriamo per il modello (25 benchmark in totale).
  • Intelligence Index (20%) — l'indice di intelligenza composito di Artificial Analysis.
  • LLM Stats (15%) — il punteggio composito pubblicato da llm-stats.com.

Quando una fonte non ha un valore per un modello, il suo peso viene ridistribuito proporzionalmente tra le fonti rimanenti — così un modello non viene mai penalizzato per l'assenza da un ranking.

Normalizzazione

Ogni segnale viene normalizzato min-max su una scala 0–100 su tutti i 700 modelli monitorati, quindi un punteggio di 80 significa sempre "80% del percorso tra il peggior e il miglior modello osservato". I benchmark percentuali sono usati così come sono; Elo, indici e prezzi sono normalizzati rispetto ai loro intervalli osservati.

Punteggi per categoria

Oltre alla classifica generale manteniamo 17 classifiche per categoria, ciascuna costruita dai benchmark più rilevanti per l'attività:

  • Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
  • Math — AIME 2025, FrontierMath, MATH.
  • Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
  • Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
  • Knowledge — SimpleQA, MMLU-Pro, MMMLU.
  • Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
  • Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
  • Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
  • Multilingual — Multilingual MMLU.
  • Writing — IFBench, Arena Elo.
  • Chat & Assistants — Arena Elo, IFBench.
  • Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
  • Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
  • Long Context — MRCR v2, Context window.
  • Speed — Output tokens/s.
  • Value — Blended price /1M, Cost per task.
  • Open Weights — Podium Score.

Fonti dei dati

Tutti i dati sono aggregati da cinque classifiche pubbliche:

Frequenza di aggiornamento

Risincronizziamo tutte le fonti ogni settimana; i rilasci principali di modelli attivano un aggiornamento immediato. Ultimo aggiornamento completo: 2026-09-16.

Limitazioni

Nessun benchmark è perfetto e la preferenza d'arena non equivale all'idoneità al compito. Per decisioni su casi d'uso specifici usa le classifiche per categoria e il strumento Confronta. I modelli in preview sono contrassegnati e possono spostarsi man mano che arrivano voti e risultati.

0 / 4