Come Valutiamo
Il nostro Podium Score combina cinque classifiche indipendenti in un unico numero comparabile.
La formula del Podium Score
Podium Score = 0,35·Arena + 0,30·Benchmarks + 0,20·Intelligence + 0,15·LLM Stats
- Arena (35%) — Valutazione Elo da battaglie di preferenza umana testa a testa (Arena.ai, 726 modelli, ponderata per voti con intervalli di confidenza).
- Benchmarks (30%) — la media di tutti i risultati benchmark normalizzati che monitoriamo per il modello (25 benchmark in totale).
- Intelligence Index (20%) — l'indice di intelligenza composito di Artificial Analysis.
- LLM Stats (15%) — il punteggio composito pubblicato da llm-stats.com.
Quando una fonte non ha un valore per un modello, il suo peso viene ridistribuito proporzionalmente tra le fonti rimanenti — così un modello non viene mai penalizzato per l'assenza da un ranking.
Normalizzazione
Ogni segnale viene normalizzato min-max su una scala 0–100 su tutti i 700 modelli monitorati, quindi un punteggio di 80 significa sempre "80% del percorso tra il peggior e il miglior modello osservato". I benchmark percentuali sono usati così come sono; Elo, indici e prezzi sono normalizzati rispetto ai loro intervalli osservati.
Punteggi per categoria
Oltre alla classifica generale manteniamo 17 classifiche per categoria, ciascuna costruita dai benchmark più rilevanti per l'attività:
- Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
- Math — AIME 2025, FrontierMath, MATH.
- Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
- Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
- Knowledge — SimpleQA, MMLU-Pro, MMMLU.
- Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
- Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
- Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
- Multilingual — Multilingual MMLU.
- Writing — IFBench, Arena Elo.
- Chat & Assistants — Arena Elo, IFBench.
- Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
- Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
- Long Context — MRCR v2, Context window.
- Speed — Output tokens/s.
- Value — Blended price /1M, Cost per task.
- Open Weights — Podium Score.
Fonti dei dati
Tutti i dati sono aggregati da cinque classifiche pubbliche:
- Arena.ai — last synced 2026-08-04.
- Artificial Analysis — last synced 2026-08-03.
- LLM Stats — last synced 2026-08-02.
- Vellum Leaderboard — last synced 2026-07-24.
- LLMBase — last synced 2026-08-04.
Frequenza di aggiornamento
Risincronizziamo tutte le fonti ogni settimana; i rilasci principali di modelli attivano un aggiornamento immediato. Ultimo aggiornamento completo: 2026-09-16.
Limitazioni
Nessun benchmark è perfetto e la preferenza d'arena non equivale all'idoneità al compito. Per decisioni su casi d'uso specifici usa le classifiche per categoria e il strumento Confronta. I modelli in preview sono contrassegnati e possono spostarsi man mano che arrivano voti e risultati.