Analisi indipendente
dei modelli di IA
Comprendi il panorama dell'IA di frontiera per scegliere il modello fondamentale ottimale, la fascia di prezzo e il provider di inferenza per il tuo progetto.
NOVITÀ ↗
Indice di codifica autonoma e agenti
Valuta i modelli nello sviluppo software a più passaggi, nell'uso di strumenti OSWorld e nel debug.
CALCOLATORE ↗
Costo per attività ed economia delle API
Calcola con precisione i costi unitari di inferenza con memorizzazione nella cache dei prompt e token di ragionamento.
Punti chiave
Qualità dell'intelligenza
Indice di qualità Podium · Più alto è meglio
Velocità di emissione
Token al secondo · Più veloce è meglio
Costo per 1M di token
Prezzo combinato (3:1) · Più basso è economico
01 · Real-Time Rankings
Modelli Principali
Top 10 modelli per punteggio Podium
Vedi Tutti →| # | Modello | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Claude Fable 5.1 Anthropic · Proprietary | 88.4 |
| 4 | GPT-6 Astra OpenAI · Proprietary | 86.2 |
| 5 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 6 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 7 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 8 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 9 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 10 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
I Migliori per Caso d'Uso
Coding
Ingegneria del codice a livello di repository: SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
Leader: Claude Fable 5.1
Matematica
Dalla matematica olimpica alla frontiera: AIME, MATH, FrontierMath.
Leader: Claude Mythos Preview
Reasoning
Reasoning profondo e scienza: GPQA Diamond, HLE, ARC-AGI-2.
Leader: Claude Mythos Preview
Agentico
Uso autonomo di strumenti: OSWorld, Toolathlon, MCP Atlas, τ²-Bench.
Leader: Kimi K3
Conoscenza
Conoscenza fattuale e anti-allucinazione: SimpleQA, MMLU-Pro, MMMLU.
Leader: Claude Mythos Preview
Multimodale
Comprensione di immagini e documenti: MMMU, CharXiv, ScreenSpot-Pro.
Leader: Claude Mythos Preview
03 · Research & Analysis
Ultimi Articoli
04 · FAQ
Domande Frequenti
Ogni modello riceve un Podium Score (0–100): una combinazione ponderata di quattro segnali: 35% Arena Elo da confronti umani, 30% media benchmark, 20% indice di intelligenza Artificial Analysis e 15% punteggio LLM Stats.
Claude Mythos Preview guida il podio con un punteggio di 97.4. Seguito da Claude Fable 5 (93.4) e Claude Fable 5.1 (88.4).
Selezioniamo 700 modelli principali su 18 categorie, più la tabella completa dell'arena con 726 modelli.
Da cinque classifiche pubbliche: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. Ogni fonte viene risincronizzata ogni settimana.