Glossario LLM
I concetti essenziali che incontrerai leggendo le classifiche. Ogni termine con una breve spiegazione e un link alla pagina correlata.
Podium Score
Il punteggio composito 0–100 di LLMPodium: 0.35·Elo dell'arena + 0.30·media dei benchmark + 0.20·Indice di intelligenza + 0.15·LLM Stats, normalizzato min-max con riponderazione dei segnali mancanti. — vedi i dati live
Rating Elo
Un sistema di punteggio preso dagli scacchi. Nelle arene LLM i modelli guadagnano Elo vincendo scontri diretti giudicati dagli umani; la differenza tra due Elo predice la probabilità di vittoria. — vedi i dati live
Benchmark
Un set di test standardizzato con compiti valutati (matematica, codice, scienza) per misurare una capacità specifica del modello in condizioni comparabili. — vedi i dati live
Token
I frammenti di sub-parola che gli LLM leggono e scrivono. Circa 1 token ≈ 4 caratteri di testo inglese; i prezzi sono indicati per milione (M) di token.
Finestra di contesto
La quantità massima di testo (in token) che un modello può considerare alla volta — prompt più risposta. I modelli frontier del 2026 vanno da 128K a 1M di token. — vedi i dati live
TTFT (tempo al primo token)
La latenza prima dell'arrivo del primo token di output. Domina la reattività percepita in chat; misurata in millisecondi. — vedi i dati live
Throughput di output (token/s)
Quanti token al secondo genera un modello dopo il primo token. Determina la velocità delle risposte lunghe. — vedi i dati live
Mixture of Experts (MoE)
Un'architettura in cui solo un sottoinsieme dei parametri («esperti») si attiva per token: grande conoscenza a basso costo di inferenza — es. Qwen3.8 Max o DeepSeek V4. — vedi i dati live
Pesi aperti
Modelli i cui parametri addestrati sono pubblici, consentendo self-hosting e fine-tuning (Kimi K3, GLM-5.2, Llama 4). In contrasto con i modelli proprietari solo API. — vedi i dati live
Modello di ragionamento
Un modello addestrato a usare token extra di «pensiero» prima di rispondere: scambia latenza con precisione sui problemi difficili (GPQA, HLE, matematica da competizione). — vedi i dati live
Allucinazione
Un'affermazione sicura ma infondata. I benchmark di fattualità come SimpleQA misurano quanto spesso i modelli le evitano. — vedi i dati live
SWE-Bench Verified
Risolvere issue reali di GitHub in repository reali, verificato da umani. Il benchmark standard dell'ingegneria del software agentica. — vedi i dati live
GPQA Diamond
Domande scientifiche di livello dottorale scritte da esperti e «a prova di ricerca»; un benchmark centrale di ragionamento. — vedi i dati live
Humanity's Last Exam
Un set di domande create da esperti al confine della conoscenza umana; i modelli frontier attuali segnano ancora 40–60%. — vedi i dati live
MMLU-Pro
Il successore rafforzato di MMLU: 14 categorie e opzioni più difficili per misurare un'ampia conoscenza accademica. — vedi i dati live
Normalizzazione min-max
Riscalare qualsiasi metrica grezza a 0–100 sull'intero insieme di modelli tracciati, così da poter mescolare punteggi di fonti diverse. 80 significa sempre «80% del percorso dal peggiore al migliore». — vedi i dati live
Intervallo di confidenza (±CI)
L'incertezza statistica di un Elo dell'arena. Intervalli sovrapposti significano che due modelli sono di fatto alla pari. — vedi i dati live
$/M token
Prezzo per milione di token, indicato separatamente per input e output. I token di output sono in genere 3–5 volte più costosi di quelli di input. — vedi i dati live