Domande Frequenti
Tutto ciò che devi sapere su classifiche, metodologia e dati di LLMPodium.
Ogni modello ottiene un Podium Score (0–100): 35% arena Elo, 30% media benchmark, 20% Intelligence Index di Artificial Analysis e 15% LLM Stats — normalizzati e combinati da cinque classifiche indipendenti.
Risincronizziamo le cinque fonti ogni settimana. Le principali uscite di modelli attivano un aggiornamento immediato. Ogni pagina mostra la data dell'ultimo aggiornamento.
Aggreghiamo cinque classifiche pubbliche: Arena.ai (arena Elo), Artificial Analysis (indice di intelligenza e prestazioni), LLM Stats, Vellum e LLMBase. I prezzi provengono dalla documentazione dei fornitori.
Il Podium Score è una media ponderata di quattro segnali normalizzati: arena Elo (35%), media benchmark (30%), indice di intelligenza (20%) e LLM Stats (15%). I segnali mancanti vengono riponderati tra le fonti rimanenti. Vedi la pagina Metodologia.
Non tutti i modelli sono valutati su ogni benchmark — alcuni richiedono capacità specifiche (es. visione per MMMU) o non sono ancora stati eseguiti sui modelli più recenti. Mostriamo '—' per i dati non disponibili.
Sì! Visita la pagina Confronta, seleziona fino a 4 modelli e vedi una comparazione affiancata di tutte le metriche: benchmark, prezzi, velocità e latenza.
Arena Elo è una valutazione basata su voti umani in battaglie dirette: due modelli anonimi rispondono allo stesso prompt, le persone votano e i voti aggiornano una valutazione stile Elo con intervalli di confidenza. È il segnale più grande nel nostro ranking.
Mostriamo il prezzo di input e output per milione di token, preso direttamente dalla pagina prezzi ufficiale di ogni fornitore. La categoria Value combina entrambi i prezzi — più basso è meglio.
Assolutamente. Seguiamo sia modelli proprietari sia modelli a pesi aperti: DeepSeek, Alibaba (Qwen), Moonshot AI (Kimi), Z.ai (GLM), MiniMax, Baidu e altri. I modelli a pesi aperti hanno una loro classifica su /leaderboard/open.
TTFT misura quanto tempo passa dall'invio di una richiesta alla ricezione del primo token della risposta. Più basso è meglio. È una metrica chiave per le applicazioni interattive dove conta la reattività.
I nostri dati di classifica provengono da benchmark pubblici. Controlla le licenze di ogni benchmark per le condizioni di riuso. Un riepilogo leggibile da macchina è disponibile su /llms.txt.
Quando un fornitore aggiorna un modello, aggiorniamo la scheda esistente o ne creiamo una nuova a seconda dell'importanza del cambiamento. I modelli ritirati conservano gli ultimi punteggi e ricevono un badge 'legacy'.