Foire Aux Questions

Tout ce que vous devez savoir sur les classements, la méthodologie et les données LLMPodium.

Chaque modèle reçoit un Podium Score (0–100) : 35 % arena Elo, 30 % moyenne des benchmarks, 20 % Intelligence Index d'Artificial Analysis et 15 % LLM Stats — normalisés et combinés à partir de cinq classements indépendants.

Nous resynchronisons les cinq sources chaque semaine. Les sorties majeures de modèles déclenchent une mise à jour immédiate. Chaque page affiche la date de dernière actualisation.

Nous agrégéons cinq classements publics : Arena.ai (arena Elo), Artificial Analysis (indice d'intelligence et performances), LLM Stats, Vellum et LLMBase. Les prix proviennent de la documentation des fournisseurs.

Le Podium Score est une moyenne pondérée de quatre signaux normalisés : arena Elo (35 %), moyenne des benchmarks (30 %), indice d'intelligence (20 %) et LLM Stats (15 %). Les signaux manquants sont re-pondérés entre les sources restantes. Voir la page Méthodologie.

Tous les modèles ne sont pas évalués sur chaque benchmark — certains exigent des capacités particulières (ex. la vision pour MMMU) ou n'ont pas encore été testés sur les nouveaux modèles. Nous affichons '—' pour les données indisponibles.

Oui ! Visitez notre page Comparateur, sélectionnez jusqu'à 4 modèles et obtenez une décomposition côte à côte de toutes les métriques : benchmarks, prix, vitesse et latence.

Arena Elo est une note de préférence issue de votes humains lors de confrontations directes : deux modèles anonymes répondent au même prompt, les gens votent, et les votes mettent à jour une note de type Elo avec intervalles de confiance. C'est le signal le plus important de notre classement.

Nous affichons le prix d'entrée et de sortie par million de tokens, tiré directement de la page tarifaire officielle de chaque fournisseur. La catégorie Value combine les deux prix — plus bas est préférable.

Absolument. Nous suivons à la fois des modèles propriétaires et des modèles à poids ouverts : DeepSeek, Alibaba (Qwen), Moonshot AI (Kimi), Z.ai (GLM), MiniMax, Baidu et d'autres. Les modèles à poids ouverts ont leur propre classement sur /leaderboard/open.

TTFT mesure le temps entre l'envoi d'une requête et la réception du premier token de la réponse. Plus bas, mieux c'est. C'est une métrique clé pour les applications interactives où la réactivité compte.

Nos données de classement proviennent de benchmarks publics. Vérifiez les licences de chaque benchmark pour les conditions de réutilisation. Un résumé lisible par machine est disponible sur /llms.txt.

Lorsqu'un fournisseur met à jour un modèle, nous mettons à jour la fiche existante ou en créons une nouvelle selon l'importance du changement. Les modèles retirés conservent leurs derniers scores et reçoivent un badge 'legacy'.
0 / 4