Comment Nous Évaluons
Notre Podium Score combine cinq classements indépendants en un chiffre comparable.
La formule du Podium Score
Podium Score = 0,35·Arena + 0,30·Benchmarks + 0,20·Intelligence + 0,15·LLM Stats
- Arena (35%) — Classement Elo issu de batailles de préférence humaine en face à face (Arena.ai, 726 modèles, pondéré par les votes avec intervalles de confiance).
- Benchmarks (30%) — la moyenne de tous les résultats de benchmarks normalisés que nous suivons pour le modèle (25 benchmarks au total).
- Intelligence Index (20%) — l'indice d'intelligence composite d'Artificial Analysis.
- LLM Stats (15%) — le score composite publié par llm-stats.com.
Lorsqu'une source n'a pas de valeur pour un modèle, son poids est réparti proportionnellement entre les sources restantes — un modèle n'est donc jamais pénalisé pour son absence d'un classement.
Normalisation
Chaque signal est normalisé min-max sur une échelle de 0 à 100 pour les 700 modèles suivis, donc un score de 80 signifie toujours « 80 % du chemin entre le pire et le meilleur modèle observé ». Les benchmarks en pourcentage sont utilisés tels quels ; Elo, indices et prix sont normalisés sur leurs plages observées.
Scores par catégorie
Au-delà du classement général, nous maintenons 17 classements par catégorie, chacun construit à partir des benchmarks les plus pertinents pour la tâche :
- Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
- Math — AIME 2025, FrontierMath, MATH.
- Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
- Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
- Knowledge — SimpleQA, MMLU-Pro, MMMLU.
- Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
- Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
- Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
- Multilingual — Multilingual MMLU.
- Writing — IFBench, Arena Elo.
- Chat & Assistants — Arena Elo, IFBench.
- Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
- Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
- Long Context — MRCR v2, Context window.
- Speed — Output tokens/s.
- Value — Blended price /1M, Cost per task.
- Open Weights — Podium Score.
Sources de données
Toutes les données sont agrégées à partir de cinq classements publics :
- Arena.ai — last synced 2026-08-04.
- Artificial Analysis — last synced 2026-08-03.
- LLM Stats — last synced 2026-08-02.
- Vellum Leaderboard — last synced 2026-07-24.
- LLMBase — last synced 2026-08-04.
Fréquence de mise à jour
Nous resynchronisons toutes les sources chaque semaine ; les sorties majeures de modèles déclenchent une mise à jour immédiate. Dernière actualisation complète : 2026-09-16.
Limitations
Aucun benchmark n'est parfait et la préférence d'arène ne vaut pas aptitude à une tâche. Pour décider de cas d'usage précis, utilisez les classements par catégorie et le outil de Comparaison. Les modèles en prévisualisation sont signalés et peuvent bouger à mesure que d'autres votes et résultats arrivent.