Analyse indépendante
des modèles d'IA
Comprenez le paysage des modèles d'IA de pointe pour choisir le modèle de fondation optimal, la tarification et le fournisseur d'inférence adapté à votre projet.
Points clés
Qualité de l'intelligence
Indice composite Podium · Plus élevé est meilleur
Vitesse de sortie
Jetons par seconde · Plus rapide est meilleur
Coût pour 1M de jetons
Tarif mixte (3:1) · Plus bas est économique
01 · Real-Time Rankings
Modèles Principaux
Top 10 des modèles selon le score Podium
Voir Tout →| # | Modèle | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Claude Fable 5.1 Anthropic · Proprietary | 88.4 |
| 4 | GPT-6 Astra OpenAI · Proprietary | 86.2 |
| 5 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 6 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 7 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 8 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 9 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 10 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
Meilleurs par Cas d'Usage
Code
Génie logiciel niveau dépôt : SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
Leader: Claude Fable 5.1
Mathématiques
Des maths de compétition à la frontière : AIME, MATH, FrontierMath.
Leader: Claude Mythos Preview
Raisonnement
Raisonnement profond et science : GPQA Diamond, HLE, ARC-AGI-2.
Leader: Claude Mythos Preview
Agentique
Usage autonome d'outils : OSWorld, Toolathlon, MCP Atlas, τ²-Bench.
Leader: Kimi K3
Connaissances
Connaissances factuelles et anti-hallucination : SimpleQA, MMLU-Pro, MMMLU.
Leader: Claude Mythos Preview
Multimodal
Compréhension vision et documents : MMMU, CharXiv, ScreenSpot-Pro.
Leader: Claude Mythos Preview
03 · Research & Analysis
Derniers Articles
04 · FAQ
Foire Aux Questions
Chaque modèle reçoit un Podium Score (0–100) : un mélange pondéré de quatre signaux — 35% Arena Elo des comparaisons humaines, 30% moyenne des benchmarks, 20% indice d'intelligence Artificial Analysis et 15% score LLM Stats.
Claude Mythos Preview domine le podium avec un score de 97.4. Suivi par Claude Fable 5 (93.4) et Claude Fable 5.1 (88.4).
Nous sélectionnons 700 modèles phares répartis sur 18 catégories, plus la table d'arène complète avec 726 modèles.
De cinq classements publics : Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. Chaque source est resynchronisée chaque semaine.