Un instantané du paysage des modèles en août 2026, entièrement tiré des données de notre classement — 58 modèles suivis, 25 benchmarks, cinq classements sources.
Le sommet du podium
Claude Mythos Preview conserve la #1 avec 97.4, suivi de Claude Fable 5 (93.4) et — le seul modèle non-Anthropic du podium — Kimi K3 (83.3), qui est aussi le meilleur modèle poids ouverts que nous suivons. Anthropic occupe quatre des cinq premières places.
L’écart poids ouverts : 14 points et en réduction
Les 83.3 de Kimi K3 sont environ 14 points Podium sous la frontière propriétaire. Sur LiveCodeBench, il bat plusieurs modèles fermés coûtant dix fois plus. Après le top 3 des modèles ouverts, toutefois, les scores passent sous 50 — le champ ouvert n’a actuellement qu’un laboratoire à la frontière.
Prix : un écart de 178×
Les prix de sortie vont de $0.28/M (DeepSeek V4 Flash) à $50/M (Claude Fable 5). Le marché s’est segmenté en trois niveaux : utilitaire (<$1/M), travail ($1–10/M) et frontière ($25–50/M). Le classement valeur montre que le point idéal intelligence-par-dollar est au niveau travail.
Vitesse : la guerre des flash
La famille Flash de Google occupe tout le podium de vitesse — Gemini 3.5 Flash-Lite à 389 tokens/seconde — tandis que le Muse Spark 1.1 de Meta (208 t/s à $4.25/M) est la meilleure histoire vitesse-par-dollar de l’année.
Ce qui a décidé 2026
Les benchmarks agentiques ont remplacé la préférence de chat comme champ de bataille : SWE-Bench Verified (Fable 5 à 95%) et Terminal-Bench ont départagé les leaders, tandis que Humanity's Last Exam reste le plafond de la frontière — personne ne le franchit aisément. Explorez les duels sur les nouvelles pages face-à-face.