Ein Schnappschuss der Modell-Landschaft im August 2026, komplett aus den Daten unseres Rankings — 58 verfolgte Modelle, 25 Benchmarks, fünf Quellen-Leaderboards.
Die Spitze des Podiums
Claude Mythos Preview hält Platz 1 mit 97.4, gefolgt von Claude Fable 5 (93.4) und — dem einzigen Nicht-Anthropic-Modell auf dem Podium — Kimi K3 (83.3), zugleich das beste Open-Weights-Modell, das wir verfolgen. Anthropic belegt vier der Top fünf.
Die Open-Weights-Lücke: 14 Punkte und schrumpfend
Kimi K3s 83.3 liegt etwa 14 Podium-Punkte unter der proprietären Front. Bei LiveCodeBench schlägt es mehrere geschlossene Modelle, die zehnmal so viel kosten. Nach den Top 3 der offenen Modelle fallen die Scores allerdings unter 50 — das offene Feld ist derzeit an der Front nur ein Labor tief.
Preise: eine Spanne von 178×
Die Ausgabepreise reichen von $0.28/M (DeepSeek V4 Flash) bis $50/M (Claude Fable 5). Der Markt hat sich in drei Stufen geteilt: Utility (<$1/M), Workhorse ($1–10/M) und Frontier ($25–50/M). Das Value-Ranking zeigt den Intelligenz-pro-Dollar-Sweet-Spot in der Workhorse-Stufe.
Geschwindigkeit: die Flash-Kriege
Googles Flash-Familie besetzt das komplette Geschwindigkeits-Podium — Gemini 3.5 Flash-Lite mit 389 Tokens/Sekunde — während Metas Muse Spark 1.1 (208 t/s bei $4.25/M) die beste Speed-pro-Dollar-Geschichte des Jahres ist.
Was 2026 entschied
Agentische Benchmarks lösten Chat-Präferenz als Schlachtfeld ab: SWE-Bench Verified (Fable 5 bei 95%) und Terminal-Bench trennten die Führung, während Humanity's Last Exam die Frontier-Decke bleibt — niemand knackt ihn souverän. Erkunden Sie beliebige Duelle auf den neuen Head-to-Head-Seiten.