Unabhängige
KI-Modell-Analyse
Verstehen Sie die Landschaft moderner KI-Modelle, um das optimale Basismodell, Preisstufen und Cloud-Inferenzanbieter für Ihre Workloads zu wählen.
Highlights
Intelligenzqualität
Podium Composite Quality Index · Höher ist besser
Ausgabegeschwindigkeit
Token pro Sekunde · Höher ist besser
Kosten pro 1 Mio. Token
Mischpreis (3:1) · Günstiger ist besser
01 · Real-Time Rankings
Top-Modelle
Top 10 Modelle nach Podium-Gesamtscore
Alle ansehen →| # | Modell | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Claude Fable 5.1 Anthropic · Proprietary | 88.4 |
| 4 | GPT-6 Astra OpenAI · Proprietary | 86.2 |
| 5 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 6 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 7 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 8 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 9 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 10 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
Beste nach Anwendungsfall
Coding
Repository-Level-Coding: SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
Führender: Claude Fable 5.1
Mathematik
Von Wettbewerbs- bis Frontier-Mathematik: AIME, MATH, FrontierMath.
Führender: Claude Mythos Preview
Reasoning
Tiefes Reasoning und Wissenschaft: GPQA Diamond, HLE, ARC-AGI-2.
Führender: Claude Mythos Preview
Agentic
Autonome Tool-Nutzung: OSWorld, Toolathlon, MCP Atlas, τ²-Bench.
Führender: Kimi K3
Wissen
Faktenwissen und Halluzinationsresistenz: SimpleQA, MMLU-Pro, MMMLU.
Führender: Claude Mythos Preview
Multimodal
Bild- und Dokumentverständnis: MMMU, CharXiv, ScreenSpot-Pro.
Führender: Claude Mythos Preview
03 · Research & Analysis
Neueste Artikel
04 · FAQ
Häufig gestellte Fragen
Jedes Modell erhält einen Podium Score (0–100): eine gewichtete Mischung aus vier Signalen — 35% Arena Elo aus menschlichen Direktvergleichen, 30% Benchmark-Durchschnitt, 20% Intelligence Index von Artificial Analysis und 15% LLM Stats Score.
Claude Mythos Preview führt das Podium mit einer Punktzahl von 97.4 an. Es folgen Claude Fable 5 (93.4) und Claude Fable 5.1 (88.4).
Wir kuratieren 700 Spitzenmodelle über 18 Kategorien sowie die vollständige Arena-Tabelle mit 726 Modellen.
Aus fünf öffentlichen Ranglisten: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. Jeder Quellcode wird wöchentlich neu synchronisiert.