Wie wir bewerten
Unser Podium Score kombiniert fünf unabhängige Ranglisten zu einer einzigen vergleichbaren Zahl.
Die Podium-Score-Formel
Podium Score = 0,35·Arena + 0,30·Benchmarks + 0,20·Intelligence + 0,15·LLM Stats
- Arena (35%) — Elo-Bewertung aus Head-to-Head-Präferenzkämpfen von Menschen (Arena.ai, 726 Modelle, stimmenbasiert mit Konfidenzintervallen).
- Benchmarks (30%) — der Mittelwert aller normalisierten Benchmark-Ergebnisse, die wir für das Modell verfolgen (insgesamt 25 Benchmarks).
- Intelligence Index (20%) — der zusammengesetzte Intelligenz-Index von Artificial Analysis.
- LLM Stats (15%) — der zusammengesetzte Score von llm-stats.com.
Hat eine Quelle für ein Modell keinen Wert, wird ihr Gewicht proportional auf die übrigen Quellen verteilt — ein Modell wird also nie dafür bestraft, dass es in einer Rangliste fehlt.
Normalisierung
Jedes Signal wird per Min-Max auf eine 0–100-Skala über alle 700 erfassten Modelle normalisiert, sodass 80 immer „80 % des Weges zwischen dem schlechtesten und besten beobachteten Modell“ bedeutet. Prozentbasierte Benchmarks werden unverändert genutzt; Elo, Indizes und Preise werden über ihre beobachteten Bereiche normalisiert.
Kategorie-Scores
Über das Gesamtranking hinaus führen wir 17 Kategorie-Ranglisten, die jeweils aus den für die Aufgabe relevantesten Benchmarks aufgebaut sind:
- Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
- Math — AIME 2025, FrontierMath, MATH.
- Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
- Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
- Knowledge — SimpleQA, MMLU-Pro, MMMLU.
- Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
- Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
- Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
- Multilingual — Multilingual MMLU.
- Writing — IFBench, Arena Elo.
- Chat & Assistants — Arena Elo, IFBench.
- Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
- Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
- Long Context — MRCR v2, Context window.
- Speed — Output tokens/s.
- Value — Blended price /1M, Cost per task.
- Open Weights — Podium Score.
Datenquellen
Alle Daten stammen aus fünf öffentlichen Ranglisten:
- Arena.ai — last synced 2026-08-04.
- Artificial Analysis — last synced 2026-08-03.
- LLM Stats — last synced 2026-08-02.
- Vellum Leaderboard — last synced 2026-07-24.
- LLMBase — last synced 2026-08-04.
Aktualisierungshäufigkeit
Wir synchronisieren alle Quellen wöchentlich; größere Modell-Releases lösen sofortige Aktualisierungen aus. Letzte vollständige Aktualisierung: 2026-09-16.
Einschränkungen
Kein Benchmark ist perfekt, und Arena-Präferenzen entsprechen nicht zwangsläufig der Eignung für Aufgaben. Für Entscheidungen zu konkreten Anwendungen nutzen Sie die Kategorie-Ranglisten und das Vergleichstool. Preview-Modelle sind gekennzeichnet und können sich verschieben, wenn weitere Stimmen und Ergebnisse eintreffen.