Wie wir bewerten

Unser Podium Score kombiniert fünf unabhängige Ranglisten zu einer einzigen vergleichbaren Zahl.

Die Podium-Score-Formel

Podium Score = 0,35·Arena + 0,30·Benchmarks + 0,20·Intelligence + 0,15·LLM Stats

  • Arena (35%) — Elo-Bewertung aus Head-to-Head-Präferenzkämpfen von Menschen (Arena.ai, 726 Modelle, stimmenbasiert mit Konfidenzintervallen).
  • Benchmarks (30%) — der Mittelwert aller normalisierten Benchmark-Ergebnisse, die wir für das Modell verfolgen (insgesamt 25 Benchmarks).
  • Intelligence Index (20%) — der zusammengesetzte Intelligenz-Index von Artificial Analysis.
  • LLM Stats (15%) — der zusammengesetzte Score von llm-stats.com.

Hat eine Quelle für ein Modell keinen Wert, wird ihr Gewicht proportional auf die übrigen Quellen verteilt — ein Modell wird also nie dafür bestraft, dass es in einer Rangliste fehlt.

Normalisierung

Jedes Signal wird per Min-Max auf eine 0–100-Skala über alle 700 erfassten Modelle normalisiert, sodass 80 immer „80 % des Weges zwischen dem schlechtesten und besten beobachteten Modell“ bedeutet. Prozentbasierte Benchmarks werden unverändert genutzt; Elo, Indizes und Preise werden über ihre beobachteten Bereiche normalisiert.

Kategorie-Scores

Über das Gesamtranking hinaus führen wir 17 Kategorie-Ranglisten, die jeweils aus den für die Aufgabe relevantesten Benchmarks aufgebaut sind:

  • Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
  • Math — AIME 2025, FrontierMath, MATH.
  • Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
  • Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
  • Knowledge — SimpleQA, MMLU-Pro, MMMLU.
  • Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
  • Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
  • Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
  • Multilingual — Multilingual MMLU.
  • Writing — IFBench, Arena Elo.
  • Chat & Assistants — Arena Elo, IFBench.
  • Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
  • Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
  • Long Context — MRCR v2, Context window.
  • Speed — Output tokens/s.
  • Value — Blended price /1M, Cost per task.
  • Open Weights — Podium Score.

Datenquellen

Alle Daten stammen aus fünf öffentlichen Ranglisten:

Aktualisierungshäufigkeit

Wir synchronisieren alle Quellen wöchentlich; größere Modell-Releases lösen sofortige Aktualisierungen aus. Letzte vollständige Aktualisierung: 2026-09-16.

Einschränkungen

Kein Benchmark ist perfekt, und Arena-Präferenzen entsprechen nicht zwangsläufig der Eignung für Aufgaben. Für Entscheidungen zu konkreten Anwendungen nutzen Sie die Kategorie-Ranglisten und das Vergleichstool. Preview-Modelle sind gekennzeichnet und können sich verschieben, wenn weitere Stimmen und Ergebnisse eintreffen.

0 / 4