Häufig gestellte Fragen
Alles über LLMPodium-Rankings, Methodik und Daten.
Jedes Modell erhält einen Podium Score (0–100): 35 % Arena-Elo, 30 % Benchmark-Durchschnitt, 20 % Intelligence Index von Artificial Analysis und 15 % LLM Stats — normalisiert und aus fünf unabhängigen Ranglisten verrechnet.
Wir synchronisieren alle fünf Quellen wöchentlich. Größere Modell-Releases lösen sofortige Aktualisierungen aus. Jede Seite zeigt das Datum der letzten Aktualisierung.
Wir aggregieren fünf öffentliche Ranglisten: Arena.ai (Arena-Elo), Artificial Analysis (Intelligence-Index und Leistung), LLM Stats, Vellum und LLMBase. Preise stammen aus der Dokumentation der Anbieter.
Der Podium Score ist ein gewichteter Mittelwert aus vier normalisierten Signalen: Arena-Elo (35 %), Benchmark-Durchschnitt (30 %), Intelligenz-Index (20 %) und LLM-Stats (15 %). Fehlende Signale werden auf die übrigen Quellen umverteilt. Details auf der Seite Methodik.
Nicht alle Modelle werden auf jedem Benchmark getestet — einige erfordern besondere Fähigkeiten (z. B. Vision für MMMU) oder wurden auf neueren Modellen noch nicht ausgeführt. Wir zeigen '—' für nicht verfügbare Daten.
Ja! Besuchen Sie die Vergleichsseite, wählen Sie bis zu 4 Modelle und sehen Sie eine Gegenüberstellung aller Metriken inkl. Benchmarks, Preisen, Geschwindigkeit und Latenz.
Arena-Elo ist ein Crowd-basiertes Präferenz-Rating aus Head-to-Head-Vergleichen: zwei anonyme Modelle beantworten denselben Prompt, Menschen stimmen ab, und die Stimmen aktualisieren eine Elo-Bewertung mit Konfidenzintervallen. Es ist das größte einzelne Signal in unserem Ranking.
Wir zeigen Ein- und Ausgabepreise pro Million Tokens, direkt von der offiziellen API-Preisseite jedes Anbieters. Die Value-Kategorie kombiniert beide Preise — niedriger ist besser.
Absolut. Wir erfassen sowohl proprietäre als auch Open-Weight-Modelle von DeepSeek, Alibaba (Qwen), Moonshot AI (Kimi), Z.ai (GLM), MiniMax, Baidu und anderen. Open-Weight-Modelle haben eine eigene Rangliste unter /leaderboard/open.
TTFT misst, wie lange es dauert, bis nach dem Senden einer Anfrage das erste Token der Antwort eintrifft. Niedriger ist besser. Es ist eine Schlüsselmetrik für interaktive Anwendungen, bei denen Reaktionsfähigkeit zählt.
Unsere Ranglistendaten stammen aus öffentlichen Benchmarks. Prüfen Sie die Lizenzen der einzelnen Benchmarks für die Wiederverwendung. Eine maschinenlesbare Zusammenfassung liegt unter /llms.txt.
Wenn ein Anbieter ein Modell aktualisiert, aktualisieren wir den Eintrag oder erstellen einen neuen, je nach Bedeutung der Änderung. Auslaufende Modelle behalten ihre letzten bekannten Ergebnisse und erhalten ein „Legacy“-Abzeichen.