KI-Benchmarks erklärt

Aktualisiert August 2026.

Ein Large Language Model ist ein KI-System, das auf großen Textmengen trainiert wird, um Sprache zu verstehen und zu erzeugen.

**So funktioniert es:** Ein Large Language Model ist ein KI-System, das auf großen Textmengen trainiert wird, um Sprache zu verstehen und zu erzeugen. Aktuelle Fähigkeiten finden Sie im Live-Ranking und auf der Methodik-Seite.

**Wichtige Begriffe:** - MMLU misst akademisches Wissen. - HumanEval misst Codegenerierung. - GPQA misst wissenschaftliches Schlussfolgern. - MATH misst mathematisches Problemlösen. - Arena Elo misst menschliche Präferenzen.

**Praktische Anwendungen:** - Modelle für relevante Aufgaben vergleichen - nicht nur einem Benchmark vertrauen - Leistung in der Praxis prüfen

Aktuelle Fähigkeiten finden Sie im Live-Ranking und auf der Methodik-Seite.