Benchmarks

Humanity's Last Exam Rangliste: Frontier-Benchmark-Analyse

### Schnelle Antwort: Was ist der Humanity's Last Exam (HLE) Benchmark?

Humanity's Last Exam (HLE) ist ein interdisziplinärer Benchmark mit 3.000 hochkomplexen Fragen, entwickelt vom Center for AI Safety (CAIS) und Scale AI, der die absolute Grenze menschlichen akademischen Wissens darstellt. Führende Reasoning-Modelle wie OpenAI o3, DeepSeek R1 und Claude 3.7 erreichen Genauigkeiten zwischen 18 % und 34 % und beenden damit die Ära der Benchmark-Sättigung.


Die Sättigungskrise: Warum Standard-Benchmarks versagen

Zwischen 2023 und 2025 geriet das Evaluierungsökosystem für künstliche Intelligenz in eine fundamentale Krise. Etablierte Branchen-Benchmarks erreichten ihre messbare Obergrenze:

  • MMLU (Massive Multitask Language Understanding): Einstiger Goldstandard akademischer Allgemeinbildung, bei dem Spitzenmodelle routinemäßig 90–92 % erzielen. Modellunterschiede wurden ununterscheidbar von Datensatzrauschen und Web-Kontamination.
  • GSM8K & MATH: Grundschulmathematik (GSM8K) wurde selbst von kompakten Edge-Modellen zu über 99 % gelöst; High-School-Mathematik (MATH) überstieg bei Reasoning-Modellen 95 %.
  • HumanEval & MBPP: Die Generierung von Python-Unit-Tests erreichte über 90 % Sättigung und testete lediglich grundlegende Syntax statt komplexer Softwarearchitektur.
  • GPQA Diamond: Konzipiert als manipulationssichere Fragen auf Doktoratsniveau in Biologie, Physik und Chemie, stiegen die Werte durch Test-Time Compute von 55 % auf über 78 %.

Da Foundation-Modelle im Pre-Training gewaltige Teile des offenen Internets absorbierten, verdeckten Auswendiglernen und Abrufmuster echte Defizite im autonomen Denken. Neue Evaluierungsmaßstäbe mit kryptografischer Wasserzeichen-Absicherung, Peer-Review und mehrstufiger deduktiver Forschungssynthese wurden zwingend erforderlich.


Was ist Humanity's Last Exam (HLE)?

Gemeinsam entwickelt vom Center for AI Safety (CAIS) und Scale AI unter Mitwirkung von über 1.000 Fachexperten internationaler Spitzenuniversitäten, fungiert Humanity's Last Exam (HLE) als ultimative Grenze vor Erreichen künstlicher allgemeiner Intelligenz (AGI).

+---------------------------------------------------------------------------------------------------+
|                        HUMANITY'S LAST EXAM (HLE) BENCHMARK-ARCHITEKTUR                           |
+---------------------------------------------------------------------------------------------------+
| Parameter                  | Spezifikationsdetails                                                |
+----------------------------+----------------------------------------------------------------------+
| Gesamtzahl der Fragen      | 3.000 multimodale und textbasierte interdisziplinäre Problemstellungen|
| Akademisches Niveau        | Promotion (PhD), Postdoc- und Spitzenforscher-Niveau                |
| Abgedeckte Fachbereiche    | Mathematik, Physik, Chemie, Biologie, Informatik, Recht, Ökonomie    |
| Kontaminationsschutz       | Kryptografische Canary-Strings, unveröffentlichte Beweise            |
| Evaluierungsformat         | Exakter String-Abgleich, numerische Toleranzen, formale Verifikation |
| Menschliche Expertenbasis  | ~100 % (Fachspezialisten mit Zugriff auf Referenzliteratur)          |
| Basiswert klassischer LLMs | < 3,5 % (Zero-Shot GPT-4o / Claude 3.5 Sonnet ohne Reasoning)       |
+----------------------------+----------------------------------------------------------------------+

Kernkriterien für die Aufnahme von Fragen

  1. Keine Google-Auffindbarkeit: Antworten können weder durch direkte Suchanfragen noch durch oberflächliche Synthese öffentlicher Dokumente gefunden werden.
  2. Postgraduale Qualifikation: Ein gebildeter Generalist ohne fachspezifisches Promotionsstudium kann die Aufgabe selbst nach mehreren Stunden Recherche nicht lösen.
  3. Automatisierte Verifizierbarkeit: Die Lösung mündet in einen exakten mathematischen Wert oder einen eindeutigen Token, um subjektive Verzerrungen durch LLM-as-a-Judge auszuschließen.
  4. Multimodales Denken: Rund 15 % der Aufgaben beinhalten komplexe biochemische Strukturdiagramme, Schaltungstopologien und nichteuklidische Geometrien.

Die Benchmark-Triade 2026: HLE, FrontierMath und ARC-AGI

Zur ganzheitlichen Messung von Frontier-Intelligenz stützt sich die Industrie auf drei komplementäre Prüfsteine:

                  =======================================================
                            FRONTIER AI REASONING TAXONOMIE
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (François Chollet)
                        |                  |                  |
               Akademische Obergrenze Tiefe mathematische    Abstrakte Regel-
               Interdisziplinäre PhD- Beweisführung          Induktion ohne
               Tiefe; 3.000 Fragen    Halbautomatisch        Vorwissen

1. FrontierMath (Epoch AI)

In Zusammenarbeit mit führenden Mathematikern und Fields-Medaillenträgern konzipiert. Beinhaltet hunderte unveröffentlichter mathematischer Forschungsprobleme (algebraische Geometrie, Zahlentheorie), die tagelange menschliche Rechenarbeit erfordern.

2. ARC-AGI (Abstraction and Reasoning Corpus)

Entwickelt von François Chollet, misst ARC-AGI die Fähigkeit zur Abstraktion und Induktion neuer Transformationsregeln anhand weniger visueller Rasterbeispiele – völlig isoliert vom linguistischen Textgedächtnis.

3. Humanity's Last Exam (HLE)

Vereint das breite Wissensspektrum von MMLU mit der deduktiven Strenge von FrontierMath und multimodaler naturwissenschaftlicher Problemlösungskompetenz.


Umfassende Rangliste der Frontier-Modelle 2026

Empirische Testergebnisse führender Reasoning-Modelle und Open-Weight-Architekturen:

Modellarchitektur Anbieter / Lizenz HLE Gesamtgenauigkeit (%) HLE Mathe/Informatik (%) FrontierMath Tier-1 (%) ARC-AGI-2 Verifiziert (%) Kosten / 1M Tokens
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) Proprietäre API 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B Full) MIT Open Weights 27.6% 32.8% 24.1% 71.2% $2.19 (Self-Hosted)
OpenAI o1 (Full Reasoning) Proprietäre API 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL-Reasoning) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 Open 14.2% 17.9% 9.4% 49.6% $0.60 (Lokal FP8)
Claude 3.5 Sonnet (Standard) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (Zero-Shot-Basis) Proprietäre API 3.2% 3.8% 1.8% 34.2% $2.50

Detailanalyse: Wie Reasoning-Modelle HLE bezwingen

1. OpenAI o3: Skalierung der Test-Time-Baumsuche

OpenAI o3 belegt die Spitzenposition (33,8 %) primär durch massives Reinforcement Learning in Verbindung mit Prozess-Belohnungsmodellen (PRMs). Bei quantenmechanischen Berechnungen generiert und beschneidet o3 tausende spekulative Lösungszweige vor der finalen Antwort.

2. Claude 3.7 Sonnet: Hybrides Denken und kalibrierte Selbstkorrektur

Claude 3.7 Sonnet bietet dynamisch konfigurierbare Denktokens (0 bis 128k). In der Biochemie und Rechtsphilosophie glänzt das Modell durch autonome Selbstkorrektur: Erkennt es interne Rechenfehler oder thermodynamische Widersprüche, navigiert es selbstständig zurück und korrigiert den Lösungsweg.

3. DeepSeek R1: Der Open-Weight-Durchbruch

DeepSeek R1 beweist, dass reines Reinforcement Learning ohne teure, menschlich annotierte Schritt-für-Schritt-Leitfäden komplexe Argumentationsketten eigenständig erschließen kann. Damit steht Forschern weltweit eine erstklassige Lösung auf eigener Hardware zur Verfügung.


Warum Standard-RAG an HLE scheitert

Herkömmliches Prompting und Retrieval-Augmented Generation (RAG) versagen bei HLE vollständig:

  • Synthetische Unikate: HLE-Aufgaben basieren auf neuartigen Modifikationen wissenschaftlicher Theoreme, die nirgendwo im Web indiziert sind.
  • Semantische Fehlschlüsse: Vektordatenbanken liefern oberflächlich ähnliche Begriffe, die Modelle zu fehlerhaften Analogien verleiten.

HLE-Evaluation lokal via vLLM reproduzieren:

# Evaluierungs-Repository klonen und Setup durchführen
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# Lokale vLLM-Evaluation von DeepSeek R1 ausführen
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

Fazit und Handlungsempfehlungen

  1. MMLU und GSM8K ausmerzen: Für quantitative Analysen, Code-Verifikation oder komplexe Fachthemen bieten diese Tests keinen Mehrwert mehr. Nutzen Sie HLE- und FrontierMath-Aufgaben.
  2. Inferenzzeit-Berechnung priorisieren: Ein kompaktes 32B-Modell mit Test-Time-Suche übertrifft regelmäßig massive Modelle ohne Denkarchitektur.
  3. Zweistufige Architekturen aufbauen: Routinetasks werden kostengünstig an Standardmodelle übergeben, während komplexe Promotionsprobleme an o3, Claude 3.7 oder DeepSeek R1 delegiert werden.
← Alle Artikel
0 / 4