### Schnelle Antwort: Was ist der Humanity's Last Exam (HLE) Benchmark?
Humanity's Last Exam (HLE) ist ein interdisziplinärer Benchmark mit 3.000 hochkomplexen Fragen, entwickelt vom Center for AI Safety (CAIS) und Scale AI, der die absolute Grenze menschlichen akademischen Wissens darstellt. Führende Reasoning-Modelle wie OpenAI o3, DeepSeek R1 und Claude 3.7 erreichen Genauigkeiten zwischen 18 % und 34 % und beenden damit die Ära der Benchmark-Sättigung.
Die Sättigungskrise: Warum Standard-Benchmarks versagen
Zwischen 2023 und 2025 geriet das Evaluierungsökosystem für künstliche Intelligenz in eine fundamentale Krise. Etablierte Branchen-Benchmarks erreichten ihre messbare Obergrenze:
- MMLU (Massive Multitask Language Understanding): Einstiger Goldstandard akademischer Allgemeinbildung, bei dem Spitzenmodelle routinemäßig 90–92 % erzielen. Modellunterschiede wurden ununterscheidbar von Datensatzrauschen und Web-Kontamination.
- GSM8K & MATH: Grundschulmathematik (GSM8K) wurde selbst von kompakten Edge-Modellen zu über 99 % gelöst; High-School-Mathematik (MATH) überstieg bei Reasoning-Modellen 95 %.
- HumanEval & MBPP: Die Generierung von Python-Unit-Tests erreichte über 90 % Sättigung und testete lediglich grundlegende Syntax statt komplexer Softwarearchitektur.
- GPQA Diamond: Konzipiert als manipulationssichere Fragen auf Doktoratsniveau in Biologie, Physik und Chemie, stiegen die Werte durch Test-Time Compute von 55 % auf über 78 %.
Da Foundation-Modelle im Pre-Training gewaltige Teile des offenen Internets absorbierten, verdeckten Auswendiglernen und Abrufmuster echte Defizite im autonomen Denken. Neue Evaluierungsmaßstäbe mit kryptografischer Wasserzeichen-Absicherung, Peer-Review und mehrstufiger deduktiver Forschungssynthese wurden zwingend erforderlich.
Was ist Humanity's Last Exam (HLE)?
Gemeinsam entwickelt vom Center for AI Safety (CAIS) und Scale AI unter Mitwirkung von über 1.000 Fachexperten internationaler Spitzenuniversitäten, fungiert Humanity's Last Exam (HLE) als ultimative Grenze vor Erreichen künstlicher allgemeiner Intelligenz (AGI).
+---------------------------------------------------------------------------------------------------+
| HUMANITY'S LAST EXAM (HLE) BENCHMARK-ARCHITEKTUR |
+---------------------------------------------------------------------------------------------------+
| Parameter | Spezifikationsdetails |
+----------------------------+----------------------------------------------------------------------+
| Gesamtzahl der Fragen | 3.000 multimodale und textbasierte interdisziplinäre Problemstellungen|
| Akademisches Niveau | Promotion (PhD), Postdoc- und Spitzenforscher-Niveau |
| Abgedeckte Fachbereiche | Mathematik, Physik, Chemie, Biologie, Informatik, Recht, Ökonomie |
| Kontaminationsschutz | Kryptografische Canary-Strings, unveröffentlichte Beweise |
| Evaluierungsformat | Exakter String-Abgleich, numerische Toleranzen, formale Verifikation |
| Menschliche Expertenbasis | ~100 % (Fachspezialisten mit Zugriff auf Referenzliteratur) |
| Basiswert klassischer LLMs | < 3,5 % (Zero-Shot GPT-4o / Claude 3.5 Sonnet ohne Reasoning) |
+----------------------------+----------------------------------------------------------------------+
Kernkriterien für die Aufnahme von Fragen
- Keine Google-Auffindbarkeit: Antworten können weder durch direkte Suchanfragen noch durch oberflächliche Synthese öffentlicher Dokumente gefunden werden.
- Postgraduale Qualifikation: Ein gebildeter Generalist ohne fachspezifisches Promotionsstudium kann die Aufgabe selbst nach mehreren Stunden Recherche nicht lösen.
- Automatisierte Verifizierbarkeit: Die Lösung mündet in einen exakten mathematischen Wert oder einen eindeutigen Token, um subjektive Verzerrungen durch LLM-as-a-Judge auszuschließen.
- Multimodales Denken: Rund 15 % der Aufgaben beinhalten komplexe biochemische Strukturdiagramme, Schaltungstopologien und nichteuklidische Geometrien.
Die Benchmark-Triade 2026: HLE, FrontierMath und ARC-AGI
Zur ganzheitlichen Messung von Frontier-Intelligenz stützt sich die Industrie auf drei komplementäre Prüfsteine:
=======================================================
FRONTIER AI REASONING TAXONOMIE
=======================================================
/ | \
/ | \
Humanity's Last Exam FrontierMath ARC-AGI-2
(HLE) (Epoch AI) (François Chollet)
| | |
Akademische Obergrenze Tiefe mathematische Abstrakte Regel-
Interdisziplinäre PhD- Beweisführung Induktion ohne
Tiefe; 3.000 Fragen Halbautomatisch Vorwissen
1. FrontierMath (Epoch AI)
In Zusammenarbeit mit führenden Mathematikern und Fields-Medaillenträgern konzipiert. Beinhaltet hunderte unveröffentlichter mathematischer Forschungsprobleme (algebraische Geometrie, Zahlentheorie), die tagelange menschliche Rechenarbeit erfordern.
2. ARC-AGI (Abstraction and Reasoning Corpus)
Entwickelt von François Chollet, misst ARC-AGI die Fähigkeit zur Abstraktion und Induktion neuer Transformationsregeln anhand weniger visueller Rasterbeispiele – völlig isoliert vom linguistischen Textgedächtnis.
3. Humanity's Last Exam (HLE)
Vereint das breite Wissensspektrum von MMLU mit der deduktiven Strenge von FrontierMath und multimodaler naturwissenschaftlicher Problemlösungskompetenz.
Umfassende Rangliste der Frontier-Modelle 2026
Empirische Testergebnisse führender Reasoning-Modelle und Open-Weight-Architekturen:
| Modellarchitektur | Anbieter / Lizenz | HLE Gesamtgenauigkeit (%) | HLE Mathe/Informatik (%) | FrontierMath Tier-1 (%) | ARC-AGI-2 Verifiziert (%) | Kosten / 1M Tokens |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 (High CoT) | Proprietary API | 65.0% | 72.4% | 87.8% | 96.4% | $10.00 / $50.00 |
| OpenAI GPT-6 Astra | Proprietary API | 57.2% | 74.1% | 97.6% | 99.9% | $10.00 / $50.00 |
| OpenAI o3 (High Effort) | Proprietäre API | 33.8% | 38.4% | 31.2% | 78.4% | $45.00 |
| Claude 3.7 Sonnet (Thinking) | Anthropic API | 31.4% | 35.2% | 28.6% | 74.9% | $18.00 |
| DeepSeek R1 (671B Full) | MIT Open Weights | 27.6% | 32.8% | 24.1% | 71.2% | $2.19 (Self-Hosted) |
| OpenAI o1 (Full Reasoning) | Proprietäre API | 24.2% | 29.1% | 19.8% | 66.5% | $30.00 |
| Kimi k1.5 (Long-CoT) | Moonshot API | 22.8% | 27.4% | 18.2% | 63.8% | $4.50 |
| Gemini 2.0 Flash Thinking | Google Cloud | 21.5% | 25.0% | 16.9% | 61.4% | $3.50 |
| Qwen-2.5-Max (RL-Reasoning) | Alibaba Cloud | 19.8% | 23.6% | 14.5% | 58.2% | $3.20 |
| DeepSeek-R1-Distill-Qwen-32B | Apache 2.0 Open | 14.2% | 17.9% | 9.4% | 49.6% | $0.60 (Lokal FP8) |
| Claude 3.5 Sonnet (Standard) | Anthropic API | 5.8% | 6.2% | 2.4% | 38.1% | $3.75 |
| GPT-4o (Zero-Shot-Basis) | Proprietäre API | 3.2% | 3.8% | 1.8% | 34.2% | $2.50 |
Detailanalyse: Wie Reasoning-Modelle HLE bezwingen
1. OpenAI o3: Skalierung der Test-Time-Baumsuche
OpenAI o3 belegt die Spitzenposition (33,8 %) primär durch massives Reinforcement Learning in Verbindung mit Prozess-Belohnungsmodellen (PRMs). Bei quantenmechanischen Berechnungen generiert und beschneidet o3 tausende spekulative Lösungszweige vor der finalen Antwort.
2. Claude 3.7 Sonnet: Hybrides Denken und kalibrierte Selbstkorrektur
Claude 3.7 Sonnet bietet dynamisch konfigurierbare Denktokens (0 bis 128k). In der Biochemie und Rechtsphilosophie glänzt das Modell durch autonome Selbstkorrektur: Erkennt es interne Rechenfehler oder thermodynamische Widersprüche, navigiert es selbstständig zurück und korrigiert den Lösungsweg.
3. DeepSeek R1: Der Open-Weight-Durchbruch
DeepSeek R1 beweist, dass reines Reinforcement Learning ohne teure, menschlich annotierte Schritt-für-Schritt-Leitfäden komplexe Argumentationsketten eigenständig erschließen kann. Damit steht Forschern weltweit eine erstklassige Lösung auf eigener Hardware zur Verfügung.
Warum Standard-RAG an HLE scheitert
Herkömmliches Prompting und Retrieval-Augmented Generation (RAG) versagen bei HLE vollständig:
- Synthetische Unikate: HLE-Aufgaben basieren auf neuartigen Modifikationen wissenschaftlicher Theoreme, die nirgendwo im Web indiziert sind.
- Semantische Fehlschlüsse: Vektordatenbanken liefern oberflächlich ähnliche Begriffe, die Modelle zu fehlerhaften Analogien verleiten.
HLE-Evaluation lokal via vLLM reproduzieren:
# Evaluierungs-Repository klonen und Setup durchführen
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang
# Lokale vLLM-Evaluation von DeepSeek R1 ausführen
python run_hle_eval.py \
--model "deepseek-ai/DeepSeek-R1" \
--backend "vllm" \
--tensor-parallel-size 8 \
--temperature 0.6 \
--top-p 0.95 \
--max-thinking-tokens 32768 \
--subject-filter "mathematics,physics,computer_science" \
--output-dir "./results/deepseek_r1_hle"
Fazit und Handlungsempfehlungen
- MMLU und GSM8K ausmerzen: Für quantitative Analysen, Code-Verifikation oder komplexe Fachthemen bieten diese Tests keinen Mehrwert mehr. Nutzen Sie HLE- und FrontierMath-Aufgaben.
- Inferenzzeit-Berechnung priorisieren: Ein kompaktes 32B-Modell mit Test-Time-Suche übertrifft regelmäßig massive Modelle ohne Denkarchitektur.
- Zweistufige Architekturen aufbauen: Routinetasks werden kostengünstig an Standardmodelle übergeben, während komplexe Promotionsprobleme an o3, Claude 3.7 oder DeepSeek R1 delegiert werden.