### Réponse Rapide : Qu'est-ce que le benchmark Humanity's Last Exam (HLE) ?
Humanity's Last Exam (HLE) est un benchmark pluridisciplinaire de 3 000 questions d'élite conçu par le Center for AI Safety (CAIS) et Scale AI pour représenter le sommet absolu du savoir académique humain. Couvrant la physique quantique et la géométrie algébrique, les modèles de raisonnement de pointe (OpenAI o3, DeepSeek R1, Claude 3.7) n'obtiennent qu'entre 18 % et 34 %, marquant la fin de la saturation des benchmarks.
La crise de la saturation : pourquoi les benchmarks classiques ont échoué
Entre 2023 et 2025, l'écosystème d'évaluation de l'intelligence artificielle a été frappé par une obsolescence critique. Les benchmarks de référence servant à départager les meilleurs modèles ont atteint leur plafond opérationnel :
- MMLU (Massive Multitask Language Understanding) : Autrefois référence absolue de la culture académique générale, les modèles de pointe y affichent désormais 90 à 92 %, rendant les écarts indistinguables du bruit statistique ou de la contamination des données.
- GSM8K et MATH : Les problèmes mathématiques scolaires (GSM8K) sont résolus à plus de 99 % par de petits modèles distillés, tandis que le test de lycée MATH dépasse 95 % grâce aux modèles de raisonnement.
- HumanEval et MBPP : La génération de tests unitaires Python a franchi les 90 %, mesurant une conformité syntaxique de base plutôt que de la conception logicielle complexe.
- GPQA Diamond : Conçu pour être impossible à résoudre via Google à un niveau doctoral en biologie, physique et chimie, ses scores sont passés de 55 % à plus de 78 % grâce au calcul au moment de l'inférence (Test-Time Compute).
Les modèles de fondation ayant ingéré une grande partie du web public durant leur pré-entraînement, la mémorisation a masqué l'absence de véritable raisonnement synthétique. La recherche exigeait de nouveaux protocoles sécurisés par filigranes cryptographiques, validés par les pairs et nécessitant des dérivations doctorales en plusieurs étapes.
Présentation de Humanity's Last Exam (HLE)
Co-développé par le Center for AI Safety (CAIS) et Scale AI, avec l'appui de plus de 1 000 spécialistes académiques à travers le monde, Humanity's Last Exam (HLE) constitue l'ultime frontière d'évaluation avant l'intelligence artificielle générale (AGI).
+---------------------------------------------------------------------------------------------------+
| ARCHITECTURE DU BENCHMARK HUMANITY'S LAST EXAM (HLE) |
+---------------------------------------------------------------------------------------------------+
| Paramètre | Spécifications techniques |
+----------------------------+----------------------------------------------------------------------+
| Nombre total de questions | 3 000 problèmes interdisciplinaires textuels et multimodaux |
| Niveau académique | Doctorat (PhD), chercheurs postdoctoraux et scientifiques de haut vol|
| Disciplines couvertes | Mathématiques, physique, chimie, biologie, informatique, droit, etc. |
| Protection anti-fuites | Chaînes canaris cryptographiques, preuves et énoncés inédits |
| Format d'évaluation | Correspondance exacte de chaînes, tolérance numérique, preuve formelle|
| Référence humaine experte | ~100 % (Spécialistes du domaine avec accès à la littérature technique)|
| LLM classique sans CoT | < 3,5 % (Zero-shot GPT-4o / Claude 3.5 Sonnet sans temps de réflexion)|
+----------------------------+----------------------------------------------------------------------+
Critères stricts de sélection des questions
- Introuvable sur les moteurs de recherche : La réponse ne peut être obtenue par recherche directe ou synthèse superficielle du web.
- Prérequis doctoral : Un universitaire sans spécialisation doctorale dans le domaine précis ne peut résoudre la question en plusieurs heures.
- Vérifiabilité objective : La réponse correspond à une valeur mathématique exacte ou un jeton non ambigu, éliminant tout biais d'évaluation par un modèle tiers (LLM-as-a-judge).
- Raisonnement multimodal complexe : Près de 15 % des questions intègrent des schémas moléculaires, des topologies de circuits ou des diagrammes non euclidiens.
Le triumvirat des benchmarks de pointe en 2026 : HLE, FrontierMath et ARC-AGI
L'évaluation de pointe repose sur trois piliers méthodologiques complémentaires :
=======================================================
TAXONOMIE DU RAISONNEMENT EN IA AVANCÉE
=======================================================
/ | \
/ | \
Humanity's Last Exam FrontierMath ARC-AGI-2
(HLE) (Epoch AI) (François Chollet)
| | |
Plafond académique total Démonstrations Induction de règles
Complexité PhD transverse mathématiques inédites abstraites visuelles
3 000 problèmes experts Preuves rigoureuses Sans pré-entraînement
1. FrontierMath (Epoch AI)
Créé en collaboration avec des lauréats de la médaille Fields, FrontierMath regroupe des centaines de problèmes originaux et inédits exigeant des heures de recherche humaine. Les modèles sans raisonnement n'atteignent pas 2 %, tandis que les moteurs de pointe oscillent entre 20 % et 30 %.
2. ARC-AGI (Abstraction and Reasoning Corpus)
Conçu par François Chollet, ce test mesure l'aptitude à inférer de nouvelles règles de transformation spatiale à partir de quelques grilles d'exemples, isolant l'intelligence fluide de la mémoire lexicale.
3. Humanity's Last Exam (HLE)
Il réunit l'éclectisme académique de MMLU, l'exigence formelle de FrontierMath et la résolution de schémas scientifiques multimodaux.
Classement global des modèles de pointe en 2026
Résultats empiriques mesurés sur les modèles de raisonnement majeurs :
| Architecture de modèle | Fournisseur / Licence | HLE Précision globale (%) | HLE Maths/Informatique (%) | FrontierMath Tier-1 (%) | ARC-AGI-2 Vérifié (%) | Coût moyen / 1M Tokens |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 (High CoT) | Proprietary API | 65.0% | 72.4% | 87.8% | 96.4% | $10.00 / $50.00 |
| OpenAI GPT-6 Astra | Proprietary API | 57.2% | 74.1% | 97.6% | 99.9% | $10.00 / $50.00 |
| OpenAI o3 (High Effort) | API propriétaire | 33.8% | 38.4% | 31.2% | 78.4% | $45.00 |
| Claude 3.7 Sonnet (Thinking) | Anthropic API | 31.4% | 35.2% | 28.6% | 74.9% | $18.00 |
| DeepSeek R1 (671B Complet) | MIT Open Weights | 27.6% | 32.8% | 24.1% | 71.2% | $2.19 (Auto-hébergé) |
| OpenAI o1 (Raisonnement) | API propriétaire | 24.2% | 29.1% | 19.8% | 66.5% | $30.00 |
| Kimi k1.5 (Long-CoT) | Moonshot API | 22.8% | 27.4% | 18.2% | 63.8% | $4.50 |
| Gemini 2.0 Flash Thinking | Google Cloud | 21.5% | 25.0% | 16.9% | 61.4% | $3.50 |
| Qwen-2.5-Max (RL Reasoning) | Alibaba Cloud | 19.8% | 23.6% | 14.5% | 58.2% | $3.20 |
| DeepSeek-R1-Distill-Qwen-32B | Apache 2.0 Open | 14.2% | 17.9% | 9.4% | 49.6% | $0.60 (Local FP8) |
| Claude 3.5 Sonnet (Standard) | Anthropic API | 5.8% | 6.2% | 2.4% | 38.1% | $3.75 |
| GPT-4o (Référence Zero-shot) | API propriétaire | 3.2% | 3.8% | 1.8% | 34.2% | $2.50 |
Analyse technique : comment les modèles attaquent HLE
1. OpenAI o3 : Exploration arborescente en phase d'inférence
OpenAI o3 domine le classement (33,8 %) en combinant l'apprentissage par renforcement à grande échelle et une recherche arborescente guidée par des modèles de récompense de processus (PRM), élaguant les pistes incohérentes avant toute émission finale.
2. Claude 3.7 Sonnet : Réflexion hybride et autocorrection
Claude 3.7 Sonnet permet d'allouer de 0 à 128 000 jetons de réflexion. Il excelle particulièrement en biologie moléculaire et en droit, faisant preuve d'une autocorrection remarquable : lorsqu'il détecte une contradiction thermodynamique dans ses calculs, il réévalue de lui-même sa chaîne de déduction.
3. DeepSeek R1 : La révolution des poids ouverts
DeepSeek R1 prouve que l'apprentissage par renforcement pur, sans annotations humaines d'étapes de raisonnement, permet l'émergence d'une vérification autonome performante. Les centres de recherche peuvent ainsi déployer un système compétitif sur leurs propres infrastructures.
Pourquoi le RAG traditionnel s'effondre sur HLE
Les méthodes de recherche documentaire (RAG) et les requêtes directes échouent systématiquement :
- Unicité synthétique : Les problèmes reposent sur des lemmes créés de toutes pièces, introuvables sur le web.
- Pièges de similarité vectorielle : Les bases de données vectorielles renvoient des documents en apparence analogues qui induisent le modèle en erreur.
Évaluation locale via vLLM :
# Cloner le dépôt officiel et installer l'environnement
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang
# Exécuter l'évaluation de DeepSeek R1 via vLLM
python run_hle_eval.py \
--model "deepseek-ai/DeepSeek-R1" \
--backend "vllm" \
--tensor-parallel-size 8 \
--temperature 0.6 \
--top-p 0.95 \
--max-thinking-tokens 32768 \
--subject-filter "mathematics,physics,computer_science" \
--output-dir "./results/deepseek_r1_hle"
Recommandations opérationnelles pour les équipes d'ingénierie
- Supprimez MMLU et GSM8K de vos grilles d'évaluation : Pour valider un modèle dans l'analyse financière, le juridique ou la cybersécurité, MMLU ne fournit plus de signal probant. Utilisez des sous-ensembles de HLE et FrontierMath.
- Misez sur le calcul à l'inférence : Un modèle 32B distillé intégrant une recherche approfondie dépasse systématiquement des modèles massifs dépourvus de chaîne de pensée.
- Mettez en place un routage à deux niveaux : Traitez 95 % des requêtes simples avec des modèles économiques et réservez o3, Claude 3.7 ou DeepSeek R1 aux tâches doctorales complexes.