Benchmarks

Classement Humanity's Last Exam : Analyse des Benchmarks IA

### Réponse Rapide : Qu'est-ce que le benchmark Humanity's Last Exam (HLE) ?

Humanity's Last Exam (HLE) est un benchmark pluridisciplinaire de 3 000 questions d'élite conçu par le Center for AI Safety (CAIS) et Scale AI pour représenter le sommet absolu du savoir académique humain. Couvrant la physique quantique et la géométrie algébrique, les modèles de raisonnement de pointe (OpenAI o3, DeepSeek R1, Claude 3.7) n'obtiennent qu'entre 18 % et 34 %, marquant la fin de la saturation des benchmarks.


La crise de la saturation : pourquoi les benchmarks classiques ont échoué

Entre 2023 et 2025, l'écosystème d'évaluation de l'intelligence artificielle a été frappé par une obsolescence critique. Les benchmarks de référence servant à départager les meilleurs modèles ont atteint leur plafond opérationnel :

  • MMLU (Massive Multitask Language Understanding) : Autrefois référence absolue de la culture académique générale, les modèles de pointe y affichent désormais 90 à 92 %, rendant les écarts indistinguables du bruit statistique ou de la contamination des données.
  • GSM8K et MATH : Les problèmes mathématiques scolaires (GSM8K) sont résolus à plus de 99 % par de petits modèles distillés, tandis que le test de lycée MATH dépasse 95 % grâce aux modèles de raisonnement.
  • HumanEval et MBPP : La génération de tests unitaires Python a franchi les 90 %, mesurant une conformité syntaxique de base plutôt que de la conception logicielle complexe.
  • GPQA Diamond : Conçu pour être impossible à résoudre via Google à un niveau doctoral en biologie, physique et chimie, ses scores sont passés de 55 % à plus de 78 % grâce au calcul au moment de l'inférence (Test-Time Compute).

Les modèles de fondation ayant ingéré une grande partie du web public durant leur pré-entraînement, la mémorisation a masqué l'absence de véritable raisonnement synthétique. La recherche exigeait de nouveaux protocoles sécurisés par filigranes cryptographiques, validés par les pairs et nécessitant des dérivations doctorales en plusieurs étapes.


Présentation de Humanity's Last Exam (HLE)

Co-développé par le Center for AI Safety (CAIS) et Scale AI, avec l'appui de plus de 1 000 spécialistes académiques à travers le monde, Humanity's Last Exam (HLE) constitue l'ultime frontière d'évaluation avant l'intelligence artificielle générale (AGI).

+---------------------------------------------------------------------------------------------------+
|                        ARCHITECTURE DU BENCHMARK HUMANITY'S LAST EXAM (HLE)                       |
+---------------------------------------------------------------------------------------------------+
| Paramètre                  | Spécifications techniques                                            |
+----------------------------+----------------------------------------------------------------------+
| Nombre total de questions  | 3 000 problèmes interdisciplinaires textuels et multimodaux          |
| Niveau académique          | Doctorat (PhD), chercheurs postdoctoraux et scientifiques de haut vol|
| Disciplines couvertes      | Mathématiques, physique, chimie, biologie, informatique, droit, etc. |
| Protection anti-fuites     | Chaînes canaris cryptographiques, preuves et énoncés inédits         |
| Format d'évaluation        | Correspondance exacte de chaînes, tolérance numérique, preuve formelle|
| Référence humaine experte  | ~100 % (Spécialistes du domaine avec accès à la littérature technique)|
| LLM classique sans CoT     | < 3,5 % (Zero-shot GPT-4o / Claude 3.5 Sonnet sans temps de réflexion)|
+----------------------------+----------------------------------------------------------------------+

Critères stricts de sélection des questions

  1. Introuvable sur les moteurs de recherche : La réponse ne peut être obtenue par recherche directe ou synthèse superficielle du web.
  2. Prérequis doctoral : Un universitaire sans spécialisation doctorale dans le domaine précis ne peut résoudre la question en plusieurs heures.
  3. Vérifiabilité objective : La réponse correspond à une valeur mathématique exacte ou un jeton non ambigu, éliminant tout biais d'évaluation par un modèle tiers (LLM-as-a-judge).
  4. Raisonnement multimodal complexe : Près de 15 % des questions intègrent des schémas moléculaires, des topologies de circuits ou des diagrammes non euclidiens.

Le triumvirat des benchmarks de pointe en 2026 : HLE, FrontierMath et ARC-AGI

L'évaluation de pointe repose sur trois piliers méthodologiques complémentaires :

                  =======================================================
                           TAXONOMIE DU RAISONNEMENT EN IA AVANCÉE
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (François Chollet)
                        |                  |                  |
               Plafond académique total Démonstrations        Induction de règles
               Complexité PhD transverse mathématiques inédites abstraites visuelles
               3 000 problèmes experts  Preuves rigoureuses   Sans pré-entraînement

1. FrontierMath (Epoch AI)

Créé en collaboration avec des lauréats de la médaille Fields, FrontierMath regroupe des centaines de problèmes originaux et inédits exigeant des heures de recherche humaine. Les modèles sans raisonnement n'atteignent pas 2 %, tandis que les moteurs de pointe oscillent entre 20 % et 30 %.

2. ARC-AGI (Abstraction and Reasoning Corpus)

Conçu par François Chollet, ce test mesure l'aptitude à inférer de nouvelles règles de transformation spatiale à partir de quelques grilles d'exemples, isolant l'intelligence fluide de la mémoire lexicale.

3. Humanity's Last Exam (HLE)

Il réunit l'éclectisme académique de MMLU, l'exigence formelle de FrontierMath et la résolution de schémas scientifiques multimodaux.


Classement global des modèles de pointe en 2026

Résultats empiriques mesurés sur les modèles de raisonnement majeurs :

Architecture de modèle Fournisseur / Licence HLE Précision globale (%) HLE Maths/Informatique (%) FrontierMath Tier-1 (%) ARC-AGI-2 Vérifié (%) Coût moyen / 1M Tokens
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) API propriétaire 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B Complet) MIT Open Weights 27.6% 32.8% 24.1% 71.2% $2.19 (Auto-hébergé)
OpenAI o1 (Raisonnement) API propriétaire 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL Reasoning) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 Open 14.2% 17.9% 9.4% 49.6% $0.60 (Local FP8)
Claude 3.5 Sonnet (Standard) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (Référence Zero-shot) API propriétaire 3.2% 3.8% 1.8% 34.2% $2.50

Analyse technique : comment les modèles attaquent HLE

1. OpenAI o3 : Exploration arborescente en phase d'inférence

OpenAI o3 domine le classement (33,8 %) en combinant l'apprentissage par renforcement à grande échelle et une recherche arborescente guidée par des modèles de récompense de processus (PRM), élaguant les pistes incohérentes avant toute émission finale.

2. Claude 3.7 Sonnet : Réflexion hybride et autocorrection

Claude 3.7 Sonnet permet d'allouer de 0 à 128 000 jetons de réflexion. Il excelle particulièrement en biologie moléculaire et en droit, faisant preuve d'une autocorrection remarquable : lorsqu'il détecte une contradiction thermodynamique dans ses calculs, il réévalue de lui-même sa chaîne de déduction.

3. DeepSeek R1 : La révolution des poids ouverts

DeepSeek R1 prouve que l'apprentissage par renforcement pur, sans annotations humaines d'étapes de raisonnement, permet l'émergence d'une vérification autonome performante. Les centres de recherche peuvent ainsi déployer un système compétitif sur leurs propres infrastructures.


Pourquoi le RAG traditionnel s'effondre sur HLE

Les méthodes de recherche documentaire (RAG) et les requêtes directes échouent systématiquement :

  • Unicité synthétique : Les problèmes reposent sur des lemmes créés de toutes pièces, introuvables sur le web.
  • Pièges de similarité vectorielle : Les bases de données vectorielles renvoient des documents en apparence analogues qui induisent le modèle en erreur.

Évaluation locale via vLLM :

# Cloner le dépôt officiel et installer l'environnement
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# Exécuter l'évaluation de DeepSeek R1 via vLLM
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

Recommandations opérationnelles pour les équipes d'ingénierie

  1. Supprimez MMLU et GSM8K de vos grilles d'évaluation : Pour valider un modèle dans l'analyse financière, le juridique ou la cybersécurité, MMLU ne fournit plus de signal probant. Utilisez des sous-ensembles de HLE et FrontierMath.
  2. Misez sur le calcul à l'inférence : Un modèle 32B distillé intégrant une recherche approfondie dépasse systématiquement des modèles massifs dépourvus de chaîne de pensée.
  3. Mettez en place un routage à deux niveaux : Traitez 95 % des requêtes simples avec des modèles économiques et réservez o3, Claude 3.7 ou DeepSeek R1 aux tâches doctorales complexes.
← Tous les Articles
0 / 4