Benchmarks

Classifica Humanity's Last Exam: Benchmark AI di Frontiera

### Risposta Rapida: Cos'è il benchmark Humanity's Last Exam (HLE)?

Humanity's Last Exam (HLE) è un benchmark multidisciplinare di 3.000 quesiti sviluppato da CAIS e Scale AI per tracciare il limite massimo della conoscenza accademica umana. Spaziando dalla fisica quantistica alla geometria algebrica, i migliori modelli di ragionamento (OpenAI o3, DeepSeek R1, Claude 3.7) ottengono tra il 18% e il 34%, ponendo fine alla saturazione dei benchmark.


La crisi della saturazione: perché i benchmark tradizionali sono falliti

Tra il 2023 e il 2025, l'ecosistema di valutazione dell'intelligenza artificiale ha subito una rapida obsolescenza metrica. I benchmark storici hanno raggiunto la saturazione:

  • MMLU (Massive Multitask Language Understanding): Precedente punto di riferimento per la cultura accademica generale, vede i modelli di frontiera stabilmente tra il 90% e il 92%, rendendo impossibile distinguere progressi reali da rumore o contaminazione del web.
  • GSM8K & MATH: I problemi di matematica scolastica (GSM8K) sono risolti con oltre il 99% di accuratezza persino da modelli compatti, mentre i test di matematica avanzata (MATH) superano il 95% con i modelli di ragionamento.
  • HumanEval & MBPP: La generazione di test unitari Python supera il 90%, testando la correttezza della sintassi di base piuttosto che la reale architettura del software.
  • GPQA Diamond: Progettato per essere immune a Google a livello di dottorato in biologia, chimica e fisica, è salito dal 55% a oltre il 78% grazie al calcolo in fase di inferenza (Test-Time Compute).

Poiché i modelli fondazionali hanno assorbito gran parte del web durante il pre-addestramento, la memorizzazione ha oscurato le reali carenze di ragionamento logico. La ricerca necessitava di un nuovo test con watermark crittografici, revisione accademica tra pari e passaggi deduttivi a livello di dottorato.


Che cos'è Humanity's Last Exam (HLE)

Sviluppato dal Center for AI Safety (CAIS) insieme a Scale AI, con il contributo di oltre 1.000 docenti e ricercatori di istituti universitari internazionali, Humanity's Last Exam (HLE) è stato progettato come l'ultimo banco di prova prima dell'intelligenza artificiale generale (AGI).

+---------------------------------------------------------------------------------------------------+
|                        ARCHITETTURA DEL BENCHMARK HUMANITY'S LAST EXAM (HLE)                      |
+---------------------------------------------------------------------------------------------------+
| Parametro                  | Dettagli di specifica                                                |
+----------------------------+----------------------------------------------------------------------+
| Totale domande             | 3.000 problemi multidisciplinari testuali e multimodali              |
| Livello accademico         | Dottorato di ricerca (PhD), ricercatori post-doc e docenti           |
| Discipline coperte         | Matematica, fisica, chimica, biologia, informatica, diritto, economia |
| Protezione anti-leak       | Stringhe canarino crittografiche, dimostrazioni inedite              |
| Formato di verifica        | Match esatto di stringa, tolleranza numerica, validazione logica     |
| Baseline esperti umani     | ~100% (Specialisti di disciplina con accesso a materiale teorico)   |
| LLM standard senza CoT     | < 3.5% (Zero-shot GPT-4o / Claude 3.5 Sonnet senza ragionamento)     |
+----------------------------+----------------------------------------------------------------------+

Criteri di ammissione dei quesiti in HLE

  1. Totale assenza da Google: La soluzione non può essere trovata con ricerche dirette né con la sintesi di documenti online.
  2. Requisito di studi avanzati: Un laureato generico senza specializzazione di dottorato nella materia specifica non è in grado di risolvere il quesito neanche dopo diverse ore.
  3. Verificabilità oggettiva automatizzata: La risposta si riduce a un valore matematico esatto o a una sequenza alfanumerica univoca, escludendo l'arbitrarietà dei giudizi basati su LLM-as-a-judge.
  4. Ragionamento multimodale scientifico: Circa il 15% delle domande include schemi biochimici, mappe topologiche di circuiti e geometrie non euclidee.

La triade dei benchmark di frontiera nel 2026: HLE, FrontierMath e ARC-AGI

Per misurare l'intelligenza di frontiera, la comunità tecnica si affida a tre test complementari:

                  =======================================================
                            TASSONOMIA DEL RAGIONAMENTO NELL'AI
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (François Chollet)
                        |                  |                  |
               Massimo limite teorico  Dimostrazioni          Induzione di regole
               Livello dottorato PhD   matematiche inedite    astratte visuali
               3.000 quesiti esperti   Verifica rigorosa      Nessuna memoria pregressa

1. FrontierMath (Epoch AI)

Realizzato in collaborazione con vincitori della Medaglia Fields, raccoglie centinaia di problemi inediti che richiedono ore di lavoro a matematici esperti. I modelli standard non raggiungono il 2%, mentre i motori di ragionamento salgono al 20-30%.

2. ARC-AGI (Abstraction and Reasoning Corpus)

Creato da François Chollet, valuta la capacità di ricavare nuove regole di trasformazione geometrica da pochissimi esempi, separando l'intelligenza fluida dalla memoria verbale.

3. Humanity's Last Exam (HLE)

Combina la vastità nozionistica di MMLU con il rigore deduttivo di FrontierMath e l'analisi scientifica multimodale.


Tabella dei leader dei benchmark di frontiera 2026

I risultati empirici registrati sui principali modelli a confronto:

Architettura Modello Fornitore / Licenza HLE Accuratezza Globale (%) HLE Matematica/Informatica (%) FrontierMath Tier-1 (%) ARC-AGI-2 Verificato (%) Costo Medio / 1M Token
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) API Proprietaria 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B Full) MIT Open Weights 27.6% 32.8% 24.1% 71.2% $2.19 (Self-hosted)
OpenAI o1 (Full Reasoning) API Proprietaria 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL-Reasoning) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 Open 14.2% 17.9% 9.4% 49.6% $0.60 (Locale FP8)
Claude 3.5 Sonnet (Standard) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (Base Zero-shot) API Proprietaria 3.2% 3.8% 1.8% 34.2% $2.50

Analisi approfondita: come i modelli affrontano HLE

1. OpenAI o3: Ricerca ad albero durante l'inferenza

OpenAI o3 conquista il primato (33,8%) grazie a un massiccio apprendimento per rinforzo unito alla ricerca su alberi di decisione guidata da modelli di Process Reward (PRM), scartando i rami analitici incoerenti prima di formulare l'output.

2. Claude 3.7 Sonnet: Pensiero adattivo e autocorrezione

Claude 3.7 Sonnet permette di dosare liberamente i token di riflessione (fino a 128k). In biologia e materie giuridiche dimostra un'eccellente capacità di ravvedimento: rilevando violazioni termodinamiche o logiche nei passaggi intermedi, reimposta la dimostrazione in piena autonomia.

3. DeepSeek R1: La svolta open source

DeepSeek R1 ha dimostrato che l'apprendimento per rinforzo basato esclusivamente su regole oggettive (accuratezza matematica e rispetto del formato) genera catene di ragionamento complesse senza ricorrere a costose annotazioni umane, offrendo prestazioni eccellenti a costi minimi.


Perché il RAG tradizionale fallisce su HLE

L'interrogazione tramite prompt standard e RAG si rivela inefficace su questo benchmark:

  • Origine sintetica: I problemi non esistono sul web o nei paper scientifici indicizzati.
  • Inganno di similarità: I database vettoriali recuperano frammenti lessicalmente simili che spingono il modello verso analogie fuorvianti.

Esecuzione della valutazione con vLLM:

# Clone della repository ufficiale e configurazione
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# Esecuzione della valutazione di DeepSeek R1 via vLLM
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

Linee guida operative per gli sviluppatori

  1. Rimuovere MMLU e GSM8K dai criteri di selezione: Per applicazioni in ambito finanziario, medico o crittografico, questi test non forniscono più alcun valore discriminante. Utilizzate HLE e FrontierMath.
  2. Privilegiare il calcolo in inferenza: Un modello 32B con ricerca approfondita supera regolarmente modelli monolitici privi di elaborazione riflessiva.
  3. Architettura di instradamento a doppio livello: Gestite la maggioranza delle richieste ordinarie con modelli rapidi ed economici ed escalate i quesiti complessi a o3, Claude 3.7 o DeepSeek R1.
← Tutti gli Articoli
0 / 4