### Respuesta Rápida: ¿Qué es el Benchmark Humanity's Last Exam (HLE)?
Humanity's Last Exam (HLE) es un benchmark interdisciplinario de 3.000 preguntas diseñado por el Center for AI Safety (CAIS) y Scale AI para representar el límite absoluto del conocimiento académico humano. Con preguntas de física cuántica y geometría algebraica, modelos como OpenAI o3, DeepSeek R1 y Claude 3.7 obtienen entre un 18% y un 34%, poniendo fin a la saturación de métricas.
La crisis de saturación: por qué colapsaron los benchmarks tradicionales
Entre 2023 y 2025, el ecosistema de evaluación de inteligencia artificial sufrió una obsolescencia sin precedentes. Los estándares que diferenciaban a los mejores modelos tocaron techo:
- MMLU (Massive Multitask Language Understanding): El referente de conocimiento general se convirtió en un estándar donde los modelos punteros alcanzan entre el 90% y el 92%, volviendo imposible distinguir avances reales del ruido o la contaminación web.
- GSM8K y MATH: Los problemas de matemáticas escolares (GSM8K) son resueltos con más del 99% de precisión incluso por modelos ligeros, y los exámenes de secundaria (MATH) superaron el 95% con modelos de razonamiento.
- HumanEval y MBPP: La generación de pruebas unitarias en Python superó el 90%, evaluando sintaxis básica en lugar de diseño y arquitectura de software.
- GPQA Diamond: Creado con preguntas a prueba de Google de nivel posgrado, pasó de un 55% a más del 78% mediante el escalado de cómputo en inferencia (Test-Time Compute).
Dado que los modelos base absorbieron enormes volúmenes de la web abierta durante su preentrenamiento, la memorización encubrió carencias en razonamiento deductivo genuino. Se hizo imprescindible crear un nuevo estándar con marcas de agua criptográficas, revisión por pares y derivaciones de nivel doctoral.
Qué es Humanity's Last Exam (HLE)
Desarrollado de manera conjunta por el Center for AI Safety (CAIS) y Scale AI, con la colaboración de más de 1.000 investigadores de prestigiosas universidades, Humanity's Last Exam (HLE) se postula como la evaluación definitiva previa a la AGI.
+---------------------------------------------------------------------------------------------------+
| ARQUITECTURA DEL BENCHMARK HUMANITY'S LAST EXAM (HLE) |
+---------------------------------------------------------------------------------------------------+
| Parámetro | Especificación técnica |
+----------------------------+----------------------------------------------------------------------+
| Total de preguntas | 3.000 problemas multidisciplinarios de texto y multimodales |
| Nivel académico | Doctorado (PhD), investigadores posdoctorales y científicos senior |
| Disciplinas evaluadas | Matemáticas, física, química, biología, informática, derecho, etc. |
| Prevención de fugas | Cadenas canarias criptográficas, demostraciones inéditas |
| Método de verificación | Coincidencia exacta de cadenas, tolerancias numéricas y pruebas |
| Base de expertos humanos | ~100% (Especialistas de área con acceso a material de referencia) |
| LLM estándar sin reasoning | < 3,5% (GPT-4o / Claude 3.5 Sonnet sin cómputo de búsqueda) |
+----------------------------+----------------------------------------------------------------------+
Criterios de admisión de preguntas en HLE
- Nula presencia en Google: Imposible de resolver mediante búsquedas directas o combinación de sitios web públicos.
- Requisito de posgrado avanzado: Un profesional con formación universitaria general pero sin doctorado en la materia no puede resolver el problema en horas.
- Verificación automática inequívoca: La respuesta se reduce a un valor numérico exacto o fórmula verificable sin jueces subjetivos (LLM-as-a-judge).
- Razonamiento multimodal profundo: Alrededor del 15% incluye esquemas moleculares complejos, circuitos integrados y geometría no euclidiana.
La tríada de benchmarks de frontera en 2026: HLE, FrontierMath y ARC-AGI
Para medir capacidades avanzadas, los equipos de investigación recurren a tres evaluaciones complementarias:
=======================================================
TAXONOMÍA DEL RAZONAMIENTO EN IA
=======================================================
/ | \
/ | \
Humanity's Last Exam FrontierMath ARC-AGI-2
(HLE) (Epoch AI) (François Chollet)
| | |
Límite académico global Demostraciones Inducción de reglas
Nivel doctorado PhD matemáticas inéditas abstractas visuales
3.000 preguntas Validación rigurosa Sin memoria previa
1. FrontierMath (Epoch AI)
Desarrollado junto a medallistas Fields, contiene cientos de problemas matemáticos inéditos que requieren horas de investigación humana. Los modelos clásicos no superan el 2%, mientras que los motores de razonamiento alcanzan entre el 20% y el 30%.
2. ARC-AGI (Abstraction and Reasoning Corpus)
Diseñado por François Chollet, evalúa la deducción de reglas de transformación a partir de pocas matrices visuales, aislando la inteligencia fluida de la memoria lingüística.
3. Humanity's Last Exam (HLE)
Aúna la amplitud de MMLU, el rigor matemático de FrontierMath y el razonamiento multimodal en más de 100 disciplinas.
Tabla de líderes global 2026
Rendimiento empírico de los principales modelos de razonamiento y pesos abiertos:
| Arquitectura del Modelo | Proveedor / Licencia | HLE Precisión Global (%) | HLE Matemáticas/CS (%) | FrontierMath Tier-1 (%) | ARC-AGI-2 Verificado (%) | Coste Medio / 1M Tokens |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 (High CoT) | Proprietary API | 65.0% | 72.4% | 87.8% | 96.4% | $10.00 / $50.00 |
| OpenAI GPT-6 Astra | Proprietary API | 57.2% | 74.1% | 97.6% | 99.9% | $10.00 / $50.00 |
| OpenAI o3 (High Effort) | API Propietaria | 33.8% | 38.4% | 31.2% | 78.4% | $45.00 |
| Claude 3.7 Sonnet (Thinking) | Anthropic API | 31.4% | 35.2% | 28.6% | 74.9% | $18.00 |
| DeepSeek R1 (671B Completo) | MIT Open Weights | 27.6% | 32.8% | 24.1% | 71.2% | $2.19 (Autohospedado) |
| OpenAI o1 (Razonamiento) | API Propietaria | 24.2% | 29.1% | 19.8% | 66.5% | $30.00 |
| Kimi k1.5 (Long-CoT) | Moonshot API | 22.8% | 27.4% | 18.2% | 63.8% | $4.50 |
| Gemini 2.0 Flash Thinking | Google Cloud | 21.5% | 25.0% | 16.9% | 61.4% | $3.50 |
| Qwen-2.5-Max (RL-Reasoning) | Alibaba Cloud | 19.8% | 23.6% | 14.5% | 58.2% | $3.20 |
| DeepSeek-R1-Distill-Qwen-32B | Apache 2.0 Open | 14.2% | 17.9% | 9.4% | 49.6% | $0.60 (Local FP8) |
| Claude 3.5 Sonnet (Estándar) | Anthropic API | 5.8% | 6.2% | 2.4% | 38.1% | $3.75 |
| GPT-4o (Base Zero-shot) | API Propietaria | 3.2% | 3.8% | 1.8% | 34.2% | $2.50 |
Análisis técnico: Cómo abordan HLE los modelos de frontera
1. OpenAI o3: Búsqueda en árbol durante la inferencia
OpenAI o3 encabeza la tabla (33,8%) mediante aprendizaje por refuerzo masivo y exploración de árboles de decisión guiada por Process-Reward Models (PRM), descartando hipótesis inconsistentes antes de emitir la solución.
2. Claude 3.7 Sonnet: Pensamiento adaptable y autocorrección
Claude 3.7 Sonnet permite modular el volumen de razonamiento (0 a 128k tokens). En biofísica o derecho destaca por su habilidad para rectificar: si un paso intermediario contradice leyes físicas o principios normativos, retrocede y reestructura la prueba de forma autónoma.
3. DeepSeek R1: El hito del código abierto
DeepSeek R1 evidenció que el entrenamiento por refuerzo puro sobre reglas objetivas (exactitud matemática y formato) hace emerger cadenas de razonamiento complejas sin necesidad de costosas anotaciones humanas paso a paso.
Ineficacia de RAG frente a HLE
El prompting tradicional y los sistemas RAG colapsan ante este examen:
- Exclusividad sintética: Las preguntas no figuran en internet, preprints ni repositorios.
- Engaño semántico: Los índices vectoriales rescatan textos superficialmente análogos que desvían el razonamiento del modelo hacia callejones sin salida.
Reproducción local de la evaluación mediante vLLM:
# Clonar el repositorio oficial e instalar dependencias
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang
# Ejecutar la evaluación de DeepSeek R1 con vLLM
python run_hle_eval.py \
--model "deepseek-ai/DeepSeek-R1" \
--backend "vllm" \
--tensor-parallel-size 8 \
--temperature 0.6 \
--top-p 0.95 \
--max-thinking-tokens 32768 \
--subject-filter "mathematics,physics,computer_science" \
--output-dir "./results/deepseek_r1_hle"
Recomendaciones prácticas para ingeniería de IA
- Retirar MMLU y GSM8K de las métricas de selección: Para validar modelos en auditoría de código, análisis financiero o medicina, MMLU ya no aporta discriminación. Adopte HLE y FrontierMath.
- Priorizar el cómputo en inferencia: Un modelo compacto de 32B con búsqueda y verificación profunda rinde sistemáticamente mejor que un modelo colosal sin tokens de pensamiento.
- Implantar enrutamiento en dos capas: Gestione el 95% de las peticiones con modelos estándar rápidos y desvíe las consultas multidisciplinares críticas a o3, Claude 3.7 o DeepSeek R1.