### Resposta Rápida: O que é o benchmark Humanity's Last Exam (HLE)?
O Humanity's Last Exam (HLE) é um benchmark multidisciplinar com 3.000 questões avançadas desenvolvido pelo Center for AI Safety (CAIS) e Scale AI para demarcar o limite do conhecimento acadêmico humano. Abrangendo física quântica e geometria algébrica, modelos como OpenAI o3, DeepSeek R1 e Claude 3.7 atingem entre 18% e 34%, encerrando a saturação das métricas tradicionais.
A crise de saturação: por que os benchmarks tradicionais colapsaram
Entre 2023 e 2025, o ecossistema de avaliação de inteligência artificial sofreu com a rápida obsolescência de suas principais métricas. As referências históricas atingiram seu teto de mensuração:
- MMLU (Massive Multitask Language Understanding): Antes o padrão ouro do conhecimento geral, passou a registrar índices de 90% a 92% nos modelos de ponta, tornando as diferenças residuais indistinguíveis do ruído do dataset ou de contaminação web.
- GSM8K e MATH: Problemas de matemática escolar básica (GSM8K) são solucionados com mais de 99% de acerto até por modelos compactos, enquanto o teste avançado MATH superou 95% com modelos de raciocínio lógico.
- HumanEval e MBPP: A geração de testes unitários em Python ultrapassou 90%, testando apenas adequação sintática em vez de arquitetura de software complexa.
- GPQA Diamond: Criado com perguntas à prova de Google em nível de pós-graduação, viu sua acurácia subir de 55% para mais de 78% com a expansão de computação em tempo de inferência (Test-Time Compute).
Como os modelos de fundação absorveram vastas parcelas da internet durante o pré-treinamento, a memorização disfarçou as deficiências reais de raciocínio dedutivo. Tornou-se essencial criar avaliações com marcas d'água criptográficas, revisão por pares e deduções em nível de doutorado.
O que é o Humanity's Last Exam (HLE)
Elaborado em conjunto pelo Center for AI Safety (CAIS) e pela Scale AI, com a cooperação de mais de 1.000 acadêmicos e pesquisadores de ponta no mundo, o Humanity's Last Exam (HLE) foi estruturado para ser a barreira definitiva de avaliação antes da AGI.
+---------------------------------------------------------------------------------------------------+
| ARQUITETURA DO BENCHMARK HUMANITY'S LAST EXAM (HLE) |
+---------------------------------------------------------------------------------------------------+
| Parâmetro | Especificações Técnicas |
+----------------------------+----------------------------------------------------------------------+
| Total de Questões | 3.000 problemas multidisciplinares multimodais e em texto |
| Nível Acadêmico | Doutorado (PhD), pesquisadores pós-doutorais e cientistas seniores |
| Disciplinas Abrangidas | Matemática, Física, Química, Biologia, Computação, Direito, Economia|
| Proteção Anticontaminação | Cadeias canário criptográficas, demonstrações e enunciados inéditos |
| Formato de Avaliação | Correspondência exata, tolerância numérica, prova formal automatizada|
| Linha de Base Humana | ~100% (Especialistas com acesso a material de consulta técnica) |
| LLM sem Raciocínio (Zero) | < 3,5% (GPT-4o / Claude 3.5 Sonnet sem tempo de raciocínio estendido)|
+----------------------------+----------------------------------------------------------------------+
Critérios de Admissão de Questões no HLE
- Inexistência no Google: A resposta não pode ser obtida por busca direta nem por compilação superficial de páginas públicas.
- Exigência de Pós-Graduação Estrita: Um graduado geral sem doutorado na área específica não consegue resolver o problema em várias horas de trabalho.
- Verificabilidade Automatizada: O resultado converge para um valor numérico exato ou expressão alfanumérica única, eliminando vieses de avaliadores subjetivos (LLM-as-a-judge).
- Raciocínio Multimodal Científico: Cerca de 15% das questões incorporam esquemas estruturais de bioquímica, diagramas de circuitos integrados e topologia não euclidiana.
A tríade de benchmarks de fronteira em 2026: HLE, FrontierMath e ARC-AGI
Para aferir a inteligência de fronteira, a indústria adota três testes complementares:
=======================================================
TAXONOMIA DO RACIOCÍNIO EM IA
=======================================================
/ | \
/ | \
Humanity's Last Exam FrontierMath ARC-AGI-2
(HLE) (Epoch AI) (François Chollet)
| | |
Teto acadêmico total Demonstrações Indução de regras
Nível PhD multidiscipl. matemáticas inéditas abstratas visuais
3.000 questões periciais Verificação rigorosa Sem pré-treinamento
1. FrontierMath (Epoch AI)
Construído em parceria com matemáticos premiados com a Medalha Fields, reúne centenas de problemas inéditos que exigem horas de trabalho de pesquisadores. Modelos tradicionais não atingem 2%, enquanto modelos de raciocínio alcançam entre 20% e 30%.
2. ARC-AGI (Abstraction and Reasoning Corpus)
Desenvolvido por François Chollet, mede a capacidade de abstrair regras inéditas a partir de poucos exemplos visuais, separando a inteligência fluida da memória enciclopédica.
3. Humanity's Last Exam (HLE)
Une o amplo repertório de áreas do MMLU, o rigor lógico do FrontierMath e a interpretação científica multimodal.
Tabela de líderes de benchmarks de fronteira 2026
Desempenho empírico consolidado dos principais modelos de raciocínio:
| Arquitetura do Modelo | Provedor / Licença | HLE Acurácia Global (%) | HLE Matemática/CS (%) | FrontierMath Tier-1 (%) | ARC-AGI-2 Verificado (%) | Custo Médio / 1M Tokens |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 (High CoT) | Proprietary API | 65.0% | 72.4% | 87.8% | 96.4% | $10.00 / $50.00 |
| OpenAI GPT-6 Astra | Proprietary API | 57.2% | 74.1% | 97.6% | 99.9% | $10.00 / $50.00 |
| OpenAI o3 (High Effort) | API Proprietária | 33.8% | 38.4% | 31.2% | 78.4% | $45.00 |
| Claude 3.7 Sonnet (Thinking) | Anthropic API | 31.4% | 35.2% | 28.6% | 74.9% | $18.00 |
| DeepSeek R1 (671B Completo) | MIT Open Weights | 27.6% | 32.8% | 24.1% | 71.2% | $2.19 (Auto-hospedado) |
| OpenAI o1 (Raciocínio Pleno) | API Proprietária | 24.2% | 29.1% | 19.8% | 66.5% | $30.00 |
| Kimi k1.5 (Long-CoT) | Moonshot API | 22.8% | 27.4% | 18.2% | 63.8% | $4.50 |
| Gemini 2.0 Flash Thinking | Google Cloud | 21.5% | 25.0% | 16.9% | 61.4% | $3.50 |
| Qwen-2.5-Max (RL Reasoning) | Alibaba Cloud | 19.8% | 23.6% | 14.5% | 58.2% | $3.20 |
| DeepSeek-R1-Distill-Qwen-32B | Apache 2.0 Open | 14.2% | 17.9% | 9.4% | 49.6% | $0.60 (Local FP8) |
| Claude 3.5 Sonnet (Padrão) | Anthropic API | 5.8% | 6.2% | 2.4% | 38.1% | $3.75 |
| GPT-4o (Base Zero-shot) | API Proprietária | 3.2% | 3.8% | 1.8% | 34.2% | $2.50 |
Análise técnica: Como os modelos atacam o HLE
1. OpenAI o3: Busca em árvore em tempo de inferência
O OpenAI o3 lidera a tabela (33,8%) graças ao aprendizado por reforço em larga escala combinado à busca em árvores com Modelos de Recompensa de Processo (PRM), podando caminhos incoerentes antes de emitir a resposta.
2. Claude 3.7 Sonnet: Pensamento dinâmico e autocorreção
O Claude 3.7 Sonnet permite modular o volume de tokens de pensamento (de 0 a 128k). Em biologia molecular e teses jurídicas, demonstra excelente autocrítica: ao detectar violações em premissas termodinâmicas intermediárias, retrocede e reformula os passos autonomamente.
3. DeepSeek R1: A revolução dos pesos abertos
O DeepSeek R1 provou que o aprendizado por reforço baseado em regras objetivas (exatidão matemática e aderência ao formato) faz emergir cadeias lógicas complexas sem depender de extensas anotações humanas passo a passo.
Por que o RAG tradicional é ineficaz no HLE
Consultas baseadas em RAG e prompts comuns falham repetidamente diante do HLE:
- Exclusividade Sintética: As formulações partem de lemas inéditos que não existem na internet indexada.
- Armadilhas de Vetorização: Bancos de dados vetoriais retornam documentos superficialmente parecidos que induzem o modelo a analogias equivocadas.
Reprodução da avaliação com vLLM:
# Clonagem do repositório oficial e preparação do ambiente
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang
# Execução da avaliação com DeepSeek R1 no vLLM
python run_hle_eval.py \
--model "deepseek-ai/DeepSeek-R1" \
--backend "vllm" \
--tensor-parallel-size 8 \
--temperature 0.6 \
--top-p 0.95 \
--max-thinking-tokens 32768 \
--subject-filter "mathematics,physics,computer_science" \
--output-dir "./results/deepseek_r1_hle"
Diretrizes de engenharia para produção
- Descarte MMLU e GSM8K: Para selecionar modelos voltados à verificação de código, finanças quantitativas ou medicina, esses testes já não possuem poder discriminatório. Utilize HLE e FrontierMath.
- Priorize Test-Time Compute: Um modelo destilado de 32B com busca profunda e verificação contínua supera modelos densos gigantescos sem raciocínio em tarefas analíticas.
- Estruture roteamento de dois níveis: Atenda 95% das solicitações com modelos rápidos e econômicos e direcione os problemas interdisciplinares complexos para o3, Claude 3.7 ou DeepSeek R1.