Benchmarks

Ranking do Humanity's Last Exam: Benchmark de IA de Fronteira

### Resposta Rápida: O que é o benchmark Humanity's Last Exam (HLE)?

O Humanity's Last Exam (HLE) é um benchmark multidisciplinar com 3.000 questões avançadas desenvolvido pelo Center for AI Safety (CAIS) e Scale AI para demarcar o limite do conhecimento acadêmico humano. Abrangendo física quântica e geometria algébrica, modelos como OpenAI o3, DeepSeek R1 e Claude 3.7 atingem entre 18% e 34%, encerrando a saturação das métricas tradicionais.


A crise de saturação: por que os benchmarks tradicionais colapsaram

Entre 2023 e 2025, o ecossistema de avaliação de inteligência artificial sofreu com a rápida obsolescência de suas principais métricas. As referências históricas atingiram seu teto de mensuração:

  • MMLU (Massive Multitask Language Understanding): Antes o padrão ouro do conhecimento geral, passou a registrar índices de 90% a 92% nos modelos de ponta, tornando as diferenças residuais indistinguíveis do ruído do dataset ou de contaminação web.
  • GSM8K e MATH: Problemas de matemática escolar básica (GSM8K) são solucionados com mais de 99% de acerto até por modelos compactos, enquanto o teste avançado MATH superou 95% com modelos de raciocínio lógico.
  • HumanEval e MBPP: A geração de testes unitários em Python ultrapassou 90%, testando apenas adequação sintática em vez de arquitetura de software complexa.
  • GPQA Diamond: Criado com perguntas à prova de Google em nível de pós-graduação, viu sua acurácia subir de 55% para mais de 78% com a expansão de computação em tempo de inferência (Test-Time Compute).

Como os modelos de fundação absorveram vastas parcelas da internet durante o pré-treinamento, a memorização disfarçou as deficiências reais de raciocínio dedutivo. Tornou-se essencial criar avaliações com marcas d'água criptográficas, revisão por pares e deduções em nível de doutorado.


O que é o Humanity's Last Exam (HLE)

Elaborado em conjunto pelo Center for AI Safety (CAIS) e pela Scale AI, com a cooperação de mais de 1.000 acadêmicos e pesquisadores de ponta no mundo, o Humanity's Last Exam (HLE) foi estruturado para ser a barreira definitiva de avaliação antes da AGI.

+---------------------------------------------------------------------------------------------------+
|                        ARQUITETURA DO BENCHMARK HUMANITY'S LAST EXAM (HLE)                        |
+---------------------------------------------------------------------------------------------------+
| Parâmetro                  | Especificações Técnicas                                              |
+----------------------------+----------------------------------------------------------------------+
| Total de Questões          | 3.000 problemas multidisciplinares multimodais e em texto            |
| Nível Acadêmico            | Doutorado (PhD), pesquisadores pós-doutorais e cientistas seniores   |
| Disciplinas Abrangidas     | Matemática, Física, Química, Biologia, Computação, Direito, Economia|
| Proteção Anticontaminação  | Cadeias canário criptográficas, demonstrações e enunciados inéditos  |
| Formato de Avaliação       | Correspondência exata, tolerância numérica, prova formal automatizada|
| Linha de Base Humana       | ~100% (Especialistas com acesso a material de consulta técnica)      |
| LLM sem Raciocínio (Zero)  | < 3,5% (GPT-4o / Claude 3.5 Sonnet sem tempo de raciocínio estendido)|
+----------------------------+----------------------------------------------------------------------+

Critérios de Admissão de Questões no HLE

  1. Inexistência no Google: A resposta não pode ser obtida por busca direta nem por compilação superficial de páginas públicas.
  2. Exigência de Pós-Graduação Estrita: Um graduado geral sem doutorado na área específica não consegue resolver o problema em várias horas de trabalho.
  3. Verificabilidade Automatizada: O resultado converge para um valor numérico exato ou expressão alfanumérica única, eliminando vieses de avaliadores subjetivos (LLM-as-a-judge).
  4. Raciocínio Multimodal Científico: Cerca de 15% das questões incorporam esquemas estruturais de bioquímica, diagramas de circuitos integrados e topologia não euclidiana.

A tríade de benchmarks de fronteira em 2026: HLE, FrontierMath e ARC-AGI

Para aferir a inteligência de fronteira, a indústria adota três testes complementares:

                  =======================================================
                            TAXONOMIA DO RACIOCÍNIO EM IA
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (François Chollet)
                        |                  |                  |
               Teto acadêmico total    Demonstrações          Indução de regras
               Nível PhD multidiscipl. matemáticas inéditas   abstratas visuais
               3.000 questões periciais Verificação rigorosa   Sem pré-treinamento

1. FrontierMath (Epoch AI)

Construído em parceria com matemáticos premiados com a Medalha Fields, reúne centenas de problemas inéditos que exigem horas de trabalho de pesquisadores. Modelos tradicionais não atingem 2%, enquanto modelos de raciocínio alcançam entre 20% e 30%.

2. ARC-AGI (Abstraction and Reasoning Corpus)

Desenvolvido por François Chollet, mede a capacidade de abstrair regras inéditas a partir de poucos exemplos visuais, separando a inteligência fluida da memória enciclopédica.

3. Humanity's Last Exam (HLE)

Une o amplo repertório de áreas do MMLU, o rigor lógico do FrontierMath e a interpretação científica multimodal.


Tabela de líderes de benchmarks de fronteira 2026

Desempenho empírico consolidado dos principais modelos de raciocínio:

Arquitetura do Modelo Provedor / Licença HLE Acurácia Global (%) HLE Matemática/CS (%) FrontierMath Tier-1 (%) ARC-AGI-2 Verificado (%) Custo Médio / 1M Tokens
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) API Proprietária 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B Completo) MIT Open Weights 27.6% 32.8% 24.1% 71.2% $2.19 (Auto-hospedado)
OpenAI o1 (Raciocínio Pleno) API Proprietária 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL Reasoning) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 Open 14.2% 17.9% 9.4% 49.6% $0.60 (Local FP8)
Claude 3.5 Sonnet (Padrão) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (Base Zero-shot) API Proprietária 3.2% 3.8% 1.8% 34.2% $2.50

Análise técnica: Como os modelos atacam o HLE

1. OpenAI o3: Busca em árvore em tempo de inferência

O OpenAI o3 lidera a tabela (33,8%) graças ao aprendizado por reforço em larga escala combinado à busca em árvores com Modelos de Recompensa de Processo (PRM), podando caminhos incoerentes antes de emitir a resposta.

2. Claude 3.7 Sonnet: Pensamento dinâmico e autocorreção

O Claude 3.7 Sonnet permite modular o volume de tokens de pensamento (de 0 a 128k). Em biologia molecular e teses jurídicas, demonstra excelente autocrítica: ao detectar violações em premissas termodinâmicas intermediárias, retrocede e reformula os passos autonomamente.

3. DeepSeek R1: A revolução dos pesos abertos

O DeepSeek R1 provou que o aprendizado por reforço baseado em regras objetivas (exatidão matemática e aderência ao formato) faz emergir cadeias lógicas complexas sem depender de extensas anotações humanas passo a passo.


Por que o RAG tradicional é ineficaz no HLE

Consultas baseadas em RAG e prompts comuns falham repetidamente diante do HLE:

  • Exclusividade Sintética: As formulações partem de lemas inéditos que não existem na internet indexada.
  • Armadilhas de Vetorização: Bancos de dados vetoriais retornam documentos superficialmente parecidos que induzem o modelo a analogias equivocadas.

Reprodução da avaliação com vLLM:

# Clonagem do repositório oficial e preparação do ambiente
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# Execução da avaliação com DeepSeek R1 no vLLM
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

Diretrizes de engenharia para produção

  1. Descarte MMLU e GSM8K: Para selecionar modelos voltados à verificação de código, finanças quantitativas ou medicina, esses testes já não possuem poder discriminatório. Utilize HLE e FrontierMath.
  2. Priorize Test-Time Compute: Um modelo destilado de 32B com busca profunda e verificação contínua supera modelos densos gigantescos sem raciocínio em tarefas analíticas.
  3. Estruture roteamento de dois níveis: Atenda 95% das solicitações com modelos rápidos e econômicos e direcione os problemas interdisciplinares complexos para o3, Claude 3.7 ou DeepSeek R1.
← Todos os artigos
0 / 4