Benchmarks

Humanity's Last Exam 리더보드: 최전선 AI 벤치마크 순위

### 빠른 답변: Humanity's Last Exam (HLE) 벤치마크란 무엇인가요?

Humanity's Last Exam (HLE)은 AI 안전 센터(CAIS)와 Scale AI가 공동 구축한 3,000문항의 초고난도 학제 간 벤치마크로, 인류 학문 지식의 정점을 대표합니다. 양자역학, 대수기하학 등을 망라하며, OpenAI o3, DeepSeek R1, Claude 3.7 등 최첨단 추론 모델도 18%~34% 정답률에 머물러 벤치마크 포화 시대를 종식시켰습니다.


포화의 위기: 기존 벤치마크가 무너진 이유

2023년부터 2025년 사이 인공지능 평가 생태계는 심각한 지표 노후화에 직면했습니다. 최고 성능 모델을 구별하던 업계 표준 벤치마크들이 측정 상한선에 도달했기 때문입니다.

  • MMLU (Massive Multitask Language Understanding): 일반 학술 역량의 황금 기준이었으나 최첨단 모델들이 90~92%를 기록하면서, 모델 간의 차이가 데이터 오염 및 노이즈와 구분되지 않게 되었습니다.
  • GSM8K & MATH: 초등 산수 문제(GSM8K)는 소형 증류 모델조차 99% 이상을 기록했고, 고교 수학(MATH) 역시 추론 모델 도입으로 95%를 넘어섰습니다.
  • HumanEval & MBPP: 파이썬 단위 테스트 생성 정확도가 90%를 초과하며 복잡한 시스템 설계가 아닌 단순 문법 검증 수준으로 전락했습니다.
  • GPQA Diamond: 구글링이 불가능한 박사 수준 생물, 물리, 화학 평가로 설계되었으나, 추론 시간 연산(Test-Time Compute) 확장으로 55%에서 78% 이상으로 치솟았습니다.

기초 모델들이 방대한 인터넷 코퍼스를 사전 학습에 소모하면서 단순 암기와 검색 패턴이 실제 다단계 추론의 한계를 가렸습니다. 이에 따라 암호화 카나리 문자열, 엄격한 동료 검토, 다단계 박사 수준의 연역적 합성이 요구되는 새로운 평가 체계가 필수적이 되었습니다.


Humanity's Last Exam (HLE)의 등장

Center for AI Safety (CAIS)Scale AI가 주도하고 전 세계 유수 대학 1,000명 이상의 연구진이 참여한 Humanity's Last Exam (HLE) 은 범용 인공지능(AGI) 이전의 최종 학술 관문으로 설계되었습니다.

+---------------------------------------------------------------------------------------------------+
|                        HUMANITY'S LAST EXAM (HLE) 벤치마크 아키텍처                                |
+---------------------------------------------------------------------------------------------------+
| 항목                       | 상세 내용                                                            |
+----------------------------+----------------------------------------------------------------------+
| 총 문항 수                 | 3,000개 멀티모달 및 텍스트 기반 다학제 문제                          |
| 학술 난이도                | 박사 과정(PhD), 포닥, 전문 연구원 수준                               |
| 포함 학문 분야             | 수학, 물리학, 화학, 생물학, 컴퓨터공학, 법학, 인문학, 경제학 등       |
| 오염 방지 대책             | 암호화 카나리 문자열, 비공개 증명, 독창적 신규 문제 구성             |
| 검증 방식                  | 완전 일치 문자열, 수치 허용 오차, 엄격한 자동 증명 검증              |
| 인간 전문가 기준치         | ~100% (참고 문헌 접근이 허용된 해당 분야 전문 연구원)                |
| 비추론 LLM 베이스라인      | < 3.5% (추론 연산 없는 제로샷 GPT-4o / Claude 3.5 Sonnet)            |
+----------------------------+----------------------------------------------------------------------+

HLE 문제 채택 핵심 기준

  1. 완전한 검색 불가성 (Zero Googleability): 직접 검색이나 웹 문서의 단순 결합으로는 정답을 도출할 수 없습니다.
  2. 대학원 수준의 전문 지식 전제: 해당 전공의 대학원 연구 경험이 없는 일반 지식인은 수 시간을 투자해도 풀이에 도달할 수 없습니다.
  3. 자동화된 객관적 검증성: 주관적 평가 편향을 없애기 위해 정답이 정확한 수치나 기호 토큰으로 수렴해야 합니다.
  4. 심층 멀티모달 추론: 전체의 약 15%가 복잡한 과학 회로도, 구조 생물학 다이어그램, 비유클리드 기하 도형을 포함합니다.

2026 프론티어 벤치마크 삼총사: HLE, FrontierMath, ARC-AGI

진정한 최전선 지능을 측정하기 위해 AI 엔지니어링 업계는 3대 보완 테스트를 활용합니다.

                  =======================================================
                                프론티어 AI 추론 분류 체계
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (François Chollet)
                        |                  |                  |
               인간 학술의 절대 한계     심층 수학 학술 증명     미지의 추상 규칙 귀납
               다분야 박사급 깊이        미발표 최상위 연구 난제 사전 학습 암기 완전 배제
               3,000개 정선된 문항       반자동 엄밀 검증       순수 유동 지능 측정

1. FrontierMath (Epoch AI)

필즈상 수상자 등 유수 수학자들과 협력하여 개발한 미공개 수학 문제들로 구성되어 있습니다. 비추론 모델은 2% 미만에 불과했으나 최신 추론 모델은 20~30%를 기록하고 있습니다.

2. ARC-AGI (추상화 및 추론 코퍼스)

프랑수아 숄레가 고안한 평가로, 몇 가지 시각적 격자 예시로부터 새로운 변환 규칙을 도출하는 능력을 테스트하여 언어적 기억과 순수 문제 해결 능력을 분리합니다.

3. Humanity's Last Exam (HLE)

MMLU의 폭넓은 지식 범위와 FrontierMath의 엄밀한 논리, 100개 이상 학과에 걸친 멀티모달 이해력을 통합한 벤치마크입니다.


2026 종합 프론티어 리더보드 순위

최신 프론티어 추론 모델 및 오픈 웨이트 아키텍처의 실측 벤치마크 결과입니다:

모델 아키텍처 제공사 / 라이선스 HLE 종합 정답률 (%) HLE 수학/CS (%) FrontierMath Tier-1 (%) ARC-AGI-2 검증 (%) 100만 토큰당 평균 비용
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) 독점 API 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B 풀버전) MIT 오픈 웨이트 27.6% 32.8% 24.1% 71.2% $2.19 (자체 호스팅)
OpenAI o1 (추론 풀버전) 독점 API 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL 추론) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 오픈 14.2% 17.9% 9.4% 49.6% $0.60 (로컬 FP8)
Claude 3.5 Sonnet (표준형) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (제로샷 기준선) 독점 API 3.2% 3.8% 1.8% 34.2% $2.50

심층 분석: 최첨단 추론 모델들의 HLE 공략 방식

1. OpenAI o3: 추론 시간 대규모 트리 탐색

OpenAI o3는 대규모 강화학습과 프로세스 보상 모델(PRM) 기반의 테스트 시간 탐색을 결합하여 리더보드 1위(33.8%)를 달성했습니다. 복잡한 계산 도중 수천 가지 가설을 검토하고 모순된 경로를 사전에 가지치기합니다.

2. Claude 3.7 Sonnet: 하이브리드 사고 및 자율 수정

Anthropic의 Claude 3.7 Sonnet은 사고 토큰을 0부터 128k까지 유연하게 조절할 수 있습니다. 분자생물학이나 법철학 문제에서 중간 추론 오류를 감지하면 스스로 되돌아가 논리를 재정립하는 탁월한 자기 교정 능력을 보여줍니다.

3. DeepSeek R1: 오픈 웨이트의 비약적 혁신

DeepSeek R1은 인간의 세밀한 단계별 주석 없이도 수학적 엄밀성과 형식 규칙에 기반한 순수 강화학습만으로 깊이 있는 추론 체인이 발현될 수 있음을 입증하며, 저비용 클러스터에서도 강력한 추론을 가능하게 했습니다.


기존 RAG가 HLE에서 실패하는 이유

HLE 문제에 대해 검색 증강 생성(RAG)과 일반 프롬프트는 완전히 무력화됩니다:

  • 합성 고유성: 문제는 웹이나 공개 학술지에 존재하지 않는 독창적인 보조정리와 경로로 설계되었습니다.
  • 의미론적 유사성의 함정: 벡터 임베딩이 겉보기에 유사한 무관한 문헌을 검색해 모델의 추론을 잘못된 방향으로 유도합니다.

vLLM을 활용한 로컬 HLE 벤치마크 재현:

# 평가 도구 복제 및 환경 설정
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# vLLM을 통한 DeepSeek R1 분산 평가 실행
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

엔지니어링 실무자를 위한 권고사항

  1. MMLU와 GSM8K 지표 폐기: 금융, 의료, 암호학 등 고난도 업무를 위한 모델 선정 시 MMLU는 더 이상 변별력이 없습니다. HLE와 FrontierMath를 활용하세요.
  2. 파라미터 규모보다 추론 시간 연산 우선: 사고 탐색을 수행하는 32B 모델이 추론 루프가 없는 거대 모델보다 실질적인 문제 해결력이 우수합니다.
  3. 2단계 라우팅 파이프라인 구축: 일반 요청의 95%는 비용 효율적인 기본 모델에 할당하고, 고난도 복합 추론 요청만 o3, Claude 3.7 Thinking, DeepSeek R1으로 라우팅하십시오.

결론

Humanity's Last Exam은 진정한 기계 지능의 척도를 재정의했습니다. 선도 모델들이 25~34% 수준에 도달한 지금, 인공지능 연구는 단순 암기 학습에서 벗어나 자율적 탐색과 형식 검증의 새로운 지평으로 나아가고 있습니다.

← 전체 아티클
0 / 4