### クイック回答:Humanity's Last Exam (HLE) ベンチマークとは?
Humanity's Last Exam (HLE) は、Center for AI Safety (CAIS) と Scale AI が共同開発した、人類の学術的限界を測る3,000問の超難関学際的ベンチマークです。量子力学や代数幾何学を網羅し、OpenAI o3、DeepSeek R1、Claude 3.7 などのフロンティア推論モデルの正答率は18%〜34%に留まり、ベンチマーク飽和の時代に終止符を打ちました。
飽和の危機:なぜ従来のベンチマークは陳腐化したのか?
2023年から2025年にかけて、AI評価エコシステムは深刻な指標陳腐化の危機に直面しました。これまで最高峰の知能を識別してきた標準テストが上限に達したためです。
- MMLU (Massive Multitask Language Understanding): 一般学術能力の評価基準でしたが、最先端モデルは軒並み90〜92%を記録し、微小な差はデータ汚染やノイズと区別できなくなりました。
- GSM8K & MATH: 小学校レベルの算数 (GSM8K) は軽量モデルでも99%以上の正答率となり、高校数学 (MATH) も推論モデルによって95%を超えました。
- HumanEval & MBPP: Pythonコード生成は90%以上に達し、問われているのは高度な設計力ではなく基本的な構文の正しさだけとなりました。
- GPQA Diamond: Google検索では解けない博士課程レベルの理科問題として作られましたが、推論時計算量 (Test-Time Compute) の拡大により55%から78%以上に跳ね上がりました。
事前学習で膨大な公開データを吸収した結果、単なる記憶と検索が本質的な論理的推論の欠如を隠蔽していました。このため、暗号化カナリア文字列、厳格な査読、複数段階の博士号レベルの演繹推論を要求する新たな評価基盤が不可欠となったのです。
Humanity's Last Exam (HLE) の全貌
Center for AI Safety (CAIS) と Scale AI が主導し、世界中の研究機関に所属する1,000名以上の専門家を結集して作成された Humanity's Last Exam (HLE) は、汎用人工知能 (AGI) に至る前の最終関門として位置付けられています。
+---------------------------------------------------------------------------------------------------+
| HUMANITY'S LAST EXAM (HLE) ベンチマーク構造 |
+---------------------------------------------------------------------------------------------------+
| 項目 | 詳細仕様 |
+----------------------------+----------------------------------------------------------------------+
| 総問題数 | 3,000問(マルチモーダルおよびテキストベースの学際的問題) |
| 学術難易度 | 博士課程(PhD)、ポスドク、学術研究者レベル |
| 対象分野 | 数学、物理学、化学、生物学、計算機科学、法学、人文学、経済学等 |
| 汚染防止策 | 暗号化カナリア文字列、未公開の証明、独自の新規問題設計 |
| 評価形式 | 完全一致文字列、数値許容誤差、厳密な自動証明検証 |
| 人間専門家の基準値 | 約100%(参考文献の参照が許可された特定分野の専門家) |
| 非推論LLMのベースライン | < 3.5%(テスト時計算なしのゼロショット GPT-4o / Claude 3.5 Sonnet) |
+----------------------------+----------------------------------------------------------------------+
HLE 問題採用のコア基準
- 完全な非検索性 (Zero Googleability): 検索エンジンや既存Webページの合成では回答を得られないこと。
- 大学院修了相当の前提知識: 専門分野の大学院教育を受けていない一般の教養人では、数時間かけても解法に到達できないこと。
- 自動検証可能性: 評価バイアスを排除するため、解答が厳密な数値や明確な英数字トークンに帰着すること。
- マルチモーダル推論: 全体の約15%に高度な回路図、構造生物学の分子モデル、非ユークリッド幾何学図面を含むこと。
2026年フロンティア評価の三本柱:HLE、FrontierMath、ARC-AGI
真のフロンティア知能を計測するため、AIエンジニアリングコミュニティは3つの相補的なストレステストを併用します。
=======================================================
フロンティアAI推論タクソノミー
=======================================================
/ | \
/ | \
Humanity's Last Exam FrontierMath ARC-AGI-2
(HLE) (Epoch AI) (François Chollet)
| | |
人類の学術的限界 極めて深い数学的証明 未知の抽象規則帰納
多分野の博士号レベル 未公開の先端研究課題 事前学習記憶を完全排除
厳選された3,000問 半自動厳密検証 純粋な流動性知能
1. FrontierMath (Epoch AI)
フィールズ賞受賞者を含む数学者と共同開発された未発表のオリジナル数学問題集。非推論モデルは2%未満でしたが、最新の推論モデルは20〜30%に達しています。
2. ARC-AGI (Abstraction and Reasoning Corpus)
フランソワ・ショレが考案した、極少数の視覚的グリッド例から未知の変換規則を推論するテスト。事前学習による記憶と純粋な問題解決能力を切り離します。
3. Humanity's Last Exam (HLE)
MMLUの網羅的な知識の広さ、FrontierMathの論理的厳密さ、そして100を超える学術分野におけるマルチモーダル科学読解力を統合したテストです。
2026年 フロンティアモデル総合リーダーボード
先端推論モデルとオープンウェイトアーキテクチャの最新実測データ:
| モデルアーキテクチャ | プロバイダー / ライセンス | HLE 総合正答率 (%) | HLE 数学/情報 (%) | FrontierMath Tier-1 (%) | ARC-AGI-2 検証済 (%) | 平均コスト / 1Mトークン |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 (High CoT) | Proprietary API | 65.0% | 72.4% | 87.8% | 96.4% | $10.00 / $50.00 |
| OpenAI GPT-6 Astra | Proprietary API | 57.2% | 74.1% | 97.6% | 99.9% | $10.00 / $50.00 |
| OpenAI o3 (High Effort) | 独自API | 33.8% | 38.4% | 31.2% | 78.4% | $45.00 |
| Claude 3.7 Sonnet (思考モード) | Anthropic API | 31.4% | 35.2% | 28.6% | 74.9% | $18.00 |
| DeepSeek R1 (671B 完全版) | MIT オープンウェイト | 27.6% | 32.8% | 24.1% | 71.2% | $2.19 (自前運用) |
| OpenAI o1 (推論強化版) | 独自API | 24.2% | 29.1% | 19.8% | 66.5% | $30.00 |
| Kimi k1.5 (Long-CoT) | Moonshot API | 22.8% | 27.4% | 18.2% | 63.8% | $4.50 |
| Gemini 2.0 Flash Thinking | Google Cloud | 21.5% | 25.0% | 16.9% | 61.4% | $3.50 |
| Qwen-2.5-Max (強化学習推論) | Alibaba Cloud | 19.8% | 23.6% | 14.5% | 58.2% | $3.20 |
| DeepSeek-R1-Distill-Qwen-32B | Apache 2.0 オープン | 14.2% | 17.9% | 9.4% | 49.6% | $0.60 (ローカルFP8) |
| Claude 3.5 Sonnet (標準) | Anthropic API | 5.8% | 6.2% | 2.4% | 38.1% | $3.75 |
| GPT-4o (ゼロショット基準) | 独自API | 3.2% | 3.8% | 1.8% | 34.2% | $2.50 |
詳細分析:フロンティア推論モデルはHLEをいかに解くか
1. OpenAI o3:テスト時ツリー探索の大規模化
OpenAI o3 は、プロセス報酬モデル (PRM) を用いたテスト時探索と強化学習のスケーリングにより、リーダーボード首位 (33.8%) を獲得しました。量子力学問題などにおいて、膨大な解法ルートを探索し、誤った推論を事前に枝刈りします。
2. Claude 3.7 Sonnet:柔軟な思考トークンと自己修正力
Claude 3.7 Sonnet は思考トークン数を0〜128kまで動的に調整可能です。分子生物学や法哲学の難問において、自身の推論ステップに論理矛盾や物理的不可逆性を見出した際に自律的に逆戻りして検証する卓越した自己修正を示します。コストパフォーマンスでも優位に立っています。
3. DeepSeek R1:オープンウェイトの革命的躍進
DeepSeek R1 は、人間の手作業によるステップ解説データなしでも、厳格なルールベース強化学習によって高度な自己検証推論が創発することを示しました。独自のオンプレミス環境で最先端に迫る推論を低コストに再現可能です。
なぜ従来のRAGはHLEで役に立たないのか
HLE に対して従来の検索拡張生成 (RAG) は完全に通用しません。
- 合成データの独自性: 問題は公に存在しない学術的補題に基づいて新規作成されています。
- 意味検索の罠: ベクトル検索は表面的なキーワード類似度に惑わされ、誤った前提知識をコンテキストに注入してしまいます。
vLLMを用いたローカルHLE評価手順:
# 評価ツールのクローンとセットアップ
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang
# vLLM経由でDeepSeek R1の分散推論評価を実行
python run_hle_eval.py \
--model "deepseek-ai/DeepSeek-R1" \
--backend "vllm" \
--tensor-parallel-size 8 \
--temperature 0.6 \
--top-p 0.95 \
--max-thinking-tokens 32768 \
--subject-filter "mathematics,physics,computer_science" \
--output-dir "./results/deepseek_r1_hle"
実務エンジニアへの提言
- MMLU と GSM8K の社内評価からの排除: 専門分野のモデル選定において、満点付近に達した旧テストは選別の役に立ちません。HLE や FrontierMath を導入してください。
- パラメータ数よりもテスト時計算量を重視: 思考と探索を行う32B蒸留モデルは、思考なしの巨大モデルよりも格段に高い実用推論力を発揮します。
- 二階層ルーティングの構築: 定型処理は高速な軽量モデルで処理し、高度な多段階推論を要する案件のみ o3 や Claude 3.7、DeepSeek R1 に転送する構成が費用対効果を最大化します。
結論
Humanity's Last Exam は、真の機械的知性を評価するための強固なベンチマークとなりました。トップモデルが25〜34%に達した現在、AI研究の主戦場は単なるデータ学習から、自律的な仮説検証と形式的定理証明の統合へとシフトしています。