### 快速解答:什么是 Humanity's Last Exam (HLE) 基准?
Humanity's Last Exam (HLE) 是由人工智能安全中心 (CAIS) 与 Scale AI 联合打造的多学科前沿评测基准,包含 3,000 道顶尖学术难题,代表人类学科知识的绝对天花板。涵盖量子力学、代数几何及生物合成等领域,OpenAI o3、DeepSeek R1 和 Claude 3.7 的准确率仅在 18% 至 34% 之间,彻底终结了基准饱和时代。
饱和危机:为何传统基准全面失效?
在 2023 至 2025 年间,人工智能评测生态遭遇了严重的指标老化危机。过去用于区分顶尖模型能力的基准已全面逼近理论极限:
- MMLU (大规模多任务语言理解):前沿模型得分普遍达到 90% 至 92%,模型间的细微差距已难以与训练集污染和数据噪声区分。
- GSM8K 与 MATH:小学数学题库 GSM8K 在轻量蒸馏模型上的准确率已超 99%,而高中难度 MATH 也在推理模型推动下达到 95% 以上的通过率。
- HumanEval 与 MBPP:Python 单元测试生成准确率突破 90%,仅能考察基础语法,无法衡量复杂的软件架构与工程设计能力。
- GPQA Diamond:专为防止搜索而设计的博士级理化生评测,在测试时计算(Test-Time Compute)加持下,得分已从 55% 飙升至 78% 以上。
由于基础大模型在预训练阶段吸纳了海量公开网络数据,数据污染与检索记忆掩盖了真实的合成推理短板。业界亟需经过严密防泄漏设计、同行专家评审且需要博士级多步演绎推导的全新基准。
认识 Humanity's Last Exam (HLE)
由 Center for AI Safety (CAIS) 和 Scale AI 牵头,汇聚全球顶尖学府 1,000 多名专业学者共同制定的 Humanity's Last Exam (HLE),被誉为通向通用人工智能 (AGI) 前的终极学术考卷。
+---------------------------------------------------------------------------------------------------+
| HUMANITY'S LAST EXAM (HLE) 评测体系架构 |
+---------------------------------------------------------------------------------------------------+
| 评估维度 | 规格说明 |
+----------------------------+----------------------------------------------------------------------+
| 题目总量 | 3,000 道多模态与纯文本高难度跨学科问题 |
| 学术难度 | 博士生、博士后及资深学术研究员层级 |
| 涵盖学科 | 数学、物理学、化学、生物学、计算机科学、法律、人文、经济学等 |
| 防污染机制 | 加密金丝雀字符串、未公开证明过程、全新命题设计 |
| 评分机制 | 精确字符串比对、数值容差、自动化严格证明验证 |
| 人类专家基准 | 约 100%(领域专家在允许查阅文献条件下的解题率) |
| 无推理传统 LLM 基准 | < 3.5%(零样本 GPT-4o / Claude 3.5 Sonnet,不含扩展推理) |
+----------------------------+----------------------------------------------------------------------+
HLE 题目入选的核心法则
- 完全不可被搜索引擎检索:答案无法通过直接搜索或公开网页的表面信息拼凑得出。
- 研究生门槛先验:未经特定学科深造的研究人员,即便耗费数小时也无法推导出有效解法。
- 自动化客观验证:结论收敛至唯一的数学常数、代数形式或不可模糊解读的符号,杜绝 LLM-as-a-judge 带来的主观偏置。
- 深度多模态推理:约 15% 的试题包含严谨的学术图表、结构生物大分子模型、集成电路拓扑与非欧几何图形。
2026 前沿基准三剑客:HLE、FrontierMath 与 ARC-AGI
在 2026 年,全面评估大模型智能需依靠三大互补的核心测试:
=======================================================
前沿 AI 推理评测三维坐标系
=======================================================
/ | \
/ | \
Humanity's Last Exam FrontierMath ARC-AGI-2
(HLE) (Epoch AI) (François Chollet)
| | |
人类综合学术天花板 极深数学学术证明 前所未见抽象归纳
跨学科博士级难度 顶尖未公开研究命题 零预训练先验记忆
3,000 道精选问题 半自动化严格证明 纯粹流体智能测试
1. FrontierMath (Epoch AI)
联合菲尔兹奖得主等顶尖数学家深度构建,包含数百道未发表的原创高难度数学猜想与定理证明。传统模型得分低于 2%,而前沿推理模型已提升至 20% 至 30%。
2. ARC-AGI (抽象与推理语料库)
由 François Chollet 主导设计,通过少量全新视觉网格示例,考察模型推导全新几何转换规则的能力,将纯粹的流体智能与预训练语言记忆彻底解耦。
3. Humanity's Last Exam (HLE)
融合了 MMLU 的广泛学科覆盖度、FrontierMath 的严密逻辑推导以及 100 多个二级学科的多模态学术理解力。
2026 前沿大模型综合评测榜单
汇总各前沿推理模型与开源架构的最新评测实测数据:
| 模型架构 | 供应商 / 许可类型 | HLE 全学科准确率 (%) | HLE 数学/计算机 (%) | FrontierMath Tier-1 (%) | ARC-AGI-2 验证准确率 (%) | 每百万 Token 综合成本 |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 (High CoT) | Proprietary API | 65.0% | 72.4% | 87.8% | 96.4% | $10.00 / $50.00 |
| OpenAI GPT-6 Astra | Proprietary API | 57.2% | 74.1% | 97.6% | 99.9% | $10.00 / $50.00 |
| OpenAI o3 (High Effort) | 闭源专有 API | 33.8% | 38.4% | 31.2% | 78.4% | $45.00 |
| Claude 3.7 Sonnet (思考模式) | Anthropic API | 31.4% | 35.2% | 28.6% | 74.9% | $18.00 |
| DeepSeek R1 (671B 完整版) | MIT 开源权重 | 27.6% | 32.8% | 24.1% | 71.2% | $2.19 (算力自建) |
| OpenAI o1 (完整推理版) | 闭源专有 API | 24.2% | 29.1% | 19.8% | 66.5% | $30.00 |
| Kimi k1.5 (长思维链) | 月之暗面 API | 22.8% | 27.4% | 18.2% | 63.8% | $4.50 |
| Gemini 2.0 Flash Thinking | Google Cloud | 21.5% | 25.0% | 16.9% | 61.4% | $3.50 |
| Qwen-2.5-Max (强化推理版) | 阿里云计算 | 19.8% | 23.6% | 14.5% | 58.2% | $3.20 |
| DeepSeek-R1-Distill-Qwen-32B | Apache 2.0 开源 | 14.2% | 17.9% | 9.4% | 49.6% | $0.60 (本地部署) |
| Claude 3.5 Sonnet (标准版) | Anthropic API | 5.8% | 6.2% | 2.4% | 38.1% | $3.75 |
| GPT-4o (零样本基线) | 闭源专有 API | 3.2% | 3.8% | 1.8% | 34.2% | $2.50 |
深度剖析:顶尖推理模型如何攻克 HLE
1. OpenAI o3:大规模测试时树搜索
OpenAI o3 凭借大规模强化学习结合过程奖励模型 (PRM) 的测试时搜索夺得榜首 (33.8%)。面对量子态变换或前沿拓扑学难题,o3 会在思维链中探索数千条可能路径,在输出最终答案前精准剪枝不合逻辑的数学推演。
2. Claude 3.7 Sonnet:自适应思考与反思校准
Claude 3.7 Sonnet 支持 0 到 128k 自由调节的思考 Token。在生物化学机制与复杂法律逻辑推演中,Claude 3.7 展现出强大的自我反省能力,当发现某一步演算违反热力学定律时,能主动回退重塑推理逻辑。其性价比显著优于 o3。
3. DeepSeek R1:开源权重的里程碑跃升
DeepSeek R1 证明了通过纯粹的规则驱动强化学习(验证数学准确性与输出格式),大模型无需大量人工精细标注即可自发涌现出深层推理与反思验证能力,让全球研发团队能以极其低廉的硬件成本复现前沿推理能力。
为何传统 RAG 在 HLE 面前全面溃败?
针对 HLE 题目,传统的提示词工程与检索增强生成 (RAG) 几乎失效:
- 合成唯一性:HLE 试题采用定制的数学引理与未公开化学分子路径,公网索引库中不存在任何直接题解。
- 语义误导陷阱:向量数据库仅能依据词汇余弦相似度检索出外表相似的内容,反而将大模型误导至错误的类比推理中。
使用 vLLM 本地运行 HLE 评测流程:
# 克隆评测官方仓库并安装环境
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang
# 启动 DeepSeek R1 的多卡并行测试
python run_hle_eval.py \
--model "deepseek-ai/DeepSeek-R1" \
--backend "vllm" \
--tensor-parallel-size 8 \
--temperature 0.6 \
--top-p 0.95 \
--max-thinking-tokens 32768 \
--subject-filter "mathematics,physics,computer_science" \
--output-dir "./results/deepseek_r1_hle"
工程落地与技术选型建议
- 果断淘汰 MMLU 与 GSM8K:若企业正在为金融量化、医疗诊断、密码学验证或架构分析评估模型,MMLU 已失去鉴别度。建议采用 HLE、FrontierMath 与 LiveCodeBench 子集构建企业基线。
- 测试时算力优于模型参数量:带有深度多路径搜索验证的 32B 蒸馏推理模型,在复杂推理任务中的实际表现屡屡超越未配备思考机制的巨型千亿稠密模型。
- 采用双层路由架构:在生产环境中,将 95% 的日常请求分流至高吞吐轻量模型(如 Claude 3.5 Haiku、DeepSeek-V3),仅将多学科博士级综合难题升级至 o3、Claude 3.7 Thinking 或 DeepSeek R1。
结语
Humanity's Last Exam 为新一代人工智能确立了极具公信力的认知度量标尺。随着顶尖模型得分突破 30%,AI 评测正从被动的记忆检索迈向真正的自主推理、交互式形式化定理证明与前沿科学发现的新纪元。