### Быстрый ответ: Что такое бенчмарк Humanity's Last Exam (HLE)?
Humanity's Last Exam (HLE) — междисциплинарный бенчмарк из 3000 сложнейших вопросов от CAIS и Scale AI, представляющий собой академический потолок человеческих знаний. Охватывая квантовую физику, алгебраическую геометрию и право, модели рассуждений (OpenAI o3, DeepSeek R1, Claude 3.7) набирают от 18% до 34%, завершая эпоху насыщения тестов.
Кризис насыщения: почему стандартные бенчмарки устарели
В период с 2023 по 2025 год индустрия оценки систем искусственного интеллекта столкнулась с катастрофическим устареванием метрик. Традиционные эталонные тесты, определявшие превосходство моделей, уперлись в потолок:
- MMLU (Massive Multitask Language Understanding): Бывший золотой стандарт академической эрудиции показывает результаты 90–92% у передовых систем. Разница между моделями стала неотличима от шума в датасете и сетевого загрязнения (contamination).
- GSM8K и MATH: Простые школьные текстовые задачи (GSM8K) решаются даже компактными дистиллированными моделями с точностью более 99%, а школьный тест MATH преодолел рубеж в 95% у reasoning-моделей.
- HumanEval и MBPP: Генерация модульных тестов на Python превысила 90%, тестируя лишь базовый синтаксис вместо глубокой программной архитектуры.
- GPQA Diamond: Созданный как защищенный от поиска в Google тест уровня аспирантуры по биологии, физике и химии, GPQA Diamond вырос с 55% до более чем 78% благодаря масштабированию вычислений во время инференса (test-time compute).
Поскольку базовые модели поглотили колоссальную часть открытого веб-пространства при предобучении, эффект простого запоминания скрывал реальный дефицит алгоритмического рассуждения. Для проверки фронтира потребовались принципиально новые тесты с криптографическими водяными знаками, рецензированием экспертов и многоэтапными докторскими выводами.
Что такое Humanity's Last Exam (HLE)
Разработанный Center for AI Safety (CAIS) совместно со Scale AI при участии более 1000 экспертов мировых академических институтов, Humanity's Last Exam (HLE) задуман как финальный рубеж оценки на пути к AGI.
+---------------------------------------------------------------------------------------------------+
| АРХИТЕКТУРА БЕНЧМАРКА HUMANITY'S LAST EXAM (HLE) |
+---------------------------------------------------------------------------------------------------+
| Параметр | Характеристики |
+----------------------------+----------------------------------------------------------------------+
| Общее число вопросов | 3 000 мультимодальных и текстовых междисциплинарных задач |
| Академический уровень | Уровень кандидатов наук (PhD), постдоков и академических экспертов |
| Охватываемые дисциплины | Математика, физика, химия, биология, CS, юриспруденция, экономика |
| Защита от утечек | Канареечные криптографические строки, неопубликованные доказательства|
| Формат верификации | Точное строковое совпадение, численные допуски, проверка доказательств|
| Базовый уровень человека | ~100% (Профильные специалисты с доступом к справочной литературе) |
| Базовый уровень LLM без CoT| < 3.5% (Zero-shot GPT-4o / Claude 3.5 Sonnet без reasoning-поиска) |
+----------------------------+----------------------------------------------------------------------+
Критерии отбора вопросов HLE
- Нулевая находимость в Google: Ответ невозможно найти прямым поиском или компиляцией открытых веб-документов.
- Требование высшей научной квалификации: Образованный человек широкого профиля без специализированной аспирантуры не способен решить задачу даже за несколько часов.
- Автоматическая проверяемость: Решение сводится к строгому математическому значению, формуле или верифицируемому токену, исключая субъективность оценки через LLM-as-a-judge.
- Мультимодальное рассуждение: Около 15% вопросов включают сложные биохимические структуры, топологии интегральных схем и неевклидовы диаграммы.
Триада передовых бенчмарков 2026 года: HLE, FrontierMath и ARC-AGI
Для комплексной оценки reasoning-моделей сообщество использует три взаимодополняющих стресс-теста:
=======================================================
ТАКСОНОМИЯ ПЕРЕДОВЫХ ТЕСТОВ ИИ
=======================================================
/ | \
/ | \
Humanity's Last Exam FrontierMath ARC-AGI-2
(HLE) (Epoch AI) (Франсуа Шолле)
| | |
Широкий научный потолок Глубокая математика Абстрактная логика
Глубина уровня PhD Исследовательские Новые правила без
3 000 вопросов сложные теоремы предварительных данных
1. FrontierMath (Epoch AI)
Создан при участии ведущих математиков и лауреатов Филдсовской премии. Включает сотни оригинальных неопубликованных математических проблем (алгебраическая геометрия, теория чисел, комбинаторика), требующих часов или дней работы ученых.
2. ARC-AGI (Abstraction and Reasoning Corpus)
Созданный Франсуа Шолле бенчмарк проверяет способность ИИ осваивать новые правила абстрактной визуальной трансформации по нескольким примерам без опоры на запомненные знания из обучения.
3. Humanity's Last Exam (HLE)
Объединяет всесторонний кругозор MMLU, математическую строгость FrontierMath и мультимодальный синтез по более чем 100 научным направлениям.
Сводная таблица лидеров бенчмарков 2026 года
Результаты эмпирического тестирования передовых рассуждающих моделей:
| Архитектура модели | Провайдер / Лицензия | HLE Общая точность (%) | HLE Math/CS (%) | FrontierMath Tier-1 (%) | ARC-AGI-2 Verified (%) | Средняя стоимость / 1M токенов |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 (High CoT) | Proprietary API | 65.0% | 72.4% | 87.8% | 96.4% | $10.00 / $50.00 |
| OpenAI GPT-6 Astra | Proprietary API | 57.2% | 74.1% | 97.6% | 99.9% | $10.00 / $50.00 |
| OpenAI o3 (High Effort) | Проприетарный API | 33.8% | 38.4% | 31.2% | 78.4% | $45.00 |
| Claude 3.7 Sonnet (Thinking) | Anthropic API | 31.4% | 35.2% | 28.6% | 74.9% | $18.00 |
| DeepSeek R1 (671B Full) | MIT Open Weights | 27.6% | 32.8% | 24.1% | 71.2% | $2.19 (Хостинг) |
| OpenAI o1 (Full Reasoning) | Проприетарный API | 24.2% | 29.1% | 19.8% | 66.5% | $30.00 |
| Kimi k1.5 (Long-CoT) | Moonshot API | 22.8% | 27.4% | 18.2% | 63.8% | $4.50 |
| Gemini 2.0 Flash Thinking | Google Cloud | 21.5% | 25.0% | 16.9% | 61.4% | $3.50 |
| Qwen-2.5-Max (RL-Reasoning) | Alibaba Cloud | 19.8% | 23.6% | 14.5% | 58.2% | $3.20 |
| DeepSeek-R1-Distill-Qwen-32B | Apache 2.0 Open | 14.2% | 17.9% | 9.4% | 49.6% | $0.60 (FP8 локально) |
| Claude 3.5 Sonnet (Standard) | Anthropic API | 5.8% | 6.2% | 2.4% | 38.1% | $3.75 |
| GPT-4o (Zero-shot) | Проприетарный API | 3.2% | 3.8% | 1.8% | 34.2% | $2.50 |
Детальный анализ: как reasoning-модели решают HLE
1. OpenAI o3: Масштабирование поиска по дереву на инференсе
OpenAI o3 занимает лидирующую позицию (33.8%) благодаря масштабному обучению с подкреплением и поиску по дереву решений с верификаторами процесса (Process-Reward Models, PRM). В квантовых задачах модель генерирует и отсекает тысячи гипотез до выдачи ответа.
2. Claude 3.7 Sonnet: Гибридное мышление и калиброванная самокоррекция
Архитектура Anthropic позволяет гибко выделять до 128 000 токенов размышлений. Claude 3.7 Sonnet демонстрирует высокую способность к самокоррекции в молекулярной биологии и юриспруденции, откатываясь назад при обнаружении логических противоречий.
3. DeepSeek R1: Прорыв открытых весов
DeepSeek R1 доказал, что чистое обучение с подкреплением (RL) на основе правил проверки формата и математической точности способно развить глубокие цепочки рассуждений без участия человека-разметчика, достигая 27.6% на HLE при себестоимости вычислений в разы ниже конкурентов.
Почему стандартный RAG бессилен перед HLE
Классический поиск по документам (RAG) и стандартные промпты терпят полное фиаско на HLE:
- Синтетическая уникальность: Задачи не содержатся в интернете, препринтах arXiv или репозиториях GitHub.
- Векторные ловушки: Векторный семантический поиск извлекает поверхностно похожие документы, которые уводят модель по ложному пути рассуждений.
Воспроизведение оценки HLE через vLLM:
# Клонирование репозитория оценки и установка зависимостей
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang
# Запуск локальной оценки DeepSeek R1 через vLLM
python run_hle_eval.py \
--model "deepseek-ai/DeepSeek-R1" \
--backend "vllm" \
--tensor-parallel-size 8 \
--temperature 0.6 \
--top-p 0.95 \
--max-thinking-tokens 32768 \
--subject-filter "mathematics,physics,computer_science" \
--output-dir "./results/deepseek_r1_hle"
Практические рекомендации для инженеров
- Исключите MMLU и GSM8K из тестирования: Для задач финансовой аналитики, верификации кода и юридического анализа MMLU больше не дает полезного сигнала. Переходите на HLE и FrontierMath.
- Ставьте на вычисления во время инференса (test-time compute): Компактная модель 32B с глубоким поиском и верификацией ответов регулярно превосходит гигантские монолитные модели без reasoning-контура.
- Используйте двухуровневую архитектуру: Направляйте 95% рутинных запросов на недорогие стандартные LLM, эскалируя междисциплинарные синтетические задачи на o3, Claude 3.7 или DeepSeek R1.
Заключение
Humanity's Last Exam задал принципиально новый ориентир подлинного машинного интеллекта. Результаты ведущих моделей в диапазоне 25–34% показывают, что эпоха простого заучивания интернет-корпуса завершена, а дальнейший прогресс зависит от автономного поиска решений и формальной математической верификации.