### คำตอบด่วน: เบนช์มาร์ก Humanity's Last Exam (HLE) คืออะไร?
Humanity's Last Exam (HLE) คือแบบทดสอบสหสาขาวิชาชีพจำนวน 3,000 ข้อที่พัฒนาโดย Center for AI Safety (CAIS) และ Scale AI เพื่อวัดขีดจำกัดสูงสุดของความรู้ทางวิชาการของมนุษย์ ครอบคลุมตั้งแต่กลศาสตร์ควอนตัมไปจนถึงเรขาคณิตเชิงพีชคณิต โมเดลการใช้เหตุผลชั้นนำอย่าง OpenAI o3, DeepSeek R1 และ Claude 3.7 ทำคะแนนได้เพียง 18% ถึง 34% ซึ่งเป็นการยุติยุคที่เกณฑ์มาตรฐานเดิมอิ่มตัว
วิกฤตการณ์ความอิ่มตัว: เหตุใดเบนช์มาร์กมาตรฐานจึงล้าสมัย
ระหว่างปี 2023 ถึง 2025 ระบบนิเวศการประเมินปัญญาประดิษฐ์ประสบปัญหาวิกฤตตัวชี้วัดเดิมหมดประสิทธิภาพ เกณฑ์มาตรฐานระดับอุตสาหกรรมที่เคยใช้คัดแยกโมเดลชั้นนำเริ่มตันที่ขีดจำกัดสูงสุด:
- MMLU (Massive Multitask Language Understanding): อดีตมาตรฐานทองคำสำหรับความรู้ทางวิชาการ ปัจจุบันโมเดลชั้นนำทำคะแนนได้ 90% ถึง 92% จนไม่สามารถแยกความแตกต่างระหว่างการพัฒนาจริงกับมลภาวะของข้อมูลในเว็บได้
- GSM8K และ MATH: โจทย์คณิตศาสตร์ระดับประถม (GSM8K) ถูกแก้ได้ด้วยความแม่นยำกว่า 99% แม้กระทั่งโดยโมเดลขนาดเล็ก ส่วนข้อสอบ MATH ระดับมัธยมปลายก็ทะลุ 95% ด้วยโมเดลการใช้เหตุผล
- HumanEval และ MBPP: การสร้างโค้ดยูนิตเทสต์ภาษา Python มีอัตราความสำเร็จเกิน 90% ซึ่งเป็นการทดสอบความถูกต้องของไวยากรณ์พื้นฐานมากกว่าสถาปัตยกรรมซอฟต์แวร์ที่ซับซ้อน
- GPQA Diamond: ออกแบบมาเพื่อเป็นคำถามระดับปริญญาเอกที่ไม่สามารถค้นหาผ่าน Google ได้ คะแนนพุ่งจาก 55% เป็นกว่า 78% ด้วยการขยายการคำนวณขณะอนุมาน (Test-Time Compute)
เนื่องจากโมเดลพื้นฐานดูดซับข้อมูลเว็บสาธารณะจำนวนมหาศาลระหว่างการฝึกฝนล่วงหน้า การท่องจำและการสืบค้นจึงบดบังข้อบกพร่องที่แท้จริงของการใช้เหตุผลเชิงตรรกะ ส่งผลให้นักวิจัยต้องสร้างแบบทดสอบใหม่ที่มีการป้องกันด้วยลายน้ำเข้ารหัสและผ่านการตรวจทานอย่างเข้มงวด
ทำความรู้จักกับ Humanity's Last Exam (HLE)
พัฒนาขึ้นโดย Center for AI Safety (CAIS) ร่วมกับ Scale AI พร้อมการสนับสนุนจากผู้เชี่ยวชาญกว่า 1,000 คนจากสถาบันการศึกษาชั้นนำทั่วโลก Humanity's Last Exam (HLE) ได้รับการออกแบบให้เป็นด่านประเมินด่านสุดท้ายก่อนเข้าสู่ปัญญาประดิษฐ์ทั่วไป (AGI)
+---------------------------------------------------------------------------------------------------+
| โครงสร้างเบนช์มาร์ก HUMANITY'S LAST EXAM (HLE) |
+---------------------------------------------------------------------------------------------------+
| พารามิเตอร์ | รายละเอียดข้อกำหนด |
+----------------------------+----------------------------------------------------------------------+
| จำนวนข้อสอบทั้งหมด | ปัญหาแบบสหสาขาวิชาชีพทั้งข้อความและมัลติโมดัล 3,000 ข้อ |
| ระดับทางวิชาการ | ระดับผู้สมัครปริญญาเอก (PhD), นักวิจัยหลังปริญญาเอก, ผู้เชี่ยวชาญ |
| สาขาวิชาที่ครอบคลุม | คณิตศาสตร์, ฟิสิกส์, เคมี, ชีววิทยา, วิทยาการคอมพิวเตอร์, กฎหมาย ฯลฯ |
| การป้องกันข้อมูลรั่วไหล | คานารีสตริงที่เข้ารหัส, ข้อพิสูจน์ที่ยังไม่เผยแพร่, การตั้งโจทย์ใหม่ |
| รูปแบบการประเมินผล | การจับคู่สตริงที่แน่นอน, พิกัดเผื่อตัวเลข, การตรวจสอบเชิงตรรกะ |
| เกณฑ์มาตรฐานมนุษย์ผู้เชี่ยวชาญ| ~100% (ผู้เชี่ยวชาญเฉพาะทางที่ได้รับอนุญาตให้เปิดเอกสารอ้างอิงได้) |
| โมเดล LLM ทั่วไปที่ไม่มี CoT| < 3.5% (Zero-shot GPT-4o / Claude 3.5 Sonnet ที่ไม่มีเวลาคิด) |
+----------------------------+----------------------------------------------------------------------+
เกณฑ์หลักในการคัดเลือกคำถามเข้าสู่ HLE
- ไม่สามารถค้นหาผ่าน Google ได้เลย: คำตอบไม่สามารถหาได้จากการค้นหาโดยตรงหรือการรวมข้อมูลหน้าเว็บ
- ต้องใช้ความรู้ระดับบัณฑิตศึกษาเฉพาะทาง: ผู้จบการศึกษาระดับปริญญาตรีทั่วไปไม่สามารถแก้โจทย์ได้แม้จะมีเวลาหลายชั่วโมง
- ตรวจสอบความถูกต้องได้โดยอัตโนมัติ: คำตอบสรุปเป็นค่าตัวเลขที่แน่นอนหรือสัญลักษณ์ที่ชัดเจน เพื่อขจัดอคติจากการใช้โมเดลเป็นผู้ตัดสิน (LLM-as-a-judge)
- การให้เหตุผลเชิงมัลติโมดัลขั้นสูง: ราว 15% ประกอบด้วยแผนภาพชีวเคมี โครงสร้างวงจร และเรขาคณิตนอกแบบยุคลิด
เสาหลักเบนช์มาร์ก AI ปี 2026: HLE, FrontierMath และ ARC-AGI
เพื่อวัดความฉลาดระดับแนวหน้า ชุมชนวิศวกรรมปัญญาประดิษฐ์จึงพึ่งพาการทดสอบที่ส่งเสริมซึ่งกันและกัน 3 รายการ:
=======================================================
อนุกรมวิธานการประเมินผล AI ชั้นนำ
=======================================================
/ | \
/ | \
Humanity's Last Exam FrontierMath ARC-AGI-2
(HLE) (Epoch AI) (François Chollet)
| | |
เพดานวิชาการระดับสูงสุด บทพิสูจน์คณิตศาสตร์ การอนุมานกฎ
ความลึกระดับปริญญาเอก ขั้นสูงที่ยังไม่ตีพิมพ์ นามธรรมที่มองเห็น
3,000 ข้อสอบผู้เชี่ยวชาญ การตรวจยืนยันที่เข้มงวด ปราศจากความจำเดิม
1. FrontierMath (Epoch AI)
ร่วมพัฒนาโดยนักคณิตศาสตร์ระดับเหรียญฟีลด์ส ประกอบด้วยโจทย์คณิตศาสตร์ที่ยังไม่เคยเผยแพร่จำนวนหลายร้อยข้อที่ต้องใช้เวลานานในการแก้ โมเดลทั่วไปทำได้ไม่ถึง 2% แต่โมเดลการใช้เหตุผลยุคใหม่ทำได้ 20% ถึง 30%
2. ARC-AGI (Abstraction and Reasoning Corpus)
คิดค้นโดย François Chollet เพื่อทดสอบความสามารถในการอนุมานกฎการแปลงภาพจากตัวอย่างตารางกริดเพียงไม่กี่ภาพ ซึ่งแยกความฉลาดแบบไหล (Fluid Intelligence) ออกจากความจำทางภาษา
3. Humanity's Last Exam (HLE)
ผสมผสานความกว้างขวางของ MMLU, ความเข้มงวดทางตรรกะของ FrontierMath และการวิเคราะห์ภาพทางวิทยาศาสตร์มัลติโมดัลเข้าด้วยกัน
ตารางอันดับโมเดลปัญญาประดิษฐ์ชั้นนำประจำปี 2026
ผลการทดสอบเชิงประจักษ์ของโมเดลการใช้เหตุผลและสถาปัตยกรรมโอเพนเวท:
| สถาปัตยกรรมโมเดล | ผู้ให้บริการ / สัญญาอนุญาต | HLE ความแม่นยำรวม (%) | HLE คณิต/คอมพิวเตอร์ (%) | FrontierMath Tier-1 (%) | ARC-AGI-2 ยืนยันแล้ว (%) | ต้นทุนเฉลี่ย / 1M โทเค็น |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 (High CoT) | Proprietary API | 65.0% | 72.4% | 87.8% | 96.4% | $10.00 / $50.00 |
| OpenAI GPT-6 Astra | Proprietary API | 57.2% | 74.1% | 97.6% | 99.9% | $10.00 / $50.00 |
| OpenAI o3 (High Effort) | API กรรมสิทธิ์ | 33.8% | 38.4% | 31.2% | 78.4% | $45.00 |
| Claude 3.7 Sonnet (Thinking) | Anthropic API | 31.4% | 35.2% | 28.6% | 74.9% | $18.00 |
| DeepSeek R1 (671B Full) | MIT Open Weights | 27.6% | 32.8% | 24.1% | 71.2% | $2.19 (โฮสต์เอง) |
| OpenAI o1 (Full Reasoning) | API กรรมสิทธิ์ | 24.2% | 29.1% | 19.8% | 66.5% | $30.00 |
| Kimi k1.5 (Long-CoT) | Moonshot API | 22.8% | 27.4% | 18.2% | 63.8% | $4.50 |
| Gemini 2.0 Flash Thinking | Google Cloud | 21.5% | 25.0% | 16.9% | 61.4% | $3.50 |
| Qwen-2.5-Max (RL-Reasoning) | Alibaba Cloud | 19.8% | 23.6% | 14.5% | 58.2% | $3.20 |
| DeepSeek-R1-Distill-Qwen-32B | Apache 2.0 Open | 14.2% | 17.9% | 9.4% | 49.6% | $0.60 (เครื่องตนเอง) |
| Claude 3.5 Sonnet (มาตรฐาน) | Anthropic API | 5.8% | 6.2% | 2.4% | 38.1% | $3.75 |
| GPT-4o (เกณฑ์อ้างอิงทั่วไป) | API กรรมสิทธิ์ | 3.2% | 3.8% | 1.8% | 34.2% | $2.50 |
การวิเคราะห์ทางเทคนิค: โมเดลการใช้เหตุผลแก้โจทย์ HLE ได้อย่างไร
1. OpenAI o3: การค้นหาแบบโครงสร้างต้นไม้ขนาดใหญ่ในเวลาอนุมาน
OpenAI o3 คว้าอันดับหนึ่ง (33.8%) ด้วยการเรียนรู้แบบเสริมกำลังขนาดใหญ่ร่วมกับการค้นหาบนต้นไม้การตัดสินใจโดยใช้โมเดลรางวัลกระบวนการ (PRM) ซึ่งช่วยตัดเส้นทางที่ไม่สมเหตุสมผลออกไปก่อนแสดงคำตอบสุดท้าย
2. Claude 3.7 Sonnet: การคิดแบบปรับเปลี่ยนได้และการแก้ไขตัวเอง
Claude 3.7 Sonnet สามารถกำหนดจำนวนโทเค็นการคิดได้ตั้งแต่ 0 ถึง 128,000 โทเค็น มีความสามารถในการแก้ไขข้อผิดพลาดระหว่างทางได้อย่างยอดเยี่ยม โดยเฉพาะในวิชาชีววิทยาโมเลกุลและนิติศาสตร์
3. DeepSeek R1: ความก้าวหน้าของโมเดลเปิด
DeepSeek R1 พิสูจน์ให้เห็นว่าการเรียนรู้แบบเสริมกำลังโดยอิงกฎเกณฑ์อย่างแท้จริง (ความถูกต้องทางคณิตศาสตร์และรูปแบบที่ถูกต้อง) สามารถสร้างทักษะการใช้เหตุผลที่ซับซ้อนได้โดยไม่ต้องใช้ข้อมูลที่มนุษย์เขียนทีละขั้นตอน
ทำไมระบบ RAG ดั้งเดิมจึงใช้ไม่ได้ผลกับ HLE
การสั่งงานแบบทั่วไปและระบบ RAG ล้มเหลวโดยสิ้นเชิงในการทดสอบ HLE:
- ความเป็นเอกลักษณ์ที่ถูกสร้างขึ้นใหม่: โจทย์มาจากบทพิสูจน์ที่ถูกสร้างขึ้นใหม่และไม่มีอยู่บนอินเทอร์เน็ต
- กับดักความคล้ายคลึงของเวกเตอร์: เวกเตอร์ดึงข้อมูลที่คล้ายกันแค่ผิวเผิน ส่งผลให้โมเดลอนุมานไปในทิศทางที่ผิด
คำสั่งรันการประเมินผลผ่าน vLLM:
# โคลนคลังโค้ดและติดตั้งสภาพแวดล้อม
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang
# รันการทดสอบ DeepSeek R1 ผ่าน vLLM
python run_hle_eval.py \
--model "deepseek-ai/DeepSeek-R1" \
--backend "vllm" \
--tensor-parallel-size 8 \
--temperature 0.6 \
--top-p 0.95 \
--max-thinking-tokens 32768 \
--subject-filter "mathematics,physics,computer_science" \
--output-dir "./results/deepseek_r1_hle"
คำแนะนำเชิงปฏิบัติสำหรับวิศวกรซอฟต์แวร์
- ยกเลิกการใช้ MMLU และ GSM8K ในการประเมิน: การทดสอบเหล่านี้ไม่สามารถคัดกรองงานที่มีความซับซ้อนสูงได้อีกต่อไป ควรเปลี่ยนมาใช้ HLE และ FrontierMath
- ให้ความสำคัญกับการคำนวณในเวลาอนุมาน: โมเดลขนาด 32B ที่มีการคิดและตรวจสอบคำตอบอย่างลึกซึ้งมักทำงานได้ดีกว่าโมเดลขนาดใหญ่ที่ไม่มีการคิด
- จัดสถาปัตยกรรมแบบสองระดับ: ส่ง 95% ของคำขอทั่วไปไปยังโมเดลราคาประหยัด และส่งคำถามระดับปริญญาเอกไปยัง o3, Claude 3.7 หรือ DeepSeek R1