Benchmarks

ตารางผู้นำ Humanity's Last Exam: จัดอันดับเบนช์มาร์ก AI

### คำตอบด่วน: เบนช์มาร์ก Humanity's Last Exam (HLE) คืออะไร?

Humanity's Last Exam (HLE) คือแบบทดสอบสหสาขาวิชาชีพจำนวน 3,000 ข้อที่พัฒนาโดย Center for AI Safety (CAIS) และ Scale AI เพื่อวัดขีดจำกัดสูงสุดของความรู้ทางวิชาการของมนุษย์ ครอบคลุมตั้งแต่กลศาสตร์ควอนตัมไปจนถึงเรขาคณิตเชิงพีชคณิต โมเดลการใช้เหตุผลชั้นนำอย่าง OpenAI o3, DeepSeek R1 และ Claude 3.7 ทำคะแนนได้เพียง 18% ถึง 34% ซึ่งเป็นการยุติยุคที่เกณฑ์มาตรฐานเดิมอิ่มตัว


วิกฤตการณ์ความอิ่มตัว: เหตุใดเบนช์มาร์กมาตรฐานจึงล้าสมัย

ระหว่างปี 2023 ถึง 2025 ระบบนิเวศการประเมินปัญญาประดิษฐ์ประสบปัญหาวิกฤตตัวชี้วัดเดิมหมดประสิทธิภาพ เกณฑ์มาตรฐานระดับอุตสาหกรรมที่เคยใช้คัดแยกโมเดลชั้นนำเริ่มตันที่ขีดจำกัดสูงสุด:

  • MMLU (Massive Multitask Language Understanding): อดีตมาตรฐานทองคำสำหรับความรู้ทางวิชาการ ปัจจุบันโมเดลชั้นนำทำคะแนนได้ 90% ถึง 92% จนไม่สามารถแยกความแตกต่างระหว่างการพัฒนาจริงกับมลภาวะของข้อมูลในเว็บได้
  • GSM8K และ MATH: โจทย์คณิตศาสตร์ระดับประถม (GSM8K) ถูกแก้ได้ด้วยความแม่นยำกว่า 99% แม้กระทั่งโดยโมเดลขนาดเล็ก ส่วนข้อสอบ MATH ระดับมัธยมปลายก็ทะลุ 95% ด้วยโมเดลการใช้เหตุผล
  • HumanEval และ MBPP: การสร้างโค้ดยูนิตเทสต์ภาษา Python มีอัตราความสำเร็จเกิน 90% ซึ่งเป็นการทดสอบความถูกต้องของไวยากรณ์พื้นฐานมากกว่าสถาปัตยกรรมซอฟต์แวร์ที่ซับซ้อน
  • GPQA Diamond: ออกแบบมาเพื่อเป็นคำถามระดับปริญญาเอกที่ไม่สามารถค้นหาผ่าน Google ได้ คะแนนพุ่งจาก 55% เป็นกว่า 78% ด้วยการขยายการคำนวณขณะอนุมาน (Test-Time Compute)

เนื่องจากโมเดลพื้นฐานดูดซับข้อมูลเว็บสาธารณะจำนวนมหาศาลระหว่างการฝึกฝนล่วงหน้า การท่องจำและการสืบค้นจึงบดบังข้อบกพร่องที่แท้จริงของการใช้เหตุผลเชิงตรรกะ ส่งผลให้นักวิจัยต้องสร้างแบบทดสอบใหม่ที่มีการป้องกันด้วยลายน้ำเข้ารหัสและผ่านการตรวจทานอย่างเข้มงวด


ทำความรู้จักกับ Humanity's Last Exam (HLE)

พัฒนาขึ้นโดย Center for AI Safety (CAIS) ร่วมกับ Scale AI พร้อมการสนับสนุนจากผู้เชี่ยวชาญกว่า 1,000 คนจากสถาบันการศึกษาชั้นนำทั่วโลก Humanity's Last Exam (HLE) ได้รับการออกแบบให้เป็นด่านประเมินด่านสุดท้ายก่อนเข้าสู่ปัญญาประดิษฐ์ทั่วไป (AGI)

+---------------------------------------------------------------------------------------------------+
|                        โครงสร้างเบนช์มาร์ก HUMANITY'S LAST EXAM (HLE)                             |
+---------------------------------------------------------------------------------------------------+
| พารามิเตอร์                | รายละเอียดข้อกำหนด                                                    |
+----------------------------+----------------------------------------------------------------------+
| จำนวนข้อสอบทั้งหมด         | ปัญหาแบบสหสาขาวิชาชีพทั้งข้อความและมัลติโมดัล 3,000 ข้อ               |
| ระดับทางวิชาการ            | ระดับผู้สมัครปริญญาเอก (PhD), นักวิจัยหลังปริญญาเอก, ผู้เชี่ยวชาญ     |
| สาขาวิชาที่ครอบคลุม        | คณิตศาสตร์, ฟิสิกส์, เคมี, ชีววิทยา, วิทยาการคอมพิวเตอร์, กฎหมาย ฯลฯ |
| การป้องกันข้อมูลรั่วไหล     | คานารีสตริงที่เข้ารหัส, ข้อพิสูจน์ที่ยังไม่เผยแพร่, การตั้งโจทย์ใหม่ |
| รูปแบบการประเมินผล         | การจับคู่สตริงที่แน่นอน, พิกัดเผื่อตัวเลข, การตรวจสอบเชิงตรรกะ       |
| เกณฑ์มาตรฐานมนุษย์ผู้เชี่ยวชาญ| ~100% (ผู้เชี่ยวชาญเฉพาะทางที่ได้รับอนุญาตให้เปิดเอกสารอ้างอิงได้) |
| โมเดล LLM ทั่วไปที่ไม่มี CoT| < 3.5% (Zero-shot GPT-4o / Claude 3.5 Sonnet ที่ไม่มีเวลาคิด)       |
+----------------------------+----------------------------------------------------------------------+

เกณฑ์หลักในการคัดเลือกคำถามเข้าสู่ HLE

  1. ไม่สามารถค้นหาผ่าน Google ได้เลย: คำตอบไม่สามารถหาได้จากการค้นหาโดยตรงหรือการรวมข้อมูลหน้าเว็บ
  2. ต้องใช้ความรู้ระดับบัณฑิตศึกษาเฉพาะทาง: ผู้จบการศึกษาระดับปริญญาตรีทั่วไปไม่สามารถแก้โจทย์ได้แม้จะมีเวลาหลายชั่วโมง
  3. ตรวจสอบความถูกต้องได้โดยอัตโนมัติ: คำตอบสรุปเป็นค่าตัวเลขที่แน่นอนหรือสัญลักษณ์ที่ชัดเจน เพื่อขจัดอคติจากการใช้โมเดลเป็นผู้ตัดสิน (LLM-as-a-judge)
  4. การให้เหตุผลเชิงมัลติโมดัลขั้นสูง: ราว 15% ประกอบด้วยแผนภาพชีวเคมี โครงสร้างวงจร และเรขาคณิตนอกแบบยุคลิด

เสาหลักเบนช์มาร์ก AI ปี 2026: HLE, FrontierMath และ ARC-AGI

เพื่อวัดความฉลาดระดับแนวหน้า ชุมชนวิศวกรรมปัญญาประดิษฐ์จึงพึ่งพาการทดสอบที่ส่งเสริมซึ่งกันและกัน 3 รายการ:

                  =======================================================
                               อนุกรมวิธานการประเมินผล AI ชั้นนำ
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (François Chollet)
                        |                  |                  |
               เพดานวิชาการระดับสูงสุด   บทพิสูจน์คณิตศาสตร์    การอนุมานกฎ
               ความลึกระดับปริญญาเอก   ขั้นสูงที่ยังไม่ตีพิมพ์ นามธรรมที่มองเห็น
               3,000 ข้อสอบผู้เชี่ยวชาญ การตรวจยืนยันที่เข้มงวด ปราศจากความจำเดิม

1. FrontierMath (Epoch AI)

ร่วมพัฒนาโดยนักคณิตศาสตร์ระดับเหรียญฟีลด์ส ประกอบด้วยโจทย์คณิตศาสตร์ที่ยังไม่เคยเผยแพร่จำนวนหลายร้อยข้อที่ต้องใช้เวลานานในการแก้ โมเดลทั่วไปทำได้ไม่ถึง 2% แต่โมเดลการใช้เหตุผลยุคใหม่ทำได้ 20% ถึง 30%

2. ARC-AGI (Abstraction and Reasoning Corpus)

คิดค้นโดย François Chollet เพื่อทดสอบความสามารถในการอนุมานกฎการแปลงภาพจากตัวอย่างตารางกริดเพียงไม่กี่ภาพ ซึ่งแยกความฉลาดแบบไหล (Fluid Intelligence) ออกจากความจำทางภาษา

3. Humanity's Last Exam (HLE)

ผสมผสานความกว้างขวางของ MMLU, ความเข้มงวดทางตรรกะของ FrontierMath และการวิเคราะห์ภาพทางวิทยาศาสตร์มัลติโมดัลเข้าด้วยกัน


ตารางอันดับโมเดลปัญญาประดิษฐ์ชั้นนำประจำปี 2026

ผลการทดสอบเชิงประจักษ์ของโมเดลการใช้เหตุผลและสถาปัตยกรรมโอเพนเวท:

สถาปัตยกรรมโมเดล ผู้ให้บริการ / สัญญาอนุญาต HLE ความแม่นยำรวม (%) HLE คณิต/คอมพิวเตอร์ (%) FrontierMath Tier-1 (%) ARC-AGI-2 ยืนยันแล้ว (%) ต้นทุนเฉลี่ย / 1M โทเค็น
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) API กรรมสิทธิ์ 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B Full) MIT Open Weights 27.6% 32.8% 24.1% 71.2% $2.19 (โฮสต์เอง)
OpenAI o1 (Full Reasoning) API กรรมสิทธิ์ 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL-Reasoning) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 Open 14.2% 17.9% 9.4% 49.6% $0.60 (เครื่องตนเอง)
Claude 3.5 Sonnet (มาตรฐาน) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (เกณฑ์อ้างอิงทั่วไป) API กรรมสิทธิ์ 3.2% 3.8% 1.8% 34.2% $2.50

การวิเคราะห์ทางเทคนิค: โมเดลการใช้เหตุผลแก้โจทย์ HLE ได้อย่างไร

1. OpenAI o3: การค้นหาแบบโครงสร้างต้นไม้ขนาดใหญ่ในเวลาอนุมาน

OpenAI o3 คว้าอันดับหนึ่ง (33.8%) ด้วยการเรียนรู้แบบเสริมกำลังขนาดใหญ่ร่วมกับการค้นหาบนต้นไม้การตัดสินใจโดยใช้โมเดลรางวัลกระบวนการ (PRM) ซึ่งช่วยตัดเส้นทางที่ไม่สมเหตุสมผลออกไปก่อนแสดงคำตอบสุดท้าย

2. Claude 3.7 Sonnet: การคิดแบบปรับเปลี่ยนได้และการแก้ไขตัวเอง

Claude 3.7 Sonnet สามารถกำหนดจำนวนโทเค็นการคิดได้ตั้งแต่ 0 ถึง 128,000 โทเค็น มีความสามารถในการแก้ไขข้อผิดพลาดระหว่างทางได้อย่างยอดเยี่ยม โดยเฉพาะในวิชาชีววิทยาโมเลกุลและนิติศาสตร์

3. DeepSeek R1: ความก้าวหน้าของโมเดลเปิด

DeepSeek R1 พิสูจน์ให้เห็นว่าการเรียนรู้แบบเสริมกำลังโดยอิงกฎเกณฑ์อย่างแท้จริง (ความถูกต้องทางคณิตศาสตร์และรูปแบบที่ถูกต้อง) สามารถสร้างทักษะการใช้เหตุผลที่ซับซ้อนได้โดยไม่ต้องใช้ข้อมูลที่มนุษย์เขียนทีละขั้นตอน


ทำไมระบบ RAG ดั้งเดิมจึงใช้ไม่ได้ผลกับ HLE

การสั่งงานแบบทั่วไปและระบบ RAG ล้มเหลวโดยสิ้นเชิงในการทดสอบ HLE:

  • ความเป็นเอกลักษณ์ที่ถูกสร้างขึ้นใหม่: โจทย์มาจากบทพิสูจน์ที่ถูกสร้างขึ้นใหม่และไม่มีอยู่บนอินเทอร์เน็ต
  • กับดักความคล้ายคลึงของเวกเตอร์: เวกเตอร์ดึงข้อมูลที่คล้ายกันแค่ผิวเผิน ส่งผลให้โมเดลอนุมานไปในทิศทางที่ผิด

คำสั่งรันการประเมินผลผ่าน vLLM:

# โคลนคลังโค้ดและติดตั้งสภาพแวดล้อม
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# รันการทดสอบ DeepSeek R1 ผ่าน vLLM
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

คำแนะนำเชิงปฏิบัติสำหรับวิศวกรซอฟต์แวร์

  1. ยกเลิกการใช้ MMLU และ GSM8K ในการประเมิน: การทดสอบเหล่านี้ไม่สามารถคัดกรองงานที่มีความซับซ้อนสูงได้อีกต่อไป ควรเปลี่ยนมาใช้ HLE และ FrontierMath
  2. ให้ความสำคัญกับการคำนวณในเวลาอนุมาน: โมเดลขนาด 32B ที่มีการคิดและตรวจสอบคำตอบอย่างลึกซึ้งมักทำงานได้ดีกว่าโมเดลขนาดใหญ่ที่ไม่มีการคิด
  3. จัดสถาปัตยกรรมแบบสองระดับ: ส่ง 95% ของคำขอทั่วไปไปยังโมเดลราคาประหยัด และส่งคำถามระดับปริญญาเอกไปยัง o3, Claude 3.7 หรือ DeepSeek R1
← บทความทั้งหมด
0 / 4