Benchmarks

لوحة تصدر Humanity's Last Exam: تصنيف نماذج الذكاء الاصطناعي

### إجابة سريعة: ما هو معيار Humanity's Last Exam (HLE)؟

يُعد Humanity's Last Exam (HLE) اختباراً متعدد التخصصات يضم 3000 مسألة فائقة الصعوبة طوره مركز أمان الذكاء الاصطناعي (CAIS) وScale AI لتمثيل السقف الأكاديمي للمعرفة البشرية. بتغطيته لميكانيكا الكم والهندسة الجبرية، تحقق نماذج الاستدلال المتقدمة مثل OpenAI o3 وDeepSeek R1 وClaude 3.7 دقة بين 18% و34%، منهية عصر تشبع الاختبارات القياسية.


أزمة التشبع: لماذا انهارت الاختبارات القياسية التقليدية؟

بين عامي 2023 و2025، واجه نظام تقييم نماذج الذكاء الاصطناعي أزمة تقادم حادة، حيث وصلت المعايير التي كانت تفصل بين النماذج الرائدة إلى سقف قياسها:

  • MMLU (Massive Multitask Language Understanding): كان المعيار الذهبي للثقافة الأكاديمية العامة، لكن النماذج المتقدمة تسجل فيه باستمرار بين 90% و92%، مما جعل الفروقات طفيفة ولا يمكن تمييزها عن تلوث البيانات.
  • GSM8K وMATH: أصبحت مسائل الرياضيات المدرسية (GSM8K) تُحل بدقة تتجاوز 99% حتى من النماذج المصغرة، بينما تجاوز اختبار MATH الثانوي نسبة 95% بفضل نماذج الاستدلال.
  • HumanEval وMBPP: تجاوزت دقة توليد اختبارات بايثون 90%، مما يقيس التوافق النحوي البسيط بدلاً من هندسة البرمجيات المعقدة.
  • GPQA Diamond: صُمم ليكون مقاوماً للبحث عبر جوجل على مستوى الدكتوراه في العلوم، وارتفعت دقته من 55% إلى أكثر من 78% بفضل الحوسبة الموسعة أثناء الاستدلال (Test-Time Compute).

نتيجة لامتصاص النماذج التأسيسية مليارات النصوص أثناء التدريب الأولي، حجب الحفظ والاسترجاع الضعف الحقيقي في التفكير المنطقي. تطلب ذلك معايير محصنة بعلامات مائية تشفيرية، ومراجعة دقيقة من النظراء، واستنتاجات دكتوراه متعددة الخطوات.


ما هو معيار Humanity's Last Exam (HLE)؟

تم تطوير Humanity's Last Exam (HLE) بالتعاون بين Center for AI Safety (CAIS) وScale AI، وبمشاركة أكثر من 1000 خبير أكاديمي من جامعات عالمية مرموقة، ليكون خط التقييم النهائي قبل الوصول إلى الذكاء الاصطناعي العام (AGI).

+---------------------------------------------------------------------------------------------------+
|                        بنية معيار HUMANITY'S LAST EXAM (HLE) القياسي                              |
+---------------------------------------------------------------------------------------------------+
| المعيار                    | تفاصيل المواصفات                                                     |
+----------------------------+----------------------------------------------------------------------+
| إجمالي الأسئلة             | 3,000 مسألة متعددة التخصصات نصية ومتعددة الوسائط                     |
| المستوى الأكاديمي          | مرحلة الدكتوراه (PhD)، باحثو ما بعد الدكتوراه، وعلماء متخصصون        |
| المجالات المغطاة           | الرياضيات، الفيزياء، الكيمياء، الأحياء، علوم الحاسوب، القانون وغيره |
| الحماية من التسريب         | سلاسل كناري مشفرة، براهين غير منشورة، صياغات جديدة كلياً            |
| صيغة التحقق                | مطابقة دقيقة للنصوص، تفاوتات عددية محددة، تحقق منطقي صارم            |
| خط الأساس البشري للخبراء   | ~100% (متخصصون في المجال مع إتاحة المراجع العلمية)                   |
| النماذج الكلاسيكية بدون CoT | < 3.5% (صفر استدلال GPT-4o / Claude 3.5 Sonnet بدون وقت تفكير)       |
+----------------------------+----------------------------------------------------------------------+

معايير اختيار أسئلة HLE

  1. استحالة البحث عبر الإنترنت (Zero Googleability): لا يمكن العثور على الإجابة عبر البحث المباشر أو التجميع السطحي لصفحات الويب.
  2. شرط المعرفة التخصصية العليا: لا يمكن لشخص جامعي غير متخصص في أبحاث الدكتوراه للمجال حل المسألة حتى بعد ساعات من البحث.
  3. قابلية التحقق الآلي المطلق: تنتهي المسألة بقيمة رياضية محددة أو رمز قاطع، مما يمنع التحيز الذاتي للتقييم بواسطة نماذج لغوية (LLM-as-a-judge).
  4. استدلال علمي متعدد الوسائط: تشمل قرابة 15% من المسائل رسومات كيميائية حيوية وتخطيطات دوائر هندسية معقدة.

ثلاثية معايير النخبة لعام 2026: HLE وFrontierMath وARC-AGI

لقياس الذكاء الاستدلالي الحقيقي، يعتمد مجتمع الذكاء الاصطناعي على ثلاثة اختبارات تكاملية:

                  =======================================================
                            تصنيف اختبارات الاستدلال المتقدمة
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (فرانسوا شوليه)
                        |                  |                  |
               السقف الأكاديمي الشامل   براهين رياضية عميقة    استقراء قواعد
               مستوى دكتوراه متعدد التخصصات أبحاث غير منشورة   تجريدية بصرية
               3,000 مسألة نخبوية       تحقق صارم شبه آلي      دون ذاكرة لغوية

1. FrontierMath (Epoch AI)

تم بناؤه بالتعاون مع كبار علماء الرياضيات وحائزي ميدالية فيلدز، ويحتوي على مئات المسائل الرياضية غير المنشورة التي تتطلب ساعات أو أياماً من العمل البشري المتواصل.

2. ARC-AGI (Abstraction and Reasoning Corpus)

ابتكره فرانسوا شوليه لقياس القدرة على اكتساب مهارات جديدة واستنباط قواعد التحول المجرد من أمثلة بصرية معدودة بمعزل عن المعرفة اللغوية المحفوظة.

3. Humanity's Last Exam (HLE)

يجمع بين الاتساع المعرفي لاختبار MMLU والصرامة الرياضية لاختبار FrontierMath والفهم العلمي متعدد الوسائط.


لوحة المتصدرين الشاملة لعام 2026

نتائج التقييم التجريبي لنماذج الاستدلال الرائدة والأنظمة مفتوحة الأوزان:

بنية النموذج المزود / الترخيص دقة HLE الإجمالية (%) دقة HLE رياضيات/حاسوب (%) FrontierMath Tier-1 (%) ARC-AGI-2 المعتمد (%) متوسط التكلفة / 1M توكن
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) واجهة API خاصة 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B الكامل) MIT مفتوح المصدر 27.6% 32.8% 24.1% 71.2% $2.19 (استضافة ذاتية)
OpenAI o1 (استدلال كامل) واجهة API خاصة 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL-Reasoning) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 مفتوح 14.2% 17.9% 9.4% 49.6% $0.60 (محلي FP8)
Claude 3.5 Sonnet (قياسي) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (خط أساس Zero-shot) واجهة API خاصة 3.2% 3.8% 1.8% 34.2% $2.50

تحليل تقني: كيف تتصدى نماذج الاستدلال لاختبار HLE؟

1. OpenAI o3: توسيع البحث الشجري أثناء الاستدلال

يتصدر o3 الترتيب (33.8%) بفضل التعلم المعزز المكثف والبحث في شجرة الحلول باستخدام نماذج مكافأة العمليات (PRM)، حيث يستكشف آلاف الفرضيات ويستبعد التناقضات قبل صياغة الحل النهائي.

2. Claude 3.7 Sonnet: التفكير التكيفي والتصحيح الذاتي

يتيح Claude 3.7 تعديل عدد توكنات التفكير بمرونة تصل إلى 128 ألف توكن. ويظهر كفاءة استثنائية في التصحيح الذاتي في مجالات الأحياء الجزيئية والقانون، حيث يتراجع ويعيد بناء مسار البرهان عندما يكتشف خطأ منطقياً.

3. DeepSeek R1: الثورة مفتوحة الأوزان

أثبت DeepSeek R1 أن التعلم المعزز الخالص القائم على قواعد دقيقة (الصحة الرياضية وتنسيق المخرجات) قادر على توليد سلاسل استدلال معقدة دون الحاجة إلى بيانات تدريب بشرية باهظة التكلفة.


لماذا يفشل نظام RAG التقليدي أمام HLE؟

تنهار محاولات استرجاع المعلومات التقليدية تماماً أمام هذا الاختبار:

  • التفرد التركيبي: المسائل مبنية على نظريات مصممة حديثاً لا تتوفر على شبكة الإنترنت.
  • التضليل الدلالي: تسترجع قواعد البيانات المتجهية نصوصاً متشابهة ظاهرياً تقود النموذج إلى استنتاجات خاطئة.

تشغيل تقييم HLE محلياً عبر vLLM:

# استنساخ مستودع التقييم وتثبيت المتطلبات
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# تشغيل تقييم DeepSeek R1 عبر vLLM
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

توصيات هندسية عملية

  1. استبعاد MMLU وGSM8K من معايير التقييم: لا تقدم هذه الاختبارات أي قيمة تفريقية في المجالات التحليلية أو المالية المعقدة. اعتمد على HLE وFrontierMath.
  2. إعطاء الأولوية للحوسبة أثناء الاستدلال: نموذج مصغر بحجم 32B يدعم البحث والتحقق يحقق نتائج أفضل بكثير من النماذج الضخمة الخالية من آليات التفكير.
  3. اعتماد بنية توجيه ثنائية المستوى: وجّه 95% من الطلبات الروتينية لنماذج سريعة ورخيصة، وقم بتصعيد المسائل الأكاديمية المعقدة إلى o3 أو Claude 3.7 أو DeepSeek R1.
→ كل المقالات
0 / 4