Benchmarks

Humanity's Last Exam لیڈر بورڈ: فرنٹیر AI بینچ مارکس

### فوری جواب: Humanity's Last Exam (HLE) بینچ مارک کیا ہے؟

Humanity's Last Exam (HLE) ایک کثیر الجہتی بینچ مارک ہے جس میں 3,000 انتہائی پیچیدہ سوالات شامل ہیں، جنہیں CAIS اور Scale AI نے انسانی علمی صلاحیتوں کی آخری حد جانچنے کے لیے تیار کیا ہے۔ کوانٹم فزکس اور الجبرک جیومیٹری جیسے مضامین پر مشتمل اس امتحان میں OpenAI o3، DeepSeek R1 اور Claude 3.7 جیسے جدید ترین ماڈلز کی درستگی محض 18% سے 34% کے درمیان ہے، جس نے روایتی بینچ مارکس کی سیچوریشن کا خاتمہ کر دیا ہے۔


سیچوریشن کا بحران: روایتی بینچ مارکس کیوں غیر مؤثر ہو گئے؟

2023 سے 2025 کے دوران مصنوعی ذہانت کے ماڈلز کی جانچ کا نظام سخت فرسودگی کا شکار ہو گیا۔ ماضی میں ماڈلز کی تفریق کرنے والے روایتی بینچ مارکس اپنی انتہائی حد کو چھو چکے تھے:

  • MMLU (Massive Multitask Language Understanding): عام تعلیمی صلاحیتوں کا یہ گولڈ اسٹینڈرڈ اب سرفہرست ماڈلز کے ہاتھوں 90% سے 92% تک پہنچ چکا ہے، جس کے باعث ماڈل کے حقیقی ارتقاء اور انٹرنیٹ کے ڈیٹا کے شور میں تمیز ناممکن ہو گئی۔
  • GSM8K اور MATH: پرائمری اسکول کی ریاضی (GSM8K) اب چھوٹے ماڈلز بھی 99% سے زیادہ درستگی کے ساتھ حل کرتے ہیں، جبکہ ہائی اسکول MATH کا امتحان ریزننگ ماڈلز کے ذریعے 95% سے اوپر چلا گیا۔
  • HumanEval اور MBPP: پائتھن کوڈ جنریشن کی درستگی 90% سے تجاوز کر گئی، جو سافٹ ویئر ڈیزائن کے بجائے صرف بنیادی نحو (Syntax) کی جانچ کرتی ہے۔
  • GPQA Diamond: پی ایچ ڈی سطح کے گوگل پروف سائنسی سوالات پر مبنی یہ ٹیسٹ ٹیسٹ-ٹائم کمپیوٹ (Test-Time Compute) کی بدولت 55% سے بڑھ کر 78% سے زائد ہو گیا۔

چونکہ فاؤنڈیشن ماڈلز نے پری ٹریننگ کے دوران انٹرنیٹ کا بڑا حصہ محفوظ کر لیا تھا، اس لیے محض زبانی یادداشت نے منطقی استدلال کی حقیقی کمزوریوں کو چھپا رکھا تھا۔ اس لیے کرپٹوگرافک سیکیورٹی اور پی ایچ ڈی سطح کی کثیر الجہتی استقرائی صلاحیتوں کے نئے ٹیسٹ ناگزیر ہو گئے۔


Humanity's Last Exam (HLE) کا تعارف

Center for AI Safety (CAIS) اور Scale AI کے زیر اہتمام، دنیا بھر کی صف اول کی جامعات کے 1,000 سے زائد ماہرین کی مدد سے تیار کردہ Humanity's Last Exam (HLE) کو عمومی مصنوعی ذہانت (AGI) سے قبل کی آخری علمی سرحد قرار دیا گیا ہے۔

+---------------------------------------------------------------------------------------------------+
|                        HUMANITY'S LAST EXAM (HLE) بینچ مارک کا ڈھانچہ                             |
+---------------------------------------------------------------------------------------------------+
| پیرامیٹر                   | تفصیلات                                                              |
+----------------------------+----------------------------------------------------------------------+
| کل سوالات                  | 3,000 کثیر الجہتی ملٹی ماڈل اور تحریری مسائل                          |
| علمی سطح                   | پی ایچ ڈی (PhD)، پوسٹ ڈاک اور سینئر محققین کی سطح                     |
| شامل مضامین                | ریاضی، طبیعیات، کیمیا، حیاتیات، کمپیوٹر سائنس، قانون، معاشیات وغیرہ  |
| ڈیٹا کے اخراج سے تحفظ      | کرپٹوگرافک کینری اسٹرنگز، غیر مطبوعہ تصدیقات، بالکل نئے سوالات      |
| جانچ کا طریقہ              | مکمل اسٹرنگ میچنگ، عددی مارجن، خودکار منطقی تصدیق                   |
| انسانی ماہرین کی بنیاد     | ~100% (حوالہ جاتی مواد تک رسائی رکھنے والے متعلقہ شعبے کے ماہرین)    |
| روایتی بغیر ریزننگ LLM     | < 3.5% (زیرو شاٹ GPT-4o / Claude 3.5 Sonnet بغیر تفصیلی سوچ کے)     |
+----------------------------+----------------------------------------------------------------------+

HLE میں سوالات کی شمولیت کے بنیادی معیارات

  1. گوگل پر تلاش ناممکن (Zero Googleability): جواب براہ راست سرچ یا عوامی ویب صفحات کے ملاپ سے نہیں مل سکتا۔
  2. پوسٹ گریجویٹ مہارت لازمی: متعلقہ شعبے میں باقاعدہ پی ایچ ڈی کے بغیر عام تعلیم یافتہ فرد گھنٹوں کی کوشش کے بعد بھی اسے حل نہیں کر سکتا۔
  3. خودکار غیر جانبدارانہ تصدیق: جواب کسی حتمی عددی یا ریاضیاتی علامت پر ختم ہوتا ہے تاکہ شخصی جانچ کا تعصب ختم ہو۔
  4. گہری ملٹی ماڈل صلاحیت: تقریباً 15% سوالات پیچیدہ بائیو کیمیکل اسٹرکچرز، الیکٹرانک سرکٹس اور غیر اقلیدسی جیومیٹری پر مشتمل ہیں۔

2026 کے تین بنیادی بینچ مارکس: HLE، FrontierMath اور ARC-AGI

حقیقی ذہانت ناپنے کے لیے تحقیقی برادری تین تکمیلی ٹیسٹوں پر انحصار کرتی ہے:

                  =======================================================
                                 فرنٹیر AI ریزننگ کی درجہ بندی
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (François Chollet)
                        |                  |                  |
               علمی صلاحیت کی آخری حد   گہرے ریاضیاتی ثبوت     نئے تجریدی اصولوں
               پی ایچ ڈی سطح کی گہرائی   غیر مطبوعہ تحقیقی مسائل کی پہچان
               3,000 ماہرانہ سوالات     نیم خودکار سخت جانچ   پہلے سے محفوظ یادداشت کے بغیر

1. FrontierMath (Epoch AI)

فیلڈز میڈل یافتہ ماہرین ریاضی کی مدد سے تیار کردہ اس امتحان میں سینکڑوں غیر مطبوعہ پیچیدہ سوالات شامل ہیں جنہیں حل کرنے کے لیے ماہرین کو گھنٹوں یا دنوں کا وقت درکار ہوتا ہے۔

2. ARC-AGI (Abstraction and Reasoning Corpus)

فرانسوا شولے کا ڈیزائن کردہ یہ ٹیسٹ بصری گرڈ کی چند مثالوں سے تبدیلی کے نئے اصول اخذ کرنے کی صلاحیت کو ناپتا ہے، جو زبانی یادداشت سے پاک ذہانت کی عکاسی کرتا ہے۔

3. Humanity's Last Exam (HLE)

یہ MMLU کی علمی وسعت، FrontierMath کی ریاضیاتی سختی اور 100 سے زائد شعبوں میں سائنسی بصیرت کو یکجا کرتا ہے۔


2026 کا جامع فرنٹیر لیڈر بورڈ

نمایاں ریزننگ ماڈلز اور اوپن ویٹ سسٹمز کے تجرباتی نتائج درج ذیل ہیں:

ماڈل آرکیٹیکچر فراہم کنندہ / لائسنس HLE مجموعی درستگی (%) HLE ریاضی/کمپیوٹر (%) FrontierMath Tier-1 (%) ARC-AGI-2 تصدیق شدہ (%) اوسط لاگت / 1M ٹوکن
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) ملکیتی API 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B Full) MIT اوپن ویٹس 27.6% 32.8% 24.1% 71.2% $2.19 (ذاتی سرور)
OpenAI o1 (مکمل ریزننگ) ملکیتی API 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL ریزننگ) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 اوپن 14.2% 17.9% 9.4% 49.6% $0.60 (مقامی FP8)
Claude 3.5 Sonnet (معیاری) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (زیرو شاٹ بنیاد) ملکیتی API 3.2% 3.8% 1.8% 34.2% $2.50

تکنیکی تجزیہ: ریزننگ ماڈلز HLE کو کیسے حل کرتے ہیں؟

1. OpenAI o3: انفرینس کے دوران وسیع ٹری سرچ

OpenAI o3 عمل کے انعامی ماڈلز (PRM) کے تحت ٹیسٹ-ٹائم سرچ اور وسیع ری انفورسمنٹ لرننگ کی بدولت سرفہرست (33.8%) ہے۔ یہ حتمی جواب دینے سے قبل ہزاروں ممکنہ راستوں کی چھان بین کرتا ہے۔

2. Claude 3.7 Sonnet: لچکدار سوچ اور ازخود اصلاح

Claude 3.7 صارفین کو سوچنے کے لیے 0 سے 128k تک ٹوکنز ایڈجسٹ کرنے کی سہولت فراہم کرتا ہے۔ مالیکیولر بائیولوجی اور قانون میں یہ غلطیوں کو پہچان کر خود ہی استدلال کو نئے سرے سے درست کرنے کی غیر معمولی صلاحیت رکھتا ہے۔

3. DeepSeek R1: اوپن ویٹ ماڈلز کی شاندار کامیابی

DeepSeek R1 نے ثابت کیا کہ انسانی رہنمائی کے بغیر صرف ریاضیاتی درستگی اور سخت قواعد پر مبنی خالص ری انفورسمنٹ لرننگ (RL) کے ذریعے بھی گہری سوچ اور خودکار تصدیق کے طریقے خود بخود ابھر سکتے ہیں۔


روایتی RAG کا نظام HLE کے سامنے کیوں ناکام ہو جاتا ہے؟

عام پرامپٹس اور ڈیٹا بیس پر مبنی RAG نظام HLE کے سامنے بے بس ہو جاتے ہیں:

  • نئی تخلیق کی انفرادیت: سوالات بالکل نئی سائنسی تھیوریز پر مبنی ہیں جو انٹرنیٹ پر موجود نہیں۔
  • مشابہت کا فریب: ویکٹر سرچ ملتی جلتی اصطلاحات تلاش کر کے ماڈل کو غلط سمت میں الجھا دیتی ہے۔

vLLM کے ذریعے مقامی سطح پر HLE کا ٹیسٹ چلانا:

# ریپوزٹری کلون کریں اور ماحولیات تیار کریں
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# vLLM پر DeepSeek R1 کی جانچ شروع کریں
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

سافٹ ویئر انجینئرز کے لیے تجاویز

  1. MMLU اور GSM8K کو جانچ کے نظام سے ہٹا دیں: کوڈ ویریفکیشن یا سائنسی ڈیٹا کے لیے یہ پرانے ٹیسٹ اب بیکار ہو چکے ہیں۔ ان کی جگہ HLE اور FrontierMath استعمال کریں۔
  2. ماڈل کے سائز سے زیادہ ٹیسٹ-ٹائم کمپیوٹ کو ترجیح دیں: گہری سوچ اور تلاش کی صلاحیت رکھنے والا ایک 32B ماڈل بغیر سوچنے والے دیو ہیکل ماڈل سے بہتر کام کرتا ہے۔
  3. دو سطحی نظام اپنائیں: 95% عام کام تیز رفتار سستے ماڈلز کے سپرد کریں اور پی ایچ ڈی سطح کے پیچیدہ سوالات o3، Claude 3.7 یا DeepSeek R1 کو بھیجیں۔
→ تمام مضامین
0 / 4