### त्वरित उत्तर: Humanity's Last Exam (HLE) बेंचमार्क क्या है?
Humanity's Last Exam (HLE) CAIS और Scale AI द्वारा विकसित 3,000 अत्यंत कठिन प्रश्नों का एक बहुविषयक बेंचमार्क है, जो मानव ज्ञान की अंतिम सीमा का प्रतिनिधित्व करता है। क्वांटम भौतिकी और बीजगणितीय ज्यामिति को कवर करते हुए, OpenAI o3, DeepSeek R1 और Claude 3.7 जैसे फ्रंटियर रीजनिंग मॉडल 18% से 34% के बीच स्कोर करते हैं, जिसने पुराने बेंचमार्क के संतृप्ति युग को समाप्त कर दिया है।
संतृप्ति का संकट: पारंपरिक बेंचमार्क क्यों अप्रचलित हुए
2023 और 2025 के बीच, कृत्रिम बुद्धिमत्ता मूल्यांकन पारिस्थितिकी तंत्र ने गंभीर मेट्रिक अप्रचलन का सामना किया। उद्योग मानक परीक्षण संतृप्ति की सीमा तक पहुँच गए:
- MMLU (Massive Multitask Language Understanding): सामान्य शैक्षणिक क्षमता का यह मानक अब शीर्ष मॉडलों द्वारा 90% से 92% तक आसानी से पार कर लिया गया है, जिससे मॉडलों के बीच वास्तविक अंतर और डेटा संदूषण को अलग करना असंभव हो गया।
- GSM8K और MATH: प्राथमिक विद्यालयी गणित (GSM8K) छोटे मॉडलों द्वारा भी 99%+ सटीकता के साथ हल किया जाने लगा, जबकि हाई स्कूल MATH रीजनिंग मॉडलों के साथ 95% से अधिक सटीकता तक पहुँच गया।
- HumanEval और MBPP: पायथन यूनिट टेस्ट जनरेशन 90% से अधिक हो गया, जो केवल बुनियादी सिंटैक्स की जांच करता है, न कि जटिल सॉफ्टवेयर आर्किटेक्चर की।
- GPQA Diamond: गूगल-प्रूफ पीएचडी स्तर के विज्ञान प्रश्नों के रूप में डिज़ाइन किया गया यह परीक्षण, टेस्ट-टाइम कम्प्यूट स्केलिंग के साथ 55% से बढ़कर 78%+ पर पहुँच गया।
क्योंकि आधारभूत मॉडलों ने प्री-ट्रेनिंग के दौरान इंटरनेट का विशाल डेटा अवशोषित कर लिया था, केवल रटने और पुनः प्राप्त करने की प्रणाली ने वास्तविक तार्किक तर्क की कमी को छिपा दिया। इसके लिए क्रिप्टोग्राफिक सुरक्षा, सहकर्मी समीक्षा और पीएचडी-स्तरीय बहु-चरणीय निगमनात्मक निष्कर्षों की आवश्यकता थी।
Humanity's Last Exam (HLE) क्या है?
Center for AI Safety (CAIS) और Scale AI द्वारा 1,000 से अधिक वैश्विक शोधकर्ताओं के सहयोग से निर्मित, Humanity's Last Exam (HLE) को आर्टिफिशियल जनरल इंटेलिजेंस (AGI) से पहले अंतिम अकादमिक सीमा के रूप में तैयार किया गया है।
+---------------------------------------------------------------------------------------------------+
| HUMANITY'S LAST EXAM (HLE) बेंचमार्क आर्किटेक्चर |
+---------------------------------------------------------------------------------------------------+
| पैरामीटर | विनिर्देश विवरण |
+----------------------------+----------------------------------------------------------------------+
| कुल प्रश्न | 3,000 मल्टीमॉडल और टेक्स्ट-आधारित बहुविषयक समस्याएं |
| शैक्षणिक स्तर | पीएचडी (PhD), पोस्टडॉक और वरिष्ठ शोधकर्ता स्तर |
| शामिल विषय | गणित, भौतिकी, रसायन विज्ञान, जीव विज्ञान, कंप्यूटर साइंस, कानून आदि |
| संदूषण रोधी उपाय | क्रिप्टोग्राफिक कैनरी स्ट्रिंग्स, अप्रकाशित प्रमाण, नवीन समस्याएं |
| सत्यापन प्रारूप | सटीक स्ट्रिंग मिलान, संख्यात्मक सहनशीलता, औपचारिक प्रमाण सत्यापन |
| मानव विशेषज्ञ आधाररेखा | ~100% (संदर्भ सामग्री तक पहुंच रखने वाले विषय विशेषज्ञ) |
| बिना रीजनिंग पारंपरिक LLM | < 3.5% (जीरो-शॉट GPT-4o / Claude 3.5 Sonnet बिना डीप रीजनिंग के) |
+----------------------------+----------------------------------------------------------------------+
HLE में प्रश्न शामिल करने के मुख्य मानदंड
- शून्य खोज योग्यता (Zero Googleability): उत्तर सीधे खोज या सार्वजनिक वेब पेजों के संश्लेषण द्वारा नहीं पाया जा सकता।
- स्नातकोत्तर विशेषज्ञता की आवश्यकता: विषय में विशेष पीएचडी प्रशिक्षण के बिना एक सामान्य शिक्षित व्यक्ति घंटों में भी समस्या को हल नहीं कर सकता।
- स्वचालित निष्पक्ष सत्यापन: समाधान एक सटीक गणितीय मान या अस्पष्टता-रहित टोकन में समाप्त होता है, जिससे व्यक्तिपरक मूल्यांकन पूर्वाग्रह समाप्त होता है।
- गहन मल्टीमॉडल तर्क: लगभग 15% प्रश्नों में जैव-रासायनिक संरचनाएं, सर्किट टोपोलॉजी और गैर-यूक्लिडियन ज्यामिति आरेख शामिल हैं।
2026 के तीन प्रमुख फ्रंटियर बेंचमार्क: HLE, FrontierMath और ARC-AGI
फ्रंटियर बुद्धिमत्ता को मापने के लिए तीन पूरक तनाव परीक्षणों का उपयोग किया जाता है:
=======================================================
फ्रंटियर AI रीजनिंग वर्गीकरण
=======================================================
/ | \
/ | \
Humanity's Last Exam FrontierMath ARC-AGI-2
(HLE) (Epoch AI) (François Chollet)
| | |
समग्र शैक्षणिक सीमा गहन गणितीय शोध अमूर्त नवीन नियमों
बहुविषयक पीएचडी गहराई अप्रकाशित कठिन प्रमाण का प्रेरण (Induction)
3,000 विशेषज्ञ प्रश्न अर्ध-स्वचालित सत्यापन शून्य पूर्व-स्मृति
1. FrontierMath (Epoch AI)
फील्ड्स मेडल विजेताओं के सहयोग से निर्मित, इसमें सैकड़ों अप्रकाशित गणितीय शोध समस्याएं शामिल हैं। मानक मॉडल 2% से नीचे रहे, जबकि रीजनिंग मॉडल 20% से 30% तक पहुँच गए हैं।
2. ARC-AGI (Abstraction and Reasoning Corpus)
फ़्राँस्वा चॉलेट द्वारा विकसित, यह परीक्षण बहुत कम दृश्य ग्रिड उदाहरणों से नए परिवर्तन नियमों का अनुमान लगाने की क्षमता का परीक्षण करता है, जो स्मृति से मुक्त तर्क को मापता है।
3. Humanity's Last Exam (HLE)
यह MMLU के व्यापक ज्ञान, FrontierMath की तार्किक कठोरता और 100 से अधिक विषयों में मल्टीमॉडल समझ को जोड़ता है।
2026 फ्रंटियर मॉडल व्यापक लीडरबोर्ड
प्रमुख मॉडलों के अनुभवजन्य बेंचमार्क परिणाम:
| मॉडल आर्किटेक्चर | प्रदाता / लाइसेंस | HLE समग्र सटीकता (%) | HLE गणित/सीएस (%) | FrontierMath Tier-1 (%) | ARC-AGI-2 सत्यापित (%) | औसत लागत / 1M टोकन |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 (High CoT) | Proprietary API | 65.0% | 72.4% | 87.8% | 96.4% | $10.00 / $50.00 |
| OpenAI GPT-6 Astra | Proprietary API | 57.2% | 74.1% | 97.6% | 99.9% | $10.00 / $50.00 |
| OpenAI o3 (High Effort) | प्रोप्रायटरी API | 33.8% | 38.4% | 31.2% | 78.4% | $45.00 |
| Claude 3.7 Sonnet (Thinking) | Anthropic API | 31.4% | 35.2% | 28.6% | 74.9% | $18.00 |
| DeepSeek R1 (671B Full) | MIT ओपन वेट्स | 27.6% | 32.8% | 24.1% | 71.2% | $2.19 (सेल्फ-होस्टेड) |
| OpenAI o1 (Full Reasoning) | प्रोप्रायटरी API | 24.2% | 29.1% | 19.8% | 66.5% | $30.00 |
| Kimi k1.5 (Long-CoT) | Moonshot API | 22.8% | 27.4% | 18.2% | 63.8% | $4.50 |
| Gemini 2.0 Flash Thinking | Google Cloud | 21.5% | 25.0% | 16.9% | 61.4% | $3.50 |
| Qwen-2.5-Max (RL Reasoning) | Alibaba Cloud | 19.8% | 23.6% | 14.5% | 58.2% | $3.20 |
| DeepSeek-R1-Distill-Qwen-32B | Apache 2.0 ओपन | 14.2% | 17.9% | 9.4% | 49.6% | $0.60 (लोकल FP8) |
| Claude 3.5 Sonnet (मानक) | Anthropic API | 5.8% | 6.2% | 2.4% | 38.1% | $3.75 |
| GPT-4o (जीरो-शॉट बेसलाइन) | प्रोप्रायटरी API | 3.2% | 3.8% | 1.8% | 34.2% | $2.50 |
तकनीकी विश्लेषण: फ्रंटियर रीजनिंग मॉडल HLE को कैसे हल करते हैं
1. OpenAI o3: टेस्ट-टाइम ट्री सर्च स्केलिंग
OpenAI o3 बड़े पैमाने पर सुदृढ़ीकरण सीखने और प्रोसेस रिवॉर्ड मॉडल (PRM) के माध्यम से टेस्ट-टाइम सर्च के दम पर शीर्ष स्थान (33.8%) प्राप्त करता है। यह अंतिम उत्तर से पहले हजारों संभावित शाखाओं की खोज और छंटाई करता है।
2. Claude 3.7 Sonnet: हाइब्रिड सोच और स्व-सुधार
Claude 3.7 Sonnet उपयोगकर्ताओं को 0 से 128k थिंकिंग टोकन कॉन्फ़िगर करने की अनुमति देता है। जैव रसायन और कानून में यह उत्कृष्ट स्व-सुधार प्रदर्शित करता है: यदि कोई मध्यवर्ती गणना तार्किक विरोधाभास पैदा करती है, तो यह स्वायत्त रूप से पीछे हटकर पुनः सुधार करता है।
3. DeepSeek R1: ओपन-वेट क्रांति
DeepSeek R1 ने साबित किया कि केवल गणितीय सटीकता और प्रारूप नियमों पर आधारित शुद्ध सुदृढ़ीकरण सीखना (RL) बिना मानवीय एनोटेशन के भी असाधारण तर्क श्रृंखलाएं विकसित कर सकता है।
सामान्य RAG प्रणाली HLE पर क्यों विफल होती है
पारंपरिक RAG और सामान्य प्रॉम्प्टिंग HLE पर पूरी तरह निष्फल साबित होते हैं:
- सिंथेटिक विशिष्टता: प्रश्न पूरी तरह से नए वैज्ञानिक शोध और प्रमेयों पर आधारित हैं जो वेब पर मौजूद नहीं हैं।
- वेक्टर समानता का भ्रम: वेक्टर डेटाबेस केवल सतही रूप से मिलते-जुलते दस्तावेज़ लाते हैं, जो मॉडल को गलत दिशा में ले जाते हैं।
vLLM के माध्यम से HLE मूल्यांकन चलाना:
# रिपोजिटरी क्लोन करें और आवश्यकताएं इंस्टॉल करें
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang
# vLLM के माध्यम से DeepSeek R1 का मूल्यांकन निष्पादित करें
python run_hle_eval.py \
--model "deepseek-ai/DeepSeek-R1" \
--backend "vllm" \
--tensor-parallel-size 8 \
--temperature 0.6 \
--top-p 0.95 \
--max-thinking-tokens 32768 \
--subject-filter "mathematics,physics,computer_science" \
--output-dir "./results/deepseek_r1_hle"
सॉफ्टवेयर और AI इंजीनियरों के लिए सिफारिशें
- MMLU और GSM8K को आंतरिक मूल्यांकन से हटाएं: जटिल विश्लेषण या कोड सत्यापन के लिए ये बेंचमार्क अब कोई उपयोगी जानकारी नहीं देते। HLE और FrontierMath का उपयोग करें।
- मॉडल आकार की तुलना में टेस्ट-टाइम गणना को प्राथमिकता दें: सोच और सत्यापन के साथ एक 32B मॉडल बिना थिंकिंग वाले बड़े मॉडल से बेहतर परिणाम देता है।
- दो-स्तरीय आर्किटेक्चर लागू करें: 95% सामान्य कार्यों को सस्ते मॉडल पर भेजें और जटिल पीएचडी स्तर के प्रश्नों को o3, Claude 3.7 या DeepSeek R1 पर एस्केलेट करें।