Benchmarks

Humanity's Last Exam लीडरबोर्ड: फ्रंटियर AI बेंचमार्क रैंकिंग

### त्वरित उत्तर: Humanity's Last Exam (HLE) बेंचमार्क क्या है?

Humanity's Last Exam (HLE) CAIS और Scale AI द्वारा विकसित 3,000 अत्यंत कठिन प्रश्नों का एक बहुविषयक बेंचमार्क है, जो मानव ज्ञान की अंतिम सीमा का प्रतिनिधित्व करता है। क्वांटम भौतिकी और बीजगणितीय ज्यामिति को कवर करते हुए, OpenAI o3, DeepSeek R1 और Claude 3.7 जैसे फ्रंटियर रीजनिंग मॉडल 18% से 34% के बीच स्कोर करते हैं, जिसने पुराने बेंचमार्क के संतृप्ति युग को समाप्त कर दिया है।


संतृप्ति का संकट: पारंपरिक बेंचमार्क क्यों अप्रचलित हुए

2023 और 2025 के बीच, कृत्रिम बुद्धिमत्ता मूल्यांकन पारिस्थितिकी तंत्र ने गंभीर मेट्रिक अप्रचलन का सामना किया। उद्योग मानक परीक्षण संतृप्ति की सीमा तक पहुँच गए:

  • MMLU (Massive Multitask Language Understanding): सामान्य शैक्षणिक क्षमता का यह मानक अब शीर्ष मॉडलों द्वारा 90% से 92% तक आसानी से पार कर लिया गया है, जिससे मॉडलों के बीच वास्तविक अंतर और डेटा संदूषण को अलग करना असंभव हो गया।
  • GSM8K और MATH: प्राथमिक विद्यालयी गणित (GSM8K) छोटे मॉडलों द्वारा भी 99%+ सटीकता के साथ हल किया जाने लगा, जबकि हाई स्कूल MATH रीजनिंग मॉडलों के साथ 95% से अधिक सटीकता तक पहुँच गया।
  • HumanEval और MBPP: पायथन यूनिट टेस्ट जनरेशन 90% से अधिक हो गया, जो केवल बुनियादी सिंटैक्स की जांच करता है, न कि जटिल सॉफ्टवेयर आर्किटेक्चर की।
  • GPQA Diamond: गूगल-प्रूफ पीएचडी स्तर के विज्ञान प्रश्नों के रूप में डिज़ाइन किया गया यह परीक्षण, टेस्ट-टाइम कम्प्यूट स्केलिंग के साथ 55% से बढ़कर 78%+ पर पहुँच गया।

क्योंकि आधारभूत मॉडलों ने प्री-ट्रेनिंग के दौरान इंटरनेट का विशाल डेटा अवशोषित कर लिया था, केवल रटने और पुनः प्राप्त करने की प्रणाली ने वास्तविक तार्किक तर्क की कमी को छिपा दिया। इसके लिए क्रिप्टोग्राफिक सुरक्षा, सहकर्मी समीक्षा और पीएचडी-स्तरीय बहु-चरणीय निगमनात्मक निष्कर्षों की आवश्यकता थी।


Humanity's Last Exam (HLE) क्या है?

Center for AI Safety (CAIS) और Scale AI द्वारा 1,000 से अधिक वैश्विक शोधकर्ताओं के सहयोग से निर्मित, Humanity's Last Exam (HLE) को आर्टिफिशियल जनरल इंटेलिजेंस (AGI) से पहले अंतिम अकादमिक सीमा के रूप में तैयार किया गया है।

+---------------------------------------------------------------------------------------------------+
|                        HUMANITY'S LAST EXAM (HLE) बेंचमार्क आर्किटेक्चर                          |
+---------------------------------------------------------------------------------------------------+
| पैरामीटर                   | विनिर्देश विवरण                                                       |
+----------------------------+----------------------------------------------------------------------+
| कुल प्रश्न                 | 3,000 मल्टीमॉडल और टेक्स्ट-आधारित बहुविषयक समस्याएं                  |
| शैक्षणिक स्तर              | पीएचडी (PhD), पोस्टडॉक और वरिष्ठ शोधकर्ता स्तर                        |
| शामिल विषय                 | गणित, भौतिकी, रसायन विज्ञान, जीव विज्ञान, कंप्यूटर साइंस, कानून आदि  |
| संदूषण रोधी उपाय           | क्रिप्टोग्राफिक कैनरी स्ट्रिंग्स, अप्रकाशित प्रमाण, नवीन समस्याएं    |
| सत्यापन प्रारूप            | सटीक स्ट्रिंग मिलान, संख्यात्मक सहनशीलता, औपचारिक प्रमाण सत्यापन      |
| मानव विशेषज्ञ आधाररेखा     | ~100% (संदर्भ सामग्री तक पहुंच रखने वाले विषय विशेषज्ञ)              |
| बिना रीजनिंग पारंपरिक LLM | < 3.5% (जीरो-शॉट GPT-4o / Claude 3.5 Sonnet बिना डीप रीजनिंग के)    |
+----------------------------+----------------------------------------------------------------------+

HLE में प्रश्न शामिल करने के मुख्य मानदंड

  1. शून्य खोज योग्यता (Zero Googleability): उत्तर सीधे खोज या सार्वजनिक वेब पेजों के संश्लेषण द्वारा नहीं पाया जा सकता।
  2. स्नातकोत्तर विशेषज्ञता की आवश्यकता: विषय में विशेष पीएचडी प्रशिक्षण के बिना एक सामान्य शिक्षित व्यक्ति घंटों में भी समस्या को हल नहीं कर सकता।
  3. स्वचालित निष्पक्ष सत्यापन: समाधान एक सटीक गणितीय मान या अस्पष्टता-रहित टोकन में समाप्त होता है, जिससे व्यक्तिपरक मूल्यांकन पूर्वाग्रह समाप्त होता है।
  4. गहन मल्टीमॉडल तर्क: लगभग 15% प्रश्नों में जैव-रासायनिक संरचनाएं, सर्किट टोपोलॉजी और गैर-यूक्लिडियन ज्यामिति आरेख शामिल हैं।

2026 के तीन प्रमुख फ्रंटियर बेंचमार्क: HLE, FrontierMath और ARC-AGI

फ्रंटियर बुद्धिमत्ता को मापने के लिए तीन पूरक तनाव परीक्षणों का उपयोग किया जाता है:

                  =======================================================
                                 फ्रंटियर AI रीजनिंग वर्गीकरण
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (François Chollet)
                        |                  |                  |
               समग्र शैक्षणिक सीमा     गहन गणितीय शोध         अमूर्त नवीन नियमों
               बहुविषयक पीएचडी गहराई   अप्रकाशित कठिन प्रमाण  का प्रेरण (Induction)
               3,000 विशेषज्ञ प्रश्न   अर्ध-स्वचालित सत्यापन   शून्य पूर्व-स्मृति

1. FrontierMath (Epoch AI)

फील्ड्स मेडल विजेताओं के सहयोग से निर्मित, इसमें सैकड़ों अप्रकाशित गणितीय शोध समस्याएं शामिल हैं। मानक मॉडल 2% से नीचे रहे, जबकि रीजनिंग मॉडल 20% से 30% तक पहुँच गए हैं।

2. ARC-AGI (Abstraction and Reasoning Corpus)

फ़्राँस्वा चॉलेट द्वारा विकसित, यह परीक्षण बहुत कम दृश्य ग्रिड उदाहरणों से नए परिवर्तन नियमों का अनुमान लगाने की क्षमता का परीक्षण करता है, जो स्मृति से मुक्त तर्क को मापता है।

3. Humanity's Last Exam (HLE)

यह MMLU के व्यापक ज्ञान, FrontierMath की तार्किक कठोरता और 100 से अधिक विषयों में मल्टीमॉडल समझ को जोड़ता है।


2026 फ्रंटियर मॉडल व्यापक लीडरबोर्ड

प्रमुख मॉडलों के अनुभवजन्य बेंचमार्क परिणाम:

मॉडल आर्किटेक्चर प्रदाता / लाइसेंस HLE समग्र सटीकता (%) HLE गणित/सीएस (%) FrontierMath Tier-1 (%) ARC-AGI-2 सत्यापित (%) औसत लागत / 1M टोकन
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) प्रोप्रायटरी API 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B Full) MIT ओपन वेट्स 27.6% 32.8% 24.1% 71.2% $2.19 (सेल्फ-होस्टेड)
OpenAI o1 (Full Reasoning) प्रोप्रायटरी API 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL Reasoning) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 ओपन 14.2% 17.9% 9.4% 49.6% $0.60 (लोकल FP8)
Claude 3.5 Sonnet (मानक) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (जीरो-शॉट बेसलाइन) प्रोप्रायटरी API 3.2% 3.8% 1.8% 34.2% $2.50

तकनीकी विश्लेषण: फ्रंटियर रीजनिंग मॉडल HLE को कैसे हल करते हैं

1. OpenAI o3: टेस्ट-टाइम ट्री सर्च स्केलिंग

OpenAI o3 बड़े पैमाने पर सुदृढ़ीकरण सीखने और प्रोसेस रिवॉर्ड मॉडल (PRM) के माध्यम से टेस्ट-टाइम सर्च के दम पर शीर्ष स्थान (33.8%) प्राप्त करता है। यह अंतिम उत्तर से पहले हजारों संभावित शाखाओं की खोज और छंटाई करता है।

2. Claude 3.7 Sonnet: हाइब्रिड सोच और स्व-सुधार

Claude 3.7 Sonnet उपयोगकर्ताओं को 0 से 128k थिंकिंग टोकन कॉन्फ़िगर करने की अनुमति देता है। जैव रसायन और कानून में यह उत्कृष्ट स्व-सुधार प्रदर्शित करता है: यदि कोई मध्यवर्ती गणना तार्किक विरोधाभास पैदा करती है, तो यह स्वायत्त रूप से पीछे हटकर पुनः सुधार करता है।

3. DeepSeek R1: ओपन-वेट क्रांति

DeepSeek R1 ने साबित किया कि केवल गणितीय सटीकता और प्रारूप नियमों पर आधारित शुद्ध सुदृढ़ीकरण सीखना (RL) बिना मानवीय एनोटेशन के भी असाधारण तर्क श्रृंखलाएं विकसित कर सकता है।


सामान्य RAG प्रणाली HLE पर क्यों विफल होती है

पारंपरिक RAG और सामान्य प्रॉम्प्टिंग HLE पर पूरी तरह निष्फल साबित होते हैं:

  • सिंथेटिक विशिष्टता: प्रश्न पूरी तरह से नए वैज्ञानिक शोध और प्रमेयों पर आधारित हैं जो वेब पर मौजूद नहीं हैं।
  • वेक्टर समानता का भ्रम: वेक्टर डेटाबेस केवल सतही रूप से मिलते-जुलते दस्तावेज़ लाते हैं, जो मॉडल को गलत दिशा में ले जाते हैं।

vLLM के माध्यम से HLE मूल्यांकन चलाना:

# रिपोजिटरी क्लोन करें और आवश्यकताएं इंस्टॉल करें
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# vLLM के माध्यम से DeepSeek R1 का मूल्यांकन निष्पादित करें
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

सॉफ्टवेयर और AI इंजीनियरों के लिए सिफारिशें

  1. MMLU और GSM8K को आंतरिक मूल्यांकन से हटाएं: जटिल विश्लेषण या कोड सत्यापन के लिए ये बेंचमार्क अब कोई उपयोगी जानकारी नहीं देते। HLE और FrontierMath का उपयोग करें।
  2. मॉडल आकार की तुलना में टेस्ट-टाइम गणना को प्राथमिकता दें: सोच और सत्यापन के साथ एक 32B मॉडल बिना थिंकिंग वाले बड़े मॉडल से बेहतर परिणाम देता है।
  3. दो-स्तरीय आर्किटेक्चर लागू करें: 95% सामान्य कार्यों को सस्ते मॉडल पर भेजें और जटिल पीएचडी स्तर के प्रश्नों को o3, Claude 3.7 या DeepSeek R1 पर एस्केलेट करें।
← सभी लेख
0 / 4