### দ্রুত উত্তর: Humanity's Last Exam (HLE) বেঞ্চমার্ক কী?
Humanity's Last Exam (HLE) হলো CAIS এবং Scale AI দ্বারা যৌথভাবে তৈরি ৩,০০০টি কঠিন বহুবিষয়ক প্রশ্নের একটি বেঞ্চমার্ক, যা মানব একাডেমিক জ্ঞানের সর্বোচ্চ সীমাকে নির্দেশ করে। কোয়ান্টাম বলবিদ্যা ও বীজগণিতীয় জ্যামিতি সমৃদ্ধ এই পরীক্ষায় OpenAI o3, DeepSeek R1 এবং Claude 3.7-এর মতো ফ্রন্টিয়ার রিজনিং মডেলগুলোর নির্ভুলতা মাত্র ১৮% থেকে ৩৪%, যা পুরনো বেঞ্চমার্কের স্যাচুরেশন যুগের সমাপ্তি ঘটিয়েছে।
স্যাচুরেশন সংকট: গতানুগতিক বেঞ্চমার্ক কেন অকার্যকর হলো
২০২৩ থেকে ২০২৫ সালের মধ্যে কৃত্রিম বুদ্ধিমত্তা মূল্যায়নের ক্ষেত্রে মেট্রিকগুলোর কার্যকারিতা দ্রুত হ্রাস পায়। যে বেঞ্চমার্কগুলো পূর্বে সেরা মডেলগুলোকে আলাদা করত, সেগুলোর সীমা পূর্ণ হয়ে যায়:
- MMLU (Massive Multitask Language Understanding): একসময় সাধারণ একাডেমিক দক্ষতার মাপকাঠি থাকলেও এখন শীর্ষস্থানীয় মডেলগুলো এতে ৯০% থেকে ৯২% স্কোর করে, যার ফলে মডেলের উন্নতি ও ডেটাসেটের নয়েজের মধ্যে পার্থক্য বোঝা অসম্ভব হয়ে পড়ে।
- GSM8K এবং MATH: প্রাথমিক গণিতের সমস্যাগুলো (GSM8K) এখন ছোট ডিস্টিল্ড মডেলগুলোও ৯৯%+ নির্ভুলতায় সমাধান করে, আর হাইস্কুল স্তরের MATH পরীক্ষায় রিজনিং মডেলগুলো ৯৫%+ সাফল্য অর্জন করেছে।
- HumanEval এবং MBPP: পাইথন ইউনিট টেস্ট জেনারেশনের সাফল্য ৯০% ছাড়িয়েছে, যা মূল সফটওয়্যার আর্কিটেকচারের বদলে কেবল সাধারণ সিনট্যাক্স যাচাই করে।
- GPQA Diamond: গুগল সার্চের নাগালের বাইরে পিএইচডি স্তরের বিজ্ঞান প্রশ্ন হিসেবে ডিজাইন করা হলেও, টেস্ট-টাইম কম্পিউট (Test-Time Compute) সম্প্রসারণের ফলে এর স্কোর ৫৫% থেকে বেড়ে ৭৮%-এর উপরে পৌঁছেছে।
যেহেতু ফাউন্ডেশন মডেলগুলো প্রি-ট্রেনিংয়ের সময় ইন্টারনেটের প্রায় সব উন্মুক্ত ডেটা গ্রহণ করেছে, তাই মুখস্থবিদ্যা ও সার্চ প্যাটার্ন মডেলের আসল যুক্তির ঘাটতি ঢেকে রেখেছিল। এর ফলে ক্রিপ্টোগ্রাফিক ওয়াটারমার্কযুক্ত এবং বহু-ধাপীয় ডক্টরেট পর্যায়ের সিদ্ধান্তমূলক বিশ্লেষণের নতুন মূল্যায়নের প্রয়োজন দেখা দেয়।
Humanity's Last Exam (HLE) পরিচিতি
বিশ্বের শীর্ষস্থানীয় বিশ্ববিদ্যালয়ের ১,০০০ জনেরও বেশি বিশেষজ্ঞের সহযোগিতায় Center for AI Safety (CAIS) এবং Scale AI দ্বারা তৈরি Humanity's Last Exam (HLE)-কে আর্টিফিশিয়াল জেনারেল ইন্টেলিজেন্সের (AGI) আগের চূড়ান্ত একাডেমিক বাধা হিসেবে বিবেচনা করা হয়।
+---------------------------------------------------------------------------------------------------+
| HUMANITY'S LAST EXAM (HLE) বেঞ্চমার্ক আর্কিটেকচার |
+---------------------------------------------------------------------------------------------------+
| প্যারামিটার | বিবরণ |
+----------------------------+----------------------------------------------------------------------+
| মোট প্রশ্ন | ৩,০০০টি মাল্টিমোডাল ও টেক্সট-ভিত্তিক বহুবিষয়ক সমস্যা |
| একাডেমিক মান | পিএইচডি (PhD), পোস্টডক্টরাল এবং সিনিয়র গবেষক পর্যায় |
| অন্তর্ভুক্ত বিষয় | গণিত, পদার্থবিজ্ঞান, রসায়ন, জীববিজ্ঞান, কম্পিউটার সায়েন্স, আইন ইত্যাদি |
| ডেটা লিক প্রতিরোধ | ক্রিপ্টোগ্রাফিক ক্যানারি স্ট্রিং, অপ্রকাশিত প্রমাণ ও মৌলিক প্রশ্ন |
| যাচাইকরণ পদ্ধতি | হুবহু স্ট্রিং ম্যাচ, সংখ্যাগত মার্জিন ও আনুষ্ঠানিক গাণিতিক প্রমাণ |
| মানব বিশেষজ্ঞের মানদণ্ড | ~১০০% (তথ্যসূত্র দেখার সুবিধাপ্রাপ্ত সংশ্লিষ্ট বিষয়ের গবেষক) |
| সাধারণ LLM বেসলাইন | < ৩.৫% (জিরো-শট GPT-4o / Claude 3.5 Sonnet অতিরিক্ত চিন্তা ছাড়া) |
+----------------------------+----------------------------------------------------------------------+
HLE-তে প্রশ্ন অন্তর্ভুক্তির প্রধান শর্তসমূহ
- গুগলে সম্পূর্ণ অনুপস্থিতি (Zero Googleability): সরাসরি সার্চ বা পাবলিক ওয়েব পৃষ্ঠার তথ্য একত্রিত করে কোনো উত্তর পাওয়া যাবে না।
- স্নাতকোত্তর বিশেষায়িত যোগ্যতা: সংশ্লিষ্ট বিষয়ে বিশেষ পিএইচডি ডিগ্রি ছাড়া একজন সাধারণ শিক্ষিত ব্যক্তি কয়েক ঘণ্টা চেষ্টা করেও সমাধান করতে পারবেন না।
- স্বয়ংক্রিয় যাচাইযোগ্যতা: কোনো ব্যক্তিনিষ্ঠ মূল্যায়ন (LLM-as-a-judge) এড়াতে উত্তরটি সুনির্দিষ্ট গাণিতিক সংখ্যা বা প্রতীকে শেষ হতে হবে।
- গভীর মাল্টিমোডাল যুক্তি: প্রায় ১৫% প্রশ্নে জটিল বায়োকেমিক্যাল ডায়াগ্রাম, সার্কিট টপোলজি এবং নন-ইউক্লিডীয় জ্যামিতিক চিত্র রয়েছে।
২০২৬ সালের শীর্ষ তিনটি বেঞ্চমার্ক: HLE, FrontierMath ও ARC-AGI
আসল বুদ্ধিমত্তা পরিমাপ করতে প্রকৌশলী সমাজ তিনটি পরস্পর পরিপূরক পরীক্ষার ওপর নির্ভর করে:
=======================================================
ফ্রন্টিয়ার AI রিজনিং শ্রেণিবিন্যাস
=======================================================
/ | \
/ | \
Humanity's Last Exam FrontierMath ARC-AGI-2
(HLE) (Epoch AI) (François Chollet)
| | |
সার্বিক একাডেমিক চূড়া গভীর গাণিতিক গবেষণা অজানা রূপান্তরের
বহুবিষয়ক পিএইচডি গভীরতা অপ্রকাশিত কঠিন প্রমাণ বিমূর্ত নিয়ম অনুমান
৩,০০০ বিশেষজ্ঞ প্রশ্ন আধা-স্বয়ংক্রিয় যাচাই পূর্ব-স্মৃতি সম্পূর্ণ বর্জিত
১. FrontierMath (Epoch AI)
ফিল্ডস মেডেল বিজয়ীদের সহযোগিতায় নির্মিত এই বেঞ্চমার্কে শত শত অপ্রকাশিত গাণিতিক সমস্যা রয়েছে। সাধারণ মডেলগুলো এতে ২%-এর নিচে থাকলেও আধুনিক রিজনিং মডেলগুলো ২০% থেকে ৩০% অর্জন করছে।
২. ARC-AGI (Abstraction and Reasoning Corpus)
ফ্রাঁসোয়া শোলে দ্বারা উদ্ভাবিত এই পরীক্ষাটি খুব কম ভিজ্যুয়াল গ্রিড উদাহরণ থেকে নতুন রূপান্তর নিয়ম অনুমান করার ক্ষমতা পরীক্ষা করে, যা স্মৃতিশক্তি থেকে বুদ্ধিমত্তাকে পৃথক করে।
৩. Humanity's Last Exam (HLE)
এটি MMLU-এর ব্যাপক জ্ঞান, FrontierMath-এর কঠোর গাণিতিক যুক্তি এবং ১০০টিরও বেশি বিষয়ের মাল্টিমোডাল বিশ্লেষণকে একত্রিত করে।
২০২৬ ফ্রন্টিয়ার মডেলের সমন্বিত লিডারবোর্ড
প্রধান রিজনিং মডেলগুলোর পরীক্ষামূলক ফলাফল নিচে দেওয়া হলো:
| মডেল আর্কিটেকচার | সরবরাহকারী / লাইসেন্স | HLE সার্বিক নির্ভুলতা (%) | HLE গণিত/সিএস (%) | FrontierMath Tier-1 (%) | ARC-AGI-2 যাচাইকৃত (%) | গড় খরচ / ১M টোকেন |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 (High CoT) | Proprietary API | 65.0% | 72.4% | 87.8% | 96.4% | $10.00 / $50.00 |
| OpenAI GPT-6 Astra | Proprietary API | 57.2% | 74.1% | 97.6% | 99.9% | $10.00 / $50.00 |
| OpenAI o3 (High Effort) | প্রোপাইটারি API | 33.8% | 38.4% | 31.2% | 78.4% | $45.00 |
| Claude 3.7 Sonnet (Thinking) | Anthropic API | 31.4% | 35.2% | 28.6% | 74.9% | $18.00 |
| DeepSeek R1 (671B Full) | MIT ওপেন ওয়েটস | 27.6% | 32.8% | 24.1% | 71.2% | $2.19 (সেলফ-হোস্টেড) |
| OpenAI o1 (Full Reasoning) | প্রোপাইটারি API | 24.2% | 29.1% | 19.8% | 66.5% | $30.00 |
| Kimi k1.5 (Long-CoT) | Moonshot API | 22.8% | 27.4% | 18.2% | 63.8% | $4.50 |
| Gemini 2.0 Flash Thinking | Google Cloud | 21.5% | 25.0% | 16.9% | 61.4% | $3.50 |
| Qwen-2.5-Max (RL-Reasoning) | Alibaba Cloud | 19.8% | 23.6% | 14.5% | 58.2% | $3.20 |
| DeepSeek-R1-Distill-Qwen-32B | Apache 2.0 ওপেন | 14.2% | 17.9% | 9.4% | 49.6% | $0.60 (লোকাল FP8) |
| Claude 3.5 Sonnet (স্ট্যান্ডার্ড) | Anthropic API | 5.8% | 6.2% | 2.4% | 38.1% | $3.75 |
| GPT-4o (জিরো-শট বেসলাইন) | প্রোপাইটারি API | 3.2% | 3.8% | 1.8% | 34.2% | $2.50 |
প্রযুক্তিগত বিশ্লেষণ: রিজনিং মডেলগুলো কীভাবে HLE সমাধান করে
১. OpenAI o3: ইনফারেন্সে বৃহৎ ট্রি সার্চ
OpenAI o3 বড় আকারের রিইনফোর্সমেন্ট লার্নিং ও প্রসেস রিওয়ার্ড মডেলের (PRM) সাহায্যে টেস্ট-টাইম সার্চ ব্যবহার করে শীর্ষস্থান (৩৩.৮%) অধিকার করেছে। জটিল হিসাবের ক্ষেত্রে এটি হাজার হাজার বিকল্প বিবেচনা করে ভুল অনুমানগুলো আগেই বাতিল করে দেয়।
২. Claude 3.7 Sonnet: সমন্বিত চিন্তা ও স্বতঃস্ফূর্ত সংশোধন
Claude 3.7 মডেলে চিন্তার জন্য প্রয়োজনীয় টোকেনের সংখ্যা ০ থেকে ১২৮ হাজারে পরিবর্তন করা যায়। জৈব রসায়ন ও আইনের সমস্যায় এটি নিজের ভুল নিজে শনাক্ত করে সমাধান পুনর্গঠন করতে দারুণ সক্ষম।
৩. DeepSeek R1: ওপেন-ওয়েট বিপ্লব
DeepSeek R1 দেখিয়ে দিয়েছে যে মানুষের হাতে তৈরি ব্যাখ্যা ছাড়াই কেবল গাণিতিক নির্ভুলতা ও সুনির্দিষ্ট ফরম্যাট যাচাইয়ের মাধ্যমে শক্তিশালী রিজনিং দক্ষতা তৈরি সম্ভব, যা অত্যন্ত সাশ্রয়ী মূল্যে পরিচালনা করা যায়।
প্রথাগত RAG কেন HLE-তে ব্যর্থ হয়
সাধারণ প্রম্পট এবং RAG ব্যবস্থা HLE-এর সামনে পুরোপুরি ব্যর্থ:
- সিন্থেটিক স্বাতন্ত্র্য: প্রশ্নগুলো নতুন বৈজ্ঞানিক সূত্রের ভিত্তিতে তৈরি, যা ইন্টারনেটে খুঁজে পাওয়া যায় না।
- ভেক্টর সাদৃশ্যের বিভ্রান্তি: ভেক্টর ডাটাবেস আপাতদৃষ্টিতে মিল থাকা অপ্রাসঙ্গিক নথি খুঁজে আনে, যা মডেলকে ভুল সিদ্ধান্তের দিকে পরিচালিত করে।
vLLM দিয়ে লোকাল HLE মূল্যায়নের পদ্ধতি:
# অফিসিয়াল রিপোজিটরি ক্লোন ও সেটআপ
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang
# vLLM-এর মাধ্যমে DeepSeek R1-এর মূল্যায়ন চালানো
python run_hle_eval.py \
--model "deepseek-ai/DeepSeek-R1" \
--backend "vllm" \
--tensor-parallel-size 8 \
--temperature 0.6 \
--top-p 0.95 \
--max-thinking-tokens 32768 \
--subject-filter "mathematics,physics,computer_science" \
--output-dir "./results/deepseek_r1_hle"
সফটওয়্যার প্রকৌশলীদের জন্য সুপারিশ
- অভ্যন্তরীণ মূল্যায়ন থেকে MMLU ও GSM8K বাদ দিন: আর্থিক বিশ্লেষণ, মেডিকেল নির্ণয় বা কোড ভেরিফিকেশনের জন্য এই পুরনো টেস্টগুলো আর কোনো কার্যকর মাপকাঠি নয়। HLE এবং FrontierMath ব্যবহার করুন।
- মডেল আকারের চেয়ে টেস্ট-টাইম কম্পিউটকে অগ্রাধিকার দিন: চিন্তা ও অনুসন্ধানের সুবিধাযুক্ত একটি ৩২B মডেল চিন্তাহীন বিশাল মডেলের চেয়ে অনেক জটিল সমস্যা সমাধান করতে পারে।
- দ্বি-স্তরবিশিষ্ট রাউটিং চালু করুন: ৯৫% সাধারণ কাজ দ্রুতগতির সাশ্রয়ী মডেলে সমাধান করুন এবং কেবল জটিল পিএইচডি স্তরের সমস্যাগুলো o3, Claude 3.7 কিংবা DeepSeek R1-এ পাঠান।