Benchmarks

Humanity's Last Exam লিডারবোর্ড: ফ্রন্টিয়ার AI বেঞ্চমার্ক

### দ্রুত উত্তর: Humanity's Last Exam (HLE) বেঞ্চমার্ক কী?

Humanity's Last Exam (HLE) হলো CAIS এবং Scale AI দ্বারা যৌথভাবে তৈরি ৩,০০০টি কঠিন বহুবিষয়ক প্রশ্নের একটি বেঞ্চমার্ক, যা মানব একাডেমিক জ্ঞানের সর্বোচ্চ সীমাকে নির্দেশ করে। কোয়ান্টাম বলবিদ্যা ও বীজগণিতীয় জ্যামিতি সমৃদ্ধ এই পরীক্ষায় OpenAI o3, DeepSeek R1 এবং Claude 3.7-এর মতো ফ্রন্টিয়ার রিজনিং মডেলগুলোর নির্ভুলতা মাত্র ১৮% থেকে ৩৪%, যা পুরনো বেঞ্চমার্কের স্যাচুরেশন যুগের সমাপ্তি ঘটিয়েছে।


স্যাচুরেশন সংকট: গতানুগতিক বেঞ্চমার্ক কেন অকার্যকর হলো

২০২৩ থেকে ২০২৫ সালের মধ্যে কৃত্রিম বুদ্ধিমত্তা মূল্যায়নের ক্ষেত্রে মেট্রিকগুলোর কার্যকারিতা দ্রুত হ্রাস পায়। যে বেঞ্চমার্কগুলো পূর্বে সেরা মডেলগুলোকে আলাদা করত, সেগুলোর সীমা পূর্ণ হয়ে যায়:

  • MMLU (Massive Multitask Language Understanding): একসময় সাধারণ একাডেমিক দক্ষতার মাপকাঠি থাকলেও এখন শীর্ষস্থানীয় মডেলগুলো এতে ৯০% থেকে ৯২% স্কোর করে, যার ফলে মডেলের উন্নতি ও ডেটাসেটের নয়েজের মধ্যে পার্থক্য বোঝা অসম্ভব হয়ে পড়ে।
  • GSM8K এবং MATH: প্রাথমিক গণিতের সমস্যাগুলো (GSM8K) এখন ছোট ডিস্টিল্ড মডেলগুলোও ৯৯%+ নির্ভুলতায় সমাধান করে, আর হাইস্কুল স্তরের MATH পরীক্ষায় রিজনিং মডেলগুলো ৯৫%+ সাফল্য অর্জন করেছে।
  • HumanEval এবং MBPP: পাইথন ইউনিট টেস্ট জেনারেশনের সাফল্য ৯০% ছাড়িয়েছে, যা মূল সফটওয়্যার আর্কিটেকচারের বদলে কেবল সাধারণ সিনট্যাক্স যাচাই করে।
  • GPQA Diamond: গুগল সার্চের নাগালের বাইরে পিএইচডি স্তরের বিজ্ঞান প্রশ্ন হিসেবে ডিজাইন করা হলেও, টেস্ট-টাইম কম্পিউট (Test-Time Compute) সম্প্রসারণের ফলে এর স্কোর ৫৫% থেকে বেড়ে ৭৮%-এর উপরে পৌঁছেছে।

যেহেতু ফাউন্ডেশন মডেলগুলো প্রি-ট্রেনিংয়ের সময় ইন্টারনেটের প্রায় সব উন্মুক্ত ডেটা গ্রহণ করেছে, তাই মুখস্থবিদ্যা ও সার্চ প্যাটার্ন মডেলের আসল যুক্তির ঘাটতি ঢেকে রেখেছিল। এর ফলে ক্রিপ্টোগ্রাফিক ওয়াটারমার্কযুক্ত এবং বহু-ধাপীয় ডক্টরেট পর্যায়ের সিদ্ধান্তমূলক বিশ্লেষণের নতুন মূল্যায়নের প্রয়োজন দেখা দেয়।


Humanity's Last Exam (HLE) পরিচিতি

বিশ্বের শীর্ষস্থানীয় বিশ্ববিদ্যালয়ের ১,০০০ জনেরও বেশি বিশেষজ্ঞের সহযোগিতায় Center for AI Safety (CAIS) এবং Scale AI দ্বারা তৈরি Humanity's Last Exam (HLE)-কে আর্টিফিশিয়াল জেনারেল ইন্টেলিজেন্সের (AGI) আগের চূড়ান্ত একাডেমিক বাধা হিসেবে বিবেচনা করা হয়।

+---------------------------------------------------------------------------------------------------+
|                        HUMANITY'S LAST EXAM (HLE) বেঞ্চমার্ক আর্কিটেকচার                          |
+---------------------------------------------------------------------------------------------------+
| প্যারামিটার                | বিবরণ                                                                |
+----------------------------+----------------------------------------------------------------------+
| মোট প্রশ্ন                  | ৩,০০০টি মাল্টিমোডাল ও টেক্সট-ভিত্তিক বহুবিষয়ক সমস্যা                |
| একাডেমিক মান                | পিএইচডি (PhD), পোস্টডক্টরাল এবং সিনিয়র গবেষক পর্যায়                |
| অন্তর্ভুক্ত বিষয়            | গণিত, পদার্থবিজ্ঞান, রসায়ন, জীববিজ্ঞান, কম্পিউটার সায়েন্স, আইন ইত্যাদি |
| ডেটা লিক প্রতিরোধ           | ক্রিপ্টোগ্রাফিক ক্যানারি স্ট্রিং, অপ্রকাশিত প্রমাণ ও মৌলিক প্রশ্ন    |
| যাচাইকরণ পদ্ধতি             | হুবহু স্ট্রিং ম্যাচ, সংখ্যাগত মার্জিন ও আনুষ্ঠানিক গাণিতিক প্রমাণ    |
| মানব বিশেষজ্ঞের মানদণ্ড     | ~১০০% (তথ্যসূত্র দেখার সুবিধাপ্রাপ্ত সংশ্লিষ্ট বিষয়ের গবেষক)        |
| সাধারণ LLM বেসলাইন         | < ৩.৫% (জিরো-শট GPT-4o / Claude 3.5 Sonnet অতিরিক্ত চিন্তা ছাড়া)    |
+----------------------------+----------------------------------------------------------------------+

HLE-তে প্রশ্ন অন্তর্ভুক্তির প্রধান শর্তসমূহ

  1. গুগলে সম্পূর্ণ অনুপস্থিতি (Zero Googleability): সরাসরি সার্চ বা পাবলিক ওয়েব পৃষ্ঠার তথ্য একত্রিত করে কোনো উত্তর পাওয়া যাবে না।
  2. স্নাতকোত্তর বিশেষায়িত যোগ্যতা: সংশ্লিষ্ট বিষয়ে বিশেষ পিএইচডি ডিগ্রি ছাড়া একজন সাধারণ শিক্ষিত ব্যক্তি কয়েক ঘণ্টা চেষ্টা করেও সমাধান করতে পারবেন না।
  3. স্বয়ংক্রিয় যাচাইযোগ্যতা: কোনো ব্যক্তিনিষ্ঠ মূল্যায়ন (LLM-as-a-judge) এড়াতে উত্তরটি সুনির্দিষ্ট গাণিতিক সংখ্যা বা প্রতীকে শেষ হতে হবে।
  4. গভীর মাল্টিমোডাল যুক্তি: প্রায় ১৫% প্রশ্নে জটিল বায়োকেমিক্যাল ডায়াগ্রাম, সার্কিট টপোলজি এবং নন-ইউক্লিডীয় জ্যামিতিক চিত্র রয়েছে।

২০২৬ সালের শীর্ষ তিনটি বেঞ্চমার্ক: HLE, FrontierMath ও ARC-AGI

আসল বুদ্ধিমত্তা পরিমাপ করতে প্রকৌশলী সমাজ তিনটি পরস্পর পরিপূরক পরীক্ষার ওপর নির্ভর করে:

                  =======================================================
                                ফ্রন্টিয়ার AI রিজনিং শ্রেণিবিন্যাস
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (François Chollet)
                        |                  |                  |
               সার্বিক একাডেমিক চূড়া   গভীর গাণিতিক গবেষণা    অজানা রূপান্তরের
               বহুবিষয়ক পিএইচডি গভীরতা অপ্রকাশিত কঠিন প্রমাণ   বিমূর্ত নিয়ম অনুমান
               ৩,০০০ বিশেষজ্ঞ প্রশ্ন    আধা-স্বয়ংক্রিয় যাচাই   পূর্ব-স্মৃতি সম্পূর্ণ বর্জিত

১. FrontierMath (Epoch AI)

ফিল্ডস মেডেল বিজয়ীদের সহযোগিতায় নির্মিত এই বেঞ্চমার্কে শত শত অপ্রকাশিত গাণিতিক সমস্যা রয়েছে। সাধারণ মডেলগুলো এতে ২%-এর নিচে থাকলেও আধুনিক রিজনিং মডেলগুলো ২০% থেকে ৩০% অর্জন করছে।

২. ARC-AGI (Abstraction and Reasoning Corpus)

ফ্রাঁসোয়া শোলে দ্বারা উদ্ভাবিত এই পরীক্ষাটি খুব কম ভিজ্যুয়াল গ্রিড উদাহরণ থেকে নতুন রূপান্তর নিয়ম অনুমান করার ক্ষমতা পরীক্ষা করে, যা স্মৃতিশক্তি থেকে বুদ্ধিমত্তাকে পৃথক করে।

৩. Humanity's Last Exam (HLE)

এটি MMLU-এর ব্যাপক জ্ঞান, FrontierMath-এর কঠোর গাণিতিক যুক্তি এবং ১০০টিরও বেশি বিষয়ের মাল্টিমোডাল বিশ্লেষণকে একত্রিত করে।


২০২৬ ফ্রন্টিয়ার মডেলের সমন্বিত লিডারবোর্ড

প্রধান রিজনিং মডেলগুলোর পরীক্ষামূলক ফলাফল নিচে দেওয়া হলো:

মডেল আর্কিটেকচার সরবরাহকারী / লাইসেন্স HLE সার্বিক নির্ভুলতা (%) HLE গণিত/সিএস (%) FrontierMath Tier-1 (%) ARC-AGI-2 যাচাইকৃত (%) গড় খরচ / ১M টোকেন
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) প্রোপাইটারি API 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B Full) MIT ওপেন ওয়েটস 27.6% 32.8% 24.1% 71.2% $2.19 (সেলফ-হোস্টেড)
OpenAI o1 (Full Reasoning) প্রোপাইটারি API 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL-Reasoning) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 ওপেন 14.2% 17.9% 9.4% 49.6% $0.60 (লোকাল FP8)
Claude 3.5 Sonnet (স্ট্যান্ডার্ড) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (জিরো-শট বেসলাইন) প্রোপাইটারি API 3.2% 3.8% 1.8% 34.2% $2.50

প্রযুক্তিগত বিশ্লেষণ: রিজনিং মডেলগুলো কীভাবে HLE সমাধান করে

১. OpenAI o3: ইনফারেন্সে বৃহৎ ট্রি সার্চ

OpenAI o3 বড় আকারের রিইনফোর্সমেন্ট লার্নিং ও প্রসেস রিওয়ার্ড মডেলের (PRM) সাহায্যে টেস্ট-টাইম সার্চ ব্যবহার করে শীর্ষস্থান (৩৩.৮%) অধিকার করেছে। জটিল হিসাবের ক্ষেত্রে এটি হাজার হাজার বিকল্প বিবেচনা করে ভুল অনুমানগুলো আগেই বাতিল করে দেয়।

২. Claude 3.7 Sonnet: সমন্বিত চিন্তা ও স্বতঃস্ফূর্ত সংশোধন

Claude 3.7 মডেলে চিন্তার জন্য প্রয়োজনীয় টোকেনের সংখ্যা ০ থেকে ১২৮ হাজারে পরিবর্তন করা যায়। জৈব রসায়ন ও আইনের সমস্যায় এটি নিজের ভুল নিজে শনাক্ত করে সমাধান পুনর্গঠন করতে দারুণ সক্ষম।

৩. DeepSeek R1: ওপেন-ওয়েট বিপ্লব

DeepSeek R1 দেখিয়ে দিয়েছে যে মানুষের হাতে তৈরি ব্যাখ্যা ছাড়াই কেবল গাণিতিক নির্ভুলতা ও সুনির্দিষ্ট ফরম্যাট যাচাইয়ের মাধ্যমে শক্তিশালী রিজনিং দক্ষতা তৈরি সম্ভব, যা অত্যন্ত সাশ্রয়ী মূল্যে পরিচালনা করা যায়।


প্রথাগত RAG কেন HLE-তে ব্যর্থ হয়

সাধারণ প্রম্পট এবং RAG ব্যবস্থা HLE-এর সামনে পুরোপুরি ব্যর্থ:

  • সিন্থেটিক স্বাতন্ত্র্য: প্রশ্নগুলো নতুন বৈজ্ঞানিক সূত্রের ভিত্তিতে তৈরি, যা ইন্টারনেটে খুঁজে পাওয়া যায় না।
  • ভেক্টর সাদৃশ্যের বিভ্রান্তি: ভেক্টর ডাটাবেস আপাতদৃষ্টিতে মিল থাকা অপ্রাসঙ্গিক নথি খুঁজে আনে, যা মডেলকে ভুল সিদ্ধান্তের দিকে পরিচালিত করে।

vLLM দিয়ে লোকাল HLE মূল্যায়নের পদ্ধতি:

# অফিসিয়াল রিপোজিটরি ক্লোন ও সেটআপ
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# vLLM-এর মাধ্যমে DeepSeek R1-এর মূল্যায়ন চালানো
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

সফটওয়্যার প্রকৌশলীদের জন্য সুপারিশ

  1. অভ্যন্তরীণ মূল্যায়ন থেকে MMLU ও GSM8K বাদ দিন: আর্থিক বিশ্লেষণ, মেডিকেল নির্ণয় বা কোড ভেরিফিকেশনের জন্য এই পুরনো টেস্টগুলো আর কোনো কার্যকর মাপকাঠি নয়। HLE এবং FrontierMath ব্যবহার করুন।
  2. মডেল আকারের চেয়ে টেস্ট-টাইম কম্পিউটকে অগ্রাধিকার দিন: চিন্তা ও অনুসন্ধানের সুবিধাযুক্ত একটি ৩২B মডেল চিন্তাহীন বিশাল মডেলের চেয়ে অনেক জটিল সমস্যা সমাধান করতে পারে।
  3. দ্বি-স্তরবিশিষ্ট রাউটিং চালু করুন: ৯৫% সাধারণ কাজ দ্রুতগতির সাশ্রয়ী মডেলে সমাধান করুন এবং কেবল জটিল পিএইচডি স্তরের সমস্যাগুলো o3, Claude 3.7 কিংবা DeepSeek R1-এ পাঠান।
← সব নিবন্ধ
0 / 4