আমরা কীভাবে মূল্যায়ন করি

Podium Score পাঁচটি স্বাধীন লিডারবোর্ডকে একটি তুলনীয় সংখ্যায় একত্রিত করে।

Podium Score সূত্র

Podium Score = ০.৩৫·অ্যারেনা + ০.৩০·বেঞ্চমার্ক + ০.২০·বুদ্ধিমত্তা + ০.১৫·LLM Stats

  • Arena (35%) — ব্যবহারকারীর জোড়া ভোট থেকে Elo রেটিং (Arena.ai, 719 মডেল, ভোট-ভারিত, কনফিডেন্স ইন্টারভালসহ)।
  • Benchmarks (30%) — মডেলের জন্য আমাদের ট্র্যাক করা সব স্বাভাবিকীকৃত বেঞ্চমার্ক ফলাফলের গড় (মোট 25টি বেঞ্চমার্ক)।
  • Intelligence Index (20%) — Artificial Analysis-এর সম্মিলিত বুদ্ধিমত্তা সূচক।
  • LLM Stats (15%) — llm-stats.com কর্তৃক প্রকাশিত সম্মিলিত স্কোর।

যখন কোনো উৎসের কাছে কোনো মডেলের মান নেই, তার ওজন অন্য উৎসগুলোর মধ্যে আনুপাতিকভাবে পুনর্বণ্টন হয় — একটি লিডারবোর্ডে অনুপস্থিতির জন্য মডেলকে কখনো শাস্তি দেওয়া হয় না।

স্বাভাবিকীকরণ

প্রতিটি সংকেত সব 673টি ট্র্যাক করা মডেল জুড়ে min-max দিয়ে ০–১০০ স্কেলে স্বাভাবিক হয়, তাই ৮০-এর অর্থ সবসময় "সবচেয়ে খারাপ ও সেরা দেখা মডেলের মাঝে ৮০% দূরত্ব"। শতাংশ বেঞ্চমার্ক যেমন আছে তেমনই; Elo, সূচক ও দাম নিজ নিজ পরিসরে স্বাভাবিক হয়।

বিভাগ স্কোর

সামগ্রিক র‍্যাংকিংয়ের পাশাপাশি আমরা 17টি বিভাগ লিডারবোর্ড রাখি, প্রতিটি সেই কাজের জন্য সবচেয়ে প্রাসঙ্গিক বেঞ্চমার্কের উপর ভিত্তি করে:

  • Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
  • Math — AIME 2025, FrontierMath, MATH.
  • Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
  • Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
  • Knowledge — SimpleQA, MMLU-Pro, MMMLU.
  • Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
  • Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
  • Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
  • Multilingual — Multilingual MMLU.
  • Writing — IFBench, Arena Elo.
  • Chat & Assistants — Arena Elo, IFBench.
  • Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
  • Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
  • Long Context — MRCR v2, Context window.
  • Speed — Output tokens/s.
  • Value — Blended price /1M, Cost per task.
  • Open Weights — Podium Score.

ডেটা উৎস

সব ডেটা পাঁচটি পাবলিক লিডারবোর্ড থেকে সংকলিত:

আপডেটের হার

আমরা সব উৎস প্রতি সপ্তাহে সিঙ্ক করি; বড় মডেল প্রকাশ তাৎক্ষণিক আপডেট করে। সর্বশেষ পূর্ণ আপডেট: 2026-08-05।

সীমাবদ্ধতা

কোনো বেঞ্চমার্কই নিখুঁত নয়, আর অ্যারেনা পছন্দ কাজের উপযোগিতার সমান নয়। নির্দিষ্ট পরিস্থিতির সিদ্ধান্তের জন্য বিভাগ লিডারবোর্ড ও তুলনা টুল ব্যবহার করুন। প্রিভিউ অবস্থার মডেল চিহ্নিত থাকে এবং নতুন ভোট/ফলাফলে সরতে পারে।