আমরা কীভাবে মূল্যায়ন করি
Podium Score পাঁচটি স্বাধীন লিডারবোর্ডকে একটি তুলনীয় সংখ্যায় একত্রিত করে।
Podium Score সূত্র
Podium Score = ০.৩৫·অ্যারেনা + ০.৩০·বেঞ্চমার্ক + ০.২০·বুদ্ধিমত্তা + ০.১৫·LLM Stats
- Arena (35%) — ব্যবহারকারীর জোড়া ভোট থেকে Elo রেটিং (Arena.ai, 719 মডেল, ভোট-ভারিত, কনফিডেন্স ইন্টারভালসহ)।
- Benchmarks (30%) — মডেলের জন্য আমাদের ট্র্যাক করা সব স্বাভাবিকীকৃত বেঞ্চমার্ক ফলাফলের গড় (মোট 25টি বেঞ্চমার্ক)।
- Intelligence Index (20%) — Artificial Analysis-এর সম্মিলিত বুদ্ধিমত্তা সূচক।
- LLM Stats (15%) — llm-stats.com কর্তৃক প্রকাশিত সম্মিলিত স্কোর।
যখন কোনো উৎসের কাছে কোনো মডেলের মান নেই, তার ওজন অন্য উৎসগুলোর মধ্যে আনুপাতিকভাবে পুনর্বণ্টন হয় — একটি লিডারবোর্ডে অনুপস্থিতির জন্য মডেলকে কখনো শাস্তি দেওয়া হয় না।
স্বাভাবিকীকরণ
প্রতিটি সংকেত সব 673টি ট্র্যাক করা মডেল জুড়ে min-max দিয়ে ০–১০০ স্কেলে স্বাভাবিক হয়, তাই ৮০-এর অর্থ সবসময় "সবচেয়ে খারাপ ও সেরা দেখা মডেলের মাঝে ৮০% দূরত্ব"। শতাংশ বেঞ্চমার্ক যেমন আছে তেমনই; Elo, সূচক ও দাম নিজ নিজ পরিসরে স্বাভাবিক হয়।
বিভাগ স্কোর
সামগ্রিক র্যাংকিংয়ের পাশাপাশি আমরা 17টি বিভাগ লিডারবোর্ড রাখি, প্রতিটি সেই কাজের জন্য সবচেয়ে প্রাসঙ্গিক বেঞ্চমার্কের উপর ভিত্তি করে:
- Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
- Math — AIME 2025, FrontierMath, MATH.
- Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
- Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
- Knowledge — SimpleQA, MMLU-Pro, MMMLU.
- Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
- Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
- Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
- Multilingual — Multilingual MMLU.
- Writing — IFBench, Arena Elo.
- Chat & Assistants — Arena Elo, IFBench.
- Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
- Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
- Long Context — MRCR v2, Context window.
- Speed — Output tokens/s.
- Value — Blended price /1M, Cost per task.
- Open Weights — Podium Score.
ডেটা উৎস
সব ডেটা পাঁচটি পাবলিক লিডারবোর্ড থেকে সংকলিত:
- Arena.ai — last synced 2026-08-04.
- Artificial Analysis — last synced 2026-08-03.
- LLM Stats — last synced 2026-08-02.
- Vellum Leaderboard — last synced 2026-07-24.
- LLMBase — last synced 2026-08-04.
আপডেটের হার
আমরা সব উৎস প্রতি সপ্তাহে সিঙ্ক করি; বড় মডেল প্রকাশ তাৎক্ষণিক আপডেট করে। সর্বশেষ পূর্ণ আপডেট: 2026-08-05।
সীমাবদ্ধতা
কোনো বেঞ্চমার্কই নিখুঁত নয়, আর অ্যারেনা পছন্দ কাজের উপযোগিতার সমান নয়। নির্দিষ্ট পরিস্থিতির সিদ্ধান্তের জন্য বিভাগ লিডারবোর্ড ও তুলনা টুল ব্যবহার করুন। প্রিভিউ অবস্থার মডেল চিহ্নিত থাকে এবং নতুন ভোট/ফলাফলে সরতে পারে।