LLM র্যাংকিং · আপডেট হয়েছে ৫ আগ, ২০২৬
The Definitive
LLM Leaderboard.
673টি ভাষা মডেল তুলনা 25টি বেঞ্চমার্ক, অ্যারেনা ভোট, দাম ও গতিতে — পাঁচটি স্বাধীন লিডারবোর্ড একত্রিত করে।
৫টি স্বাধীন লিডারবোর্ড থেকে সংকলিত:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
673+
মডেল
Flagship curated
25
বেঞ্চমার্ক
Rigorous evals
44
প্রদানকারী
Global AI labs
719
অ্যারেনায় মডেল
Human battle Elo
01 · Real-Time Rankings
শীর্ষ মডেল
Top 10 Models by Overall Podium Score
সব দেখুন →| # | মডেল | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 4 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 5 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 6 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 7 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 8 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
| 9 | Claude Opus 4 7 Thinking Anthropic · Unknown | 75.0 |
| 10 | Claude Opus 5 Max Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
কাজ অনুযায়ী সেরা
কোডিং
কোড ইঞ্জিনিয়ারিং: SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench ও HumanEval।
নেতা: Claude Fable 5
গণিত
অলিম্পিয়াড গণিত থেকে ফ্রন্টিয়ার সমস্যা: AIME, MATH ও FrontierMath।
নেতা: Claude Mythos Preview
যুক্তি
গভীর যুক্তি ও বিজ্ঞান: GPQA Diamond, HLE ও ARC-AGI-2।
নেতা: Claude Mythos Preview
এজেন্টিক
স্বায়ত্তশাসিত টুল ও কম্পিউটার ব্যবহার: OSWorld, Toolathlon, MCP Atlas, τ²-Bench।
নেতা: Kimi K3
জ্ঞান
তথ্য ও হ্যালুসিনেশন-প্রতিরোধ: SimpleQA, MMLU-Pro ও MMMLU।
নেতা: Claude Mythos Preview
মাল্টিমোডাল
ছবি ও ডকুমেন্ট বোঝা: MMMU, CharXiv ও ScreenSpot-Pro।
নেতা: Claude Mythos Preview
03 · Research & Analysis
সর্বশেষ নিবন্ধ
04 · FAQ
সাধারণ প্রশ্ন
প্রতিটি মডেল একটি Podium Score (০–১০০) পায় — চারটি সংকেতের ভারিত মিশ্রণ: ৩৫% মানুষের তুলনা থেকে অ্যারেনা Elo, ৩০% বেঞ্চমার্ক গড়, ২০% Artificial Analysis-এর Intelligence Index এবং ১৫% LLM Stats স্কোর। সব সংকেত একটি সাধারণ স্কেলে স্বাভাবিক করা হয়।
Claude Mythos Preview 97.4 নিয়ে শীর্ষে। এরপর Claude Fable 5 (93.4) এবং Kimi K3 (83.3)। নতুন ভোট ও ফলাফল এলে র্যাংকিং প্রতি সপ্তাহে বদলায়।
আমরা 18টি বিভাগে (কোডিং, গণিত, যুক্তি, এজেন্ট, জ্ঞান, মাল্টিমোডাল, দীর্ঘ কনটেক্সট, গতি, মূল্য ও ওপেন ওয়েট) 673টি ফ্ল্যাগশিপ মডেল বাছাই করি, সঙ্গে 719 মডেলের পূর্ণ অ্যারেনা টেবিল।
পাঁচটি পাবলিক লিডারবোর্ড থেকে: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase। প্রতিটি উৎস প্রতি সপ্তাহে সিঙ্ক হয়; সঠিক সূত্র পদ্ধতি পাতায়।