LLM درجہ بندی · اپ ڈیٹ شدہ 5 اگست، 2026
The Definitive
LLM Leaderboard.
673 زبان کے ماڈلز کا موازنہ 25 بینچ مارکس، ارینا ووٹس، قیمتوں اور رفتار پر — پانچ آزاد لیڈر بورڈز کو ملا کر۔
5 آزاد لیڈر بورڈز سے مرتب:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
673+
ماڈلز
Flagship curated
25
بینچ مارک
Rigorous evals
44
فراہم کنندگان
Global AI labs
719
ارینا میں ماڈلز
Human battle Elo
01 · Real-Time Rankings
سرکردہ ماڈلز
Top 10 Models by Overall Podium Score
سب دیکھیں ←| # | ماڈل | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 4 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 5 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 6 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 7 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 8 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
| 9 | Claude Opus 4 7 Thinking Anthropic · Unknown | 75.0 |
| 10 | Claude Opus 5 Max Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
کام کے لحاظ سے بہترین
کوڈنگ
کوڈ انجینئرنگ: SWE-Bench، LiveCodeBench، SciCode، Terminal-Bench اور HumanEval۔
سرکردہ: Claude Fable 5
ریاضی
اولمپیاد ریاضی سے فرنٹیئر مسائل تک: AIME، MATH اور FrontierMath۔
سرکردہ: Claude Mythos Preview
استدلال
گہرا استدلال اور سائنس: GPQA Diamond، HLE اور ARC-AGI-2۔
سرکردہ: Claude Mythos Preview
ایجنٹک
خودمختار ٹولز اور کمپیوٹر آپریشن: OSWorld، Toolathlon، MCP Atlas، τ²-Bench۔
سرکردہ: Kimi K3
علم
حقائق اور ہیلوسینیشن مزاحمت: SimpleQA، MMLU-Pro اور MMMLU۔
سرکردہ: Claude Mythos Preview
ملٹی موڈل
تصویر اور دستاویز کی سمجھ: MMMU، CharXiv اور ScreenSpot-Pro۔
سرکردہ: Claude Mythos Preview
03 · Research & Analysis
تازہ ترین مضامین
04 · FAQ
اکثر پوچھے گئے سوالات
ہر ماڈل کو ایک Podium Score (0–100) ملتا ہے — چار اشاروں کا وزنی امتزاج: 35% انسانی موازنے سے ارینا Elo، 30% بینچ مارک اوسط، 20% Artificial Analysis کا انٹیلیجنس انڈیکس اور 15% LLM Stats اسکور۔ تمام اشاروں کو ایک مشترکہ پیمانے پر معمول کیا جاتا ہے۔
Claude Mythos Preview 97.4 کے ساتھ سر فہرست ہے۔ اس کے بعد Claude Fable 5 (93.4) اور Kimi K3 (83.3)۔ نئے ووٹس اور نتائج آنے پر درجہ بندی ہر ہفتے بدلتی ہے۔
ہم 18 زمروں (کوڈنگ، ریاضی، استدلال، ایجنٹس، علم، ملٹی موڈل، طویل سیاق، رفتار، قدر اور اوپن ویٹس) میں 673 فلیگ شپ ماڈلز منتخب کرتے ہیں، اس کے علاوہ 719 ماڈلز کی مکمل ارینا ٹیبل۔
پانچ عوامی لیڈر بورڈز سے: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase۔ ہر ذریعہ ہر ہفتے ہم آہنگ ہوتا ہے؛ درست فارمولا طریقہ کار کے صفحے پر ہے۔