LLM रैंकिंग · अपडेट किया गया 5 अग॰ 2026

The Definitive
LLM Leaderboard.

673 भाषा मॉडलों की तुलना 25 बेंचमार्क, एरीना वोट, कीमत और गति पर — पाँच स्वतंत्र लीडरबोर्ड को मिलाकर।

5 स्वतंत्र लीडरबोर्ड से संकलित:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
llmpodium eval --benchmark suite
$llmpodium compare claude-mythos-preview vs claude-fable-5
EvaluatingRunning SWE-Bench, AIME, GPQA & Arena Elo...
Claude Mythos Preview: Score 97.4 · 80 t/s · Rank #1
Claude Fable 5: Score 93.4 · 71 t/s · 1509 Elo
Podium VerdictClaude Mythos Preview leads overall composite index
$
Tracked AI Labs
OpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaiduOpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaidu
673+
मॉडल
Flagship curated
25
बेंचमार्क
Rigorous evals
44
प्रदाता
Global AI labs
719
एरीना में मॉडल
Human battle Elo
01 · Real-Time Rankings

शीर्ष मॉडल

सभी देखें →

Top 10 Models by Overall Podium Score

सभी देखें →
#मॉडलPodium Scoreएरीना Eloकोडिंगगतिकीमत (आउटपुट)
01
Claude Mythos Preview
Anthropic · Proprietary
97.4
80.980 t/s$15/M
02
Claude Fable 5
Anthropic · Proprietary
93.4
150984.171 t/s$50/M
03
Kimi K3
Moonshot AI · Open Weights
83.3
148561.537 t/s$15/M
4
Claude Opus 5
Anthropic · Proprietary
81.4
149270.460 t/s$25/M
5
GPT-5.6 Sol
OpenAI · Proprietary
80.8
148364.872 t/s$30/M
6
Qwen3.8 Max
Alibaba · Proprietary
79.8
149650.355 t/s$2/M
7
Claude Opus 4.8
Anthropic · Proprietary
76.0
148458.050 t/s$15/M
8
Claude Opus 4 6 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
9
Claude Opus 4 7 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
10
Claude Opus 5 Max
Anthropic · Unknown
75.0
50 t/s$15/M
02 · Evaluation Domains

कार्य के अनुसार सर्वश्रेष्ठ

सभी देखें →
03 · Research & Analysis

नवीनतम लेख

सभी लेख

Open LLM Intelligence Platform

Find the perfect model for your workflow.

Compare accuracy, price-per-token, latency, and real-world agent performance across 700+ language models in seconds.

04 · FAQ

अक्सर पूछे जाने वाले प्रश्न

संपूर्ण FAQ
हर मॉडल को एक Podium Score (0–100) मिलता है — चार संकेतों का भारित मिश्रण: 35% मानव तुलना से एरीना Elo, 30% बेंचमार्क औसत, 20% Artificial Analysis का Intelligence Index और 15% LLM Stats स्कोर। सभी संकेतों को एक समान पैमाने पर सामान्य किया जाता है।
Claude Mythos Preview 97.4 के साथ शीर्ष पर है। इसके बाद Claude Fable 5 (93.4) और Kimi K3 (83.3)। नए वोट और परिणाम आने पर रैंकिंग हर हफ्ते बदलती है।
हम 18 श्रेणियों (कोडिंग, गणित, तर्क, एजेंट, ज्ञान, मल्टीमोडल, लॉन्ग कॉन्टेक्स्ट, गति, मूल्य और ओपन वेट) में 673 फ्लैगशिप मॉडल क्यूरेट करते हैं, साथ ही 719 मॉडलों की पूरी एरीना तालिका।
पाँच सार्वजनिक लीडरबोर्ड से: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase। प्रत्येक स्रोत हर हफ्ते सिंक होता है; सटीक सूत्र कार्यप्रणाली पृष्ठ पर है।