ترتيب LLM · آخر تحديث 5 أغسطس 2026
The Definitive
LLM Leaderboard.
مقارنة 673 نموذجاً لغوياً عبر 25 اختباراً وأصوات الأرينا والأسعار والسرعة — بجمع خمس لوحات صدارة مستقلة.
مجمّعة من 5 لوحات صدارة مستقلة:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
673+
نموذج
Flagship curated
25
اختبار
Rigorous evals
44
مزوّد
Global AI labs
719
نموذج في الأرينا
Human battle Elo
01 · Real-Time Rankings
أفضل النماذج
Top 10 Models by Overall Podium Score
عرض الكل ←| # | النموذج | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 4 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 5 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 6 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 7 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 8 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
| 9 | Claude Opus 4 7 Thinking Anthropic · Unknown | 75.0 |
| 10 | Claude Opus 5 Max Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
الأفضل لكل مهمة
البرمجة
هندسة الأكواد: SWE-Bench وLiveCodeBench وSciCode وTerminal-Bench وHumanEval.
المتصدر: Claude Fable 5
الرياضيات
من رياضيات الأولمبياد إلى مسائل الحدود الأمامية: AIME وMATH وFrontierMath.
المتصدر: Claude Mythos Preview
الاستدلال
استدلال عميق وعلوم: GPQA Diamond وHLE وARC-AGI-2.
المتصدر: Claude Mythos Preview
الوكلاء
أدوات مستقلة وتشغيل الحاسوب: OSWorld وToolathlon وMCP Atlas وτ²-Bench.
المتصدر: Kimi K3
المعرفة
حقائق ومقاومة الهلوسة: SimpleQA وMMLU-Pro وMMMLU.
المتصدر: Claude Mythos Preview
متعدد الوسائط
فهم الصور والمستندات: MMMU وCharXiv وScreenSpot-Pro.
المتصدر: Claude Mythos Preview
03 · Research & Analysis
أحدث المقالات
04 · FAQ
أسئلة متكررة
يحصل كل نموذج على Podium Score (0–100) — مزيج مرجّح من أربع إشارات: 35% Elo الأرينا من مقارنات بشرية، 30% متوسط الاختبارات، 20% مؤشر الذكاء من Artificial Analysis و15% درجة LLM Stats. تُسوَّى كل الإشارات على مقياس موحد.
Claude Mythos Preview في الصدارة بدرجة 97.4. يليه Claude Fable 5 (93.4) وKimi K3 (83.3). تتغير الترتيبات أسبوعياً مع وصول أصوات ونتائج جديدة.
ننتقي 673 نموذجاً رائداً في 18 فئة (البرمجة، الرياضيات، الاستدلال، الوكلاء، المعرفة، متعدد الوسائط، السياق الطويل، السرعة، القيمة، والأوزان المفتوحة)، إضافة إلى جدول الأرينا الكامل بواقع 719 نموذجاً.
من خمس لوحات صدارة عامة: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. تُزامن كل مصدر أسبوعياً؛ الصيغة الدقيقة على صفحة المنهجية.