Peringkat LLM · Diperbarui 5 Agu 2026
The Definitive
LLM Leaderboard.
Membandingkan 673 model bahasa pada 25 benchmark, suara arena, harga, dan kecepatan — menggabungkan lima papan peringkat independen.
Digabungkan dari 5 papan peringkat independen:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
673+
Model
Flagship curated
25
Benchmark
Rigorous evals
44
Penyedia
Global AI labs
719
Model di arena
Human battle Elo
01 · Real-Time Rankings
Model teratas
Top 10 Models by Overall Podium Score
Lihat semua →| # | Model | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 4 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 5 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 6 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 7 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 8 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
| 9 | Claude Opus 4 7 Thinking Anthropic · Unknown | 75.0 |
| 10 | Claude Opus 5 Max Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
Terbaik per tugas
Coding
Rekayasa kode: SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench, dan HumanEval.
Pemimpin: Claude Fable 5
Matematika
Dari matematika olimpiade hingga soal frontier: AIME, MATH, dan FrontierMath.
Pemimpin: Claude Mythos Preview
Penalaran
Penalaran mendalam dan sains: GPQA Diamond, HLE, dan ARC-AGI-2.
Pemimpin: Claude Mythos Preview
Agen
Alat otonom dan penggunaan komputer: OSWorld, Toolathlon, MCP Atlas, τ²-Bench.
Pemimpin: Kimi K3
Pengetahuan
Fakta dan ketahanan terhadap halusinasi: SimpleQA, MMLU-Pro, dan MMMLU.
Pemimpin: Claude Mythos Preview
Multimodal
Pemahaman gambar dan dokumen: MMMU, CharXiv, dan ScreenSpot-Pro.
Pemimpin: Claude Mythos Preview
03 · Research & Analysis
Artikel terbaru
04 · FAQ
Pertanyaan umum
Setiap model mendapat Podium Score (0–100) — campuran berbobot dari empat sinyal: 35% Elo arena dari perbandingan oleh manusia, 30% rata-rata benchmark, 20% Intelligence Index dari Artificial Analysis, dan 15% skor LLM Stats. Semua sinyal dinormalisasi ke skala umum, sehingga skornya menjadi jalan tengah yang masuk akal dari lima papan peringkat independen.
Claude Mythos Preview memimpin dengan 97.4. Berikutnya Claude Fable 5 (93.4) dan Kimi K3 (83.3). Peringkat berubah tiap minggu seiring masuknya suara dan hasil baru.
Kami mengkurasi 673 model unggulan dalam 18 kategori (coding, matematika, penalaran, agen, pengetahuan, multimodal, konteks panjang, kecepatan, nilai, dan bobot terbuka), ditambah tabel arena lengkap berisi 719 model.
Dari lima papan peringkat publik: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. Setiap sumber disinkronkan tiap minggu; formula lengkapnya ada di halaman metodologi.