coding Coding · llm-stats.com
LiveCodeBench
Continuously refreshed competitive programming problems immune to data contamination.
48
โมเดลที่ทดสอบ
DeepSeek V4 Pro
โมเดลเด่น
93.5%
คะแนนสูงสุด
DeepSeek
ผู้ให้บริการ
| # | โมเดล | LiveCodeBench |
|---|---|---|
| 1 | DeepSeek V4 Pro DeepSeek | 93.5% |
| 2 | Gemini 3 Pro Google | 91.7% |
| 3 | DeepSeek V4 Flash DeepSeek | 91.6% |
| 4 | DeepSeek V3.2 DeepSeek | 83.3% |
| 5 | Grok 4 Heavy xAI | 79.4% |
| 6 | GPT-6 Astra OpenAI | 76.2% |
| 7 | Kimi K3 Moonshot AI | 74.7% |
| 8 | GPT-5.5 OpenAI | 74.3% |
| 9 | GPT-5.6 Terra OpenAI | 74% |
| 10 | GPT-5.3 Codex OpenAI | 74% |
| 11 | GPT-5.6 Luna OpenAI | 74% |
| 12 | MiniMax M3 MiniMax | 74% |
| 13 | GPT-5.6 Sol OpenAI | 73.7% |
| 14 | MiMo V2.5 Pro Xiaomi | 73.3% |
| 15 | Gemini 3.1 Pro Google | 72.7% |
| 16 | GLM-5.2 Z.ai | 71.3% |
| 17 | Claude Fable 5 Anthropic | 70% |
| 18 | Claude Opus 5 Anthropic | 70% |
| 19 | Gemini 3.6 Flash Google | 69.7% |
| 20 | Muse Spark Meta | 69.7% |
| 21 | Qwen3.6 Plus Alibaba | 69.7% |
| 22 | Qwen3.8 Flash Next Alibaba | 69.5% |
| 23 | Gemini 3.5 Flash Google | 69.3% |
| 24 | Qwen3.7 Max Alibaba | 69% |
| 25 | DeepSeek V4.1 Flash DeepSeek | 68% |
| 26 | Claude Opus 4.8 Anthropic | 67.7% |
| 27 | Grok 4.5 xAI | 67.7% |
| 28 | Nemotron 3 Ultra 550B NVIDIA | 67% |
| 29 | Hunyuan Hy3 Tencent | 66.7% |
| 30 | GLM-5.3 Flash Z.ai | 66.5% |
| 31 | Kimi K2.7 Code Moonshot AI | 66.3% |
| 32 | Muse Spark 1.1 Meta | 63.3% |
| 33 | Inkling Thinking Machines | 63.3% |
| 34 | Claude Sonnet 5 Anthropic | 58.7% |
| 35 | Claude Opus 4.6 Anthropic | 58.3% |
| 36 | 58% | |
| 37 | GLM-5.1 Z.ai | 57% |
| 38 | Claude Sonnet 4.6 (max) Anthropic | 57% |
| 39 | MiniMax-M2.7 MiniMax | 55% |
| 40 | 45% | |
| 41 | Mistral Medium 3.5 Mistral | 43% |
| 42 | Claude 4.5 Haiku Anthropic | 41% |
| 43 | Nova 2.0 Pro Preview Amazon | 39% |
| 44 | GPT-oss-120B OpenAI | 37% |
| 45 | 36% | |
| 46 | Solar Pro 3 Upstage | 28% |
| 47 | GPT-oss-20B OpenAI | 27% |
| 48 | 27% |
ข้อมูลเบนช์มาร์กรวบรวมจาก llm-stats.com ดู ระเบียบวิธี