coding Coding · llm-stats.com
SWE-Bench Verified
Real GitHub issues resolved end-to-end; the industry standard for agentic coding.
40
テスト済みモデル
Claude Fable 5
トップモデル
95%
トップスコア
Anthropic
プロバイダー
| # | モデル | SWE-Bench Verified |
|---|---|---|
| 1 | Claude Fable 5 Anthropic | 95% |
| 2 | Claude Mythos Preview Anthropic | 93.9% |
| 3 | GPT-6 Astra OpenAI | 90.2% |
| 4 | Claude Opus 4.8 Anthropic | 88.6% |
| 5 | Claude Opus 4.7 Anthropic | 87.6% |
| 6 | Claude Sonnet 5 Anthropic | 85.2% |
| 7 | Claude Opus 4.5 Anthropic | 80.9% |
| 8 | Claude Opus 4.6 Anthropic | 80.8% |
| 9 | Gemini 3.1 Pro Google | 80.6% |
| 10 | DeepSeek V4 Pro DeepSeek | 80.6% |
| 11 | MiniMax M3 MiniMax | 80.5% |
| 12 | Qwen3.7 Max Alibaba | 80.4% |
| 13 | Kimi K2.6 Moonshot AI | 80.2% |
| 14 | GPT-5.2 OpenAI | 80% |
| 15 | Claude Sonnet 4.6 Anthropic | 79.6% |
| 16 | DeepSeek V4 Flash DeepSeek | 79% |
| 17 | MiMo V2.5 Pro Xiaomi | 78.9% |
| 18 | Qwen3.6 Plus Alibaba | 78.8% |
| 19 | Gemini 3 Flash Google | 78% |
| 20 | Hunyuan Hy3 Tencent | 78% |
| 21 | Qwen3.7 Plus Alibaba | 77.7% |
| 22 | Muse Spark Meta | 77.4% |
| 23 | Seed 2.0 Pro ByteDance | 76.5% |
| 24 | Qwen3.5 397B-A17B Alibaba | 76.4% |
| 25 | GPT-5.1 OpenAI | 76.3% |
| 26 | Gemini 3 Pro Google | 76.2% |
| 27 | GPT-5 OpenAI | 74.9% |
| 28 | Claude Opus 4.1 Anthropic | 74.5% |
| 29 | DeepSeek V3.2 DeepSeek | 73.1% |
| 30 | DeepSeek V4.1 Flash DeepSeek | 65% |
| 31 | Claude Sonnet 4.6 (max) Anthropic | 47% |
| 32 | GLM-5.1 Z.ai | 46% |
| 33 | MiniMax-M2.7 MiniMax | 45% |
| 34 | Mistral Medium 3.5 Mistral | 35% |
| 35 | Claude 4.5 Haiku Anthropic | 33% |
| 36 | Nova 2.0 Pro Preview Amazon | 32% |
| 37 | GPT-oss-120B OpenAI | 30% |
| 38 | Solar Pro 3 Upstage | 23% |
| 39 | GPT-oss-20B OpenAI | 22% |
| 40 | 22% |
ベンチマークデータは llm-stats.com から集計。詳細は方法論。