coding Coding · llm-stats.com

SWE-Bench Verified

Real GitHub issues resolved end-to-end; the industry standard for agentic coding.

40
테스트된 모델
Claude Fable 5
톱 모델
95%
최고 점수
Anthropic
제공업체
#모델명SWE-Bench Verified제공업체Podium Score
1
95%
Anthropic93.4
2
93.9%
Anthropic97.4
3
90.2%
OpenAI86.2
4
88.6%
Anthropic76.0
5
87.6%
Anthropic52.0
6
85.2%
Anthropic45.4
7
80.9%
Anthropic52.1
8
80.8%
Anthropic61.2
9
80.6%
Google60.6
10
80.6%
DeepSeek46.0
11
MiniMax M3
MiniMax
80.5%
MiniMax39.6
12
80.4%
Alibaba51.0
13
Kimi K2.6
Moonshot AI
80.2%
Moonshot AI49.0
14
GPT-5.2
OpenAI
80%
OpenAI49.2
15
79.6%
Anthropic38.1
16
79%
DeepSeek42.0
17
78.9%
Xiaomi48.0
18
78.8%
Alibaba32.4
19
78%
Google42.4
20
78%
Tencent38.9
21
77.7%
Alibaba42.2
22
77.4%
Meta47.0
23
Seed 2.0 Pro
ByteDance
76.5%
ByteDance40.0
24
76.4%
Alibaba23.9
25
GPT-5.1
OpenAI
76.3%
OpenAI42.3
26
76.2%
Google51.9
27
GPT-5
OpenAI
74.9%
OpenAI23.0
28
74.5%
Anthropic21.7
29
73.1%
DeepSeek12.9
30
65%
DeepSeek54.5
31
47%
Anthropic0.0
32
46%
Z.ai46.0
33
45%
MiniMax45.0
34
35%
Mistral35.0
35
33%
Anthropic24.1
36
32%
Amazon14.4
37
30%
OpenAI30.0
38
23%
Upstage23.0
39
22%
OpenAI22.0
40
22%
K222.0
벤치마크 데이터는 llm-stats.com에서 집계. 자세한 내용은 방법론.
0 / 4