🛠️ 코딩 에이전트 랭킹

에이전트형 코딩: SWE-Bench Pro, Terminal-Bench, τ²-Bench.

제공업체
라이선스
40개 모델
#모델명Podium ScoreSWE-Bench VerifiedSWE-Bench ProTerminal-Bench Hardτ²-Bench Retail속도
01
Claude Mythos Preview
Anthropic · preview
85.9
93.9%77.8%80 t/s
02
85.5
95%62.9%98.5%71 t/s
03
85.2
85.2%96 t/s
4
80.9
80.9%50 t/s
5
GPT-5.2
OpenAI
80.0
80%90 t/s
6
79.6
79.6%50 t/s
7
78.0
78%120 t/s
8
77.6
88.6%69.2%58.3%94.4%50 t/s
9
Seed 2.0 Pro
ByteDance
76.5
76.5%40 t/s
10
Qwen3.5 397B-A17B
Alibaba · 오픈소스
76.4
76.4%71 t/s
11
GPT-5.1
OpenAI
76.3
76.3%60 t/s
12
75.9
87.6%64.3%80 t/s
13
GPT-5
OpenAI
74.9
74.9%60 t/s
14
74.5
74.5%80 t/s
15
DeepSeek V3.2
DeepSeek · 오픈소스
73.1
73.1%60 t/s
16
MiMo V2.5 Pro
Xiaomi · 오픈소스
72.1
78.9%43.2%94.2%65 t/s
17
71.9
64.6%65.9%85.1%72 t/s
18
71.6
80.4%60.6%50.8%94.7%203 t/s
19
71.4
80.8%48.5%84.8%50 t/s
20
71.1
80.6%54.2%53.8%95.6%136 t/s
21
GPT-5.5
OpenAI
71.0
58.6%60.6%93.9%60 t/s
22
GLM-5.2
Z.ai · 오픈소스
70.7
62.1%50.8%99.1%164 t/s
23
MiniMax M3
MiniMax
70.6
80.5%42.4%88.9%93 t/s
24
69.5
53%86%118 t/s
25
Kimi K2.6
Moonshot AI · 오픈소스
69.4
80.2%58.6%40 t/s
26
69.3
78.8%56.6%43.9%97.7%55 t/s
27
69.1
63.4%57.6%86.3%127 t/s
28
68.3
76.2%41.7%87.1%120 t/s
29
68.1
40.9%95.3%267 t/s
30
68.0
78%57.9%69 t/s
31
67.7
67.7%55 t/s
32
67.7
77.7%57.6%54 t/s
33
Kimi K2.7 Code
Moonshot AI · 오픈소스
67.4
44.7%90.1%39 t/s
34
66.7
77.4%52.4%45.5%91.5%80 t/s
35
DeepSeek V4 Pro
DeepSeek · 오픈소스
65.9
80.6%55.4%36.4%91.2%66 t/s
36
DeepSeek V4 Flash
DeepSeek · 오픈소스
65.8
79%52.6%113 t/s
37
64.7
64.7%59 t/s
38
62.7
62.7%175 t/s
39
Nemotron 3 Ultra 550B
NVIDIA · 오픈소스
59.9
36.4%83.3%142 t/s
40
GPT-5.4
OpenAI
57.7
57.7%60 t/s
Podium Score는 5개 리더보드의 가중 평균입니다. 자세한 내용은 평가 방법을 참고하세요.