💻 Coding · llm-stats.com

SWE-Bench Pro

Harder, contamination-resistant successor to SWE-Bench with commercial-repo issues.

20
测试模型数
Claude Mythos Preview
最佳模型
77.8%
最高分
Anthropic
提供商
#模型名称SWE-Bench Pro提供商Podium 综合得分
1
77.8%
Anthropic97.4
2
69.2%
Anthropic76.0
3
67.7%
Alibaba79.8
4
64.7%
xAI61.3
5
64.6%
OpenAI80.8
6
64.3%
Anthropic52.0
7
63.4%
OpenAI66.4
8
62.7%
OpenAI49.1
9
62.1%
Z.ai59.1
10
60.6%
Alibaba51.0
11
GPT-5.5
OpenAI
58.6%
OpenAI54.0
12
Kimi K2.6
Moonshot AI
58.6%
Moonshot AI49.0
13
57.9%
Tencent38.9
14
GPT-5.4
OpenAI
57.7%
OpenAI51.0
15
57.6%
Alibaba42.2
16
56.6%
Alibaba32.4
17
55.4%
DeepSeek46.0
18
54.2%
Google60.6
19
52.6%
DeepSeek42.0
20
52.4%
Meta47.0
基准数据聚合自 llm-stats.com。详见方法论