Benchmark

SWE-Bench

Software Engineering Benchmark

Real-world GitHub issue resolution across popular open-source repositories.

25
Models Tested
Claude Opus 4
Top Model
72.5%
Top Score
100 %
Max Possible
#ModelSWE-Bench ScoreProviderComposite
1
Claude Opus 4
Anthropic
72.5%Anthropic97.8
2
o3
OpenAI
71.7%OpenAI97.1
3
o4-mini
OpenAI
68.1%OpenAI91.5
463.8%Google97.5
562.3%Anthropic90.3
655.2%xAI88.8
7
DeepSeek R1
DeepSeek
49.2%DeepSeek92.3
849%Anthropic88.4
948.2%Google86.7
1047.5%Meta87.5
11
DeepSeek V3
DeepSeek
42%DeepSeek86.1
1241.3%Alibaba84.5
1340.6%Anthropic79.2
14
GPT-4o
OpenAI
38.4%OpenAI89.2
1536.8%Google80.5
1635.2%Meta82.1
1732.8%Meta79.8
18
Mistral Large
Mistral AI
30.1%Mistral AI76.5
1928.3%xAI74.8
2027.3%Meta74.3
2126.5%Alibaba76
2223.4%OpenAI75.8
23
Mixtral 8x22B
Mistral AI
18.2%Mistral AI65.2
2415.8%Cohere60.8
25
Phi-4
Microsoft
12.5%Microsoft64.5
Source: Jimenez et al., 2024