Benchmark

LiveCodeBench

Live Code Benchmark

Contamination-free code generation from recent competitive programming problems.

25
Models Tested
Claude Opus 4
Top Model
73.8%
Top Score
100 %
Max Possible
#ModelLiveCodeBench ScoreProviderComposite
1
Claude Opus 4
Anthropic
73.8%Anthropic97.8
2
o3
OpenAI
72.1%OpenAI97.1
370.4%Google97.5
4
DeepSeek R1
DeepSeek
65.8%DeepSeek92.3
5
o4-mini
OpenAI
65.3%OpenAI91.5
655.1%Anthropic90.3
752.8%xAI88.8
850.2%Meta87.5
948.6%Google86.7
10
DeepSeek V3
DeepSeek
43.5%DeepSeek86.1
1142.8%Alibaba84.5
1240.2%Anthropic88.4
13
GPT-4o
OpenAI
33.1%OpenAI89.2
1429.3%Anthropic79.2
1528.5%Google80.5
1627.6%Meta82.1
1725.1%Meta79.8
18
Mistral Large
Mistral AI
22.4%Mistral AI76.5
1921.3%Alibaba76
2020.5%xAI74.8
2119.8%Meta74.3
2218.3%OpenAI75.8
23
Mixtral 8x22B
Mistral AI
12.1%Mistral AI65.2
249.2%Cohere60.8
25
Phi-4
Microsoft
8.5%Microsoft64.5
Source: Jain et al., 2024