Benchmark

MATH

Mathematics Aptitude Test of Heuristics

High school and competition math problems across algebra, geometry, number theory.

25
Models Tested
DeepSeek R1
Top Model
97.3%
Top Score
100 %
Max Possible
#ModelMATH ScoreProviderComposite
1
DeepSeek R1
DeepSeek
97.3%DeepSeek92.3
297.2%Google97.5
3
o3
OpenAI
96.7%OpenAI97.1
4
Claude Opus 4
Anthropic
96.1%Anthropic97.8
5
o4-mini
OpenAI
93.2%OpenAI91.5
6
DeepSeek V3
DeepSeek
90.2%DeepSeek86.1
788.5%Alibaba84.5
888.1%xAI88.8
987.4%Google86.7
1085.6%Anthropic90.3
1184.2%Meta87.5
1278.3%Anthropic88.4
13
GPT-4o
OpenAI
76.6%OpenAI89.2
1473.8%Meta82.1
1573.5%Google80.5
1672.1%Meta79.8
1771.5%Alibaba76
1869.7%Anthropic79.2
1969.5%OpenAI75.8
20
Mistral Large
Mistral AI
69.2%Mistral AI76.5
2168.5%xAI74.8
2268%Meta74.3
23
Phi-4
Microsoft
62.5%Microsoft64.5
24
Mixtral 8x22B
Mistral AI
60.4%Mistral AI65.2
2555.3%Cohere60.8
Source: Hendrycks et al., 2021