Benchmark

GPQA

Graduate-Level Google-Proof QA

Expert-level questions across physics, chemistry, biology that resist search-engine retrieval.

25
Models Tested
Gemini 2.5 Pro
Top Model
84%
Top Score
100 %
Max Possible
#ModelGPQA ScoreProviderComposite
184%Google97.5
2
Claude Opus 4
Anthropic
83.5%Anthropic97.8
3
o3
OpenAI
81.3%OpenAI97.1
4
o4-mini
OpenAI
72.1%OpenAI91.5
5
DeepSeek R1
DeepSeek
71.5%DeepSeek92.3
670.2%Anthropic90.3
768.5%xAI88.8
865%Anthropic88.4
962.8%Meta87.5
1062.3%Google86.7
11
DeepSeek V3
DeepSeek
59.1%DeepSeek86.1
1258.3%Alibaba84.5
1355.4%Google80.5
14
GPT-4o
OpenAI
53.6%OpenAI89.2
1551.1%Meta82.1
1648.7%Meta79.8
1748.2%Anthropic79.2
18
Mistral Large
Mistral AI
46.5%Mistral AI76.5
1945.6%Alibaba76
2044.8%xAI74.8
2142.3%Meta74.3
2241.1%OpenAI75.8
23
Phi-4
Microsoft
38.5%Microsoft64.5
24
Mixtral 8x22B
Mistral AI
33.5%Mistral AI65.2
2530.2%Cohere60.8
Source: Rein et al., 2023