reasoning Reasoning · llm-stats.com

GPQA Diamond

Graduate-level science questions in physics, chemistry and biology, designed to be Google-proof.

82
Getestete Modelle
GPT-6 Astra
Top-Modell
96%
Top-Score
OpenAI
Anbieter
#ModellGPQA DiamondAnbieterPodium Score
1
96%
OpenAI86.2
2
94.6%
Anthropic97.4
3
94.6%
OpenAI80.8
4
94.3%
Google60.6
5
94.2%
Anthropic52.0
6
93.6%
Anthropic76.0
7
GPT-5.5
OpenAI
93.6%
OpenAI54.0
8
Kimi K3
Moonshot AI
93.5%
Moonshot AI83.3
9
Claude Opus 5
Anthropic
93.2%
Anthropic81.4
10
93%
xAI61.3
11
92.9%
OpenAI66.4
12
MiniMax M3
MiniMax
92.9%
MiniMax39.6
13
92.8%
Google65.9
14
GPT-5.4
OpenAI
92.8%
OpenAI51.0
15
92.6%
Anthropic93.4
16
92.6%
Alibaba79.8
17
92.4%
Alibaba51.0
18
GPT-5.2
OpenAI
92.4%
OpenAI49.2
19
92.3%
OpenAI49.1
20
92.2%
Google50.0
21
91.9%
Google51.9
22
91.5%
OpenAI52.4
23
91.3%
Anthropic61.2
24
91.2%
Z.ai59.1
25
Kimi K2.6
Moonshot AI
90.5%
Moonshot AI49.0
26
90.4%
Google42.4
27
90.4%
Tencent38.9
28
90.4%
Alibaba32.4
29
90.3%
Alibaba42.2
30
90.1%
DeepSeek46.0
31
89.9%
Anthropic38.1
32
89.8%
Meta69.9
33
Kimi K2.7 Code
Moonshot AI
89.6%
Moonshot AI41.8
34
89.5%
Meta47.0
35
Seed 2.0 Pro
ByteDance
88.9%
ByteDance40.0
36
88.4%
xAI54.5
37
88.4%
Alibaba23.9
38
GPT-5.1
OpenAI
88.1%
OpenAI42.3
39
88.1%
DeepSeek42.0
40
Inkling
Thinking Machines
87.2%
Thinking Machines31.7
41
87%
Anthropic52.1
42
87%
NVIDIA19.0
43
86.6%
Xiaomi48.0
44
86.6%
Alibaba22.0
45
GPT-5
OpenAI
85.7%
OpenAI23.0
46
81%
Alibaba66.8
47
80%
Anthropic45.4
48
78.5%
Z.ai64.2
49
68%
IBM58.6
50
67%
Z.ai46.0
51
67%
Anthropic0.0
52
64%
MiniMax45.0
53
62%
DeepSeek54.5
54
54%
IBM49.2
55
51%
Mistral35.0
56
49%
Agnes48.2
57
48%
Anthropic24.1
58
46%
Amazon14.4
59
45%
Agnes42.5
60
43%
OpenAI30.0
61
42%
IBM42.0
62
36%
DeepSeek65.0
63
G9v3-39A5B
AI9Stars
36%
AI9Stars65.0
64
G9v3-3B
AI9Stars
36%
AI9Stars65.0
65
GLM-5.3
Zhipu AI
36%
Zhipu AI65.0
66
36%
xAI65.0
67
36%
xAI65.0
68
36%
xAI65.0
69
HyperNova 60B
Multiverse
36%
Multiverse65.0
70
36%
Kwai65.0
71
LFM2.5-2.6B
Liquid AI
36%
Liquid AI65.0
72
LFM2.5-8B-A1B
Liquid AI
36%
Liquid AI65.0
73
36%
Liquid AI65.0
74
36%
LongCat65.0
75
36%
Mistral65.0
76
36%
Alibaba65.0
77
36%
Alibaba65.0
78
36%
Alibaba65.0
79
36%
Alibaba65.0
80
34%
Upstage23.0
81
32%
OpenAI22.0
82
31%
K222.0
Benchmark-Daten aggregiert aus llm-stats.com. Siehe Methodik.
0 / 4