Rangliste

Research Rankings

Wissenschaftliche Literatur und Expertenwissen: HLE, GPQA Diamond, MMLU-Pro.

85 Modelle
#ModellPodium ScoreGPQA DiamondHumanity’s Last ExamMMLU-ProGeschwindigkeit
01
Seed 2.0 Pro
ByteDance
88.9
88.9%40 t/s
02
GPT-5.1
OpenAI
88.1
88.1%60 t/s
03
87.0
87%50 t/s
4
87.0
87%60 t/s
5
Qwen3.5 122B-A10B
Alibaba · Offen
86.7
86.6%86.7%126 t/s
6
GPT-5
OpenAI
85.7
85.7%60 t/s
7
Gemma 4 31B
Google · Offen
85.2
85.2%35 t/s
8
DeepSeek V3.2
DeepSeek · Offen
85.0
85%60 t/s
9
Qwen3.8 Flash Next
Alibaba · Offen
81.0
81%168 t/s
10
Claude Mythos Preview
Anthropic · reasoning · preview
79.7
94.6%64.7%80 t/s
11
GLM-5.3 Flash
Z.ai · Offen
78.5
78.5%182 t/s
12
75.8
93.6%57.9%50 t/s
13
75.8
91.9%45.8%89.8%120 t/s
14
DeepSeek V4 Pro
DeepSeek · Offen
75.3
90.1%48.2%87.5%66 t/s
15
Kimi K3
Moonshot AI · Offen · reasoning
74.8
93.5%56%37 t/s
16
GPT-6 Astra
OpenAI · reasoning
74.6
96%53.2%82 t/s
17
74.5
94.2%54.7%80 t/s
18
74.5
92.4%41.4%89.6%203 t/s
19
74.0
89.5%58.4%80 t/s
20
DeepSeek V4 Flash
DeepSeek · Offen
73.1
88.1%45.1%86.2%113 t/s
21
GLM-5.2
Z.ai · Offen
73.0
91.2%54.7%164 t/s
22
Claude Fable 5
Anthropic · reasoning
72.9
92.6%53.3%71 t/s
23
Claude Opus 5
Anthropic
72.9
93.2%52.6%60 t/s
24
72.9
94.3%51.4%136 t/s
25
GPT-5.5
OpenAI
72.9
93.6%52.2%60 t/s
26
72.2
91.3%53.1%50 t/s
27
71.2
90.3%34.7%88.5%54 t/s
28
70.9
94.6%47.2%72 t/s
29
Grok 4 Heavy
xAI · preview
69.6
88.4%50.7%50 t/s
30
69.5
89.9%49%50 t/s
31
69.2
90.4%28.8%88.5%55 t/s
32
Qwen3.5 397B-A17B
Alibaba · Offen
68.3
88.4%28.7%87.8%71 t/s
33
68.1
92.6%43.6%55 t/s
34
68.0
68%78 t/s
35
67.5
89.8%45.1%208 t/s
36
67.4
92.9%41.8%127 t/s
37
GLM-5.1
Z.ai · Offen
67.0
67%74 t/s
38
67.0
90.4%43.5%120 t/s
39
67.0
67%50 t/s
40
Nemotron 3 Ultra 550B
NVIDIA · Offen
66.8
87%26.6%86.8%142 t/s
41
66.7
93%40.3%59 t/s
42
66.6
92.2%41%267 t/s
43
GPT-5.4
OpenAI
66.3
92.8%39.8%60 t/s
44
65.7
91.5%39.9%118 t/s
45
65.6
92.8%38.3%233 t/s
46
MiniMax M3
MiniMax
65.0
92.9%37.1%93 t/s
47
64.8
92.3%37.2%175 t/s
48
64.0
64%40 t/s
49
GPT-5.2
OpenAI
63.5
92.4%34.5%90 t/s
50
Kimi K2.6
Moonshot AI · Offen
63.5
90.5%36.4%40 t/s
51
DeepSeek V4.1 Flash
DeepSeek · Offen · reasoning
62.0
62%214 t/s
52
Kimi K2.7 Code
Moonshot AI · Offen
61.2
89.6%32.8%39 t/s
53
61.0
90.4%31.6%69 t/s
54
MiMo V2.5 Pro
Xiaomi · Offen
60.2
86.6%33.8%65 t/s
55
Inkling
Thinking Machines
58.5
87.2%29.7%81 t/s
56
54.0
54%115 t/s
57
51.0
51%60 t/s
58
Agnes 3.0 Flash
Agnes · reasoning
49.0
49%235 t/s
59
48.9
80%17.8%96 t/s
60
48.0
48%80 t/s
61
Nova 2.0 Pro Preview
Amazon · preview
46.0
46%40 t/s
62
45.0
45%65 t/s
63
GPT-oss-120B
OpenAI · Offen
43.0
43%240 t/s
64
42.0
42%148 t/s
65
36.0
36%120 t/s
66
G9v3-39A5B
AI9Stars · Offen
36.0
36%60 t/s
67
G9v3-3B
AI9Stars · Offen
36.0
36%60 t/s
68
GLM-5.3
Zhipu AI
36.0
36%90 t/s
69
36.0
36%59 t/s
70
36.0
36%59 t/s
71
36.0
36%62 t/s
72
HyperNova 60B
Multiverse · Offen
36.0
36%367 t/s
73
36.0
36%103 t/s
74
LFM2.5-2.6B
Liquid AI · Offen
36.0
36%60 t/s
75
LFM2.5-8B-A1B
Liquid AI · Offen
36.0
36%338 t/s
76
LFM2.5-VL-1.6B
Liquid AI · Offen
36.0
36%395 t/s
77
LongCat 2.0
LongCat · Offen
36.0
36%42 t/s
78
Magistral Small 1.2
Mistral · Offen
36.0
36%60 t/s
79
Qwen3.8 27B (xhigh)
Alibaba · Offen
36.0
36%53 t/s
80
Qwen3.8 27B (low)
Alibaba · Offen
36.0
36%64 t/s
81
Qwen3.8 27B (medium)
Alibaba · Offen
36.0
36%62 t/s
82
Qwen3.8 27B (Non-reasoning)
Alibaba · Offen · reasoning
36.0
36%62 t/s
83
34.0
34%40 t/s
84
GPT-oss-20B
OpenAI · Offen
32.0
32%90 t/s
85
31.0
31%40 t/s
Der Podium Score ist eine gewichtete Mischung aus fünf Ranglisten. Siehe Methodik für Details.
0 / 4