🔭 रैंकिंग: अनुसंधान

वैज्ञानिक साहित्य और विशेषज्ञ कार्य: HLE, GPQA Diamond और MMLU-Pro।

प्रदाता
लाइसेंस
मॉडल: 48
#मॉडलPodium ScoreGPQA DiamondHumanity’s Last ExamMMLU-Proगति
01
Seed 2.0 Pro
ByteDance
88.9
88.9%40 t/s
02
GPT-5.1
OpenAI
88.1
88.1%60 t/s
03
87.0
87%50 t/s
4
87.0
87%60 t/s
5
Qwen3.5 122B-A10B
Alibaba · ओपन
86.7
86.6%86.7%126 t/s
6
GPT-5
OpenAI
85.7
85.7%60 t/s
7
Gemma 4 31B
Google · ओपन
85.2
85.2%35 t/s
8
DeepSeek V3.2
DeepSeek · ओपन
85.0
85%60 t/s
9
Claude Mythos Preview
Anthropic · preview
79.7
94.6%64.7%80 t/s
10
75.8
93.6%57.9%50 t/s
11
75.8
91.9%45.8%89.8%120 t/s
12
DeepSeek V4 Pro
DeepSeek · ओपन
75.3
90.1%48.2%87.5%66 t/s
13
Kimi K3
Moonshot AI · ओपन
74.8
93.5%56%37 t/s
14
74.5
94.2%54.7%80 t/s
15
74.5
92.4%41.4%89.6%203 t/s
16
74.0
89.5%58.4%80 t/s
17
DeepSeek V4 Flash
DeepSeek · ओपन
73.1
88.1%45.1%86.2%113 t/s
18
GLM-5.2
Z.ai · ओपन
73.0
91.2%54.7%164 t/s
19
72.9
92.6%53.3%71 t/s
20
Claude Opus 5
Anthropic
72.9
93.2%52.6%60 t/s
21
72.9
94.3%51.4%136 t/s
22
GPT-5.5
OpenAI
72.9
93.6%52.2%60 t/s
23
72.2
91.3%53.1%50 t/s
24
71.2
90.3%34.7%88.5%54 t/s
25
70.9
94.6%47.2%72 t/s
26
Grok 4 Heavy
xAI · preview
69.6
88.4%50.7%50 t/s
27
69.5
89.9%49%50 t/s
28
69.2
90.4%28.8%88.5%55 t/s
29
Qwen3.5 397B-A17B
Alibaba · ओपन
68.3
88.4%28.7%87.8%71 t/s
30
68.1
92.6%43.6%55 t/s
31
67.5
89.8%45.1%208 t/s
32
67.4
92.9%41.8%127 t/s
33
67.0
90.4%43.5%120 t/s
34
Nemotron 3 Ultra 550B
NVIDIA · ओपन
66.8
87%26.6%86.8%142 t/s
35
66.7
93%40.3%59 t/s
36
66.6
92.2%41%267 t/s
37
GPT-5.4
OpenAI
66.3
92.8%39.8%60 t/s
38
65.7
91.5%39.9%118 t/s
39
65.6
92.8%38.3%233 t/s
40
MiniMax M3
MiniMax
65.0
92.9%37.1%93 t/s
41
64.8
92.3%37.2%175 t/s
42
GPT-5.2
OpenAI
63.5
92.4%34.5%90 t/s
43
Kimi K2.6
Moonshot AI · ओपन
63.5
90.5%36.4%40 t/s
44
Kimi K2.7 Code
Moonshot AI · ओपन
61.2
89.6%32.8%39 t/s
45
61.0
90.4%31.6%69 t/s
46
MiMo V2.5 Pro
Xiaomi · ओपन
60.2
86.6%33.8%65 t/s
47
Inkling
Thinking Machines
58.5
87.2%29.7%81 t/s
48
48.9
80%17.8%96 t/s
Podium Score पाँच लीडरबोर्ड का भारित मिश्रण है। अधिक जानें कार्यप्रणाली में।