Leaderboard

Long Context Rankings

Retrieval and reasoning over very long inputs: MRCR v2 combined with raw context window size.

82 models
#ModelPodium ScoreMRCR v2Speed
01
GPT-6 Astra
OpenAI · reasoning
100.0
93%82 t/s
02
100.0
91.5%72 t/s
03
GPT-5.4
OpenAI
100.0
60 t/s
4
Claude Fable 5
Anthropic · reasoning
99.2
71 t/s
5
Kimi K3
Moonshot AI · Open · reasoning
99.2
37 t/s
6
Claude Opus 5
Anthropic
99.2
60 t/s
7
99.2
55 t/s
8
99.2
50 t/s
9
99.2
208 t/s
10
99.2
233 t/s
11
99.2
80 t/s
12
99.2
203 t/s
13
99.2
267 t/s
14
MiMo V2.5 Pro
Xiaomi · Open
99.2
65 t/s
15
DeepSeek V4 Pro
DeepSeek · Open
99.2
66 t/s
16
99.2
96 t/s
17
99.2
54 t/s
18
DeepSeek V4 Flash
DeepSeek · Open
99.2
113 t/s
19
99.2
389 t/s
20
99.2
50 t/s
21
99.2
55 t/s
22
98.4
89.6%127 t/s
23
DeepSeek V4.1 Flash
DeepSeek · Open · reasoning
98.0
214 t/s
24
Agnes 3.0 Flash
Agnes · reasoning
95.0
235 t/s
25
Inkling Small
Thinking Machines
93.6
130 t/s
26
MiniMax M3
MiniMax
93.6
93 t/s
27
Inkling
Thinking Machines
93.6
81 t/s
28
Nemotron 3 Ultra 550B
NVIDIA · Open
93.4
142 t/s
29
93.2
59 t/s
30
93.2
129 t/s
31
91.2
118 t/s
32
GPT-5.1
OpenAI
91.2
60 t/s
33
GPT-5
OpenAI
91.2
60 t/s
34
90.0
120 t/s
35
GLM-5.3
Zhipu AI
90.0
90 t/s
36
LongCat 2.0
LongCat · Open
90.0
42 t/s
37
GLM-5.3 Flash
Z.ai · Open
88.0
182 t/s
38
GLM-5.2
Z.ai · Open
87.5
164 t/s
39
Kimi K2.6
Moonshot AI · Open
87.5
40 t/s
40
Nex N2 Pro
Nex AGI
87.5
138 t/s
41
Kimi K2.7 Code
Moonshot AI · Open
87.5
39 t/s
42
87.5
69 t/s
43
Gemma 4 31B
Google · Open
87.5
35 t/s
44
Qwen3.5 397B-A17B
Alibaba · Open
87.5
71 t/s
45
Qwen3.5 122B-A10B
Alibaba · Open
87.5
126 t/s
46
Qwen3 Max
Alibaba · Open
87.5
85 t/s
47
86.3
76%50 t/s
48
Qwen3.8 Flash Next
Alibaba · Open
86.0
168 t/s
49
85.2
50 t/s
50
85.2
80 t/s
51
o3
OpenAI · reasoning
85.2
90 t/s
52
85.2
80 t/s
53
GPT-5.5
OpenAI
84.9
74%60 t/s
54
DeepSeek V3.2
DeepSeek · Open
83.5
60 t/s
55
DeepSeek R1
DeepSeek · Open · reasoning
83.5
60 t/s
56
GPT-5.2
OpenAI
81.3
90 t/s
57
75.0
59 t/s
58
75.0
59 t/s
59
75.0
62 t/s
60
75.0
103 t/s
61
Qwen3.8 27B (xhigh)
Alibaba · Open
75.0
53 t/s
62
Qwen3.8 27B (low)
Alibaba · Open
75.0
64 t/s
63
Qwen3.8 27B (medium)
Alibaba · Open
75.0
62 t/s
64
Qwen3.8 27B (Non-reasoning)
Alibaba · Open · reasoning
75.0
62 t/s
65
70.0
78 t/s
66
68.0
115 t/s
67
65.0
148 t/s
68
62.0
65 t/s
69
56.6
41.3%175 t/s
70
G9v3-39A5B
AI9Stars · Open
50.0
60 t/s
71
G9v3-3B
AI9Stars · Open
50.0
60 t/s
72
HyperNova 60B
Multiverse · Open
50.0
367 t/s
73
LFM2.5-2.6B
Liquid AI · Open
50.0
60 t/s
74
LFM2.5-8B-A1B
Liquid AI · Open
50.0
338 t/s
75
LFM2.5-VL-1.6B
Liquid AI · Open
50.0
395 t/s
76
Magistral Small 1.2
Mistral · Open
50.0
60 t/s
77
43.3
26.3%136 t/s
78
43.3
26.3%120 t/s
79
39.7
22.1%120 t/s
80
Seed 2.0 Pro
ByteDance
13.8
40 t/s
81
11.0
60 t/s
82
0.0
80 t/s
Podium Score is a weighted blend of five leaderboards. See Methodology for details.
0 / 4