🧠 Reasoning · llm-stats.com

Humanity’s Last Exam

Thousands of expert-written questions across dozens of fields, the hardest closed-ended academic benchmark in wide use.

40
测试模型数
Claude Mythos Preview
最佳模型
64.7%
最高分
Anthropic
提供商
#模型名称Humanity’s Last Exam提供商Podium 综合得分
1
64.7%
Anthropic97.4
2
58.4%
Meta47.0
3
57.9%
Anthropic76.0
4
Kimi K3
Moonshot AI
56%
Moonshot AI83.3
5
54.7%
Z.ai59.1
6
54.7%
Anthropic52.0
7
53.3%
Anthropic93.4
8
53.1%
Anthropic61.2
9
Claude Opus 5
Anthropic
52.6%
Anthropic81.4
10
GPT-5.5
OpenAI
52.2%
OpenAI54.0
11
51.4%
Google60.6
12
50.7%
xAI54.5
13
49%
Anthropic38.1
14
48.2%
DeepSeek46.0
15
47.2%
OpenAI80.8
16
45.8%
Google51.9
17
45.1%
Meta69.9
18
45.1%
DeepSeek42.0
19
43.6%
Alibaba79.8
20
43.5%
Google42.4
21
41.8%
OpenAI66.4
22
41.4%
Alibaba51.0
23
41%
Google50.0
24
40.3%
xAI61.3
25
39.9%
OpenAI52.4
26
GPT-5.4
OpenAI
39.8%
OpenAI51.0
27
38.3%
Google65.9
28
37.2%
OpenAI49.1
29
MiniMax M3
MiniMax
37.1%
MiniMax39.6
30
Kimi K2.6
Moonshot AI
36.4%
Moonshot AI49.0
31
34.7%
Alibaba42.2
32
GPT-5.2
OpenAI
34.5%
OpenAI49.2
33
33.8%
Xiaomi48.0
34
Kimi K2.7 Code
Moonshot AI
32.8%
Moonshot AI41.8
35
31.6%
Tencent38.9
36
Inkling
Thinking Machines
29.7%
Thinking Machines31.7
37
28.8%
Alibaba32.4
38
28.7%
Alibaba23.9
39
26.6%
NVIDIA19.0
40
17.8%
Anthropic45.4
基准数据聚合自 llm-stats.com。详见方法论