追踪实验室
OpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaiduOpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaidu
01 · Real-Time Rankings

综合排名TOP模型

查看全部 →

综合 Podium 评分 Top 10 模型

查看全部 →
#模型名称Podium 得分竞技场 Elo代码能力生成速度输出价格
01
Claude Mythos Preview
Anthropic · Proprietary
97.4
80.980 t/s$15/M
02
Claude Fable 5
Anthropic · Proprietary
93.4
150984.171 t/s$50/M
03
Claude Fable 5.1
Anthropic · Proprietary
88.4
95.585 t/s$15/M
4
GPT-6 Astra
OpenAI · Proprietary
86.2
149867.282 t/s$50/M
5
Kimi K3
Moonshot AI · Open Weights
83.3
148561.537 t/s$15/M
6
Claude Opus 5
Anthropic · Proprietary
81.4
149270.460 t/s$25/M
7
GPT-5.6 Sol
OpenAI · Proprietary
80.8
148364.872 t/s$30/M
8
Qwen3.8 Max
Alibaba · Proprietary
79.8
149650.355 t/s$2/M
9
Claude Opus 4.8
Anthropic · Proprietary
76.0
148458.050 t/s$15/M
10
Claude Opus 4 6 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
02 · Evaluation Domains

按场景分类榜首

查看全部 →
03 · Research & Analysis

最新技术深度文章

浏览所有文章

开放式 AI 情报平台

为你的工作流找到完美模型

数秒内对比 700 个已收录模型的准确率、token 单价、延迟与真实智能体表现。

04 · FAQ

常见问题解答

查看所有FAQ
每个模型都会获得一个Podium Score综合得分(0–100):由四项数据加权计算得到——35%盲测竞技场Elo得分、30%基准测试均分、20% Artificial Analysis智商指数以及15% LLM Stats综合分。
Claude Mythos Preview以97.4的高分荣登榜首,Claude Fable 5(93.4分)和Claude Fable 5.1(88.4分)紧随其后。
我们精选收录了700个旗舰模型,涵盖18大核心场景,并提供726个模型的完整竞技场数据。
数据均来自5个公开权威榜单:Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase。系统每周自动同步最新数据。
0 / 4