独立客观的
大模型综合评估
全面掌握前沿 AI 发展格局,为您的业务场景精准选择最优的基础大模型、计费层级与多云推理提供商。
核心亮点
综合智能水平
Podium 复合质量指数 · 越高越好
输出吞吐速度
每秒输出 Token 数 · 越高越好
每百万 Token 价格
混合定价 (3:1) · 越低越优
01 · Real-Time Rankings
综合排名TOP模型
综合 Podium 评分 Top 10 模型
查看全部 →| # | 模型名称 | Podium 得分 |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Claude Fable 5.1 Anthropic · Proprietary | 88.4 |
| 4 | GPT-6 Astra OpenAI · Proprietary | 86.2 |
| 5 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 6 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 7 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 8 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 9 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 10 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
按场景分类榜首
编程
仓库级软件工程:SWE-Bench、LiveCodeBench、SciCode、Terminal-Bench、HumanEval。
榜首模型: Claude Fable 5.1
数学
从竞赛数学到前沿问题:AIME、MATH、FrontierMath。
榜首模型: Claude Mythos Preview
推理
深度推理与科学:GPQA Diamond、HLE、ARC-AGI-2。
榜首模型: Claude Mythos Preview
智能体
自主工具使用与计算机操作:OSWorld、Toolathlon、MCP Atlas、τ²-Bench。
榜首模型: Kimi K3
知识
事实知识与抗幻觉:SimpleQA、MMLU-Pro、MMMLU。
榜首模型: Claude Mythos Preview
多模态
视觉与文档理解:MMMU、CharXiv、ScreenSpot-Pro。
榜首模型: Claude Mythos Preview
03 · Research & Analysis
最新技术深度文章
04 · FAQ
常见问题解答
每个模型都会获得一个Podium Score综合得分(0–100):由四项数据加权计算得到——35%盲测竞技场Elo得分、30%基准测试均分、20% Artificial Analysis智商指数以及15% LLM Stats综合分。
Claude Mythos Preview以97.4的高分荣登榜首,Claude Fable 5(93.4分)和Claude Fable 5.1(88.4分)紧随其后。
我们精选收录了700个旗舰模型,涵盖18大核心场景,并提供726个模型的完整竞技场数据。
数据均来自5个公开权威榜单:Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase。系统每周自动同步最新数据。