模型多维对比

支持最多选择4个模型,进行各项指标的横向对比。

评估指标Claude Mythos PreviewClaude Fable 5Claude Fable 5.1
提供商AnthropicAnthropicAnthropic
开源协议ProprietaryProprietaryProprietary
Podium 综合得分97.493.488.4
综合排名12999
竞技场 Elo1509
智商指数60.0
coding Coding80.984.195.5
math Math100.0
reasoning Reasoning98.881.092.0
agentic Agentic96.2
knowledge Knowledge100.043.358.0
multimodal Multimodal100.062.0
long-context Long Context99.2
speed Speed10.245.0
value Value71.475.0
生成速度80 t/s71 t/s85 t/s
首Token延迟141 ms350 ms
输入价格 ($/M)$3/M$10/M$3/M
输出价格 ($/M)$15/M$50/M$15/M
上下文窗口1000K1000K500K
SWE-Bench Verified93.9%95%
GPQA Diamond94.6%92.6%
Multilingual MMLU92.7%
Browsecomp86.9%
CharXiv Reasoning93.2%
Humanity’s Last Exam64.7%53.3%
SWE-Bench Pro77.8%
SciCode60.2%
LiveCodeBench70%
Ifbench63.5%
τ²-Bench Retail98.5%
Terminal-Bench Hard62.9%
FrontierMath
OSWorld
MMMU-Pro
MRCR v2
MCP Atlas
Toolathlon
Apex Agents
ScreenSpot-Pro
AIME 2025
ARC-AGI-2
Mmlupro
SimpleQA
MMLU-Pro
Ifeval
MATH
Aime2025
Math500
GpqaDiamond
Mmlu
IntelligencePerDollar
OutputSpeed
ContextWindowSize
ArenaHard
MMMU
HumanEval
0 / 4