中立で厳格な
AIモデル徹底分析
最新フロンティアAIモデルを多角的に比較。ユースケースに最適な基盤モデル、価格プラン、推論プロバイダーを見極められます。
主要指標
総合知能スコア
Podium複合品質インデックス · 高いほど優秀
生成速度
秒間トークン出力数 · 高いほど高速
100万トークンあたり価格
複合プライシング (3:1) · 低いほど安価
01 · Real-Time Rankings
トップランキングモデル
Podium総合スコア Top 10 モデル
すべて見る →| # | モデル | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Claude Fable 5.1 Anthropic · Proprietary | 88.4 |
| 4 | GPT-6 Astra OpenAI · Proprietary | 86.2 |
| 5 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 6 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 7 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 8 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 9 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 10 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
用途別ベストモデル
コーディング
リポジトリ規模のコーディング:SWE-Bench、LiveCodeBench、SciCode、Terminal-Bench、HumanEval。
首位: Claude Fable 5.1
数学
競技数学から最前線まで:AIME、MATH、FrontierMath。
首位: Claude Mythos Preview
推論
深い推論と科学:GPQA Diamond、HLE、ARC-AGI-2。
首位: Claude Mythos Preview
エージェント
自律的なツール使用:OSWorld、Toolathlon、MCP Atlas、τ²-Bench。
首位: Kimi K3
知識
事実知識と幻覚耐性:SimpleQA、MMLU-Pro、MMMLU。
首位: Claude Mythos Preview
マルチモーダル
画像・文書理解:MMMU、CharXiv、ScreenSpot-Pro。
首位: Claude Mythos Preview
03 · Research & Analysis
最新記事
04 · FAQ
よくある質問
各モデルはPodium Score(0〜100)を受け取ります。これは、直接対決のアリーナElo(35%)、ベンチマーク平均(30%)、Artificial Analysis知能指数(20%)、LLM Statsスコア(15%)を組み合わせた加重平均です。
Claude Mythos Previewがスコア97.4で首位です。次いでClaude Fable 5(93.4)、Claude Fable 5.1(88.4)が続いています。
700の主力モデルを18のカテゴリーで追跡し、726モデルのアリーナテーブルを網羅しています。
5つの公開リーダーボード(Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase)から毎週データを更新・同期しています。