LLMリーダーボード

権威ある
LLMランキング

25以上の言語モデルを10のベンチマークで比較。ランキング、価格、速度、推論能力を一箇所で確認。

GPT-4oGPT-4o Minio3o4-miniClaude 3.5 SonnetClaude 3.5 HaikuClaude Opus 4Claude Sonnet 4Gemini 2.5 ProGemini 2.5 FlashGemini 2.0 FlashLlama 3.1 405BLlama 3.1 70BLlama 3.3 70BLlama 4 MaverickMistral LargeMixtral 8x22BDeepSeek V3DeepSeek R1Qwen 2.5 72BQwen 3 235BCommand R+Grok 2Grok 3Phi-4GPT-4oGPT-4o Minio3o4-miniClaude 3.5 SonnetClaude 3.5 HaikuClaude Opus 4Claude Sonnet 4Gemini 2.5 ProGemini 2.5 FlashGemini 2.0 FlashLlama 3.1 405BLlama 3.1 70BLlama 3.3 70BLlama 4 MaverickMistral LargeMixtral 8x22BDeepSeek V3DeepSeek R1Qwen 2.5 72BQwen 3 235BCommand R+Grok 2Grok 3Phi-4
25+
追跡モデル
10
ベンチマーク
25+
プロバイダー
毎週
データ更新

トップモデル

すべて見る →
#モデル総合スコアELOMMLUSWE-Bench速度
1
Claude Opus 4
Anthropic
97.8138592.1%72.5%45 t/s
297.5139892%63.8%85 t/s
3
o3
OpenAI
97.1138091.2%71.7%58 t/s
4
DeepSeek R1
DeepSeek
92.3135890.8%49.2%32 t/s
5
o4-mini
OpenAI
91.5134588.3%68.1%145 t/s
690.3134090.4%62.3%79 t/s
7
GPT-4o
OpenAI
89.2128788.7%38.4%110 t/s
888.8133089.2%55.2%55 t/s
988.4127288.7%49%82 t/s
1087.5132589.5%47.5%120 t/s
カテゴリ

タスクで閲覧

FAQ

よくある質問

すべてのFAQ
すべてのFAQ