ランキング

2026年最速のLLM:出力スピードとレイテンシを比較

速度はユーザーが毎日体感するベンチマークであり、2026年のばらつきは巨大です:トップの389トークン/秒から、大型推論モデルの一桁まで。私たちの速度ランキングから現状をお伝えします。

今最も速いモデル

  1. Gemini 3.5 Flash-Lite — 389 t/s
  2. Gemini 3.5 Flash — 267 t/s
  3. Gemini 3.6 Flash — 233 t/s
  4. Muse Spark 1.1(Meta)— 208 t/s
  5. Qwen3.7 Max — 203 t/s

GoogleのFlashファミリーがポディウムを独占。MetaのMuse Spark 1.1にも注目:208 t/s・出力$4.25/Mで、追跡中で最高の速度対ドルオプションの一つです。

速度と知能のトレードオフ

最速モデルが最も賢いわけではありません:Flash-Liteは素の能力をスループットに振り替えています。2026年の実践パターンはルーティング — 下書きやツール呼び出しは高速モデル、難しい5%はClaude Mythos Previewのようなフロンティアモデルへ。私たちの比較ツールは速度とPodium Scoreを並べて表示します。

チャットにはレイテンシ(TTFT)が効く

体感の応答性は最初のトークンまでの時間に支配されます。チャット製品では、200 t/s・TTFT 150msのモデルが、389 t/sでもコールドスタート2秒のモデルより速く感じます — 必ず両方の数値を。各モデルのプロフィールに表示されています(例:Claude Fable 5:71 t/s、TTFT 141ms)。

結論

純粋なスループットならGemini Flash-Lite、速度と品質のバランスならMuse Spark 1.1かQwen3.7 Max。ライブの数値は速度ランキングで。

← 記事一覧へ