Benchmarks

2026年最安・最速のLLM APIプロバイダー:Groq vs Cerebras vs DeepInfra

クイックアンサー:2026年において、CerebrasはLlama 3.3 70Bで450〜920 tok/sを記録する最速のLLM APIです。一方、Groqは150ms未満のTTFTと280〜315 tok/sの安定した速度を誇ります。コスト面ではDeepInfraが100万トークンあたり$0.14/$0.28でDeepSeek V3を提供する最安のLLM APIプロバイダーです。高い信頼性にはFireworksOpenRouterが最適です。

1. はじめに:2026年におけるLLM推論の経済的変革

2026年、生成AI推論のユニットエコノミクスは劇的に進化しました。従来のGPUクラウドによる独占から、2つの新たなハードウェアパラダイムが台頭しています。

  1. 超高速SRAM搭載ASICアーキテクチャ: Cerebras(ウェエハースケールエンジンWSE-3)やGroq(言語処理ユニットLPU)は、チップ上の大容量SRAMに重みを配置することで、従来のフォン・ノイマン型ボトルネックやHBM帯域幅の制約を完全に排除しました。これにより、毎秒250〜900+トークン(tok/s)という圧倒的なリアルタイム推論を実現しています。
  2. 極限まで低価格化されたGPUフリート(vLLM / TensorRT-LLM): DeepInfraTogether AIFireworks AIは、Nvidia H100 SXM5、H200、Blackwell B200の大規模クラスタを展開しています。Continuous Batching、FlashAttention-3、投機的デコーディング、プレフィックスキャッシュの徹底的な最適化により、100万トークンあたりのコストを劇的に引き下げました。
  3. スマートルーティング・冗長化ゲートウェイ: OpenRouterなどのアグリゲーターは、世界40以上のデータセンターにリクエストを分散し、レートリミットや障害発生時に自動フェイルオーバーを提供します。

音声AIエージェントに必要な超低遅延(TTFT < 200ms)から、大規模RAGインデックスに必要な低コスト化まで、最適なプロバイダー選定には正確なベンチマークが不可欠です。

LLMPodiumチームは、GroqCerebrasDeepInfraTogether AIFireworks AIOpenRouterの6大プロバイダーを対象に、Meta Llama 3.3 70B InstructDeepSeek V3 (671B MoE)Alibaba Qwen 2.5 72B Instructを用いた包括的検証を実施しました。


2. 総合ベンチマーク比較マトリクス:速度・レイテンシ・コスト

テストは各プロバイダーに対して50並行接続で10,000リクエストを送信し、AWS us-east-1からServer-Sent Events(SSE)ストリーミングで計測しました。

+-----------------------------------------------------------------------------------------------------------------------------------------+
|                                    2026年 LLM APIプロバイダー総合ベンチマーク(LLAMA 3.3 70B & DEEPSEEK V3)                            |
+------------------+-------------------+-----------------+--------------------+--------------------+--------------------+-------------+
| プロバイダー     | ハードウェア基盤  | TTFT (P50/P95)  | 出力TPS (70B)      | 入力 $/1M トークン | 出力 $/1M トークン | 稼働率 SLA  |
+------------------+-------------------+-----------------+--------------------+--------------------+--------------------+-------------+
| Cerebras         | WSE-3 (ウェハー)  | 112ms / 185ms   | 485 - 920 tok/s    | $0.60              | $0.60              | 99.9%       |
| Groq             | LPU (カスタムTSP) | 138ms / 215ms   | 280 - 315 tok/s    | $0.59              | $0.79              | 99.9%       |
| Fireworks AI     | FireAttention H100| 185ms / 310ms   | 135 - 165 tok/s    | $0.90              | $0.90              | 99.95%      |
| Together AI      | TurboEngine H100  | 210ms / 340ms   | 115 - 145 tok/s    | $0.88              | $0.88              | 99.9%       |
| DeepInfra        | vLLM / H100 SXM5  | 310ms / 540ms   | 68 - 88 tok/s      | $0.23              | $0.40              | 99.8%       |
| OpenRouter (Auto)| マルチプロバイダー| 245ms / 520ms   | 75 - 320 tok/s     | $0.23 - $0.90      | $0.40 - $0.90      | 99.99%*     |
+------------------+-------------------+-----------------+--------------------+--------------------+--------------------+-------------+

\OpenRouterの仮想稼働率はマルチクラウド間の自動フェイルオーバーによって達成されています。*

主なベンチマーク結果:

  • 生成速度の絶対王者: CerebrasはLlama 3.3 70Bで485〜920 tok/sを記録し、世界最速のLLM APIです。Llama 3.1 8Bでは2,100 tok/sを超えます。
  • 最短の初回トークン時間(TTFT): Cerebras(112ms)に続き、Groq(138ms)が高速です。両ASICは標準的なGPUクラスタよりも40〜65%高速にプロンプトを処理します。
  • 圧倒的低価格: DeepInfraはLlama 3.3 70Bを$0.23 / $0.40、DeepSeek V3を$0.14 / $0.28で提供し、最も安価なLLM APIプロバイダーです。

3. プロバイダー別アーキテクチャ深掘り

+---------------------------------------------------------------------------------------------------+
|                                      推論用ハードウェア構造比較                                    |
+--------------------+-----------------------+-----------------------+------------------------------+
| 項目               | Cerebras WSE-3        | Groq LPU              | Nvidia H100/H200 (DeepInfra) |
+--------------------+-----------------------+-----------------------+------------------------------+
| コア構成           | 900,000 AIコア        | 230コア テンソルTSP   | 16,896 CUDA / 528 Tensor     |
| チップ面積         | 46,225 mm² (全ウェハー| ~725 mm² 単一ダイ     | 814 mm² 単一ダイ             |
| オンチップメモリ   | 44 GB SRAM            | 230 MB SRAM           | 80-141 GB HBM3/HBM3e         |
| メモリ帯域幅       | 21 PB/秒 (ペタバイト) | 80 TB/秒 (テラバイト) | 3.35 - 4.8 TB/秒             |
| インターコネクト   | 2Dメッシュファブリック| リアルタイムC2Cルータ | NVLink 4 (900 GB/s)          |
| 実行パラダイム     | 外部メモリ不使用      | 決定的パイプライン    | フォン・ノイマン型メモリ転送 |
+--------------------+-----------------------+-----------------------+------------------------------+

3.1 Groq:決定的LPUアーキテクチャ

GroqのLPU(Language Processing Unit)は、逐次的な自己回帰テンソル計算に特化しています。GPUのような動的スレッド管理を廃止し、完全に決定論的な実行サイクルを実現しています。

  • Groq API Keyの取得: Groq Cloud Consoleから即座にGroq API keyを発行可能で、OpenAI SDK完全準拠です。無料枠は30 RPM / 6,000 TPMが提供されます。

3.2 Cerebras:ウェハースケールの超並列計算

300mmシリコンウェハーを丸ごと1つの巨大チップとして製造:

  • 21 PB/sのメモリ帯域幅: 44GBのSRAMをウェハー全体に配置することで、自己回帰推論の帯域幅ボトルネックを克服し、70Bモデルで800+ tok/sの持続的なスループットを達成します。

3.3 Groq vs Cerebras(直接比較)

+----------------------------------------------------------------------------------------------+
|                                    GROQ VS CEREBRAS 徹底比較                                 |
+--------------------------+---------------------------------+---------------------------------+
| 比較項目                 | Groq LPU                        | Cerebras WSE-3                  |
+--------------------------+---------------------------------+---------------------------------+
| 出力速度 (70B)           | 280 - 315 tok/s                 | 485 - 920 tok/s (1.8〜2.9倍高速)|
| 初回遅延 TTFT (P50)      | 138 ms                          | 112 ms                          |
| 料金 (Llama 3.3 70B)     | 入力$0.59 / 出力$0.79 (1M)      | 入力$0.60 / 出力$0.60 (1M)      |
| コンテキスト長           | 128k トークン                   | 8k - 32k トークン               |
| ツール呼び出し・JSON     | 実用度100% (高精度スキーマ)     | 急速に向上中 (98.2%)            |
| モデルラインナップ       | Llama 3.3, Qwen 2.5, DeepSeek   | Llama 3.3 70B, Llama 3.1 8B     |
+--------------------------+---------------------------------+---------------------------------+

3.4 DeepInfra・Fireworks・Together・OpenRouter

  • DeepInfra: vLLMとH100による最安構成。DeepSeek V3が100万トークンあたり$0.14/$0.28で運用可能。
  • Fireworks AI: FireAttentionによる低遅延と99.95% SLA。構造化JSON出力に強い。
  • Together AI: 安定したGPUクラスタとファインチューニング基盤。
  • OpenRouter: 複数プロバイダー間の自動フェイルオーバーゲートウェイ。

4. モデル別スループット・コスト詳細検証

+-------------------------------------------------------------------------------------------------------------------------+
|                                  3大オープンモデルの実測スループットおよびコスト比較                                    |
+-----------------------+----------------------+--------------------+--------------------+-------------------+------------+
| モデル名              | プロバイダー         | 平均出力TPS        | TTFT (P50)         | 100万トークン合計 | エラー率   |
+-----------------------+----------------------+--------------------+--------------------+-------------------+------------+
| Llama 3.3 70B         | Cerebras             | 620 tok/s          | 112 ms             | $1.20 (合計)      | 0.04%      |
| Llama 3.3 70B         | Groq                 | 295 tok/s          | 138 ms             | $1.38 (合計)      | 0.02%      |
| Llama 3.3 70B         | Fireworks AI         | 148 tok/s          | 185 ms             | $1.80 (合計)      | 0.01%      |
| Llama 3.3 70B         | Together AI          | 126 tok/s          | 210 ms             | $1.76 (合計)      | 0.03%      |
| Llama 3.3 70B         | DeepInfra            | 78 tok/s           | 310 ms             | $0.63 (合計)      | 0.06%      |
+-----------------------+----------------------+--------------------+--------------------+-------------------+------------+
| DeepSeek V3 (671B MoE)| DeepInfra            | 82 tok/s           | 285 ms             | $0.42 (合計)      | 0.05%      |
| DeepSeek V3 (671B MoE)| Fireworks AI         | 115 tok/s          | 220 ms             | $1.80 (合計)      | 0.02%      |
| DeepSeek V3 (671B MoE)| Together AI          | 98 tok/s           | 240 ms             | $2.00 (合計)      | 0.03%      |
| DeepSeek V3 (671B MoE)| OpenRouter (Auto)    | 88 tok/s           | 295 ms             | $0.42 - $1.80     | 0.00%*     |
+-----------------------+----------------------+--------------------+--------------------+-------------------+------------+
| Qwen 2.5 72B Instruct | DeepInfra            | 74 tok/s           | 320 ms             | $0.63 (合計)      | 0.04%      |
| Qwen 2.5 72B Instruct | Fireworks AI         | 138 tok/s          | 195 ms             | $1.80 (合計)      | 0.02%      |
| Qwen 2.5 72B Instruct | Together AI          | 118 tok/s          | 225 ms             | $1.76 (合計)      | 0.03%      |
| Qwen 2.5 72B Instruct | Groq                 | 280 tok/s          | 145 ms             | $1.38 (合計)      | 0.02%      |
+-----------------------+----------------------+--------------------+--------------------+-------------------+------------+

5. 本番環境実装コード

# Groq API Keyの接続確認
export GROQ_API_KEY="gsk_your_groq_api_key_here"

curl -X POST "https://api.groq.com/openai/v1/chat/completions" \
  -H "Authorization: Bearer $GROQ_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama-3.3-70b-versatile",
    "messages": [{"role": "user", "content": "投機的デコーディングを簡潔に説明してください。"}],
    "stream": true
  }' \
  -w "\nTTFT: %{time_starttransfer}s | 合計時間: %{time_total}s\n"
import os
import time
from openai import OpenAI

class ResilientLLMClient:
    def __init__(self):
        self.fast_client = OpenAI(
            base_url="https://api.groq.com/openai/v1",
            api_key=os.environ.get("GROQ_API_KEY")
        )
        self.cheap_client = OpenAI(
            base_url="https://api.deepinfra.com/v1/openai",
            api_key=os.environ.get("DEEPINFRA_TOKEN")
        )

    def generate(self, prompt: str, prioritize_speed: bool = True) -> str:
        if prioritize_speed:
            try:
                start = time.perf_counter()
                res = self.fast_client.chat.completions.create(
                    model="llama-3.3-70b-versatile",
                    messages=[{"role": "user", "content": prompt}],
                    max_tokens=800
                )
                print(f"[Groq LPU] 所要時間: {time.perf_counter() - start:.3f}秒")
                return res.choices[0].message.content
            except Exception as e:
                print(f"[Groq 障害検知] DeepInfraへ自動切替: {e}")

        start = time.perf_counter()
        res = self.cheap_client.chat.completions.create(
            model="deepseek-ai/DeepSeek-V3",
            messages=[{"role": "user", "content": prompt}],
            max_tokens=800
        )
        print(f"[DeepInfra] 所要時間: {time.perf_counter() - start:.3f}秒")
        return res.choices[0].message.content

6. 月間コスト試算:1億トークンの実運用

入力1億トークン/出力2,500万トークン時の月額費用比較:

  • Claude 3.5 Sonnet: $675.00/月
  • Cerebras (Llama 3.3 70B): $75.00/月(88%削減)
  • Groq (Llama 3.3 70B): $78.75/月(88%削減)
  • DeepInfra (DeepSeek V3): $21.00/月(97%削減)

7. まとめと選定基準

  1. リアルタイム音声・チャット: 圧倒的出力速度ならCerebras、長文コンテキストやツール呼び出しならGroq
  2. バッチ処理・大規模RAG: コストパフォーマンス最高のDeepInfra(DeepSeek V3)。
  3. エンタープライズ高可用性: Fireworks AIまたはOpenRouterの自動フェイルオーバー構成を推奨。
← 記事一覧へ
0 / 4