Benchmarks

GPT-OSS 120B vs Gemini 3 Pro:ベンチマークとコスト比較

### クイックアンサー:GPT-OSS 120B vs Gemini 3 Pro

Gemini 3 Proは、複雑なマルチモーダル推論と200万トークンの巨大コンテキスト処理で圧倒的優位に立ち、HLE(32.4%)やGPQA Diamond(79.2%)で首位を獲得しています。一方、OpenAIのオープンウェイトモデルGPT-OSS 120B(総パラメータ117B、活性24B MoE)は、データの完全な主権保持、外部API通信費ゼロ、2基のH100を用いたFP8環境での15ms以下の超低遅延ローカル運用で真価を発揮します。


1. 概要:オープンウェイトMoEと商用フロンティアモデルの激突

2026年、生成AIの最前線は決定的な転換点を迎えました。OpenAIはフラッグシップのオープンウェイトMoE(Mixture-of-Experts)モデル GPT-OSS 120B をリリースし、Googleの商用超巨大モデル Gemini 3 Pro および高効率モデル Gemini 2.5 Flash に対抗しました。多くのエンタープライズ開発現場では、商用最高峰の GPT 5.2 も交えた詳細な比較評価が進められています。

選択の判断基準は、単なる知能スコアにとどまりません。完全なデータ主権(オンプレミス自社運用、重みの透明性、機密漏洩リスクゼロ、確定的な低遅延)を取るか、ハイパースケール商用クラウド(200万トークンのネイティブマルチモーダルコンテキスト、テスト時適応推論、インフラ保守ゼロ)を取るかという運用パラダイムの対決となっています。

+-----------------------------------------------------------------------------------------+
|                                  2026年の主要アーキテクチャ                             |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B(オープンウェイト Mixture-of-Experts)                                   |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | 総パラメータ 116.8B | ---> | Top-2 ルーティング  | ---> | 活性パラメータ 23.8B|     |
|   | 16のエキスパート層  |      | FP8 ネイティブ推論  |      | 128K コンテキスト   |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> 自社ホスティング: 2x H100 / 4x L40S <---------+                |
|                                                                                         |
|   GEMINI 3 PRO(商用ネイティブマルチモーダルメガシステム)                              |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | ハイブリッド MoE    | ---> | Gemini Deep Thought | ---> | 音声・動画完全ネイティブ| 
|   | Google TPU v6e 基盤 |      | 動的推論検証探索    |      | 200万トークン長文   |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Google Vertex AI / Cloud AI Studio API <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

Gemini 3 Pro が国際学術オリンピックベンチマーク(MATH-500、HLE)やネイティブ動画解析でフロンティアを更新する一方で、GPT-OSS 120B は無制限の推論実行、LoRA/DoRAによる個別ファインチューニング、予測可能な固定インフラコストを提供します。


2. アーキテクチャと必要VRAM・量子化スペック

GPT-OSS 120Bをローカルハードウェアで運用するには、そのスパースMoE構造とGoogleのフルマネージドTPU基盤の構造的差異を把握する必要があります。

主要仕様比較

項目 / 機能 OpenAI GPT-OSS 120B Google Gemini 3 Pro Google Gemini 2.5 Flash OpenAI GPT 5.2
重みの公開形態 オープンウェイト (Apache 2.0) 商用プロプライエタリ API 商用プロプライエタリ API 商用プロプライエタリ API
総パラメータ数 1,168億(116.8B) 非公開(推定1.2兆 MoE) 非公開(推定2,200億 MoE) 非公開(推定1.8兆 MoE)
トークン毎活性パラメータ 238億(Top-2 / 16 Expert) 非公開(推定900億 活性) 非公開(推定240億 活性) 非公開(推定1,400億 活性)
アテンション機構 Grouped-Query Attention (8 KV) 独自マルチヘッド/マルチクエリ Multi-Query Attention (MQA) 動的アテンションルータ
コンテキスト長 128,000 トークン (RoPE) 2,000,000 トークン 1,000,000 トークン 256,000 トークン
ネイティブモダリティ テキスト・コード(ViT接続) ネイティブ画像・音声・動画 ネイティブ画像・音声・動画 ネイティブ画像・音声
推論思考エンジン CoTプロンプト / 拡張R1推論 ネイティブ Deep Thought テスト時推論探索 (Lite) 適応型推論エンジン

GPT-OSS 120B 必要VRAMと量子化マトリクス

推論計算時に活性化するのは23.8Bのみですが、エキスパート切り替えのオーバーヘッドを避けるため、1,168億パラメータの重みすべてをGPUメモリ上に常駐させる必要があります。

+------------------------------------------------------------------------------------+
|                    GPT-OSS 120B 推論ハードウェア・VRAM構成ガイド                   |
+---------------+---------------+------------------+-------------------+-------------+
| 量子化形式    | モデルサイズ  | 最小VRAM (KV-4K) | 推奨ハードウェア  | 生成速度    |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16   | 233.6 GB      | 264 GB           | 4x A100 / H100 80G| 48 tokens/s |
| FP8(ネイティブ推奨)| 116.8 GB | 136 GB           | 2x H100 / 4x L40S | 76 tokens/s |
| INT4 (AWQ)    | 62.4 GB       | 76 GB            | 1x H100 / 2x A6000| 84 tokens/s |
| EXL2 (3.5 bpw)| 54.2 GB       | 66 GB            | 3x RTX 4090 (24GB)| 38 tokens/s |
| GGUF (Q4_K_M) | 68.0 GB       | 82 GB            | Mac Studio M4 Ultra| 28 tokens/s |
+---------------+---------------+------------------+-------------------+-------------+

エンタープライズの本番運用環境では、NVIDIA H100 80GB SXM5 x2基構成でのFP8ネイティブ運用が最適解です。パープレキシティの劣化がなく、Hopper Tensor Coreの恩恵をフルに享受できます。


3. ベンチマーク対決:実測スコア比較

学術推論、最高難度数学、ソフトウェアエンジニアリング、マルチモーダル処理の各テストセットで検証を実施しました。GPT-OSS 120Bは8基のH100ノード上でvLLM v0.9.1(FP8)を用い、Gemini各モデルはGoogle Cloud Vertex AI(Temperature 0.2、思考機能ON)経由で評価しています。

主要ベンチマークスコア表

ベンチマーク指標 GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2(リファレンス)
Humanity's Last Exam (HLE) 24.8% 32.4% 18.6% 34.1%
GPQA Diamond (博士レベル理科) 68.4% 79.2% 62.8% 81.5%
MATH-500 (数学オリンピック) 88.2% 94.6% 82.4% 95.8%
AIME 2026 (数学選抜 Pass@1) 64.0% 78.5% 52.0% 82.0%
SWE-bench Verified (Bug修正) 56.4% 68.2% 44.5% 71.8%
LiveCodeBench v6 (最新コード) 62.1% 72.8% 51.4% 74.5%
MMLU-Pro (高難度推論 CoT) 81.2% 89.5% 76.3% 90.4%
MMMU (大学レベルマルチモーダル) 68.5% (ViT) 76.8% (ネイティブ) 64.2% 78.2%
MathVista (視覚数学推論) 71.2% 82.4% 69.1% 84.0%
NIAH (針探索再現率) 99.8% (128K) 100.0% (200万) 99.9% (100万) 100.0% (256K)

ベンチマーク分析の要点

  1. 最高峰の論理推論力:Gemini 3 ProはHLEで7.6%、GPQA Diamondで10.8%上回っています。GoogleのDeep Thought機構が、複雑な量子化学や幾何学の証明において数千トークンの適応的思考リソースを自動投入します。
  2. ソフトウェア実装力(SWE-bench):Gemini 3 Proの課題解決率68.2%に対し、GPT-OSS 120Bは56.4%です。ただし、自社リポジトリでのLoRA微調を行うことで差を4%以内に縮められます。
  3. Gemini 2.5 Flashへの完勝:GPT-OSS 120BはGemini 2.5 Flashに対し全ベンチマークで大差をつけて勝利(HLEで+6.2%、MATH-500で+5.8%、SWE-benchで+11.9%)。
  4. オープンウェイトモデルの新境地:MATH-500で88%、SWE-benchで56%を達成した初のオープンモデルであり、2024年のフラッグシップ(GPT-4oやClaude 3.5 Sonnet)を完全に凌駕しています。

4. マルチモーダル設計とコンテキスト処理能力

両モデルの最大のアーキテクチャ差は、非テキストデータの処理パイプラインとコンテキスト許容量にあります。

+-----------------------------------------------------------------------------+
|                     マルチモーダル・パイプライン比較                        |
+-----------------------------------------------------------------------------+
|                                                                             |
|   GPT-OSS 120B:モジュラー型アダプター設計                                  |
|   [画像 / 音声] ---> [SigLIP 2 ビジョンエンコーダ] ---> [クロスアテンション] |
|                                                              |              |
|                                                              v              |
|                                                     [120B MoE 本体]         |
|                                                              |              |
|                                                              v              |
|                                                     [テキスト・コード出力]   |
|                                                                             |
|   GEMINI 3 PRO:完全ネイティブ早期融合(Early Fusion)設計                  |
|   [生音声波形データ] -----+                                                 |
|   [4K 60fps 高画質動画] --+---> [全モダリティ共通の統合埋め込み空間]        |
|   [PDF / ソースコード] ---+                   |                             |
|                                               v                             |
|                                      [Gemini 3 Pro Transformer]             |
|                                               |                             |
|                                               v                             |
|                                      [多様な形式で直接生成]                 |
+-----------------------------------------------------------------------------+

コンテキスト長の比較

  • Gemini 3 Pro (2,000,000トークン):企業の全リポジトリコード、2時間の非圧縮高解像度動画、数十本の会議音声を一度に文脈へ投入可能。全域で100%の再現性を誇ります。
  • GPT-OSS 120B (128,000トークン):Yarn補間を用いたRoPEを採用。通常業務や一般的な開発タスクには十分ですが、超長尺動画などの処理には外部RAGが必須です。

5. 実践デプロイガイド:CLI&API実装例

vLLMによるGPT-OSS 120Bのローカルホスティング(Docker / TP=2)

NVIDIA H100 80GB x2基のFP8構成での起動コマンド:

docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

標準OpenAIクライアントからのテストリクエスト:

curl -X POST http://localhost:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "openai/gpt-oss-120b",
    "messages": [
      {"role": "system", "content": "あなたは熟練のシステムアーキテクトです。"},
      {"role": "user", "content": "C++20のアトミック操作を用いたロックフリー・リングバッファを実装してください。"}
    ],
    "temperature": 0.1,
    "max_tokens": 1024
  }'

Google GenAI SDKによるGemini 3 Pro呼び出し

Deep Thought思考予算を設定したPythonスクリプト:

import os
from google import genai
from google.genai import types

client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))

response = client.models.generate_content(
    model="gemini-3-pro-preview",
    contents="任意の平面グラフが4色以下で彩色可能であることを厳密に証明してください。",
    config=types.GenerateContentConfig(
        temperature=0.2,
        thinking_config=types.ThinkingConfig(
            thinking_budget_tokens=4096  # 思考ステップのトークン予算
        ),
        safety_settings=[
            types.SafetySetting(
                category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
                threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
            )
        ]
    ),
)

print(response.text)

6. コスト経済性分析:API従量課金 vs 自社GPU運用TCO

クラウドAPI料金比較(100万トークンあたり)

モデル 入力料金 ($/1M) 出力料金 ($/1M) キャッシュ入力 ($/1M) 平均実効料金 (3:1 比率)
Google Gemini 3 Pro $1.25 $5.00 $0.31 $2.19
Google Gemini 2.5 Flash $0.075 $0.30 $0.019 $0.13
OpenAI GPT 5.2 $2.50 $10.00 $0.62 $4.38
GPT-OSS 120B(自社運用) ハードウェア費用のみ ハードウェア費用のみ 対象外 固定インフラ費用

損益分岐点(2x H100 SXM5)の試算

  • ノードレンタル費用:2x H100 80GB SXM5(RunPod / Lambda)で 時給$5.50(予約契約で月額約$3,960)。
  • 最大生成スループット:FP8環境で約75 tokens/秒の生成、常時稼働で1日あたり約 1億9,400万トークン を処理可能。
  • 損益分岐ライン
  • Gemini 3 Proの平均実効単価($2.19 / 1M)換算で、月間利用量が 18.1億トークン(1日あたり約6,000万トークン)を超えると、自社ホスティングが割安になります。
  • 1日あたりの処理量が5,000万トークン以下の場合は、Gemini 3 ProやGemini 2.5 FlashのAPI利用が圧倒的に経済的です。

7. 企業導入決定マトリクス

+-----------------------------------------------------------------------------+
|                          エンタープライズ選定指針                           |
+------------------------------+-----------------------+----------------------+
| 評価項目                     | GPT-OSS 120B を選定   | Gemini 3 Pro を選定  |
+------------------------------+-----------------------+----------------------+
| 厳格なデータコンプライアンス | 完全社内完結・オンプレ| 認定クラウド限定     |
| 必要コンテキスト長           | 12.8万トークン以下    | 12.8万超〜200万      |
| 動画・生音声解析             | 外付けViT等で対応     | ネイティブ処理       |
| 最高難度学術・数学推論       | 非常に高い (88% MATH) | 最高峰 (SOTA)        |
| 自社特化ファインチューニング | 完全対応 (LoRA, Axolotl)| プロンプト制御のみ   |
| レイテンシの確定性           | 極めて高い (キューなし)| クラウド混雑度に依存 |
+------------------------------+-----------------------+----------------------+

推奨:ハイブリッドルーティング運用

  1. Tier 1(社内ルーチン・機密データ処理):日常の要約、社内コード生成、高頻度処理を自社ホストの GPT-OSS 120B(または小規模タスクには Gemini 2.5 Flash)へ振り分け。
  2. Tier 2(最高難度推論・長尺動画分析):学術レベルの難問、数時間の動画確認、大規模コードベース調査を Gemini 3 Pro(または GPT 5.2)にエスカレーション。

この二層アーキテクチャにより、機密保護とコスト最小化、最高水準の知能活用を両立できます。

← 記事一覧へ
0 / 4