### クイックアンサー:GPT-OSS 120B vs Gemini 3 Pro
Gemini 3 Proは、複雑なマルチモーダル推論と200万トークンの巨大コンテキスト処理で圧倒的優位に立ち、HLE(32.4%)やGPQA Diamond(79.2%)で首位を獲得しています。一方、OpenAIのオープンウェイトモデルGPT-OSS 120B(総パラメータ117B、活性24B MoE)は、データの完全な主権保持、外部API通信費ゼロ、2基のH100を用いたFP8環境での15ms以下の超低遅延ローカル運用で真価を発揮します。
1. 概要:オープンウェイトMoEと商用フロンティアモデルの激突
2026年、生成AIの最前線は決定的な転換点を迎えました。OpenAIはフラッグシップのオープンウェイトMoE(Mixture-of-Experts)モデル GPT-OSS 120B をリリースし、Googleの商用超巨大モデル Gemini 3 Pro および高効率モデル Gemini 2.5 Flash に対抗しました。多くのエンタープライズ開発現場では、商用最高峰の GPT 5.2 も交えた詳細な比較評価が進められています。
選択の判断基準は、単なる知能スコアにとどまりません。完全なデータ主権(オンプレミス自社運用、重みの透明性、機密漏洩リスクゼロ、確定的な低遅延)を取るか、ハイパースケール商用クラウド(200万トークンのネイティブマルチモーダルコンテキスト、テスト時適応推論、インフラ保守ゼロ)を取るかという運用パラダイムの対決となっています。
+-----------------------------------------------------------------------------------------+
| 2026年の主要アーキテクチャ |
+-----------------------------------------------------------------------------------------+
| |
| GPT-OSS 120B(オープンウェイト Mixture-of-Experts) |
| +---------------------+ +---------------------+ +---------------------+ |
| | 総パラメータ 116.8B | ---> | Top-2 ルーティング | ---> | 活性パラメータ 23.8B| |
| | 16のエキスパート層 | | FP8 ネイティブ推論 | | 128K コンテキスト | |
| +---------------------+ +---------------------+ +---------------------+ |
| | | |
| +---------> 自社ホスティング: 2x H100 / 4x L40S <---------+ |
| |
| GEMINI 3 PRO(商用ネイティブマルチモーダルメガシステム) |
| +---------------------+ +---------------------+ +---------------------+ |
| | ハイブリッド MoE | ---> | Gemini Deep Thought | ---> | 音声・動画完全ネイティブ|
| | Google TPU v6e 基盤 | | 動的推論検証探索 | | 200万トークン長文 | |
| +---------------------+ +---------------------+ +---------------------+ |
| | | |
| +---------> Google Vertex AI / Cloud AI Studio API <------+ |
| |
+-----------------------------------------------------------------------------------------+
Gemini 3 Pro が国際学術オリンピックベンチマーク(MATH-500、HLE)やネイティブ動画解析でフロンティアを更新する一方で、GPT-OSS 120B は無制限の推論実行、LoRA/DoRAによる個別ファインチューニング、予測可能な固定インフラコストを提供します。
2. アーキテクチャと必要VRAM・量子化スペック
GPT-OSS 120Bをローカルハードウェアで運用するには、そのスパースMoE構造とGoogleのフルマネージドTPU基盤の構造的差異を把握する必要があります。
主要仕様比較
| 項目 / 機能 | OpenAI GPT-OSS 120B | Google Gemini 3 Pro | Google Gemini 2.5 Flash | OpenAI GPT 5.2 |
|---|---|---|---|---|
| 重みの公開形態 | オープンウェイト (Apache 2.0) | 商用プロプライエタリ API | 商用プロプライエタリ API | 商用プロプライエタリ API |
| 総パラメータ数 | 1,168億(116.8B) | 非公開(推定1.2兆 MoE) | 非公開(推定2,200億 MoE) | 非公開(推定1.8兆 MoE) |
| トークン毎活性パラメータ | 238億(Top-2 / 16 Expert) | 非公開(推定900億 活性) | 非公開(推定240億 活性) | 非公開(推定1,400億 活性) |
| アテンション機構 | Grouped-Query Attention (8 KV) | 独自マルチヘッド/マルチクエリ | Multi-Query Attention (MQA) | 動的アテンションルータ |
| コンテキスト長 | 128,000 トークン (RoPE) | 2,000,000 トークン | 1,000,000 トークン | 256,000 トークン |
| ネイティブモダリティ | テキスト・コード(ViT接続) | ネイティブ画像・音声・動画 | ネイティブ画像・音声・動画 | ネイティブ画像・音声 |
| 推論思考エンジン | CoTプロンプト / 拡張R1推論 | ネイティブ Deep Thought | テスト時推論探索 (Lite) | 適応型推論エンジン |
GPT-OSS 120B 必要VRAMと量子化マトリクス
推論計算時に活性化するのは23.8Bのみですが、エキスパート切り替えのオーバーヘッドを避けるため、1,168億パラメータの重みすべてをGPUメモリ上に常駐させる必要があります。
+------------------------------------------------------------------------------------+
| GPT-OSS 120B 推論ハードウェア・VRAM構成ガイド |
+---------------+---------------+------------------+-------------------+-------------+
| 量子化形式 | モデルサイズ | 最小VRAM (KV-4K) | 推奨ハードウェア | 生成速度 |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16 | 233.6 GB | 264 GB | 4x A100 / H100 80G| 48 tokens/s |
| FP8(ネイティブ推奨)| 116.8 GB | 136 GB | 2x H100 / 4x L40S | 76 tokens/s |
| INT4 (AWQ) | 62.4 GB | 76 GB | 1x H100 / 2x A6000| 84 tokens/s |
| EXL2 (3.5 bpw)| 54.2 GB | 66 GB | 3x RTX 4090 (24GB)| 38 tokens/s |
| GGUF (Q4_K_M) | 68.0 GB | 82 GB | Mac Studio M4 Ultra| 28 tokens/s |
+---------------+---------------+------------------+-------------------+-------------+
エンタープライズの本番運用環境では、NVIDIA H100 80GB SXM5 x2基構成でのFP8ネイティブ運用が最適解です。パープレキシティの劣化がなく、Hopper Tensor Coreの恩恵をフルに享受できます。
3. ベンチマーク対決:実測スコア比較
学術推論、最高難度数学、ソフトウェアエンジニアリング、マルチモーダル処理の各テストセットで検証を実施しました。GPT-OSS 120Bは8基のH100ノード上でvLLM v0.9.1(FP8)を用い、Gemini各モデルはGoogle Cloud Vertex AI(Temperature 0.2、思考機能ON)経由で評価しています。
主要ベンチマークスコア表
| ベンチマーク指標 | GPT-OSS 120B (FP8) | Gemini 3 Pro | Gemini 2.5 Flash | GPT 5.2(リファレンス) |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | 24.8% | 32.4% | 18.6% | 34.1% |
| GPQA Diamond (博士レベル理科) | 68.4% | 79.2% | 62.8% | 81.5% |
| MATH-500 (数学オリンピック) | 88.2% | 94.6% | 82.4% | 95.8% |
| AIME 2026 (数学選抜 Pass@1) | 64.0% | 78.5% | 52.0% | 82.0% |
| SWE-bench Verified (Bug修正) | 56.4% | 68.2% | 44.5% | 71.8% |
| LiveCodeBench v6 (最新コード) | 62.1% | 72.8% | 51.4% | 74.5% |
| MMLU-Pro (高難度推論 CoT) | 81.2% | 89.5% | 76.3% | 90.4% |
| MMMU (大学レベルマルチモーダル) | 68.5% (ViT) | 76.8% (ネイティブ) | 64.2% | 78.2% |
| MathVista (視覚数学推論) | 71.2% | 82.4% | 69.1% | 84.0% |
| NIAH (針探索再現率) | 99.8% (128K) | 100.0% (200万) | 99.9% (100万) | 100.0% (256K) |
ベンチマーク分析の要点
- 最高峰の論理推論力:Gemini 3 ProはHLEで7.6%、GPQA Diamondで10.8%上回っています。GoogleのDeep Thought機構が、複雑な量子化学や幾何学の証明において数千トークンの適応的思考リソースを自動投入します。
- ソフトウェア実装力(SWE-bench):Gemini 3 Proの課題解決率68.2%に対し、GPT-OSS 120Bは56.4%です。ただし、自社リポジトリでのLoRA微調を行うことで差を4%以内に縮められます。
- Gemini 2.5 Flashへの完勝:GPT-OSS 120BはGemini 2.5 Flashに対し全ベンチマークで大差をつけて勝利(HLEで+6.2%、MATH-500で+5.8%、SWE-benchで+11.9%)。
- オープンウェイトモデルの新境地:MATH-500で88%、SWE-benchで56%を達成した初のオープンモデルであり、2024年のフラッグシップ(GPT-4oやClaude 3.5 Sonnet)を完全に凌駕しています。
4. マルチモーダル設計とコンテキスト処理能力
両モデルの最大のアーキテクチャ差は、非テキストデータの処理パイプラインとコンテキスト許容量にあります。
+-----------------------------------------------------------------------------+
| マルチモーダル・パイプライン比較 |
+-----------------------------------------------------------------------------+
| |
| GPT-OSS 120B:モジュラー型アダプター設計 |
| [画像 / 音声] ---> [SigLIP 2 ビジョンエンコーダ] ---> [クロスアテンション] |
| | |
| v |
| [120B MoE 本体] |
| | |
| v |
| [テキスト・コード出力] |
| |
| GEMINI 3 PRO:完全ネイティブ早期融合(Early Fusion)設計 |
| [生音声波形データ] -----+ |
| [4K 60fps 高画質動画] --+---> [全モダリティ共通の統合埋め込み空間] |
| [PDF / ソースコード] ---+ | |
| v |
| [Gemini 3 Pro Transformer] |
| | |
| v |
| [多様な形式で直接生成] |
+-----------------------------------------------------------------------------+
コンテキスト長の比較
- Gemini 3 Pro (2,000,000トークン):企業の全リポジトリコード、2時間の非圧縮高解像度動画、数十本の会議音声を一度に文脈へ投入可能。全域で100%の再現性を誇ります。
- GPT-OSS 120B (128,000トークン):Yarn補間を用いたRoPEを採用。通常業務や一般的な開発タスクには十分ですが、超長尺動画などの処理には外部RAGが必須です。
5. 実践デプロイガイド:CLI&API実装例
vLLMによるGPT-OSS 120Bのローカルホスティング(Docker / TP=2)
NVIDIA H100 80GB x2基のFP8構成での起動コマンド:
docker run --gpus '"device=0,1"' -v /root/.cache/huggingface:/root/.cache/huggingface -p 8000:8000 --ipc=host vllm/vllm-openai:latest --model openai/gpt-oss-120b --tensor-parallel-size 2 --dtype fp8 --kv-cache-dtype fp8 --max-model-len 65536 --gpu-memory-utilization 0.95 --enable-chunked-prefill --enforce-eager
標準OpenAIクライアントからのテストリクエスト:
curl -X POST http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "openai/gpt-oss-120b",
"messages": [
{"role": "system", "content": "あなたは熟練のシステムアーキテクトです。"},
{"role": "user", "content": "C++20のアトミック操作を用いたロックフリー・リングバッファを実装してください。"}
],
"temperature": 0.1,
"max_tokens": 1024
}'
Google GenAI SDKによるGemini 3 Pro呼び出し
Deep Thought思考予算を設定したPythonスクリプト:
import os
from google import genai
from google.genai import types
client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))
response = client.models.generate_content(
model="gemini-3-pro-preview",
contents="任意の平面グラフが4色以下で彩色可能であることを厳密に証明してください。",
config=types.GenerateContentConfig(
temperature=0.2,
thinking_config=types.ThinkingConfig(
thinking_budget_tokens=4096 # 思考ステップのトークン予算
),
safety_settings=[
types.SafetySetting(
category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
)
]
),
)
print(response.text)
6. コスト経済性分析:API従量課金 vs 自社GPU運用TCO
クラウドAPI料金比較(100万トークンあたり)
| モデル | 入力料金 ($/1M) | 出力料金 ($/1M) | キャッシュ入力 ($/1M) | 平均実効料金 (3:1 比率) |
|---|---|---|---|---|
| Google Gemini 3 Pro | $1.25 | $5.00 | $0.31 | $2.19 |
| Google Gemini 2.5 Flash | $0.075 | $0.30 | $0.019 | $0.13 |
| OpenAI GPT 5.2 | $2.50 | $10.00 | $0.62 | $4.38 |
| GPT-OSS 120B(自社運用) | ハードウェア費用のみ | ハードウェア費用のみ | 対象外 | 固定インフラ費用 |
損益分岐点(2x H100 SXM5)の試算
- ノードレンタル費用:2x H100 80GB SXM5(RunPod / Lambda)で 時給$5.50(予約契約で月額約$3,960)。
- 最大生成スループット:FP8環境で約75 tokens/秒の生成、常時稼働で1日あたり約 1億9,400万トークン を処理可能。
- 損益分岐ライン:
- Gemini 3 Proの平均実効単価($2.19 / 1M)換算で、月間利用量が 18.1億トークン(1日あたり約6,000万トークン)を超えると、自社ホスティングが割安になります。
- 1日あたりの処理量が5,000万トークン以下の場合は、Gemini 3 ProやGemini 2.5 FlashのAPI利用が圧倒的に経済的です。
7. 企業導入決定マトリクス
+-----------------------------------------------------------------------------+
| エンタープライズ選定指針 |
+------------------------------+-----------------------+----------------------+
| 評価項目 | GPT-OSS 120B を選定 | Gemini 3 Pro を選定 |
+------------------------------+-----------------------+----------------------+
| 厳格なデータコンプライアンス | 完全社内完結・オンプレ| 認定クラウド限定 |
| 必要コンテキスト長 | 12.8万トークン以下 | 12.8万超〜200万 |
| 動画・生音声解析 | 外付けViT等で対応 | ネイティブ処理 |
| 最高難度学術・数学推論 | 非常に高い (88% MATH) | 最高峰 (SOTA) |
| 自社特化ファインチューニング | 完全対応 (LoRA, Axolotl)| プロンプト制御のみ |
| レイテンシの確定性 | 極めて高い (キューなし)| クラウド混雑度に依存 |
+------------------------------+-----------------------+----------------------+
推奨:ハイブリッドルーティング運用
- Tier 1(社内ルーチン・機密データ処理):日常の要約、社内コード生成、高頻度処理を自社ホストの GPT-OSS 120B(または小規模タスクには Gemini 2.5 Flash)へ振り分け。
- Tier 2(最高難度推論・長尺動画分析):学術レベルの難問、数時間の動画確認、大規模コードベース調査を Gemini 3 Pro(または GPT 5.2)にエスカレーション。
この二層アーキテクチャにより、機密保護とコスト最小化、最高水準の知能活用を両立できます。