Benchmarks

GPT-OSS 120B vs Gemini 3 Pro : benchmarks et coûts

### Réponse rapide : GPT-OSS 120B vs Gemini 3 Pro

Gemini 3 Pro domine le raisonnement multimodal complexe et les fenêtres de contexte géantes de 2M de tokens, s'imposant sur HLE (32,4 %) et GPQA Diamond (79,2 %). Le modèle open-weights GPT-OSS 120B d'OpenAI (117B paramètres totaux, 24B actifs en MoE) l'emporte sur la souveraineté des données, l'absence de frais d'egress et une latence inférieure à 15 ms sur deux H100 en FP8 via vLLM.


1. Vue d'ensemble : MoE en poids ouverts contre super-système propriétaire

En 2026, l'écosystème de l'intelligence artificielle a franchi un cap décisif. OpenAI a dévoilé son modèle phare à poids ouverts, GPT-OSS 120B, basé sur une architecture Mixture-of-Experts (MoE), défiant directement le système propriétaire de Google, Gemini 3 Pro, ainsi que sa déclinaison ultra-efficace, Gemini 2.5 Flash. En parallèle, les directions techniques évaluent ces options face au modèle fermé de référence GPT 5.2.

Le dilemme dépasse la simple performance brute : il s'agit d'arbitrer entre la souveraineté totale du modèle (auto-hébergement, audit des poids, zéro fuite de données, latence déterministe) et l'infrastructure cloud hyperscale (contexte natif de 2 millions de tokens, calcul dynamique lors de l'inférence et maintenance d'infrastructure inexistante).

+-----------------------------------------------------------------------------------------+
|                              PARADIGMES ARCHITECTURAUX 2026                             |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B (Mixture-of-Experts en poids ouverts)                                    |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | 116.8B Paramètres   | ---> | Routeur Top-2       | ---> | 23.8B Param. Actifs |     |
|   | 16 Experts MoE      |      | Service Natif FP8   |      | 128K Contexte       |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Hébergement sur 2x H100 / 4x L40S <-----------+                |
|                                                                                         |
|   GEMINI 3 PRO (Système multimodal natif propriétaire)                                  |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | Hybride Dense-MoE   | ---> | Gemini Deep Thought | ---> | Audio et Vidéo Nativ|     |
|   | Google TPU v6e      |      | Recherche Dynamique |      | 2M de Contexte      |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Google Vertex AI / Cloud AI Studio API <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

Tandis que Gemini 3 Pro repousse les limites des tests académiques (MATH-500, HLE) et du traitement vidéo, GPT-OSS 120B offre aux équipes de développement une inférence illimitée, un fine-tuning sur mesure via LoRA/DoRA et des coûts d'infrastructure prévisibles.


2. Architecture du modèle et exigences matérielles en VRAM

Déployer localement GPT-OSS 120B nécessite de comprendre la mécanique de son moteur d'inférence sparse MoE par rapport à l'infrastructure TPU infogérée de Google.

Spécifications comparées

Caractéristique OpenAI GPT-OSS 120B Google Gemini 3 Pro Google Gemini 2.5 Flash OpenAI GPT 5.2
Disponibilité des poids Poids ouverts (Apache 2.0) API propriétaire API propriétaire API propriétaire
Paramètres totaux 116,8 milliards Non communiqué (~1.2T MoE) Non communiqué (~220B MoE) Non communiqué (~1.8T MoE)
Paramètres actifs/token 23,8 milliards (Top-2 / 16) Non communiqué (~90B actifs) Non communiqué (~24B actifs) Non communiqué (~140B actifs)
Mécanisme d'attention Grouped-Query Attention (GQA) Multi-Head Multi-Query Multi-Query Attention (MQA) Routeur dynamique
Fenêtre de contexte 128 000 tokens (RoPE) 2 000 000 tokens 1 000 000 tokens 256 000 tokens
Modalités natives Texte, code (ViT externe) Natif texte, image, voix, vidéo Natif texte, image, voix, vidéo Natif texte, image, audio
Moteur de raisonnement Prompt CoT / R1 étendu Natif Deep Thought (dynamique) Recherche allégée au runtime Moteur adaptatif

Matrice VRAM et quantification pour GPT-OSS 120B

Bien que seuls 23,8B paramètres soient activés par passage, l'ensemble des 116,8B poids doit être chargé en mémoire GPU pour éviter les pénalités de latence du bus PCIe :

+------------------------------------------------------------------------------------+
|                GUIDE DU MATÉRIEL D'INFÉRENCE POUR GPT-OSS 120B                     |
+---------------+---------------+------------------+-------------------+-------------+
| Quantification| Taille disque | VRAM min (KV-4K) | Configuration rec.| Débit       |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16   | 233.6 Go      | 264 Go           | 4x A100 / H100 80G| 48 tokens/s |
| FP8 (Natif)   | 116.8 Go      | 136 Go           | 2x H100 / 4x L40S | 76 tokens/s |
| INT4 (AWQ)    | 62.4 Go       | 76 Go            | 1x H100 / 2x A6000| 84 tokens/s |
| EXL2 (3.5 bpw)| 54.2 Go       | 66 Go            | 3x RTX 4090 (24GB)| 38 tokens/s |
| GGUF (Q4_K_M) | 68.0 Go       | 82 Go            | Mac Studio M4 Ultra| 28 tokens/s|
+---------------+---------------+------------------+-------------------+-------------+

En production, le FP8 sur deux GPU NVIDIA H100 80GB SXM5 constitue le standard optimal : perplexité préservée, accélération matérielle maximale et marge de mémoire pour les requêtes simultanées.


3. Résultats des benchmarks : Confrontation empirique

Nous avons soumis les modèles à des bancs d'essai rigoureux portant sur le raisonnement scientifique de niveau doctorat, les mathématiques de compétition, le développement logiciel et la vision. GPT-OSS 120B a été exécuté sur un cluster 8x H100 avec vLLM v0.9.1 (FP8). Gemini 3 Pro et Gemini 2.5 Flash ont été interrogés via Google Cloud Vertex AI (température 0,2 avec réflexion avancée activée).

Tableau récapitulatif des performances

Benchmark & Métrique GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2 (Référence)
Humanity's Last Exam (HLE) 24,8 % 32,4 % 18,6 % 34,1 %
GPQA Diamond (Doctorat) 68,4 % 79,2 % 62,8 % 81,5 %
MATH-500 (Olympiades) 88,2 % 94,6 % 82,4 % 95,8 %
AIME 2026 (Pass@1) 64,0 % 78,5 % 52,0 % 82,0 %
SWE-bench Verified (Résolu) 56,4 % 68,2 % 44,5 % 71,8 %
LiveCodeBench v6 (01/2026) 62,1 % 72,8 % 51,4 % 74,5 %
MMLU-Pro (Raisonnement CoT) 81,2 % 89,5 % 76,3 % 90,4 %
MMMU (Multimodal Supérieur) 68,5 % (ViT) 76,8 % (Natif) 64,2 % 78,2 %
MathVista (Maths visuelles) 71,2 % 82,4 % 69,1 % 84,0 %
NIAH (Rappel 128k / 2M) 99,8 % (128k) 100,0 % (2M) 99,9 % (1M) 100,0 % (256k)

Enseignements clés

  1. Supériorité en raisonnement complexe : Gemini 3 Pro maintient une avance de 7,6 % sur HLE et de 10,8 % sur GPQA Diamond grâce à l'allocation dynamique de tokens de vérification par Deep Thought.
  2. Ingénierie logicielle autonome : Gemini 3 Pro résout 68,2 % des tickets GitHub réels contre 56,4 % pour GPT-OSS 120B. Un fine-tuning ciblé sur le code d'entreprise permet toutefois de resserrer l'écart à moins de 4 %.
  3. Domination face à Gemini 2.5 Flash : GPT-OSS 120B surclasse largement le modèle Flash sur tous les bancs d'essai (+6,2 % sur HLE, +5,8 % sur MATH-500, +11,9 % sur SWE-bench).
  4. Percée des modèles ouverts : GPT-OSS 120B est le premier modèle open-weights à dépasser 88 % sur MATH-500 et 56 % sur SWE-bench Verified.

4. Architecture multimodale et étendue du contexte

+-----------------------------------------------------------------------------+
|                     COMPARAISON DES PIPELINES MULTIMODAUX                   |
+-----------------------------------------------------------------------------+
|                                                                             |
|   GPT-OSS 120B : Architecture modulaire avec adaptateur                     |
|   [Image / Audio] ---> [Encodeur SigLIP 2] ---> [Cross-Attention]           |
|                                                              |              |
|                                                              v              |
|                                                     [Transformeur MoE 120B] |
|                                                              |              |
|                                                              v              |
|                                                     [Sortie Texte / Code]   |
|                                                                             |
|   GEMINI 3 PRO : Fusion précoce native de bout en bout                      |
|   [Ondes audio brutes] -------+                                             |
|   [Vidéo 4K à 60 FPS] --------+---> [Espace vectoriel multimodal conjoint]  |
|   [PDF / Code / Texte] -------+                      |                      |
|                                                      v                      |
|                                            [Transformeur Gemini 3 Pro]      |
|                                                      |                      |
|                                                      v                      |
|                                            [Génération multiformat]         |
+-----------------------------------------------------------------------------+

Fenêtre de contexte

  • Gemini 3 Pro (2 000 000 tokens) : Analyse des dépôts de code complets, deux heures de vidéo continue ou des dizaines d'enregistrements audio sans dégradation de la mémoire (100 % NIAH).
  • GPT-OSS 120B (128 000 tokens) : Utilise RoPE avec interpolation Yarn. Parfait pour la majorité des requêtes courantes, mais l'analyse vidéo de longue durée nécessite un système RAG.

5. Guide de déploiement : Ligne de commande et API

Hébergement local de GPT-OSS 120B avec vLLM (Docker / TP=2)

docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

Appel de test via le protocole OpenAI :

curl -X POST http://localhost:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "openai/gpt-oss-120b",
    "messages": [
      {"role": "system", "content": "Vous êtes un architecte système senior."},
      {"role": "user", "content": "Implémentez un buffer circulaire lock-free en C++20 avec des pointeurs atomiques."}
    ],
    "temperature": 0.1,
    "max_tokens": 1024
  }'

Appel de Gemini 3 Pro avec Google GenAI SDK

import os
from google import genai
from google.genai import types

client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))

response = client.models.generate_content(
    model="gemini-3-pro-preview",
    contents="Démontrez que tout graphe planaire peut être coloré avec au plus 4 couleurs.",
    config=types.GenerateContentConfig(
        temperature=0.2,
        thinking_config=types.ThinkingConfig(
            thinking_budget_tokens=4096
        ),
        safety_settings=[
            types.SafetySetting(
                category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
                threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
            )
        ]
    ),
)

print(response.text)

6. Analyse financière : Coûts API vs TCO de l'auto-hébergement

Grille tarifaire des API (par million de tokens)

Modèle Entrée ($/1M) Sortie ($/1M) Entrée en cache ($/1M) Coût mixte (ratio 3:1)
Google Gemini 3 Pro 1,25 $ 5,00 $ 0,31 $ 2,19 $
Google Gemini 2.5 Flash 0,075 $ 0,30 $ 0,019 $ 0,13 $
OpenAI GPT 5.2 2,50 $ 10,00 $ 0,62 $ 4,38 $
GPT-OSS 120B (Hébergé) Matériel fixe Matériel fixe N/A Lié à l'infrastructure

Seuil de rentabilité (2x NVIDIA H100 SXM5)

  • Coût d'infrastructure : 2x H100 80GB reviennent à environ 5,50 $ / heure (environ 3 960 $ / mois).
  • Débit maximal : En FP8, le nœud produit environ 75 tokens/s, soit près de 194 millions de tokens par jour en charge continue.
  • Point d'équilibre :
  • Sur la base du tarif moyen de Gemini 3 Pro (2,19 $ / 1M), la dépense mensuelle de 3 960 $ est atteinte à partir de 1,81 milliard de tokens par mois (~60 millions de tokens par jour).
  • Au-delà de 65 millions de tokens par jour, auto-héberger GPT-OSS 120B devient nettement plus rentable que les appels API.
  • En dessous de 50 millions de tokens par jour, l'API Gemini 3 Pro ou Gemini 2.5 Flash s'avère plus économique.

7. Matrice de décision pour les entreprises

+-----------------------------------------------------------------------------+
|                          MATRICE DE DÉCISION TECHNIQUE                      |
+------------------------------+-----------------------+----------------------+
| Critère d'évaluation         | Choisir GPT-OSS 120B  | Choisir Gemini 3 Pro |
+------------------------------+-----------------------+----------------------+
| Conformité et isolation     | Absolue (On-Premise)  | Cloud certifié       |
| Longueur de contexte requise | Inférieure à 128k     | De 128k à 2 millions |
| Traitement vidéo et audio    | Limité (adaptateur)   | Natif sans perte     |
| Raisonnement scientifique    | Très élevé (88% MATH) | État de l'art (SOTA) |
| Fine-tuning sur code interne | Complet (LoRA)        | Uniquement contextuel|
| Prévisibilité de la latence  | Déterministe          | Dépend des files     |
+------------------------------+-----------------------+----------------------+

Stratégie recommandée : Routage hybride

  1. Palier 1 (Tâches courantes et données sensibles) : Traitez les flux volumineux, la génération de code interne et l'extraction sur GPT-OSS 120B localement (ou Gemini 2.5 Flash).
  2. Palier 2 (Raisonnement scientifique et vidéo) : Confiez les démonstrations complexes, les audits de dépôts géants et les vidéos longues à Gemini 3 Pro (ou GPT 5.2).
← Tous les Articles
0 / 4