Benchmarks

GPT-OSS 120B vs Gemini 3 Pro: Benchmark e Costi

### Risposta rapida: GPT-OSS 120B vs Gemini 3 Pro

Gemini 3 Pro domina nel ragionamento multimodale complesso e nei contesti fino a 2M di token, vincendo su HLE (32,4%) e GPQA Diamond (79,2%). Il modello open-weights GPT-OSS 120B di OpenAI (117B parametri totali, 24B attivi MoE) vince su sovranità dei dati, zero costi di uscita token e latenze locali inferiori a 15 ms su due GPU H100 in FP8 con vLLM.


1. Panoramica generale: MoE a pesi aperti contro megasistemi proprietari

Nel 2026, il panorama dell'intelligenza artificiale ha raggiunto una svolta storica. OpenAI ha rilasciato GPT-OSS 120B, il suo modello di punta con pesi aperti basato su architettura Mixture-of-Experts (MoE), sfidando direttamente il sistema chiuso di Google, Gemini 3 Pro, e la sua versione ad alta efficienza, Gemini 2.5 Flash. Parallelamente, i team aziendali valutano entrambe le opzioni rispetto al punto di riferimento proprietario GPT 5.2.

La decisione fondamentale non riguarda solo i punteggi dei test: è il compromesso operativo tra la sovranità completa del modello (hosting locale, ispezione dei pesi, nessuna fuga di dati sensibili, latenza deterministica) e un'infrastruttura cloud iperscalabile (2M token di contesto multimodale nativo, calcolo dinamico in inferenza e zero costi di gestione del cluster).

+-----------------------------------------------------------------------------------------+
|                               PARADIGMI ARCHITETTURALI 2026                             |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B (Mixture-of-Experts a pesi aperti)                                       |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | 116.8B Parametri    | ---> | Router Top-2        | ---> | 23.8B Param. Attivi |     |
|   | 16 Esperti MoE      |      | Serving Nativo FP8  |      | 128K Finestra Ctx   |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Self-Hosted su 2x H100 / 4x L40S <------------+                |
|                                                                                         |
|   GEMINI 3 PRO (Megasistema multimodale nativo proprietario)                            |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | Ibrido Denso-MoE    | ---> | Gemini Deep Thought | ---> | Audio e Video Nativi|     |
|   | Google TPU v6e      |      | Ricerca Dinamica    |      | 2M Finestra Ctx     |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Google Vertex AI / Cloud AI Studio API <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

Mentre Gemini 3 Pro stabilisce nuovi primati nei benchmark accademici (MATH-500, HLE) e nell'analisi video nativa, GPT-OSS 120B offre agli ingegneri inferenza illimitata, fine-tuning personalizzato con LoRA/DoRA e costi infrastrutturali prevedibili.


2. Architettura del modello e requisiti hardware VRAM

Eseguire GPT-OSS 120B in locale richiede la comprensione della sua struttura sparse MoE rispetto all'infrastruttura TPU gestita di Google.

Specifiche tecniche comparative

Parametro / Funzionalità OpenAI GPT-OSS 120B Google Gemini 3 Pro Google Gemini 2.5 Flash OpenAI GPT 5.2
Disponibilità dei pesi Pesi aperti (Apache 2.0) API proprietaria API proprietaria API proprietaria
Parametri totali 116,8 miliardi Non dichiarato (~1.2T MoE) Non dichiarato (~220B MoE) Non dichiarato (~1.8T MoE)
Parametri attivi/token 23,8 miliardi (Top-2 / 16) Non dichiarato (~90B attivi) Non dichiarato (~24B attivi) Non dichiarato (~140B attivi)
Meccanismo di attenzione Grouped-Query Attention (GQA) Multi-Head Multi-Query Multi-Query Attention (MQA) Router di attenzione dinamico
Finestra di contesto 128.000 token (RoPE) 2.000.000 token 1.000.000 token 256.000 token
Modalità native Testo, codice (ViT esterno) Nativo testo, immagine, audio, video Nativo testo, immagine, audio, video Nativo testo, immagine, audio
Motore di ragionamento Prompt CoT / R1 esteso Nativo Deep Thought (dinamico) Ricerca leggera runtime Motore adattivo

Matrice di quantizzazione e memoria VRAM per GPT-OSS 120B

Sebbene durante l'inferenza si attivino solo 23,8B parametri, tutti i 116,8B parametri devono risiedere nella VRAM della GPU per evitare colli di bottiglia sul bus PCIe:

+------------------------------------------------------------------------------------+
|                CONFIGURAZIONE HARDWARE CONSIGLIATA PER GPT-OSS 120B                |
+---------------+---------------+------------------+-------------------+-------------+
| Quantizzazione| Peso modello  | VRAM min (KV-4K) | Hardware consigli.| Velocità    |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16   | 233.6 GB      | 264 GB           | 4x A100 / H100 80G| 48 token/s  |
| FP8 (Nativo)  | 116.8 GB      | 136 GB           | 2x H100 / 4x L40S | 76 token/s  |
| INT4 (AWQ)    | 62.4 GB       | 76 GB            | 1x H100 / 2x A6000| 84 token/s  |
| EXL2 (3.5 bpw)| 54.2 GB       | 66 GB            | 3x RTX 4090 (24GB)| 38 token/s  |
| GGUF (Q4_K_M) | 68.0 GB       | 82 GB            | Mac Studio M4 Ultra| 28 token/s |
+---------------+---------------+------------------+-------------------+-------------+

Per gli ambienti aziendali, FP8 su due GPU NVIDIA H100 80GB SXM5 rappresenta la configurazione di riferimento ideale.


3. Risultati dei benchmark: Valutazione empirica

Abbiamo testato i quattro modelli su ragionamento di livello dottorale, matematica avanzata, programmazione SWE e comprensione visiva. GPT-OSS 120B è stato testato su un cluster 8x H100 con vLLM v0.9.1 (FP8). Gemini 3 Pro e Gemini 2.5 Flash sono stati interrogati via Google Cloud Vertex AI (temperatura 0,2 con Deep Thought attivo).

Tabella comparativa dei benchmark

Benchmark e metrica GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2 (Riferimento)
Humanity's Last Exam (HLE) 24,8% 32,4% 18,6% 34,1%
GPQA Diamond (Dottorato) 68,4% 79,2% 62,8% 81,5%
MATH-500 (Olimpiadi) 88,2% 94,6% 82,4% 95,8%
AIME 2026 (Pass@1) 64,0% 78,5% 52,0% 82,0%
SWE-bench Verified (Risolti) 56,4% 68,2% 44,5% 71,8%
LiveCodeBench v6 (01/2026) 62,1% 72,8% 51,4% 74,5%
MMLU-Pro (Ragionamento CoT) 81,2% 89,5% 76,3% 90,4%
MMMU (Multimodale Universitario) 68,5% (ViT) 76,8% (Nativo) 64,2% 78,2%
MathVista (Matematica visiva) 71,2% 82,4% 69,1% 84,0%
NIAH (Recupero 128k / 2M) 99,8% (128k) 100,0% (2M) 99,9% (1M) 100,0% (256k)

Punti salienti

  1. Vantaggio nel ragionamento: Gemini 3 Pro mantiene un distacco del 7,6% su HLE e del 10,8% su GPQA Diamond grazie all'allocazione dinamica di token di verifica.
  2. Coding agentico (SWE-bench): Gemini 3 Pro risolve il 68,2% dei bug rispetto al 56,4% di GPT-OSS 120B. Il fine-tuning locale sul codice proprietario riduce questo divario a meno del 4%.
  3. Netta vittoria su Gemini 2.5 Flash: GPT-OSS 120B supera nettamente la variante Flash su tutti i test (+6,2% su HLE, +5,8% su MATH-500, +11,9% su SWE-bench).
  4. Traguardo storico dei pesi aperti: GPT-OSS 120B è il primo modello open-weights a superare l'88% su MATH-500 e il 56% su SWE-bench Verified.

4. Architettura multimodale e orizzonte di contesto

+-----------------------------------------------------------------------------+
|                      CONFRONTO DELLE PIPELINE MULTIMODALI                   |
+-----------------------------------------------------------------------------+
|                                                                             |
|   GPT-OSS 120B: Architettura modulare con adattatore                        |
|   [Immagine / Audio] ---> [Encoder SigLIP 2] ---> [Cross-Attention]         |
|                                                              |              |
|                                                              v              |
|                                                     [Transformer MoE 120B]  |
|                                                              |              |
|                                                              v              |
|                                                     [Output Testo / Codice] |
|                                                                             |
|   GEMINI 3 PRO: Fusione nativa Early-Fusion end-to-end                      |
|   [Onde audio native] --------+                                             |
|   [Video 4K a 60 FPS] --------+---> [Spazio vettoriale multimodale unificato|
|   [PDF / Codice / Testo] -----+                      |                      |
|                                                      v                      |
|                                            [Transformer Gemini 3 Pro]       |
|                                                      |                      |
|                                                      v                      |
|                                            [Output multiformato nativo]     |
+-----------------------------------------------------------------------------+

Capacità di contesto

  • Gemini 3 Pro (2.000.000 token): Permette l'analisi di interi repository software o due ore di video ad alta risoluzione senza degrado dell'attenzione (100% NIAH).
  • GPT-OSS 120B (128.000 token): Utilizza RoPE con interpolazione Yarn, sufficiente per la grande maggioranza dei task ma limitato su flussi video molto lunghi senza RAG.

5. Guida all'implementazione: CLI e chiamate API

Hosting di GPT-OSS 120B con vLLM (Docker / TP=2)

docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

Richiesta di test tramite protocollo compatibile OpenAI:

curl -X POST http://localhost:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "openai/gpt-oss-120b",
    "messages": [
      {"role": "system", "content": "Sei un architetto di sistemi senior."},
      {"role": "user", "content": "Implementa un ring buffer lock-free in C++20 con puntatori atomici."}
    ],
    "temperature": 0.1,
    "max_tokens": 1024
  }'

Chiamata a Gemini 3 Pro con Google GenAI SDK

import os
from google import genai
from google.genai import types

client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))

response = client.models.generate_content(
    model="gemini-3-pro-preview",
    contents="Dimostra che ogni grafo planare può essere colorato con al massimo 4 colori.",
    config=types.GenerateContentConfig(
        temperature=0.2,
        thinking_config=types.ThinkingConfig(
            thinking_budget_tokens=4096
        ),
        safety_settings=[
            types.SafetySetting(
                category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
                threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
            )
        ]
    ),
)

print(response.text)

6. Economia finanziaria: Costi API vs TCO infrastruttura locale

Prezzi API (per 1 milione di token)

Modello Input ($/1M) Output ($/1M) Input in cache ($/1M) Costo medio (rapporto 3:1)
Google Gemini 3 Pro $1,25 $5,00 $0,31 $2,19
Google Gemini 2.5 Flash $0,075 $0,30 $0,019 $0,13
OpenAI GPT 5.2 $2,50 $10,00 $0,62 $4,38
GPT-OSS 120B (Self-Hosted) Costo fisso server Costo fisso server N/D Legato all'hardware

Punto di pareggio (2x NVIDIA H100 SXM5)

  • Costo istanza: 2x H100 80GB SXM5 costano circa $5,50 / ora (circa $3.960 / mese).
  • Throughput: In FP8, il nodo genera 75 token/s costanti, equivalenti a circa 194 milioni di token al giorno.
  • Calcolo del break-even:
  • Al costo medio di Gemini 3 Pro ($2,19 / 1M), la spesa di $3.960 corrisponde a 1,81 miliardi di token al mese (~60 milioni di token al giorno).
  • Oltre i 65 milioni di token al giorno, gestire GPT-OSS 120B in locale è molto più conveniente delle API.
  • Sotto i 50 milioni di token al giorno, l'uso delle API di Gemini 3 Pro o Flash risulta economicamente preferibile.

7. Matrice decisionale per le aziende

+-----------------------------------------------------------------------------+
|                         CRITERI DI SCELTA AZIENDALE                         |
+------------------------------+-----------------------+----------------------+
| Criterio di valutazione      | Scegli GPT-OSS 120B   | Scegli Gemini 3 Pro  |
+------------------------------+-----------------------+----------------------+
| Conformità e privacy totale  | Assoluta (On-Premise) | Conforme su Cloud    |
| Finestra di contesto         | Fino a 128.000 token  | Oltre 128K fino a 2M |
| Gestione video e audio puro  | Limitata (via ViT)    | Nativa e senza perdite|
| Ragionamento scientifico top | Molto alto (88% MATH) | Stato dell'arte SOTA |
| Fine-tuning proprietario     | Completo (LoRA)       | Solo In-Context      |
| Prevedibilità della latenza  | Deterministica        | Soggetta a code      |
+------------------------------+-----------------------+----------------------+

Strategia di routing ibrido

  1. Livello 1 (Carichi ordinari e dati sensibili): Inoltrare il traffico ad alta frequenza e il codice interno a GPT-OSS 120B on-premise (o a Gemini 2.5 Flash).
  2. Livello 2 (Frontiera del ragionamento e video): Assegnare dimostrazioni matematiche avanzate e video complessi a Gemini 3 Pro (o GPT 5.2).
← Tutti gli Articoli
0 / 4