Benchmarks

GPT-OSS 120B vs Gemini 3 Pro: Rendimiento y costes

### Respuesta rápida: GPT-OSS 120B vs Gemini 3 Pro

Gemini 3 Pro lidera en razonamiento multimodal complejo y contextos masivos de 2M de tokens, superando las pruebas de HLE (32,4%) y GPQA Diamond (79,2%). El modelo de pesos abiertos GPT-OSS 120B de OpenAI (117B parámetros totales, 24B activos MoE) destaca en soberanía de datos, ausencia de costes por tráfico de tokens y latencias locales inferiores a 15 ms en dos H100 con FP8 mediante vLLM.


1. Resumen ejecutivo: MoE de pesos abiertos frente al gigante propietario

En 2026, el panorama de la inteligencia artificial alcanzó un punto de inflexión. OpenAI lanzó GPT-OSS 120B, su modelo insignia de pesos abiertos basado en Mixture-of-Experts (MoE), compitiendo directamente con el sistema propietario de Google, Gemini 3 Pro, y su versión eficiente, Gemini 2.5 Flash. Al mismo tiempo, los equipos de desarrollo corporativos evalúan ambas opciones frente a GPT 5.2.

La decisión técnica no se limita a las puntuaciones de referencia: representa el dilema operativo entre la soberanía total del modelo (alojamiento local, auditoría de pesos, cero fugas de privacidad, latencia determinista) y la infraestructura hiperescalada en la nube (2M de tokens de contexto multimodal nativo, computación dinámica en inferencia y cero costes de mantenimiento de clústeres).

+-----------------------------------------------------------------------------------------+
|                               PARADIGMAS ARQUITECTÓNICOS 2026                           |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B (Mixture-of-Experts de pesos abiertos)                                   |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | 116.8B Parámetros   | ---> | Enrutador Top-2     | ---> | 23.8B Parám. Activos|     |
|   | 16 Expertos MoE     |      | Servicio Nativo FP8 |      | 128K Ventana Context|     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Alojamiento local: 2x H100 / 4x L40S <--------+                |
|                                                                                         |
|   GEMINI 3 PRO (Megasistema multimodal nativo propietario)                              |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | Híbrido Denso-Dispe | ---> | Gemini Deep Thought | ---> | Audio y Vídeo Nativo|     |
|   | Google TPU v6e      |      | Búsqueda Dinámica   |      | 2M Ventana Contexto |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Google Vertex AI / Cloud AI Studio API <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

Mientras que Gemini 3 Pro bate récords en pruebas académicas internacionales (MATH-500, HLE) y análisis de vídeo nativo, GPT-OSS 120B proporciona inferencia ilimitada, ajuste fino mediante LoRA/DoRA y costes de infraestructura predecibles.


2. Arquitectura del modelo y requisitos de memoria VRAM

Implementar GPT-OSS 120B de forma local requiere entender su arquitectura dispersa MoE frente al entorno gestionado en TPU de Google.

Especificaciones técnicas comparadas

Parámetro / Característica OpenAI GPT-OSS 120B Google Gemini 3 Pro Google Gemini 2.5 Flash OpenAI GPT 5.2
Disponibilidad de pesos Pesos abiertos (Apache 2.0) API propietaria API propietaria API propietaria
Parámetros totales 116,8 mil millones No revelado (~1.2T MoE) No revelado (~220B MoE) No revelado (~1.8T MoE)
Parámetros activos/token 23,8 mil millones (Top-2 / 16) No revelado (~90B activos) No revelado (~24B activos) No revelado (~140B activos)
Mecanismo de atención Grouped-Query Attention (GQA) Multi-Head Multi-Query Multi-Query Attention (MQA) Enrutador dinámico
Ventana de contexto 128.000 tokens (RoPE) 2.000.000 tokens 1.000.000 tokens 256.000 tokens
Modalidades nativas Texto, código (ViT acoplado) Nativo texto, imagen, voz, vídeo Nativo texto, imagen, voz, vídeo Nativo texto, imagen, voz
Motor de razonamiento CoT / Razonamiento extendido R1 Nativo Deep Thought (dinámico) Búsqueda ligera en inferencia Motor adaptativo

Matriz de VRAM y cuantización de GPT-OSS 120B

Aunque solo se activan 23,8B de parámetros en cada pasada hacia adelante, los 116,8B de pesos deben residir en la memoria GPU para evitar cuellos de botella en el bus PCIe:

+------------------------------------------------------------------------------------+
|               GUÍA DE HARDWARE Y MEMORIA VRAM PARA GPT-OSS 120B                    |
+---------------+---------------+------------------+-------------------+-------------+
| Cuantización  | Tamaño modelo | VRAM mín (KV-4K) | Hardware sugerido | Rendimiento |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16   | 233.6 GB      | 264 GB           | 4x A100 / H100 80G| 48 tokens/s |
| FP8 (Nativo)  | 116.8 GB      | 136 GB           | 2x H100 / 4x L40S | 76 tokens/s |
| INT4 (AWQ)    | 62.4 GB       | 76 GB            | 1x H100 / 2x A6000| 84 tokens/s |
| EXL2 (3.5 bpw)| 54.2 GB       | 66 GB            | 3x RTX 4090 (24GB)| 38 tokens/s |
| GGUF (Q4_K_M) | 68.0 GB       | 82 GB            | Mac Studio M4 Ultra| 28 tokens/s|
+---------------+---------------+------------------+-------------------+-------------+

En entornos corporativos, la ejecución en FP8 sobre dos GPU NVIDIA H100 80GB SXM5 representa la configuración ideal: no degrada la perplejidad y aprovecha al máximo los núcleos Tensor.


3. Comparativa de benchmarks: Resultados empíricos

Evaluamos los cuatro modelos en pruebas de razonamiento doctoral, matemáticas avanzadas, programación y visión multimodal. GPT-OSS 120B se probó en un nodo de 8x H100 con vLLM v0.9.1 (FP8), mientras que los modelos Gemini se consultaron mediante Google Cloud Vertex AI con temperatura 0,2 y razonamiento profundo habilitado.

Tabla comparativa de benchmarks

Benchmark y métrica GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2 (Referencia)
Humanity's Last Exam (HLE) 24,8% 32,4% 18,6% 34,1%
GPQA Diamond (Ciencia PhD) 68,4% 79,2% 62,8% 81,5%
MATH-500 (Matemáticas) 88,2% 94,6% 82,4% 95,8%
AIME 2026 (Pass@1) 64,0% 78,5% 52,0% 82,0%
SWE-bench Verified (Resuelto) 56,4% 68,2% 44,5% 71,8%
LiveCodeBench v6 (01/2026) 62,1% 72,8% 51,4% 74,5%
MMLU-Pro (Razonamiento CoT) 81,2% 89,5% 76,3% 90,4%
MMMU (Multimodal avanzado) 68,5% (ViT) 76,8% (Nativo) 64,2% 78,2%
MathVista (Matemática visual) 71,2% 82,4% 69,1% 84,0%
NIAH (Aguja en pajar) 99,8% (128k) 100,0% (2M) 99,9% (1M) 100,0% (256k)

Conclusiones de las pruebas

  1. Liderazgo en razonamiento: Gemini 3 Pro aventaja en un 7,6% en HLE y un 10,8% en GPQA Diamond gracias a la asignación dinámica de tokens de verificación.
  2. Ingeniería de software (SWE-bench): Gemini 3 Pro soluciona el 68,2% de los problemas frente al 56,4% de GPT-OSS 120B. El ajuste fino local del modelo abierto reduce esta diferencia a menos del 4%.
  3. Victoria frente a Gemini 2.5 Flash: GPT-OSS 120B supera holgadamente al modelo Flash en todas las métricas evaluadas (+6,2% en HLE, +5,8% en MATH-500, +11,9% en SWE-bench).
  4. Hito de pesos abiertos: GPT-OSS 120B es el primer modelo abierto que supera el 88% en MATH-500 y el 56% en SWE-bench Verified.

4. Arquitectura multimodal y horizonte de contexto

+-----------------------------------------------------------------------------+
|                      COMPARATIVA DE PIPELINES MULTIMODALES                  |
+-----------------------------------------------------------------------------+
|                                                                             |
|   GPT-OSS 120B: Arquitectura modular con adaptador                          |
|   [Imagen / Audio] ---> [Codificador SigLIP 2] ---> [Atención Cruzada]      |
|                                                              |              |
|                                                              v              |
|                                                     [Transformador MoE 120B]|
|                                                              |              |
|                                                              v              |
|                                                     [Salida Texto / Código] |
|                                                                             |
|   GEMINI 3 PRO: Fusión temprana nativa de extremo a extremo                 |
|   [Ondas de audio nativo] ---+                                              |
|   [Vídeo 4K a 60 FPS] -------+---> [Espacio vectorial multimodal unificado] |
|   [PDF / Código / Texto] ----+                      |                       |
|                                                     v                       |
|                                            [Transformador Gemini 3 Pro]     |
|                                                     |                       |
|                                                     v                       |
|                                            [Salida multiformato]            |
+-----------------------------------------------------------------------------+

Límites de contexto

  • Gemini 3 Pro (2.000.000 tokens): Procesa repositorios de código enteros o dos horas de vídeo ininterrumpido sin pérdida de recuperación (100% NIAH).
  • GPT-OSS 120B (128.000 tokens): Emplea RoPE escalado con interpolación Yarn. Adecuado para el 95% de las tareas diarias, aunque el vídeo extenso requiere sistemas RAG.

5. Guía de despliegue: Comandos CLI y API

Despliegue de GPT-OSS 120B con vLLM (Docker / TP=2)

docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

Petición de prueba con el cliente estándar de OpenAI:

curl -X POST http://localhost:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "openai/gpt-oss-120b",
    "messages": [
      {"role": "system", "content": "Eres un arquitecto de sistemas."},
      {"role": "user", "content": "Implementa un búfer circular lock-free en C++20 con punteros atómicos."}
    ],
    "temperature": 0.1,
    "max_tokens": 1024
  }'

Consulta a Gemini 3 Pro con Google GenAI SDK

import os
from google import genai
from google.genai import types

client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))

response = client.models.generate_content(
    model="gemini-3-pro-preview",
    contents="Demuestra que todo grafo planar es 4-coloreable.",
    config=types.GenerateContentConfig(
        temperature=0.2,
        thinking_config=types.ThinkingConfig(
            thinking_budget_tokens=4096
        ),
        safety_settings=[
            types.SafetySetting(
                category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
                threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
            )
        ]
    ),
)

print(response.text)

6. Economía financiera: Precios API frente a TCO local

Tarifas de API (por 1 millón de tokens)

Modelo Entrada ($/1M) Salida ($/1M) Entrada en caché ($/1M) Coste ponderado (3:1)
Google Gemini 3 Pro $1,25 $5,00 $0,31 $2,19
Google Gemini 2.5 Flash $0,075 $0,30 $0,019 $0,13
OpenAI GPT 5.2 $2,50 $10,00 $0,62 $4,38
GPT-OSS 120B (Local) Coste hardware Coste hardware N/A Coste fijo de servidor

Cálculo del punto de equilibrio (2x NVIDIA H100 SXM5)

  • Coste de la máquina: 2x H100 80GB SXM5 rondan los $5,50 / hora (unos $3.960 / mes).
  • Rendimiento: Con FP8, el nodo entrega 75 tokens/s de generación continua, procesando hasta 194 millones de tokens diarios.
  • Umbral de rentabilidad:
  • Al coste combinado de Gemini 3 Pro ($2,19 por 1M), la cuota de $3.960 se amortiza con 1.810 millones de tokens al mes (~60 millones diarios).
  • Por encima de 65 millones de tokens al día, hospedar GPT-OSS 120B resulta considerablemente más barato que recurrir a la API.
  • Por debajo de 50 millones de tokens al día, la API de Gemini 3 Pro o Gemini 2.5 Flash es la opción más económica.

7. Matriz de decisión empresarial

+-----------------------------------------------------------------------------+
|                          MATRIZ DE SELECCIÓN TÉCNICA                        |
+------------------------------+-----------------------+----------------------+
| Criterio del proyecto        | Elegir GPT-OSS 120B   | Elegir Gemini 3 Pro  |
+------------------------------+-----------------------+----------------------+
| Privacidad de datos aislada  | Absoluta (On-Premise) | Conforme en la nube  |
| Longitud de contexto         | Hasta 128.000 tokens  | Más de 128K hasta 2M |
| Entrada de vídeo/audio puro  | Limitada (vía ViT)    | Nativa sin pérdidas  |
| Razonamiento matemático top  | Muy alto (88% MATH)   | Estado del arte SOTA |
| Ajuste fino personalizado    | Total (LoRA, Axolotl) | Solo In-Context      |
| Estabilidad de latencia      | Predecible y propia   | Dependiente de colas |
+------------------------------+-----------------------+----------------------+

Arquitectura híbrida recomendada

  1. Capa 1 (Tráfico rutinario y datos confidenciales): Dirigir consultas habituales y código interno a GPT-OSS 120B en infraestructura local (o Gemini 2.5 Flash).
  2. Capa 2 (Razonamiento de vanguardia y vídeo extenso): Escalar demostraciones complejas y vídeos de larga duración a Gemini 3 Pro (o GPT 5.2).
← Todos los Artículos
0 / 4