Benchmarks

GPT-OSS 120B vs Gemini 3 Pro: Benchmarks e Custos

### Resposta Rápida: GPT-OSS 120B vs Gemini 3 Pro

O Gemini 3 Pro domina o raciocínio multimodal complexo e contextos gigantescos de 2M de tokens, liderando no HLE (32,4%) e GPQA Diamond (79,2%). Já o modelo de pesos abertos GPT-OSS 120B da OpenAI (117B parâmetros totais, 24B ativos no MoE) vence em soberania de dados, ausência de taxas de tráfego de saída e latência local abaixo de 15 ms em duas H100 com FP8 via vLLM.


1. Visão Geral: MoE de Pesos Abertos contra Megassistemas Proprietários

Em 2026, o cenário da inteligência artificial atingiu um ponto de inflexão decisivo. A OpenAI lançou o GPT-OSS 120B, seu modelo carro-chefe de pesos abertos baseado em Mixture-of-Experts (MoE), competindo diretamente com o sistema fechado da Google, o Gemini 3 Pro, e sua variante de alta eficiência, o Gemini 2.5 Flash. Simultaneamente, equipes de engenharia corporativas comparam ambas as opções com o benchmark proprietário GPT 5.2.

A decisão técnica vai muito além das pontuações nos testes: trata-se do equilíbrio operacional entre a soberania absoluta do modelo (hospedagem local, auditoria de pesos, vazamento zero de dados, latência determinística) e a infraestrutura em nuvem hiperescalável (2M de tokens de contexto multimodal nativo, computação dinâmica em tempo de inferência e zero manutenção de clusters).

+-----------------------------------------------------------------------------------------+
|                               PARADIGMAS ARQUITETURAIS DE 2026                          |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B (Mixture-of-Experts de Pesos Abertos)                                    |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | 116.8B Parâmetros   | ---> | Roteador Top-2      | ---> | 23.8B Parâm. Ativos |     |
|   | 16 Especialistas    |      | Execução Nativa FP8 |      | Janela de 128K Ctx  |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Hospedagem Local: 2x H100 / 4x L40S <---------+                |
|                                                                                         |
|   GEMINI 3 PRO (Megassistema Multimodal Nativo Proprietário)                            |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | Híbrido Denso-MoE   | ---> | Gemini Deep Thought | ---> | Áudio e Vídeo Nativo|     |
|   | Google TPU v6e      |      | Busca Dinâmica      |      | Janela de 2M Ctx    |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Google Vertex AI / Cloud AI Studio API <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

Enquanto o Gemini 3 Pro lidera em olimpíadas acadêmicas (MATH-500, HLE) e análise de vídeo nativa, o GPT-OSS 120B oferece aos desenvolvedores inferência ilimitada, fine-tuning personalizado com LoRA/DoRA e custos de infraestrutura previsíveis.


2. Arquitetura do Modelo e Requisitos de Memória VRAM

A execução do GPT-OSS 120B em hardware local requer a compreensão de seu mecanismo esparso MoE em comparação com a infraestrutura gerenciada de TPUs da Google.

Especificações Técnicas Comparadas

Parâmetro / Recurso OpenAI GPT-OSS 120B Google Gemini 3 Pro Google Gemini 2.5 Flash OpenAI GPT 5.2
Disponibilidade dos pesos Pesos abertos (Apache 2.0) API proprietária API proprietária API proprietária
Parâmetros totais 116,8 bilhões Não divulgado (~1.2T MoE) Não divulgado (~220B MoE) Não divulgado (~1.8T MoE)
Parâmetros ativos/token 23,8 bilhões (Top-2 / 16) Não divulgado (~90B ativos) Não divulgado (~24B ativos) Não divulgado (~140B ativos)
Mecanismo de atenção Grouped-Query Attention (GQA) Multi-Head Multi-Query Multi-Query Attention (MQA) Roteador dinâmico
Janela de contexto 128.000 tokens (RoPE) 2.000.000 tokens 1.000.000 tokens 256.000 tokens
Modalidades nativas Texto, código (adaptador ViT) Nativo texto, imagem, áudio, vídeo Nativo texto, imagem, áudio, vídeo Nativo texto, imagem, áudio
Motor de raciocínio CoT / Raciocínio estendido R1 Nativo Deep Thought (dinâmico) Busca leve em inferência Motor adaptativo

Matriz de VRAM e Quantização para GPT-OSS 120B

Embora apenas 23,8B parâmetros sejam ativados por inferência, todos os 116,8B pesos precisam residir na memória da GPU para evitar gargalos críticos no barramento PCIe:

+------------------------------------------------------------------------------------+
|               GUIA DE CONFIGURAÇÃO DE HARDWARE PARA GPT-OSS 120B                   |
+---------------+---------------+------------------+-------------------+-------------+
| Quantização   | Tamanho modelo| VRAM mín (KV-4K) | Hardware sugerido | Rendimento  |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16   | 233.6 GB      | 264 GB           | 4x A100 / H100 80G| 48 tokens/s |
| FP8 (Nativo)  | 116.8 GB      | 136 GB           | 2x H100 / 4x L40S | 76 tokens/s |
| INT4 (AWQ)    | 62.4 GB       | 76 GB            | 1x H100 / 2x A6000| 84 tokens/s |
| EXL2 (3.5 bpw)| 54.2 GB       | 66 GB            | 3x RTX 4090 (24GB)| 38 tokens/s |
| GGUF (Q4_K_M) | 68.0 GB       | 82 GB            | Mac Studio M4 Ultra| 28 tokens/s|
+---------------+---------------+------------------+-------------------+-------------+

Para ambientes corporativos, a execução em FP8 em duas placas NVIDIA H100 80GB SXM5 atinge a melhor relação entre fidelidade de saída e desempenho de processamento paralelo.


3. Confronto nos Benchmarks: Resultados Empíricos

Avaliamos os quatro modelos nos principais testes de raciocínio avançado, matemática de olimpíada, engenharia de software e visão multimodal. O GPT-OSS 120B foi testado em um cluster 8x H100 com vLLM v0.9.1 (FP8), enquanto o Gemini 3 Pro e o Gemini 2.5 Flash foram consultados via Google Cloud Vertex AI (temperatura 0,2 com pensamento avançado ativado).

Tabela Comparativa de Benchmarks

Benchmark e Métrica GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2 (Referência)
Humanity's Last Exam (HLE) 24,8% 32,4% 18,6% 34,1%
GPQA Diamond (Ciência PhD) 68,4% 79,2% 62,8% 81,5%
MATH-500 (Olimpíada) 88,2% 94,6% 82,4% 95,8%
AIME 2026 (Pass@1) 64,0% 78,5% 52,0% 82,0%
SWE-bench Verified (Resolvido) 56,4% 68,2% 44,5% 71,8%
LiveCodeBench v6 (01/2026) 62,1% 72,8% 51,4% 74,5%
MMLU-Pro (Raciocínio CoT) 81,2% 89,5% 76,3% 90,4%
MMMU (Multimodal Superior) 68,5% (ViT) 76,8% (Nativo) 64,2% 78,2%
MathVista (Matemática Visual) 71,2% 82,4% 69,1% 84,0%
NIAH (Recuperação 128k / 2M) 99,8% (128k) 100,0% (2M) 99,9% (1M) 100,0% (256k)

Destaques da Avaliação

  1. Raciocínio de Fronteira: O Gemini 3 Pro mantém uma dianteira de 7,6% no HLE e de 10,8% no GPQA Diamond graças à alocação de tokens dinâmicos pelo Deep Thought.
  2. Engenharia de Software (SWE-bench): O Gemini 3 Pro resolve 68,2% dos bugs reais do GitHub contra 56,4% do GPT-OSS 120B. No entanto, o ajuste fino sobre repositórios corporativos reduz essa diferença para menos de 4%.
  3. Vitória expressiva contra o Flash: O GPT-OSS 120B supera o Gemini 2.5 Flash em todas as tarefas cognitivas (+6,2% no HLE, +5,8% no MATH-500, +11,9% no SWE-bench).
  4. Marco para modelos abertos: O GPT-OSS 120B é o primeiro modelo aberto a ultrapassar 88% no MATH-500 e 56% no SWE-bench Verified.

4. Arquitetura Multimodal e Extensão do Contexto

+-----------------------------------------------------------------------------+
|                     COMPARAÇÃO DE PIPELINES MULTIMODAIS                     |
+-----------------------------------------------------------------------------+
|                                                                             |
|   GPT-OSS 120B: Arquitetura modular com adaptador                           |
|   [Imagem / Áudio] ---> [Codificador SigLIP 2] ---> [Atenção Cruzada]       |
|                                                              |              |
|                                                              v              |
|                                                     [Transformador MoE 120B]|
|                                                              |              |
|                                                              v              |
|                                                     [Saída Texto / Código]  |
|                                                                             |
|   GEMINI 3 PRO: Fusão precoce nativa ponta a ponta                          |
|   [Ondas de áudio nativo] ----+                                             |
|   [Vídeo 4K a 60 FPS] --------+---> [Espaço vetorial multimodal integrado]  |
|   [PDF / Código / Texto] -----+                      |                      |
|                                                      v                      |
|                                            [Transformador Gemini 3 Pro]     |
|                                                      |                      |
|                                                      v                      |
|                                            [Geração multiformato]           |
+-----------------------------------------------------------------------------+

Limites de Contexto

  • Gemini 3 Pro (2.000.000 tokens): Ingere repositórios inteiros de software ou duas horas ininterruptas de vídeo com recuperação perfeita (100% NIAH).
  • GPT-OSS 120B (128.000 tokens): Emprega RoPE com interpolação Yarn. Excelente para a rotina diária de desenvolvimento, mas requer RAG externo para arquivos de vídeo muito longos.

5. Guia de Implantação: CLI e Chamadas de API

Execução do GPT-OSS 120B com vLLM (Docker / TP=2)

docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

Chamada de teste com o protocolo da OpenAI:

curl -X POST http://localhost:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "openai/gpt-oss-120b",
    "messages": [
      {"role": "system", "content": "Você é um arquiteto sênior de sistemas."},
      {"role": "user", "content": "Implemente um ring buffer lock-free em C++20 com ponteiros atômicos."}
    ],
    "temperature": 0.1,
    "max_tokens": 1024
  }'

Chamada ao Gemini 3 Pro com Google GenAI SDK

import os
from google import genai
from google.genai import types

client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))

response = client.models.generate_content(
    model="gemini-3-pro-preview",
    contents="Prove que todo grafo planar pode ser colorido com no máximo 4 cores.",
    config=types.GenerateContentConfig(
        temperature=0.2,
        thinking_config=types.ThinkingConfig(
            thinking_budget_tokens=4096
        ),
        safety_settings=[
            types.SafetySetting(
                category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
                threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
            )
        ]
    ),
)

print(response.text)

6. Economia Financeira: Preço de API vs TCO de Servidor Próprio

Comparativo de Preços de API (por 1 milhão de tokens)

Modelo Entrada ($/1M) Saída ($/1M) Entrada em Cache ($/1M) Custo Médio (Razão 3:1)
Google Gemini 3 Pro $1,25 $5,00 $0,31 $2,19
Google Gemini 2.5 Flash $0,075 $0,30 $0,019 $0,13
OpenAI GPT 5.2 $2,50 $10,00 $0,62 $4,38
GPT-OSS 120B (Local) Custo fixo Custo fixo N/D Infraestrutura Fixa

Ponto de Equilíbrio (2x NVIDIA H100 SXM5)

  • Custo do Servidor: 2x H100 80GB SXM5 custam cerca de $5,50 / hora (aproximadamente $3.960 / mês).
  • Vazão Operacional: Em FP8, o nó entrega 75 tokens/s contínuos, processando cerca de 194 milhões de tokens por dia.
  • Análise de Break-Even:
  • Pelo preço médio do Gemini 3 Pro ($2,19 / 1M), a fatura de $3.960 equivale a 1,81 bilhão de tokens ao mês (~60 milhões de tokens ao dia).
  • Acima de 65 milhões de tokens diários, manter o GPT-OSS 120B localmente é mais barato do que pagar as chamadas de API.
  • Abaixo de 50 milhões de tokens/dia, o consumo sob demanda via API do Gemini 3 Pro ou Flash é mais vantajoso.

7. Matriz de Decisão Empresarial

+-----------------------------------------------------------------------------+
|                          MATRIZ DE SELEÇÃO TÉCNICA                          |
+------------------------------+-----------------------+----------------------+
| Critério de Decisão          | Escolha GPT-OSS 120B  | Escolha Gemini 3 Pro |
+------------------------------+-----------------------+----------------------+
| Privacidade e Isolamento     | Total (On-Premise)    | Certificado em Nuvem |
| Tamanho de Contexto          | Até 128.000 tokens    | Acima de 128K até 2M |
| Processamento de Vídeo       | Limitado (via ViT)    | Nativo sem perda     |
| Raciocínio Matemático Puro   | Muito Alto (88% MATH) | Estado da Arte (SOTA)|
| Fine-Tuning de Código Próprio| Total (LoRA, Axolotl) | Apenas em Contexto   |
| Previsibilidade de Latência  | Determinística        | Sujeita a filas      |
+------------------------------+-----------------------+----------------------+

Estratégia de Roteamento Híbrido

  1. Nível 1 (Operações Diárias e Dados Críticos): Direcionar tarefas de rotina e código interno para o GPT-OSS 120B local (ou Gemini 2.5 Flash).
  2. Nível 2 (Raciocínio Extremo e Vídeo Longo): Encaminhar demonstrações complexas e vídeos longos para o Gemini 3 Pro (ou GPT 5.2).
← Todos os artigos
0 / 4