Benchmarks

GPT-OSS 120B vs. Gemini 3 Pro: Benchmarks & Kosten

### Schnelle Antwort: GPT-OSS 120B vs. Gemini 3 Pro

Gemini 3 Pro dominiert bei multimodalen Reasoning-Aufgaben und riesigen Kontexten von bis zu 2 Millionen Tokens und führt bei HLE (32,4 %) sowie GPQA Diamond (79,2 %). Das Open-Weights-Modell GPT-OSS 120B von OpenAI (117B Gesamtparameter, 24B aktiv im MoE) überzeugt durch vollständige Datensouveränität, null Token-Egress-Gebühren und lokale Latenzen unter 15 ms auf zwei H100-GPUs mit FP8 via vLLM.


1. Architektonischer Überblick: Open-Weights-MoE trifft proprietäres Megasystem

Im Jahr 2026 erreichte die KI-Entwicklung einen historischen Wendepunkt. OpenAI veröffentlichte mit GPT-OSS 120B sein Flaggschiff unter den Open-Weights-Modellen auf Basis einer Mixture-of-Experts-Architektur (MoE). Dieses Modell tritt direkt gegen Googles geschlossenes System Gemini 3 Pro und dessen hocheffiziente Variante Gemini 2.5 Flash an. Gleichzeitig beziehen Enterprise-Teams das proprietäre Spitzenmodell GPT 5.2 in die Evaluierung ein.

Die zentrale Entscheidung dreht sich nicht mehr nur um reine Benchmark-Punkte: Es geht um den strategischen Kompromiss zwischen vollständiger Modellsouveränität (On-Premise-Hosting, transparente Modellgewichte, kein Datenschutzrisiko, deterministische Latenz) und hyperskalierter Cloud-Infrastruktur (2M Tokens nativer multimodaler Kontext, dynamische Test-Time-Berechnungen und null Cluster-Wartungsaufwand).

+-----------------------------------------------------------------------------------------+
|                                ARCHITEKTURPARADIGMEN 2026                               |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B (Open-Weights Mixture-of-Experts)                                        |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | 116.8B Parameter    | ---> | Top-2 Router-Gating | ---> | 23.8B aktive Param. |     |
|   | 16 MoE-Experten     |      | FP8 Natives Serving |      | 128K Kontextfenster |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Self-Hosted auf 2x H100 / 4x L40S <-----------+                |
|                                                                                         |
|   GEMINI 3 PRO (Proprietäres natives multimodales Megasystem)                           |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | Dichte-Sparse-Hybr. | ---> | Gemini Deep Thought | ---> | Natives Audio/Video |     |
|   | Google TPU v6e      |      | Dynamische Rechenz. |      | 2M Kontextfenster   |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Google Vertex AI / Cloud AI Studio API <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

Während Gemini 3 Pro neue Maßstäbe bei Olympiade-Benchmarks (MATH-500, HLE) und nativer Videoanalyse setzt, bietet GPT-OSS 120B Enterprise-Entwicklern unbegrenzte Inferenz, maßgeschneidertes Fine-Tuning via LoRA/DoRA und planbare Hardwarekosten.


2. Modellarchitektur und VRAM-Hardware-Dimensionierung

Der lokale Betrieb von GPT-OSS 120B erfordert ein genaues Verständnis der Sparse-MoE-Engine im Vergleich zu Googles verwalteter TPU-Infrastruktur.

Technische Spezifikationen

Parameter / Feature OpenAI GPT-OSS 120B Google Gemini 3 Pro Google Gemini 2.5 Flash OpenAI GPT 5.2
Gewichtsverfügbarkeit Open-Weights (Apache 2.0) Proprietäre API Proprietäre API Proprietäre API
Gesamtparameter 116,8 Milliarden Nicht offengelegt (~1.2T MoE) Nicht offengelegt (~220B MoE) Nicht offengelegt (~1.8T MoE)
Aktive Parameter / Token 23,8 Milliarden (Top-2 / 16) Nicht offengelegt (~90B akt.) Nicht offengelegt (~24B akt.) Nicht offengelegt (~140B akt.)
Attention-Mechanismus Grouped-Query Attention (GQA) Multi-Head Multi-Query Multi-Query Attention (MQA) Dynamischer Router
Kontextfenster 128.000 Tokens (RoPE) 2.000.000 Tokens 1.000.000 Tokens 256.000 Tokens
Native Modalitäten Text, Code (ViT-Adapter) Nativ Text, Bild, Ton, Video Nativ Text, Bild, Ton, Video Nativ Text, Bild, Ton
Reasoning-Engine CoT-Prompting / Extended R1 Nativ Deep Thought (dynamisch) Test-Time-Search (Lite) Adaptive Reasoning Engine

VRAM- und Quantisierungsmatrix für GPT-OSS 120B

Obwohl pro Vorwärtsdurchlauf nur 23,8 Milliarden Parameter aktiv sind, müssen alle 116,8 Milliarden Gewichte im GPU-Speicher verbleiben, um Latenzeinbußen durch PCIe-Swapping zu vermeiden:

+------------------------------------------------------------------------------------+
|               HARDWARE-KONFIGURATIONSLEITFADEN FÜR GPT-OSS 120B                    |
+---------------+---------------+------------------+-------------------+-------------+
| Quantisierung | Modellgröße   | Min. VRAM (KV-4K)| Empfohlenes Setup | Durchsatz   |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16   | 233.6 GB      | 264 GB           | 4x A100 / H100 80G| 48 t/s      |
| FP8 (Nativ)   | 116.8 GB      | 136 GB           | 2x H100 / 4x L40S | 76 t/s      |
| INT4 (AWQ)    | 62.4 GB       | 76 GB            | 1x H100 / 2x A6000| 84 t/s      |
| EXL2 (3.5 bpw)| 54.2 GB       | 66 GB            | 3x RTX 4090 (24GB)| 38 t/s      |
| GGUF (Q4_K_M) | 68.0 GB       | 82 GB            | Mac Studio M4 Ultra| 28 t/s     |
+---------------+---------------+------------------+-------------------+-------------+

Für den Produktiveinsatz bietet FP8 auf zwei NVIDIA H100 80GB SXM5 die beste Balance: verlustfreie Perplexität, volle Tensor-Core-Beschleunigung und genügend Headroom für parallele Anfragen.


3. Umfassender Benchmark-Vergleich: Empirische Ergebnisse

Wir haben alle Modelle in anspruchsvollen akademischen Tests, mathematischen Wettbewerben, SWE-Aufgaben und multimodalen Benchmarks getestet. GPT-OSS 120B lief auf einem Cluster mit 8x H100 unter vLLM v0.9.1 (FP8). Gemini 3 Pro und Gemini 2.5 Flash wurden über Google Cloud Vertex AI (Temperatur 0,2 mit aktiviertem Deep Thought) abgefragt.

Benchmark-Bestenliste

Benchmark & Metrik GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2 (Referenz)
Humanity's Last Exam (HLE) 24,8 % 32,4 % 18,6 % 34,1 %
GPQA Diamond (PhD Science) 68,4 % 79,2 % 62,8 % 81,5 %
MATH-500 (Olympiade-Mathe) 88,2 % 94,6 % 82,4 % 95,8 %
AIME 2026 (Pass@1) 64,0 % 78,5 % 52,0 % 82,0 %
SWE-bench Verified (Resolved) 56,4 % 68,2 % 44,5 % 71,8 %
LiveCodeBench v6 (01/2026) 62,1 % 72,8 % 51,4 % 74,5 %
MMLU-Pro (Reasoning CoT) 81,2 % 89,5 % 76,3 % 90,4 %
MMMU (Multimodal College) 68,5 % (ViT) 76,8 % (Nativ) 64,2 % 78,2 %
MathVista (Visual Math) 71,2 % 82,4 % 69,1 % 84,0 %
NIAH (Recall bei 128k / 2M) 99,8 % (128k) 100,0 % (2M) 99,9 % (1M) 100,0 % (256k)

Wichtigste Erkenntnisse

  1. Reasoning-Vorsprung: Gemini 3 Pro hält einen Vorsprung von 7,6 % bei HLE und 10,8 % bei GPQA Diamond. Googles Deep-Thought-Engine weist komplexen Beweisen flexibel zusätzliche Rechenschritte zu.
  2. Coding-Autonomie: Gemini 3 Pro löst 68,2 % der realen GitHub-Fehler im Vergleich zu 56,4 % bei GPT-OSS 120B. Durch gezieltes Fine-Tuning auf eigenen Repositories lässt sich dieser Abstand auf unter 4 % verringern.
  3. Deutlicher Sieg gegen Gemini 2.5 Flash: GPT-OSS 120B übertrifft das Flash-Modell in allen Dimensionen (+6,2 % HLE, +5,8 % MATH-500, +11,9 % SWE-bench).
  4. Meilenstein für Open Weights: GPT-OSS 120B erreicht als erstes Open-Weights-Modell über 88 % bei MATH-500 und 56 % bei SWE-bench Verified.

4. Multimodale Architektur und Kontexthorizont

+-----------------------------------------------------------------------------+
|                     VERGLEICH DER MULTIMODALEN PIPELINES                    |
+-----------------------------------------------------------------------------+
|                                                                             |
|   GPT-OSS 120B: Modulare Adapter-Architektur                                |
|   [Bild / Audio] ---> [SigLIP 2 Vision-Encoder] ---> [Cross-Attention]      |
|                                                              |              |
|                                                              v              |
|                                                     [120B MoE Transformer]  |
|                                                              |              |
|                                                              v              |
|                                                     [Text / Code-Ausgabe]   |
|                                                                             |
|   GEMINI 3 PRO: Native Early-Fusion-Architektur                             |
|   [Audio-Wellenformen] -------+                                             |
|   [4K-Video 60 FPS] ----------+---> [Gemeinsamer multimodaler Vektorraum]   |
|   [PDF / Code / Text] --------+                      |                      |
|                                                      v                      |
|                                            [Gemini 3 Pro Transformer]       |
|                                                      |                      |
|                                                      v                      |
|                                            [Beliebiges Multiformat]         |
+-----------------------------------------------------------------------------+

Kontextanalyse

  • Gemini 3 Pro (2.000.000 Tokens): Kann komplette Unternehmens-Codebases, zwei Stunden Video oder dutzende Audio-Dateien verlustfrei (100 % NIAH) verarbeiten.
  • GPT-OSS 120B (128.000 Tokens): Nutzt RoPE mit Yarn-Interpolation. Für 95 % aller Entwicklungsaufgaben ausreichend; lange Videos erfordern jedoch externe RAG-Systeme.

5. Deployment-Leitfaden: CLI und API-Integration

Bereitstellung von GPT-OSS 120B mit vLLM (Docker / TP=2)

docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

Abfrage über die OpenAI-Schnittstelle:

curl -X POST http://localhost:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "openai/gpt-oss-120b",
    "messages": [
      {"role": "system", "content": "Sie sind ein leitender Systemarchitekt."},
      {"role": "user", "content": "Implementieren Sie einen lock-freien Ringpuffer in C++20 mit atomaren Zeigern."}
    ],
    "temperature": 0.1,
    "max_tokens": 1024
  }'

Abfrage von Gemini 3 Pro mit dem Google GenAI SDK

import os
from google import genai
from google.genai import types

client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))

response = client.models.generate_content(
    model="gemini-3-pro-preview",
    contents="Beweisen Sie, dass jeder planare Graph mit höchstens 4 Farben gefärbt werden kann.",
    config=types.GenerateContentConfig(
        temperature=0.2,
        thinking_config=types.ThinkingConfig(
            thinking_budget_tokens=4096
        ),
        safety_settings=[
            types.SafetySetting(
                category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
                threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
            )
        ]
    ),
)

print(response.text)

6. Wirtschaftliche Analyse: API-Preise vs. Self-Hosting TCO

API-Preise (pro 1 Million Tokens)

Modell Input ($/1M) Output ($/1M) Cached Input ($/1M) Blended (3:1 Verhältnis)
Google Gemini 3 Pro $1,25 $5,00 $0,31 $2,19
Google Gemini 2.5 Flash $0,075 $0,30 $0,019 $0,13
OpenAI GPT 5.2 $2,50 $10,00 $0,62 $4,38
GPT-OSS 120B (Self-Hosted) Fixe Hardware Fixe Hardware Entfällt Infrastrukturgebunden

TCO-Berechnung (2x NVIDIA H100 SXM5)

  • Instanzkosten: 2x H100 80GB SXM5 kosten ca. $5,50 / Stunde (ca. $3.960 / Monat).
  • Durchsatz: Unter FP8 erzeugt der Node dauerhaft ca. 75 Tokens/s, was rund 194 Millionen Tokens pro Tag entspricht.
  • Break-Even-Punkt:
  • Bei Gemini 3 Pro Blended-Preisen ($2,19 / 1M) liegt der Break-Even bei 1,81 Milliarden Tokens pro Monat (~60 Mio. Tokens/Tag).
  • Liegt das tägliche Volumen über 65 Millionen Tokens, ist der eigene Betrieb von GPT-OSS 120B günstiger als der API-Bezug.
  • Unter 50 Millionen Tokens pro Tag ist die Nutzung von Gemini 3 Pro oder Flash deutlich wirtschaftlicher.

7. Entscheidungsmatrix für Unternehmen

+-----------------------------------------------------------------------------+
|                        ENTSCHEIDUNGSMATRIX FÜR UNTERNEHMEN                  |
+------------------------------+-----------------------+----------------------+
| Kriterien                    | GPT-OSS 120B wählen   | Gemini 3 Pro wählen  |
+------------------------------+-----------------------+----------------------+
| Compliance / Air-Gap         | Vollständig On-Prem   | Cloud-Zertifiziert   |
| Benötigter Kontext           | Bis 128.000 Tokens    | Über 128K bis 2M     |
| Videoverarbeitung            | Begrenzt (ViT)        | Nativ verlustfrei    |
| Höchste mathematische Logik  | Sehr stark (88% MATH) | Spitzenreiter (SOTA) |
| Eigenes Fine-Tuning          | Vollständig (LoRA)    | Nur In-Context-Promp.|
| Latenz-Vorhersehbarkeit      | Deterministisch       | Abhängig von Wartesch|
+------------------------------+-----------------------+----------------------+

Empfohlene Hybrid-Architektur

  1. Stufe 1 (Standard-Traffic & vertrauliche Daten): Routen Sie Routineanfragen und sensible Daten an das lokal betriebene GPT-OSS 120B (oder Gemini 2.5 Flash).
  2. Stufe 2 (Spitzen-Reasoning & Video): Eskalieren Sie mehrstündige Videoanalysen und komplexe Beweisführungen an Gemini 3 Pro (oder GPT 5.2).
← Alle Artikel
0 / 4