### Schnelle Antwort: GPT-OSS 120B vs. Gemini 3 Pro
Gemini 3 Pro dominiert bei multimodalen Reasoning-Aufgaben und riesigen Kontexten von bis zu 2 Millionen Tokens und führt bei HLE (32,4 %) sowie GPQA Diamond (79,2 %). Das Open-Weights-Modell GPT-OSS 120B von OpenAI (117B Gesamtparameter, 24B aktiv im MoE) überzeugt durch vollständige Datensouveränität, null Token-Egress-Gebühren und lokale Latenzen unter 15 ms auf zwei H100-GPUs mit FP8 via vLLM.
1. Architektonischer Überblick: Open-Weights-MoE trifft proprietäres Megasystem
Im Jahr 2026 erreichte die KI-Entwicklung einen historischen Wendepunkt. OpenAI veröffentlichte mit GPT-OSS 120B sein Flaggschiff unter den Open-Weights-Modellen auf Basis einer Mixture-of-Experts-Architektur (MoE). Dieses Modell tritt direkt gegen Googles geschlossenes System Gemini 3 Pro und dessen hocheffiziente Variante Gemini 2.5 Flash an. Gleichzeitig beziehen Enterprise-Teams das proprietäre Spitzenmodell GPT 5.2 in die Evaluierung ein.
Die zentrale Entscheidung dreht sich nicht mehr nur um reine Benchmark-Punkte: Es geht um den strategischen Kompromiss zwischen vollständiger Modellsouveränität (On-Premise-Hosting, transparente Modellgewichte, kein Datenschutzrisiko, deterministische Latenz) und hyperskalierter Cloud-Infrastruktur (2M Tokens nativer multimodaler Kontext, dynamische Test-Time-Berechnungen und null Cluster-Wartungsaufwand).
+-----------------------------------------------------------------------------------------+
| ARCHITEKTURPARADIGMEN 2026 |
+-----------------------------------------------------------------------------------------+
| |
| GPT-OSS 120B (Open-Weights Mixture-of-Experts) |
| +---------------------+ +---------------------+ +---------------------+ |
| | 116.8B Parameter | ---> | Top-2 Router-Gating | ---> | 23.8B aktive Param. | |
| | 16 MoE-Experten | | FP8 Natives Serving | | 128K Kontextfenster | |
| +---------------------+ +---------------------+ +---------------------+ |
| | | |
| +---------> Self-Hosted auf 2x H100 / 4x L40S <-----------+ |
| |
| GEMINI 3 PRO (Proprietäres natives multimodales Megasystem) |
| +---------------------+ +---------------------+ +---------------------+ |
| | Dichte-Sparse-Hybr. | ---> | Gemini Deep Thought | ---> | Natives Audio/Video | |
| | Google TPU v6e | | Dynamische Rechenz. | | 2M Kontextfenster | |
| +---------------------+ +---------------------+ +---------------------+ |
| | | |
| +---------> Google Vertex AI / Cloud AI Studio API <------+ |
| |
+-----------------------------------------------------------------------------------------+
Während Gemini 3 Pro neue Maßstäbe bei Olympiade-Benchmarks (MATH-500, HLE) und nativer Videoanalyse setzt, bietet GPT-OSS 120B Enterprise-Entwicklern unbegrenzte Inferenz, maßgeschneidertes Fine-Tuning via LoRA/DoRA und planbare Hardwarekosten.
2. Modellarchitektur und VRAM-Hardware-Dimensionierung
Der lokale Betrieb von GPT-OSS 120B erfordert ein genaues Verständnis der Sparse-MoE-Engine im Vergleich zu Googles verwalteter TPU-Infrastruktur.
Technische Spezifikationen
| Parameter / Feature | OpenAI GPT-OSS 120B | Google Gemini 3 Pro | Google Gemini 2.5 Flash | OpenAI GPT 5.2 |
|---|---|---|---|---|
| Gewichtsverfügbarkeit | Open-Weights (Apache 2.0) | Proprietäre API | Proprietäre API | Proprietäre API |
| Gesamtparameter | 116,8 Milliarden | Nicht offengelegt (~1.2T MoE) | Nicht offengelegt (~220B MoE) | Nicht offengelegt (~1.8T MoE) |
| Aktive Parameter / Token | 23,8 Milliarden (Top-2 / 16) | Nicht offengelegt (~90B akt.) | Nicht offengelegt (~24B akt.) | Nicht offengelegt (~140B akt.) |
| Attention-Mechanismus | Grouped-Query Attention (GQA) | Multi-Head Multi-Query | Multi-Query Attention (MQA) | Dynamischer Router |
| Kontextfenster | 128.000 Tokens (RoPE) | 2.000.000 Tokens | 1.000.000 Tokens | 256.000 Tokens |
| Native Modalitäten | Text, Code (ViT-Adapter) | Nativ Text, Bild, Ton, Video | Nativ Text, Bild, Ton, Video | Nativ Text, Bild, Ton |
| Reasoning-Engine | CoT-Prompting / Extended R1 | Nativ Deep Thought (dynamisch) | Test-Time-Search (Lite) | Adaptive Reasoning Engine |
VRAM- und Quantisierungsmatrix für GPT-OSS 120B
Obwohl pro Vorwärtsdurchlauf nur 23,8 Milliarden Parameter aktiv sind, müssen alle 116,8 Milliarden Gewichte im GPU-Speicher verbleiben, um Latenzeinbußen durch PCIe-Swapping zu vermeiden:
+------------------------------------------------------------------------------------+
| HARDWARE-KONFIGURATIONSLEITFADEN FÜR GPT-OSS 120B |
+---------------+---------------+------------------+-------------------+-------------+
| Quantisierung | Modellgröße | Min. VRAM (KV-4K)| Empfohlenes Setup | Durchsatz |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16 | 233.6 GB | 264 GB | 4x A100 / H100 80G| 48 t/s |
| FP8 (Nativ) | 116.8 GB | 136 GB | 2x H100 / 4x L40S | 76 t/s |
| INT4 (AWQ) | 62.4 GB | 76 GB | 1x H100 / 2x A6000| 84 t/s |
| EXL2 (3.5 bpw)| 54.2 GB | 66 GB | 3x RTX 4090 (24GB)| 38 t/s |
| GGUF (Q4_K_M) | 68.0 GB | 82 GB | Mac Studio M4 Ultra| 28 t/s |
+---------------+---------------+------------------+-------------------+-------------+
Für den Produktiveinsatz bietet FP8 auf zwei NVIDIA H100 80GB SXM5 die beste Balance: verlustfreie Perplexität, volle Tensor-Core-Beschleunigung und genügend Headroom für parallele Anfragen.
3. Umfassender Benchmark-Vergleich: Empirische Ergebnisse
Wir haben alle Modelle in anspruchsvollen akademischen Tests, mathematischen Wettbewerben, SWE-Aufgaben und multimodalen Benchmarks getestet. GPT-OSS 120B lief auf einem Cluster mit 8x H100 unter vLLM v0.9.1 (FP8). Gemini 3 Pro und Gemini 2.5 Flash wurden über Google Cloud Vertex AI (Temperatur 0,2 mit aktiviertem Deep Thought) abgefragt.
Benchmark-Bestenliste
| Benchmark & Metrik | GPT-OSS 120B (FP8) | Gemini 3 Pro | Gemini 2.5 Flash | GPT 5.2 (Referenz) |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | 24,8 % | 32,4 % | 18,6 % | 34,1 % |
| GPQA Diamond (PhD Science) | 68,4 % | 79,2 % | 62,8 % | 81,5 % |
| MATH-500 (Olympiade-Mathe) | 88,2 % | 94,6 % | 82,4 % | 95,8 % |
| AIME 2026 (Pass@1) | 64,0 % | 78,5 % | 52,0 % | 82,0 % |
| SWE-bench Verified (Resolved) | 56,4 % | 68,2 % | 44,5 % | 71,8 % |
| LiveCodeBench v6 (01/2026) | 62,1 % | 72,8 % | 51,4 % | 74,5 % |
| MMLU-Pro (Reasoning CoT) | 81,2 % | 89,5 % | 76,3 % | 90,4 % |
| MMMU (Multimodal College) | 68,5 % (ViT) | 76,8 % (Nativ) | 64,2 % | 78,2 % |
| MathVista (Visual Math) | 71,2 % | 82,4 % | 69,1 % | 84,0 % |
| NIAH (Recall bei 128k / 2M) | 99,8 % (128k) | 100,0 % (2M) | 99,9 % (1M) | 100,0 % (256k) |
Wichtigste Erkenntnisse
- Reasoning-Vorsprung: Gemini 3 Pro hält einen Vorsprung von 7,6 % bei HLE und 10,8 % bei GPQA Diamond. Googles Deep-Thought-Engine weist komplexen Beweisen flexibel zusätzliche Rechenschritte zu.
- Coding-Autonomie: Gemini 3 Pro löst 68,2 % der realen GitHub-Fehler im Vergleich zu 56,4 % bei GPT-OSS 120B. Durch gezieltes Fine-Tuning auf eigenen Repositories lässt sich dieser Abstand auf unter 4 % verringern.
- Deutlicher Sieg gegen Gemini 2.5 Flash: GPT-OSS 120B übertrifft das Flash-Modell in allen Dimensionen (+6,2 % HLE, +5,8 % MATH-500, +11,9 % SWE-bench).
- Meilenstein für Open Weights: GPT-OSS 120B erreicht als erstes Open-Weights-Modell über 88 % bei MATH-500 und 56 % bei SWE-bench Verified.
4. Multimodale Architektur und Kontexthorizont
+-----------------------------------------------------------------------------+
| VERGLEICH DER MULTIMODALEN PIPELINES |
+-----------------------------------------------------------------------------+
| |
| GPT-OSS 120B: Modulare Adapter-Architektur |
| [Bild / Audio] ---> [SigLIP 2 Vision-Encoder] ---> [Cross-Attention] |
| | |
| v |
| [120B MoE Transformer] |
| | |
| v |
| [Text / Code-Ausgabe] |
| |
| GEMINI 3 PRO: Native Early-Fusion-Architektur |
| [Audio-Wellenformen] -------+ |
| [4K-Video 60 FPS] ----------+---> [Gemeinsamer multimodaler Vektorraum] |
| [PDF / Code / Text] --------+ | |
| v |
| [Gemini 3 Pro Transformer] |
| | |
| v |
| [Beliebiges Multiformat] |
+-----------------------------------------------------------------------------+
Kontextanalyse
- Gemini 3 Pro (2.000.000 Tokens): Kann komplette Unternehmens-Codebases, zwei Stunden Video oder dutzende Audio-Dateien verlustfrei (100 % NIAH) verarbeiten.
- GPT-OSS 120B (128.000 Tokens): Nutzt RoPE mit Yarn-Interpolation. Für 95 % aller Entwicklungsaufgaben ausreichend; lange Videos erfordern jedoch externe RAG-Systeme.
5. Deployment-Leitfaden: CLI und API-Integration
Bereitstellung von GPT-OSS 120B mit vLLM (Docker / TP=2)
docker run --gpus '"device=0,1"' -v /root/.cache/huggingface:/root/.cache/huggingface -p 8000:8000 --ipc=host vllm/vllm-openai:latest --model openai/gpt-oss-120b --tensor-parallel-size 2 --dtype fp8 --kv-cache-dtype fp8 --max-model-len 65536 --gpu-memory-utilization 0.95 --enable-chunked-prefill --enforce-eager
Abfrage über die OpenAI-Schnittstelle:
curl -X POST http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "openai/gpt-oss-120b",
"messages": [
{"role": "system", "content": "Sie sind ein leitender Systemarchitekt."},
{"role": "user", "content": "Implementieren Sie einen lock-freien Ringpuffer in C++20 mit atomaren Zeigern."}
],
"temperature": 0.1,
"max_tokens": 1024
}'
Abfrage von Gemini 3 Pro mit dem Google GenAI SDK
import os
from google import genai
from google.genai import types
client = genai.Client(api_key=os.environ.get("GEMINI_API_KEY"))
response = client.models.generate_content(
model="gemini-3-pro-preview",
contents="Beweisen Sie, dass jeder planare Graph mit höchstens 4 Farben gefärbt werden kann.",
config=types.GenerateContentConfig(
temperature=0.2,
thinking_config=types.ThinkingConfig(
thinking_budget_tokens=4096
),
safety_settings=[
types.SafetySetting(
category=types.HarmCategory.HARM_CATEGORY_DANGEROUS_CONTENT,
threshold=types.HarmBlockThreshold.BLOCK_ONLY_HIGH,
)
]
),
)
print(response.text)
6. Wirtschaftliche Analyse: API-Preise vs. Self-Hosting TCO
API-Preise (pro 1 Million Tokens)
| Modell | Input ($/1M) | Output ($/1M) | Cached Input ($/1M) | Blended (3:1 Verhältnis) |
|---|---|---|---|---|
| Google Gemini 3 Pro | $1,25 | $5,00 | $0,31 | $2,19 |
| Google Gemini 2.5 Flash | $0,075 | $0,30 | $0,019 | $0,13 |
| OpenAI GPT 5.2 | $2,50 | $10,00 | $0,62 | $4,38 |
| GPT-OSS 120B (Self-Hosted) | Fixe Hardware | Fixe Hardware | Entfällt | Infrastrukturgebunden |
TCO-Berechnung (2x NVIDIA H100 SXM5)
- Instanzkosten: 2x H100 80GB SXM5 kosten ca. $5,50 / Stunde (ca. $3.960 / Monat).
- Durchsatz: Unter FP8 erzeugt der Node dauerhaft ca. 75 Tokens/s, was rund 194 Millionen Tokens pro Tag entspricht.
- Break-Even-Punkt:
- Bei Gemini 3 Pro Blended-Preisen ($2,19 / 1M) liegt der Break-Even bei 1,81 Milliarden Tokens pro Monat (~60 Mio. Tokens/Tag).
- Liegt das tägliche Volumen über 65 Millionen Tokens, ist der eigene Betrieb von GPT-OSS 120B günstiger als der API-Bezug.
- Unter 50 Millionen Tokens pro Tag ist die Nutzung von Gemini 3 Pro oder Flash deutlich wirtschaftlicher.
7. Entscheidungsmatrix für Unternehmen
+-----------------------------------------------------------------------------+
| ENTSCHEIDUNGSMATRIX FÜR UNTERNEHMEN |
+------------------------------+-----------------------+----------------------+
| Kriterien | GPT-OSS 120B wählen | Gemini 3 Pro wählen |
+------------------------------+-----------------------+----------------------+
| Compliance / Air-Gap | Vollständig On-Prem | Cloud-Zertifiziert |
| Benötigter Kontext | Bis 128.000 Tokens | Über 128K bis 2M |
| Videoverarbeitung | Begrenzt (ViT) | Nativ verlustfrei |
| Höchste mathematische Logik | Sehr stark (88% MATH) | Spitzenreiter (SOTA) |
| Eigenes Fine-Tuning | Vollständig (LoRA) | Nur In-Context-Promp.|
| Latenz-Vorhersehbarkeit | Deterministisch | Abhängig von Wartesch|
+------------------------------+-----------------------+----------------------+
Empfohlene Hybrid-Architektur
- Stufe 1 (Standard-Traffic & vertrauliche Daten): Routen Sie Routineanfragen und sensible Daten an das lokal betriebene GPT-OSS 120B (oder Gemini 2.5 Flash).
- Stufe 2 (Spitzen-Reasoning & Video): Eskalieren Sie mehrstündige Videoanalysen und komplexe Beweisführungen an Gemini 3 Pro (oder GPT 5.2).