Benchmarks

GPT-OSS 120B बनाम Gemini 3 Pro: बेंचमार्क और लागत विश्लेषण

### त्वरित उत्तर: GPT-OSS 120B बनाम Gemini 3 Pro

Gemini 3 Pro जटिल मल्टीमॉडल रीज़निंग और 20 लाख (2M) टोकन संदर्भ में अग्रणी है, जो HLE (32.4%) और GPQA Diamond (79.2%) में शीर्ष पर है। OpenAI का ओपन-वेट्स मॉडल GPT-OSS 120B (117B कुल, 24B सक्रिय MoE) डेटा संप्रभुता, शून्य टोकन ट्रांसफर शुल्क और दो H100 पर vLLM FP8 में 15ms से कम स्थानीय विलंबता प्रदान करता है।


1. वास्तुशिल्प अवलोकन: ओपन-वेट्स MoE बनाम प्रोप्राइटरी सुपरसिस्टम

2026 में, आर्टिफिशियल इंटेलिजेंस ने एक महत्वपूर्ण मोड़ ले लिया है। OpenAI ने अपना प्रमुख ओपन-वेट्स मिक्सचर-ऑफ़-एक्सपर्ट्स (MoE) मॉडल GPT-OSS 120B जारी किया, जिसने Google के प्रोप्राइटरी सिस्टम Gemini 3 Pro और इसके किफायती मॉडल Gemini 2.5 Flash को सीधी चुनौती दी। साथ ही, उद्योग जगत दोनों की तुलना GPT 5.2 से कर रहा है।

मुख्य बहस केवल बेंचमार्क अंकों की नहीं है, बल्कि पूर्ण मॉडल संप्रभुता (स्थानीय होस्टिंग, भार निरीक्षण, शून्य डेटा रिसाव, निश्चित लेटेंसी) और विशाल क्लाउड इंफ्रास्ट्रक्चर (20 लाख टोकन का मल्टीमॉडल संदर्भ, डायनामिक टेस्ट-टाइम कंप्यूट और शून्य क्लस्टर रखरखाव) के बीच चयन की है।

+-----------------------------------------------------------------------------------------+
|                                2026 आर्किटेक्चर मॉडल तुलना                              |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B (ओपन-वेट्स Mixture-of-Experts)                                           |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | 116.8B कुल पैरामीटर | ---> | Top-2 राउटर रूटिंग  | ---> | 23.8B सक्रिय पैरामीटर|    |
|   | 16 एक्सपर्ट लेयर्स  |      | FP8 नेटिव सर्विंग   |      | 128K कॉन्टेक्स्ट    |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> स्थानीय होस्टिंग: 2x H100 / 4x L40S <---------+                |
|                                                                                         |
|   GEMINI 3 PRO (प्रोप्राइटरी नेटिव मल्टीमॉडल सिस्टम)                                    |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | हाइब्रिड डेंस-MoE   | ---> | Gemini Deep Thought | ---> | नेटिव ऑडियो और वीडियो|    |
|   | Google TPU v6e      |      | डायनामिक टेस्ट-टाइम |      | 20 लाख टोकन संदर्भ  |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Google Vertex AI / Cloud AI Studio API <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

जहाँ Gemini 3 Pro शैक्षणिक ओलंपियाड परीक्षणों (MATH-500, HLE) और वीडियो प्रोसेसिंग में नए मानक स्थापित करता है, वहीं GPT-OSS 120B डेवलपर्स को असीमित इन्फरेंस, LoRA/DoRA के माध्यम से कस्टम फाइन-ट्यूनिंग और अनुमानित स्थिर हार्डवेयर लागत प्रदान करता है।


2. मॉडल आर्किटेक्चर और VRAM मेमोरी आवश्यकताएं

स्थानीय हार्डवेयर पर GPT-OSS 120B चलाने के लिए इसके स्पार्स MoE इंजन और Google के प्रबंधित TPU इंफ्रास्ट्रक्चर के अंतर को समझना आवश्यक है।

तुलनात्मक तकनीकी विशिष्टताएं

पैरामीटर / विशेषता OpenAI GPT-OSS 120B Google Gemini 3 Pro Google Gemini 2.5 Flash OpenAI GPT 5.2
वेट्स की उपलब्धता ओपन-वेट्स (Apache 2.0) प्रोप्राइटरी API प्रोप्राइटरी API प्रोप्राइटरी API
कुल पैरामीटर 116.8 बिलियन अघोषित (~1.2T MoE) अघोषित (~220B MoE) अघोषित (~1.8T MoE)
प्रति टोकन सक्रिय 23.8 बिलियन (Top-2 / 16) अघोषित (~90B सक्रिय) अघोषित (~24B सक्रिय) अघोषित (~140B सक्रिय)
अटेंशन मैकेनिज्म Grouped-Query Attention (GQA) Multi-Head Multi-Query Multi-Query Attention (MQA) डायनामिक अटेंशन राउटर
कॉन्टेक्स्ट विंडो 128,000 टोकन (RoPE) 2,000,000 टोकन 1,000,000 टोकन 256,000 टोकन
नेटिव मोडैलिटीज टेक्स्ट, कोड (बाहरी ViT) नेटिव टेक्स्ट, इमेज, ऑडियो, वीडियो नेटिव टेक्स्ट, इमेज, ऑडियो, वीडियो नेटिव टेक्स्ट, इमेज, ऑडियो
रीज़निंग इंजन प्रॉम्प्ट CoT / विस्तृत R1 नेटिव Deep Thought (डायनामिक) टेस्ट-टाइम सर्च (लाइट) अनुकूलनीय रीज़निंग इंजन

GPT-OSS 120B VRAM और क्वांटाइजेशन मैट्रिक्स

यद्यपि रनटाइम पर केवल 23.8B पैरामीटर सक्रिय होते हैं, PCIe बस की रुकावट से बचने के लिए सभी 116.8B पैरामीटर GPU मेमोरी में मौजूद होने चाहिए:

+------------------------------------------------------------------------------------+
|                   GPT-OSS 120B हार्डवेयर और VRAM आवश्यकता गाइड                    |
+---------------+---------------+------------------+-------------------+-------------+
| क्वांटाइजेशन  | मॉडल आकार     | न्यूनतम VRAM     | अनुशंसित हार्डवेयर| टोकन/सेकंड  |
+---------------+---------------+------------------+-------------------+-------------+
| FP16 / BF16   | 233.6 GB      | 264 GB           | 4x A100 / H100 80G| 48 tokens/s |
| FP8 (नेटिव)   | 116.8 GB      | 136 GB           | 2x H100 / 4x L40S | 76 tokens/s |
| INT4 (AWQ)    | 62.4 GB       | 76 GB            | 1x H100 / 2x A6000| 84 tokens/s |
| EXL2 (3.5 bpw)| 54.2 GB       | 66 GB            | 3x RTX 4090 (24GB)| 38 tokens/s |
| GGUF (Q4_K_M) | 68.0 GB       | 82 GB            | Mac Studio M4 Ultra| 28 tokens/s|
+---------------+---------------+------------------+-------------------+-------------+

उद्यमों के लिए, दो NVIDIA H100 80GB SXM5 कार्ड पर FP8 में चलाना सबसे संतुलित समाधान है।


3. बेंचमार्क परिणाम: प्रत्यक्ष तुलना

हमने उच्च-स्तरीय गणित, डॉक्टरेट विज्ञान और सॉफ्टवेयर इंजीनियरिंग बेंचमार्क पर परीक्षण किया। GPT-OSS 120B को 8x H100 क्लस्टर पर vLLM v0.9.1 (FP8) के साथ परखा गया। Gemini मॉडल Google Cloud Vertex AI द्वारा मूल्यांकित किए गए।

प्रमुख बेंचमार्क स्कोर

बेंचमार्क और मीट्रिक GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2 (संदर्भ)
Humanity's Last Exam (HLE) 24.8% 32.4% 18.6% 34.1%
GPQA Diamond (PhD विज्ञान) 68.4% 79.2% 62.8% 81.5%
MATH-500 (ओलंपियाड गणित) 88.2% 94.6% 82.4% 95.8%
AIME 2026 (Pass@1) 64.0% 78.5% 52.0% 82.0%
SWE-bench Verified (हल किए) 56.4% 68.2% 44.5% 71.8%
LiveCodeBench v6 (2026 कोड) 62.1% 72.8% 51.4% 74.5%
MMLU-Pro (CoT रीज़निंग) 81.2% 89.5% 76.3% 90.4%
MMMU (कॉलेज मल्टीमॉडल) 68.5% (ViT) 76.8% (नेटिव) 64.2% 78.2%
MathVista (विज़ुअल गणित) 71.2% 82.4% 69.1% 84.0%
NIAH (20 लाख टोकन सर्च) 99.8% (128k) 100.0% (2M) 99.9% (1M) 100.0% (256k)

मुख्य विश्लेषण

  1. रीज़निंग में बढ़त: Gemini 3 Pro HLE में 7.6% और GPQA Diamond में 10.8% आगे है।
  2. सॉफ्टवेयर इंजीनियरिंग (SWE-bench): Gemini 3 Pro 68.2% वास्तविक समस्याओं को हल करता है, जबकि GPT-OSS 120B 56.4% हल करता है।
  3. Flash मॉडल पर विजय: GPT-OSS 120B हर श्रेणी में Gemini 2.5 Flash से काफी आगे है।
  4. ओपन-वेट्स की ऐतिहासिक सफलता: GPT-OSS 120B पहला ओपन मॉडल है जिसने MATH-500 पर 88% और SWE-bench पर 56% पार किया है।

4. मल्टीमॉडल आर्किटेक्चर और कॉन्टेक्स्ट सीमाएं

  • Gemini 3 Pro (2,000,000 टोकन): पूर्ण कोडबेस, 2 घंटे का बिना कंप्रेस किया वीडियो और दर्जनों ऑडियो फाइल्स को बिना सटीकता खोए प्रोसेस करता है।
  • GPT-OSS 120B (128,000 टोकन): Yarn इंटरपोलेशन आधारित RoPE का उपयोग करता है। अधिकांश कोडिंग कार्यों के लिए पर्याप्त है, लेकिन बहुत लंबे वीडियो के लिए बाहरी RAG आवश्यक है।

5. परिनियोजन गाइड: CLI और API कोड

vLLM के साथ GPT-OSS 120B चलाना (Docker / TP=2)

docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

OpenAI क्लाइंट द्वारा परीक्षण कॉल:

curl -X POST http://localhost:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "openai/gpt-oss-120b",
    "messages": [
      {"role": "system", "content": "आप एक वरिष्ठ सिस्टम आर्किटेक्ट हैं।"},
      {"role": "user", "content": "C++20 में एटॉमिक पॉइंटर्स के साथ एक लॉक-फ्री रिंग बफर लिखें।"}
    ],
    "temperature": 0.1,
    "max_tokens": 1024
  }'

6. वित्तीय अर्थशास्त्र: API दरें बनाम सर्वर TCO

मॉडल इनपुट ($/1M) आउटपुट ($/1M) कैश्ड इनपुट ($/1M) औसत दर (3:1 अनुपात)
Google Gemini 3 Pro $1.25 $5.00 $0.31 $2.19
Google Gemini 2.5 Flash $0.075 $0.30 $0.019 $0.13
OpenAI GPT 5.2 $2.50 $10.00 $0.62 $4.38
GPT-OSS 120B (लोकल सर्वर) निश्चित लागत निश्चित लागत लागू नहीं हार्डवेयर क्षमता तक
  • ब्रेक-इवन विश्लेषण: यदि आपका संगठन प्रतिदिन 6.5 करोड़ टोकन से अधिक प्रोसेस करता है, तो GPT-OSS 120B को दो H100 पर खुद चलाना Gemini 3 Pro API से बहुत सस्ता पड़ता है। 5 करोड़ टोकन/दिन से कम के लिए API अधिक किफायती है।

7. उद्यम निर्णय मैट्रिक्स

  1. हाइब्रिड रूटिंग रणनीति: आंतरिक सामान्य कार्यों, निजी कोड और संवेदनशील डेटा के लिए स्थानीय GPT-OSS 120B का उपयोग करें।
  2. जटिल शोध और वीडियो: अत्यधिक जटिल गणितीय प्रमाणों और 2 घंटे के वीडियो विश्लेषण को Gemini 3 Pro (या GPT 5.2) पर भेजें।
← सभी लेख
0 / 4