Benchmarks

GPT-OSS 120B بمقابل Gemini 3 Pro: بینچ مارکس اور لاگت کا موازنہ

### فوری جواب: GPT-OSS 120B بمقابلہ Gemini 3 Pro

جیمنی 3 پرو (Gemini 3 Pro) پیچیدہ ملٹی ماڈل استدلال اور 20 لاکھ (2M) ٹوکنز کے وسیع سیاق و سباق میں نمایاں برتری رکھتا ہے اور HLE (32.4%) اور GPQA Diamond (79.2%) میں سرفہرست ہے۔ دوسری جانب اوپن اے آئی کا اوپن ویٹس ماڈل GPT-OSS 120B (کل 117B، فعال 24B MoE) مکمل ڈیٹا خودمختاری، زیرو ٹوکن فیس اور vLLM FP8 کے ساتھ دو H100 پر 15ms سے کم تاخیر فراہم کرتا ہے۔


1. تکنیکی جائزہ: اوپن ویٹس MoE بمقابلہ کلاؤڈ مونوپولی

2026 میں مصنوعی ذہانت کا میدان ایک تاریخی موڑ پر پہنچ چکا ہے۔ اوپن اے آئی نے اپنا فلیگ شپ اوپن ویٹس مکسچر آف ایکسپرٹس (MoE) ماڈل GPT-OSS 120B متعارف کرایا ہے، جو گوگل کے ملکیتی نظام Gemini 3 Pro اور اس کے کم خرچ ماڈل Gemini 2.5 Flash کا براہ راست حریف ہے۔ اس کے ساتھ ساتھ انٹرپرائز ٹیمیں ان دونوں کا موازنہ GPT 5.2 سے بھی کر رہی ہیں۔

اصل فیصلہ محض بینچ مارک اسکور کا نہیں بلکہ ماڈل پر مکمل کنٹرول (مقامی سرور پر ہوسٹنگ، ڈیٹا کا محفوظ رہنا، یقینی رفتار) اور وسیع کلاؤڈ انفراسٹرکچر (20 لاکھ ٹوکنز کا کثیر جہتی سیاق، خودکار پروسیسنگ اور دیکھ بھال سے آزادی) کے درمیان ہے۔

+-----------------------------------------------------------------------------------------+
|                                2026 آرکیٹیکچرل ماڈلز کا موازنہ                          |
+-----------------------------------------------------------------------------------------+
|                                                                                         |
|   GPT-OSS 120B (اوپن ویٹس Mixture-of-Experts)                                           |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | کل 116.8B پیرامیٹرز | ---> | Top-2 روٹنگ میکانزم | ---> | 23.8B فعال پیرامیٹرز|     |
|   | 16 ماہر نیٹ ورکس    |      | FP8 مقامی سرونگ     |      | 128K سیاق کا دائرہ  |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> ذاتی ہوسٹنگ: 2x H100 / 4x L40S <---------------+                |
|                                                                                         |
|   GEMINI 3 PRO (گوگل کا ملکیتی مقامی ملٹی ماڈل نظام)                                    |
|   +---------------------+      +---------------------+      +---------------------+     |
|   | ہائبرڈ ڈینس-MoE     | ---> | جیمنی ڈیپ تھاٹ انجن | ---> | آواز اور ویڈیو سپورٹ|     |
|   | Google TPU v6e      |      | متحرک آزمائشی کمپیوٹ|      | 20 لاکھ ٹوکنز سیاق  |     |
|   +---------------------+      +---------------------+      +---------------------+     |
|              |                                                         |                |
|              +---------> Google Vertex AI / Cloud AI Studio API <------+                |
|                                                                                         |
+-----------------------------------------------------------------------------------------+

2. ماڈل آرکیٹیکچر اور VRAM کی ضروریات

  • کل پیرامیٹرز: 116.8 ارب (جن میں سے ہر ٹوکن پر 23.8 ارب پیرامیٹرز فعال ہوتے ہیں)۔
  • VRAM میموری اصول: اگرچہ ہر بار صرف 23.8B فعال ہوتے ہیں، لیکن PCIe تاخیر سے بچنے کے لیے تمام 116.8B پیرامیٹرز کا GPU میموری میں موجود ہونا لازمی ہے۔
  • FP8 پرفارمنس: دو عدد NVIDIA H100 80GB SXM5 پر چلانے کے لیے 136 GB VRAM درکار ہوتی ہے، جو فی سیکنڈ 76 ٹوکنز کی رفتار دیتی ہے۔

3. جامع بینچ مارک نتائج

بینچ مارک اور پیمانہ GPT-OSS 120B (FP8) Gemini 3 Pro Gemini 2.5 Flash GPT 5.2 (حوالہ)
Humanity's Last Exam (HLE) 24.8% 32.4% 18.6% 34.1%
GPQA Diamond (سائنسی پی ایچ ڈی) 68.4% 79.2% 62.8% 81.5%
MATH-500 (اولمپیاڈ ریاضی) 88.2% 94.6% 82.4% 95.8%
AIME 2026 (Pass@1) 64.0% 78.5% 52.0% 82.0%
SWE-bench Verified (کوڈنگ بگ) 56.4% 68.2% 44.5% 71.8%
LiveCodeBench v6 (2026 کوڈ) 62.1% 72.8% 51.4% 74.5%
MMLU-Pro (استدلال CoT) 81.2% 89.5% 76.3% 90.4%
MMMU (کالج ملٹی ماڈل) 68.5% (ViT) 76.8% (اصلی) 64.2% 78.2%
MathVista (بصری ریاضی) 71.2% 82.4% 69.1% 84.0%
NIAH (20 لاکھ ٹوکنز تلاش) 99.8% (128k) 100.0% (2M) 99.9% (1M) 100.0% (256k)

اہم نکات

  1. استدلال میں برتری: جیمنی 3 پرو HLE میں 7.6% اور GPQA میں 10.8% آگے ہے۔
  2. سافٹ ویئر انجینئرنگ: جیمنی 3 پرو 68.2% مسائل حل کرتا ہے جبکہ GPT-OSS 120B کا اسکور 56.4% ہے۔ مقامی سطح پر ماڈل کو فائن ٹیون کرنے سے یہ فرق 4% سے کم رہ جاتا ہے۔
  3. فلیش ماڈل پر غلبہ: GPT-OSS 120B ہر امتحان میں جیمنی 2.5 فلیش سے نمایاں طور پر آگے ہے۔
  4. اوپن ویٹس کی تاریخ ساز کامیابی: GPT-OSS 120B پہلا اوپن ماڈل ہے جس نے MATH-500 میں 88% اور SWE-bench میں 56% سے زیادہ اسکور کیا۔

4. ملٹی ماڈل اور سیاق کا دائرہ

  • Gemini 3 Pro (2,000,000 ٹوکنز): مکمل کوڈ بیس، 2 گھنٹے کی ہائی ڈیفینیشن ویڈیو اور لاتعداد آڈیو فائلز کا بغیر کسی غلطی کے یکبارگی تجزیہ کرتا ہے۔
  • GPT-OSS 120B (128,000 ٹوکنز): روزمرہ کے کوڈنگ اور تجزیاتی کاموں کے لیے بہترین ہے، مگر بہت لمبی ویڈیوز کے لیے بیرونی سرچ (RAG) درکار ہوتی ہے۔

5. تعیناتی کا طریقہ کار (vLLM Docker)

docker run --gpus '"device=0,1"'   -v /root/.cache/huggingface:/root/.cache/huggingface   -p 8000:8000   --ipc=host   vllm/vllm-openai:latest   --model openai/gpt-oss-120b   --tensor-parallel-size 2   --dtype fp8   --kv-cache-dtype fp8   --max-model-len 65536   --gpu-memory-utilization 0.95   --enable-chunked-prefill   --enforce-eager

6. مالی تجزیہ اور لاگت کا تقابل

  • API ریٹس: جیمنی 3 پرو کی اوسط فیس 2.19 ڈالر فی 10 لاکھ ٹوکنز ہے۔
  • بریک ایون پوائنٹ: اگر آپ کا ادارہ روزانہ 6.5 کروڑ ٹوکنز سے زیادہ استعمال کرتا ہے تو ذاتی سرور پر GPT-OSS 120B چلانا API کے مقابلے میں بہت زیادہ سستا ہے۔ روزانہ 5 کروڑ سے کم ٹوکنز کے لیے API استعمال کرنا زیادہ فائدہ مند ہے۔
  • حتمی حکمت عملی: عام کاموں اور حساس ڈیٹا کے لیے مقامی GPT-OSS 120B اور انتہائی پیچیدہ ریاضیاتی و ویڈیو تحقیق کے لیے Gemini 3 Pro (یا GPT 5.2) کو استعمال میں لائیں۔
→ تمام مضامین
0 / 4