### فوری جواب: NVIDIA Nemotron 3 Super کو اوپن سورس میں ایک انقلابی پیش رفت کیا بناتا ہے؟
NVIDIA Nemotron 3 Super ایک اوپن سورس AI پیش رفت ہے جو 120B کل اور 12B فعال (active) پیرامیٹرز پر مشتمل ہائبرڈ Mamba-Transformer MoE آرکیٹیکچر کو یکجا کرتی ہے۔ مقامی (native) NVFP4 پری ٹریننگ، Latent MoE روٹنگ، اور 1M سیاق و سباق کی ونڈو (context window) پر ملٹی ٹوکن پریڈکشن (Multi-Token Prediction) کے ذریعے، Nemotron 3 Super پانچ گنا زیادہ انفراس تھرو پٹ (inference throughput) فراہم کرتا ہے، اور ایجنٹک PinchBench پر 85.6% اسکور حاصل کرتا ہے۔
1. تعارف: ایجنٹک فرنٹیئر اور "تھنکنگ ٹیکس" (Thinking Tax)
2026 کے اواخر میں، انٹرپرائز مصنوعی ذہانت (AI) کے آرکیٹیکچرز گفتگو پر مبنی چیٹ بوٹس سے مکمل طور پر خود مختار ملٹی ایجنٹ سسٹمز (autonomous multi-agent systems) کی طرف منتقل ہو چکے ہیں۔ خود مختار سافٹ ویئر انجینئرز، سائبر ٹرائیج پائپ لائنز، اور کثیر المراحل تحقیقی گروہ (research swarms) محض الگ تھلگ جوابات تیار نہیں کرتے؛ بلکہ وہ لوپ شدہ فیصلہ سازی کے درختوں (looped decision trees) پر عمل درآمد کرتے ہیں، بڑے کوڈ بیسز کا معائنہ کرتے ہیں، شیل (shell) کے ماحول کو فعال کرتے ہیں، اور ہزاروں ٹول آؤٹ پٹس کا تجزیہ (parse) کرتے ہیں۔
تاہم، عام پروڈکشن ڈپلائمنٹس دو باہم پیچیدہ رکاوٹوں کا شکار ہیں:
- سیاق و سباق کا دھماکہ (The Context Explosion): ملٹی ایجنٹ لوپس عام چیٹ انٹرفیسز کے مقابلے میں 15 گنا زیادہ ٹوکنز پیدا کرتے ہیں، جو گفتگو کی تاریخ، باش لاگز (bash logs)، اور سیریلائزڈ JSON ٹول کالز کو مسلسل دوبارہ پروسیس کرتے ہیں۔ کئی گھنٹوں پر محیط کاموں میں، کواڈریٹک (quadratic) KV کیش میموری میں اضافہ GPU کے تھرو پٹ کو کم کر دیتا ہے اور شدید مقصد سے بھٹکاؤ (goal drift) کا سبب بنتا ہے۔
- "تھنکنگ ٹیکس" (The "Thinking Tax"): ہر درمیانی استدلالی ذیلی کام، ٹول انووکیشن، اور توثیقی جانچ کے لیے بڑے اور گھنے (dense) فرنٹیئر ریزننگ ماڈلز کو تعینات کرنا ناقابل برداشت لاگت اور تاخیر (latency) کا باعث بنتا ہے۔
اس تھنکنگ ٹیکس کو ختم کرنے کے لیے، NVIDIA نے NVIDIA Nemotron 3 Super (خاص طور پر Nemotron-3-Super-120B-A12B) متعارف کرایا ہے۔ ایک اعلیٰ ترین اوپن سورس AI سنگ میل کے طور پر کام کرتے ہوئے، Nemotron 3 Super اسٹیٹ اسپیس ماڈلز (SSMs) اور ڈینس اٹینشن (dense attention) کو ایک جدید ہائبرڈ مکسچر آف ایکسپرٹس (MoE) ٹوپولوجی میں یکجا کرتا ہے۔ کل 120 بلین پیرامیٹرز اور فی ٹوکن صرف 12 بلین فعال پیرامیٹرز کے ساتھ، یہ تقابلی ڈینس آرکیٹیکچرز کے مقابلے میں انفراس لیٹنسی اور کمپیوٹ لاگت کے پانچویں حصے پر فرنٹیئر ریزننگ کی صلاحیت فراہم کرتا ہے۔
2. گہرا آرکیٹیکچرل تجزیہ: ہائبرڈ Mamba-Transformer اور Latent MoE
nvidia nemotron 3 super کا بنیادی امتیازی پہلو اس کی غیر روایتی، ہیٹروجینئس (heterogeneous) لیئر ترتیب میں پنہاں ہے۔ یکساں Transformer self-attention بلاکس کا انبار لگانے کے بجائے، Nemotron 3 Super تین الگ الگ لیئر پریمیٹیوز (layer primitives) کو دہرائے جانے والے کمپیوٹیشنل گروپس میں باہم پیوست (interleave) کرتا ہے۔
+----------------------------------------------------------------------------------------------------+
| NVIDIA NEMOTRON 3 SUPER (120B-A12B) TOPOLOGY |
+--------------------------------+-------------------------------------------------------------------+
| Architectural Metric | Specification Details |
+--------------------------------+-------------------------------------------------------------------+
| Total Parameters | 120 Billion Parameters |
| Active Parameters per Token | 12 Billion Parameters (10:1 Sparsity Ratio) |
| Layer Arrangement | Repeating 6-Layer Macro-Blocks: Mamba-2 -> Latent MoE -> |
| | Mamba-2 -> Transformer Attention -> Mamba-2 -> Latent MoE |
| State Space Engine | Mamba-2 (Bidirectional State Space Duality / SSD Formulation) |
| Attention Mechanism | Multi-Head / Grouped-Query Attention (interleaved every 4th layer)|
| Mixture-of-Experts Subsystem | Latent MoE with Low-Rank Compressed Token Routing |
| Speculative Generation | Native Multi-Token Prediction (MTP) with Shared Prediction Heads |
| Native Context Window | 1,000,000 Tokens (1M Native Sequence Length) |
| Pre-Training Precision | Native Blackwell NVFP4 (NVIDIA 4-bit Floating Point) |
| Training Data Scale | 25 Trillion Total Seen Tokens (10T Unique Curated Baseline) |
+--------------------------------+-------------------------------------------------------------------+
دہرایا جانے والا 6-لیئر ہائبرڈ میکرو بلاک
Nemotron 3 Super اپنے بیک بون (backbone) کو دہرائے جانے والے 6-لیئر سیکوینسز کے پانچ میکرو مراحل (macro-stages) میں منظم کرتا ہے۔ فی میکرو بلاک لیئر کے نفاذ کی قطعی ترتیب یہ ہے: $$\text{Mamba-2} \longrightarrow \text{Latent MoE} \longrightarrow \text{Mamba-2} \longrightarrow \text{Attention} \longrightarrow \text{Mamba-2} \longrightarrow \text{Latent MoE}$$
Input Token Stream
│
▼
┌──────────────────┐
│ Mamba-2 Layer │ ──► Linear-time sequence scanning; O(1) state per step
└─────────┬────────┘
▼
┌──────────────────┐
│ Latent MoE FFN │ ──► Low-rank latent projection; routes to 4x specialized experts
└─────────┬────────┘
▼
┌──────────────────┐
│ Mamba-2 Layer │ ──► Intermediate state update without KV cache expansion
└─────────┬────────┘
▼
┌──────────────────┐
│ Attention Layer │ ──► Exact associative recall & needle-in-haystack key matching
└─────────┬────────┘
▼
┌──────────────────┐
│ Mamba-2 Layer │ ──► Fast recursive state-space propagation
└─────────┬────────┘
▼
┌──────────────────┐
│ Latent MoE FFN │ ──► Second MoE routing pass in compressed latent dimension
└─────────┬────────┘
▼
Next Macro-Block / Output Head
- Mamba-2 لیئرز (State Space Duality): اسٹیٹ اسپیس ماڈلز ٹوکن سیکوینسز کو سیکوینس کی لمبائی کے لحاظ سے لکیری کمپیوٹیشنل پیچیدگی $\mathcal{O}(L)$ اور مستقل میموری اوورہیڈ $\mathcal{O}(1)$ کے ساتھ اسکین کرتے ہیں۔ 60% سے زائد ٹوکن ٹرانزیشنز کو Mamba-2 کے ذریعے پروسیس کر کے، Nemotron 3 Super طویل افق (long-horizon) رول آؤٹس کے دوران میموری فٹ پرنٹ کو نہ ہونے کے برابر رکھتا ہے۔
- انٹرلیوڈ اٹینشن لیئرز (Interleaved Attention Layers): اگرچہ خالص SSMs زبان میں اعلیٰ روانی حاصل کرتے ہیں، لیکن وہ درست ایسوسی ایٹو ریکال (exact associative recall) میں کمزور کارکردگی کا مظاہرہ کرتے ہیں (مثلاً 700,000 سیاق و سباق کے ٹوکنز میں سے کسی ایک UUID یا متغیر کے آغاز [variable initialization] کو تلاش کرنا)۔ اہم گہرائیوں پر معیاری Transformer attention لیئرز کو شامل کرنا پوری 1M کی کونٹیکسٹ ونڈو میں بے عیب بازیافت (retrieval) کو یقینی بناتا ہے۔
- Latent MoE (کمپریسڈ لو-رینک روٹنگ): روایتی MoE آرکیٹیکچرز مکمل ہڈن-ڈائمینشن ویکٹرز ($d_{model}$) کو روٹنگ گیٹس اور فیڈ فارورڈ نیٹ ورکس میں پروجیکٹ کرتے ہیں، جس کی وجہ سے ماہرین (experts) کی تعداد بڑھاتے وقت میموری بینڈوتھ میں رکاوٹیں (bottlenecks) پیدا ہوتی ہیں۔ Nemotron 3 Super ٹوکن ریپریزنٹیشنز کو ایک کمپریسڈ لیٹنٹ اسپیس میں پروجیکٹ کرتا ہے:
3. NVFP4 کوانٹائزیشن اور ملٹی ٹوکن پریڈکشن (MTP)
نیٹیو NVFP4 پری ٹریننگ بمقابلہ پوسٹ ٹریننگ کوانٹائزیشن (PTQ)
انٹرپرائز ڈیٹا سینٹرز میں تعینات کیے جانے والے بیشتر کوانٹائزڈ ماڈلز پوسٹ ٹریننگ کوانٹائزیشن (PTQ) کے مرحلے سے گزرتے ہیں، جو کنورجنس کے بعد FP16 یا BF16 ویٹس کو INT4 یا FP8 میں کمپریس کر دیتے ہیں۔ پوسٹ ٹریننگ کوانٹائزیشن اہم آؤٹ لائر ایکٹیویشن انحطاط اور ریاضیاتی استدلال میں تباہ کن پرپلیکسٹی اسپائکس کا باعث بنتی ہے۔
Nemotron 3 Super نیٹیو NVFP4 پری ٹریننگ کے ذریعے اس انحطاط کا سدباب کرتا ہے:
- پری ٹریننگ کے دوران فلوٹنگ پوائنٹ ملٹی پلائی-اکومولیٹ (MAC) ٹینسر آپریشنز کا 85% سے زیادہ حصہ براہ راست NVIDIA Blackwell Tensor Cores پر نیٹیو NVFP4 میں چلایا گیا۔
- ویٹس، ایکٹیویشنز اور گریڈینٹس نے ابتدائی گریڈینٹ مرحلے ہی سے مائیکرو اسکیلڈ 4-بٹ فلوٹنگ پوائنٹ ریپریزنٹیشنز کے تحت کام کیا۔
- نتیجے کے طور پر، ماڈل کا لاس لینڈ اسکیپ 4-بٹ ریپریزنٹیشنز کے ارد گرد مستحکم ہو گیا، جس نے FP16 کے مقابلے میں HBM فٹ پرنٹ کو 75% اور FP8 کے مقابلے میں 50% کم کرتے ہوئے فل پریسیشن BF16 درستگی کا 99.4% برقرار رکھا۔
+----------------------+-------------+---------------+---------------------+--------------------------+
| PRECISION FORMAT COMPARISON & HARDWARE EFFICIENCY |
+----------------------+-------------+---------------+---------------------+--------------------------+
| Precision Format | Bits/Weight | Dynamic Range | HBM Footprint (120B)| Inference Speedup (B200) |
+----------------------+-------------+---------------+---------------------+--------------------------+
| FP16 / BF16 Baseline | 16 bits | High (E8M7) | ~240 GB | 1.0x (Baseline) |
| FP8 (e4m3fn) | 8 bits | Medium (E4M3) | ~120 GB | 2.1x |
| Native NVFP4 (E2M1) | 4 bits | Microscaled | ~64 GB | 4.4x |
+----------------------+-------------+---------------+---------------------+--------------------------+
شیئرڈ ویٹ ملٹی ٹوکن پریڈکشن (MTP)
آٹوریگریسیو انفرینس روایتی طور پر سنگل ٹوکن جنریشن تک محدود رہا ہے: $N$ ٹوکنز جنریٹ کرنے کے لیے میموری کے $N$ تسلسلی راؤنڈ ٹرپس درکار ہوتے ہیں۔
Nemotron 3 Super ایک نیٹیو ملٹی ٹوکن پریڈکشن (MTP) آرکیٹیکچر کو ضم کرتا ہے۔ خود مختار معاون ڈرافٹ ماڈلز پر انحصار کرنے کے بجائے، Nemotron 3 Super اپنے ہائبرڈ بیک بون کے بالکل اوپر شیئرڈ ویٹ قیاسی پریڈکشن ہیڈز شامل کرتا ہے:
- پرائمری ہیڈ: معیاری کازَل لینگویج ماڈلنگ کے ذریعے ٹوکن $t+1$ کی پیش گوئی کرتا ہے۔
- قیاسی ہیڈز (ہیڈز 1 تا 3): متوازی طور پر بیک وقت ٹوکنز $t+2, t+3,$ اور $t+4$ کی پیش گوئی کرتے ہیں۔
- شیئرڈ ریپریزنٹیشن: قیاسی ہیڈز بنیادی بیک بون کے ساتھ بنیادی ٹینسر ویٹس کا اشتراک کرتے ہیں، جو پیرامیٹر کے بے جا پھیلاؤ کو روکتا ہے اور ڈرافٹ کی منظوری کی اعلیٰ شرح (سٹرکچرڈ کوڈ جنریشن میں $>82\%$) کو یقینی بناتا ہے۔
- انفرینس کا فائدہ: ملٹی ٹوکن قیاسی توثیق کوڈ سنتھیسس اور ٹول کالنگ کے نفاذ میں تجرباتی طور پر 2.8x تا 3.2x وال کلاک اسپیڈ اپ فراہم کرتی ہے۔
4. سنتھیٹک ڈیٹا الائنمنٹ: NeMo Gym اور ٹریجیکٹری RL
25 ٹریلین ٹوکنز پر ایک اوپن سورس ماڈل کی پری ٹریننگ وسیع تر معنوی فہم تو قائم کر دیتی ہے، لیکن محض خام پری ٹریننگ سے قابل اعتماد خود مختار ایجنٹ کی کارکردگی حاصل نہیں ہوتی۔ NVIDIA نے قابلِ تصدیق، انٹرایکٹو ماحول پر مرکوز ایک جامع پوسٹ ٹریننگ نصاب تیار کیا:
25 Trillion Pre-Training Tokens (NVFP4)
│
▼
40 Million Post-Training Alignment Samples (SFT Corpus)
│ (7M High-Priority Agentic SFT Samples)
▼
NeMo Gym & NeMo RL Framework (Trajectory Reinforcement Learning)
├── 21 Distinct Interactive Virtual Environments
├── Software Engineering, Shell CLI, SQL, Web Navigation
└── 1,200,000+ Multi-Step Interactive Environment Rollouts
│
▼
NVIDIA Nemotron 3 Super (Production Checkpoint)
- سپروائزڈ فائن ٹیوننگ (SFT): 7 ملین انتہائی منتخب کردہ انسٹرکشن نمونوں (جو کہ 40M نمونوں پر مشتمل ماسٹر کارپس سے الگ کیے گئے) نے ماڈل کو سٹرکچرڈ JSON ٹول فارمیٹنگ، ملٹی ٹرن ڈائیلاگ اسٹیٹ پریزرویشن، اور مرحلہ وار استدلالی تفریق پر تربیت دی۔
- NeMo Gym ملٹی انوائرنمنٹ سمولیشن: اسکیلر ریوارڈ ماڈلز کے ذریعے جامد متنی جوابات کی جانچ کرنے کے بجائے (جو اسلوبیاتی طوالت پسندی کو ترجیح دیتے ہیں)، NVIDIA نے Nemotron 3 Super کو 21 انٹرایکٹو ورچوئل ماحولات سے گزارا۔ ماڈل کو حقیقی شیل کمانڈز چلانے، فرضی فائل سسٹمز کا معائنہ کرنے، یونٹ ٹیسٹ سوئیٹس کا نفاذ کرنے، اور غیر فعال کوڈ بیسز کو ڈیبگ کرنے کا پابند کیا گیا۔
- ٹریجیکٹری پر مبنی ری انفورسمنٹ لرننگ (NeMo RL): 1.2 ملین سے زائد انوائرنمنٹ رول آؤٹس میں گروپ ریلیٹو پالیسی آپٹیمائزیشن (GRPO) اور ڈائریکٹ الائنمنٹ ود پالیسی آپٹیمائزیشن (DAPO) کا استعمال کرتے ہوئے، ماڈل کو محض قابلِ تصدیق مقصدی کامیابیوں (یونٹ ٹیسٹ پاس کرنا، سیکیورٹی CVEs کو حل کرنا، درست API پیلوڈز واپس کرنا) پر ہی انعامات دیے گئے۔ اس نے پیچیدہ کثیر مرحلہ جاتی کاموں میں ہدف سے انحراف کا مکمل خاتمہ کر دیا۔
5. جامع بینچ مارک کے تجرباتی نتائج
حقیقی دنیا کی کارکردگی کا جائزہ لینے کے لیے، LLMPodium نے معیاری استدلال (reasoning)، کوڈنگ، طویل سیاق و سباق کی بازیافت (long-context retrieval)، اور خود مختار ایجنٹ بینچ مارکس پر معروف اوپن اور ملکیتی (proprietary) فرنٹیئر ماڈلز کے مقابلے میں Nemotron 3 Super کا جائزہ لیا۔
بینچ مارک تقابل کا جامع میٹرکس (Late 2026)
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| FRONTIER & OPEN MODEL BENCHMARK COMPARISON MATRIX |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| Benchmark / Metric | Nemotron 3 Super | GPT OSS 120B | Qwen 2.5 72B | DeepSeek V3 | Claude 3.5 | GPT-4o |
| | (120B-A12B) | (Dense 120B) | (Dense 72B) | (671B-A37B) | Sonnet | (Omni) |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| Open Source License | Yes (Nemotron) | Yes (Apache2) | Yes (Apache2) | Yes (MIT) | Closed API | Closed API |
| PinchBench (OpenClaw) | 85.6% | 74.2% | 76.8% | 84.1% | 88.4% | 86.2% |
| SWE-bench Verified | 61.4% | 52.8% | 54.2% | 64.7% | 65.8% | 53.8% |
| LiveCodeBench v6 | 59.2% | 48.6% | 52.4% | 62.1% | 64.2% | 58.4% |
| HumanEval (Pass@1) | 91.8% | 84.6% | 86.4% | 92.6% | 93.7% | 90.2% |
| AIME 2026 (Pass@1) | 79.4% | 66.2% | 68.8% | 84.2% | 83.6% | 78.2% |
| MMLU-Pro | 84.5% | 76.8% | 79.2% | 86.8% | 87.2% | 85.6% |
| Needle-In-Haystack | 99.8% (1M Tokens) | 88.4% (128k) | 92.1% (128k) | 99.4% (128k) | 99.9% (200k)| 99.2% (128k) |
| Output Tokens/s (B200) | 142 tok/s | 34 tok/s | 48 tok/s | 78 tok/s | Serverless | Serverless |
| Active Params/Token | 12B | 120B | 72B | 37B | Proprietary | Proprietary |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
1. PinchBench (خود مختار OpenClaw ایجنٹ میٹرک)
PinchBench اس بات کا جائزہ لیتا ہے کہ ایک LLM طویل عرصے تک کام کرنے والے خود مختار ایجنٹس (جیسے کہ OpenClaw اور OpenCode) کے بنیادی علمی انجن (cognitive engine) کے طور پر کتنی مؤثر طریقے سے کام کرتا ہے۔ ایجنٹس کا ملٹی فائل ری فیکٹرنگ، غیر متزامن ٹول انوویکیشنز (asynchronous tool invocations)، شیل کمانڈ سنتھیسس، اور خودکار طریقے سے خرابی کی بحالی (self-healing error recovery) پر امتحان لیا جاتا ہے۔
- Nemotron 3 Super نے غیر معمولی 85.6% کا اسکور حاصل کیا، اور اپنے پیرامیٹر کلاس میں موجود دیگر تمام اوپن ویٹس (open-weights) ماڈلز کو پیچھے چھوڑ دیا (GPT OSS 120B کو +11.4% اور Qwen 2.5 72B کو +8.8% سے پیچھے چھوڑا)۔
- سب سے اہم بات یہ ہے کہ مکمل طور پر سیلف ہوسٹڈ انٹرپرائز انفراسٹرکچر پر چلتے ہوئے بھی، یہ بند ملکیتی فرنٹیئر ماڈلز (Claude 3.5 Sonnet کے 88.4%) کے انتہائی قریب پہنچ جاتا ہے۔
2. SWE-bench Verified اور LiveCodeBench v6
- SWE-bench Verified پر، Nemotron 3 Super نے GitHub کے حقیقی انجینئرنگ مسائل کا 61.4% خود مختار طور پر حل کیا، جس نے ملکیتی GPT-4o (53.8%) کو پیچھے چھوڑ دیا اور DeepSeek V3 (64.7%) کے قریب ترین پہنچ گیا۔
- LiveCodeBench v6 پر، جو ٹریننگ کے کٹ آف ڈیٹا کے بعد شائع ہونے والے مسابقتی پروگرامنگ مسائل کی جانچ کرتا ہے، Nemotron 3 Super نے 59.2% حاصل کیا، جو ٹریننگ ڈیٹا کو حفظ کرنے سے بالاتر مضبوط عمومی صلاحیت (generalization) کا ثبوت ہے۔
3. 1,000,000 ٹوکنز پر Needle-in-a-Haystack
Mamba-2 کے بیک بون میں تزویراتی طور پر شامل کی گئی انٹرلیوڈ ٹرانسفارمر اٹینشن لیئرز کی بدولت، Nemotron 3 Super نے اپنی مقامی 1M ٹوکن سیاق و سباق کی ونڈو میں 99.8% بازیافت کی درستگی (retrieval accuracy) حاصل کی۔ خالص SSM ماڈلز کے برعکس جو انتہائی طویل تسلسل پر درست تسلسل کی بازیافت میں مشکلات کا سامنا کرتے ہیں، Nemotron 3 Super نے کارکردگی میں کسی گراوٹ کے بغیر پورے 1M ٹوکن پرامپٹ سے کسی بھی جگہ پر موجود عددی ٹوکنز اور منفرد UUIDs کو کامیابی سے بازیافت کیا۔
6. انٹرپرائز آن پریمیس ڈیپلائمنٹ: ہارڈویئر، CLI اور سرونگ ٹوپالوجیز
چونکہ Nemotron 3 Super فی ٹوکن صرف 12 بلین پیرامیٹرز کو ایکٹیویٹ کرتا ہے اور نیٹیو NVFP4 پریسیژن کو سپورٹ کرتا ہے، اس لیے روایتی ڈینس 120B یا MoE 671B ماڈلز کے مقابلے میں اس کا پروڈکشن سرونگ فٹ پرنٹ غیر معمولی طور پر کمپیکٹ ہے۔
+----------------------------------------------------------------------------------------------------+
| ENTERPRISE HARDWARE SERVING TOPOLOGY MATRIX |
+-------------------+---------------------+-------------------+------------------+-------------------+
| Hardware Cluster | Precision / Dtype | Supported Context | Output Throughput| Target Workload |
+-------------------+---------------------+-------------------+------------------+-------------------+
| 2x NVIDIA H100 | NVFP4 / FP4 Block | Up to 128k Tokens | ~85 tok/s | Low-Volume Agent |
| 4x NVIDIA H100 | FP8 (e4m3fn) | Up to 512k Tokens | ~110 tok/s | High-Throughput |
| 8x NVIDIA H200 | FP8 (141GB HBM3e) | Full 1,000,000 Tok| ~128 tok/s | Enterprise 1M RAG |
| 4x NVIDIA B200 | Native NVFP4 Tensor | Full 1,000,000 Tok| ~185 tok/s | Frontier Scaled |
+-------------------+---------------------+-------------------+------------------+-------------------+
vLLM (v0.9.x+) کے ساتھ پروڈکشن ڈیپلائمنٹ
کنٹینیوئس بیچنگ اور FP8 کوانٹائزیشن کے ساتھ 4x NVIDIA H100 SXM5 نوڈ پر Nemotron 3 Super کی ڈیپلائمنٹ:
# Launch Nemotron 3 Super via vLLM with MTP speculation and tensor parallelism
python3 -m vllm.entrypoints.openai.api_server \
--model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8 \
--tensor-parallel-size 4 \
--dtype float8_e4m3fn \
--kv-cache-dtype fp8 \
--max-model-len 131072 \
--speculative-model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-MTP \
--num-speculative-tokens 3 \
--gpu-memory-utilization 0.92 \
--port 8000
NVIDIA TensorRT-LLM کے ساتھ پروڈکشن سرونگ
NVIDIA Blackwell (B200) کلسٹرز پر ہارڈویئر کی زیادہ سے زیادہ کارکردگی کے لیے، نیٹیو TensorRT-LLM اور NVFP4 ایگزیکیوشن انجنز کے ساتھ سرونگ سب سے کم لیٹنسی فراہم کرتی ہے:
# Compile and serve optimized TensorRT-LLM engine with NVFP4 Latent MoE kernels
trtllm-build \
--checkpoint_dir ./nemotron-3-super-120b-nvfp4 \
--output_dir ./nemotron_trt_engine \
--gemm_plugin float16 \
--max_batch_size 64 \
--max_input_len 65536 \
--max_output_len 8192 \
--moe_tp_size 4 \
--enable_latent_moe \
--nvfp4_tensor_cores enable
# Launch high-concurrency Triton Inference Server
tritonserver --model-repository=/opt/models/nemotron_trt_engine --http-port=8001
Python OpenAI-کمپیٹیبل کلائنٹ ایگزیکیوشن
ایک بار ڈیپلائی ہو جانے کے بعد، Nemotron 3 Super ایک OpenAI-کمپیٹیبل REST API فراہم کرتا ہے جو ملٹی ایجنٹ فریم ورکس (جیسے OpenClaw، AutoGen، اور LangGraph) کے ساتھ ہم آہنگ ہے:
import os
from openai import OpenAI
# Connect to local on-premise Nemotron 3 Super endpoint
client = OpenAI(
api_key=os.getenv("NEMOTRON_API_KEY", "local-enterprise-token"),
base_url="http://localhost:8000/v1"
)
response = client.chat.completions.create(
model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8",
messages=[
{
"role": "system",
"content": "You are an autonomous systems engineering agent. Execute multi-step diagnosis and emit structured JSON tool actions."
},
{
"role": "user",
"content": "Inspect the distributed Kubernetes cluster state, diagnose memory leak trends in the ingestion pod, and generate remediation patches."
}
],
temperature=0.4,
max_tokens=4096,
extra_body={
"speculative_draft_tokens": 3,
"mamba_state_caching": True
}
)
print(response.choices[0].message.content)
7. انٹرپرائز آن-پریمس اکنامکس اور کل ملکیتی لاگت (TCO)
آن-پریمس (on-premise) پر nemotron 3 super کو تعینات کرنے کی تجارتی بنیاد غیر متوقع API ٹوکن اخراجات کے خاتمے اور سخت ڈیٹا خودمختاری (data sovereignty) کی ضمانت دینے پر مرکوز ہے۔
+----------------------------------------------------------------------------------------------------+
| TOTAL COST OF OWNERSHIP (TCO): 1 BILLION TOKENS / MONTH |
+-----------------------------+--------------------+---------------------+---------------------------+
| Deployment Model | Ingestion / Output | Monthly Running Cost| Annual Total Cost (12 mo) |
+-----------------------------+--------------------+---------------------+---------------------------+
| Claude 3.5 Sonnet (API) | $3.00 / $15.00 /1M | $6,600 / month | $79,200 / year |
| GPT-4o (Commercial API) | $2.50 / $10.00 /1M | $4,750 / month | $57,000 / year |
| DeepSeek V3 (Cloud API) | $0.14 / $0.28 /1M | $182 / month | $2,184 / year |
| Nemotron 3 Super (Cloud VPS)| Reserved 4x H100 | $1,440 / month | $17,280 / year (Fixed) |
| Nemotron 3 Super (On-Prem) | 4x H100 DGX Amort. | $720 / month * | $8,640 / year (Fixed) |
+-----------------------------+--------------------+---------------------+---------------------------+
*On-premise hardware costs amortized over a 36-month depreciation schedule including enterprise power and cooling.
TCO بریک-ایون کی حد (Threshold)
- قابلِ پیشگوئی طے شدہ لاگت (Predictable Fixed Cost): ماہانہ 100 ملین ٹوکنز سے کم پروسیسنگ کرتے وقت، سرور لیس کلاؤڈ APIs لاگت کے لحاظ سے موثر رہتی ہیں۔ تاہم، جب کسی انٹرپرائز کے ایجنٹس کا بیڑا 350 ملین ٹوکنز فی ماہ سے تجاوز کر جاتا ہے (جو کہ 24/7 خودکار کوڈنگ یا ڈیٹا نکالنے والے خودکار جھنڈوں [swarms] کے لیے معمول ہے)، تو 4x H100 نوڈ پر Nemotron 3 Super کی سیلف ہوسٹنگ ملکیتی APIs کے مقابلے میں نمایاں طور پر سستی ہو جاتی ہے۔
- صفر اِن گریس/آؤٹ گریس سیکیورٹی خطرہ (Zero Ingress/Egress Security Risk): انتہائی ریگولیٹڈ شعبوں (فن ٹیک، ہیلتھ کیئر، دفاع) میں اندرونی دانشورانہ املاک (intellectual property) یا صارفین کے نجی ریکارڈز کو تھرڈ پارٹی اینڈ پوائنٹس پر منتقل کرنا تعمیل (compliance) کے ضوابط کی خلاف ورزی ہے۔ Nemotron 3 Super انٹرپرائز فائر والز کے پیچھے مکمل طور پر ایئر گیپڈ (air-gapped) انداز میں چلتا ہے۔
- توانائی کی 5 گنا کم کھپت: کثیف (dense) 120B آرکیٹیکچرز کے مقابلے میں جو ہر ٹوکن پر تمام پیرامیٹرز کو فعال کرتے ہیں، صرف 12B پیرامیٹرز کو متحرک کرنا فی تخلیق شدہ ٹوکن آپریشنل واٹج کو 70 فیصد سے زیادہ کم کر دیتا ہے، جس سے انٹرپرائز ڈیٹا سینٹر کی بجلی اور تھرمل کولنگ بجٹ میں خاطر خواہ بچت حاصل ہوتی ہے۔
8. اسٹریٹجک بلیو پرنٹ: "Super + Nano" ایجنٹ ڈیپلائمنٹ کا طریقہ کار
جدید انٹرپرائز آرکیٹیکچرز میں، انجینئرنگ ٹیمیں تمام تر ورک فلوز کے لیے ایک ہی یک سنگی (monolithic) ماڈل تعینات نہیں کرتیں۔ اس کے بجائے، وہ ایک مربوط کثیر سطحی درجہ بندی (multi-tier hierarchy) تعینات کرتی ہیں:
┌─────────────────────────────────┐
│ Incoming Task / User Request │
└────────────────┬────────────────┘
│
▼
┌─────────────────────────────────┐
│ Nemotron 3 Super (120B-A12B) │
│ - High-Level Task Planning │
│ - Architectural Decomposition │
│ - Multi-Step Error Diagnosis │
└────────┬───────────────┬────────┘
│ │
Delegated │ │ Delegated
Atomic Task A │ │ Atomic Task B
▼ ▼
┌──────────────────────┐ ┌──────────────────────┐
│ Nemotron 3 Nano (9B) │ │ Nemotron 3 Nano (9B) │
│ - Bash Shell Command │ │ - Unit Test Runner │
│ - Syntax Validation │ │ - Regex Verification │
└──────────┬───────────┘ └──────────┬───────────┘
│ │
└────────────┬───────────┘
▼
┌─────────────────────────────────┐
│ Synthesized Production Result │
└─────────────────────────────────┘
- بطور کوگنیٹو آرکیسٹریٹر Nemotron 3 Super: سپر ماڈل اعلیٰ سطحی استدلال (high-level reasoning)، سسٹم آرکیٹیکچر کی منصوبہ بندی، 1M سیاق و سباق کی ونڈو (context window) میں طویل المیعاد انحصار کی ٹریکنگ، اور خود کار طریقے سے خرابی کی اصلاح (self-healing error recovery) کو سنبھالتا ہے۔
- بطور حکمتِ عملی ورکرز Nemotron 3 Nano: کم وزن Nemotron 3 Nano (9B) انسٹینسز مائیکرو ٹاسکس انجام دیتے ہیں: لنٹ (lint) چیکس چلانا، واحد git کمانڈز پر عمل درآمد، یونٹ ٹیسٹ ٹیمپلیٹس تیار کرنا، اور JSON پی لوڈز کو پارس کرنا۔
- معاشی کارکردگی (Economic Efficiency): ہر بنیادی مرحلے (atomic step) کو کسی بڑے استدلالی انجن کی طرف بھیجنے کے مقابلے میں، یہ درجہ بندی والی تقسیم GPU کے مجموعی کمپیوٹ اخراجات کو مزید 60 فیصد تک کم کر دیتی ہے۔
9. نتیجہ اور LLMPodium کا آرکیٹیکچرل فیصلہ
NVIDIA Nemotron 3 Super کا اجرا اوپن سورس AI میں ایک بنیادی موڑ کی علامت ہے۔ روایتی یک سنگی ٹرانسفارمر آرکیٹیکچرز سے دلیری کے ساتھ انحراف کرتے ہوئے اور Mamba-2 اسٹیٹ اسپیس ڈوئلٹی، Latent MoE لو-رینک روٹنگ، اور نیٹیو Blackwell NVFP4 پری ٹریننگ کو یکجا کر کے، NVIDIA نے انفرینس کے لحاظ سے موثر ایجنٹک انٹیلیجنس کے لیے ایک نیا معیار قائم کیا ہے۔
انجینئرنگ لیڈرز کے لیے کلیدی آرکیٹیکچرل نکات:
- بے مثال ایجنٹک صلاحیت: PinchBench پر 85.6% اسکور Nemotron 3 Super کو OpenClaw جیسے ملٹی ایجنٹ اسکیفولڈز کے لیے ایک پریمیئر اوپن ویٹس (open-weights) کوگنیٹو انجن کے طور پر ثابت کرتا ہے۔
- تاخیر (Latency) کے بغیر سیاق و سباق: لکیری وقت (linear-time) پر کام کرنے والے Mamba-2 بلاکس سے لیس نیٹیو 1,000,000 ٹوکن سیاق و سباق کی ونڈو، روایتی LLMs کی کواڈریٹک میموری دیوار (quadratic memory wall) کو ختم کر دیتی ہے۔
- بلیک ویل-نیٹیو ایکسلریشن (Blackwell-Native Acceleration): NVFP4 میں نیٹیو پری ٹریننگ نہ ہونے کے برابر درستگی کے نقصان کے ساتھ B200 انفراسٹرکچر پر 4 گنا تیز انفرینس اسپیڈ اپ کی سہولت فراہم کرتی ہے۔
- بنیادی TCO اصلاح (Radical TCO Optimization): فی ٹوکن صرف 12B فعال پیرامیٹرز کے ساتھ، انٹرپرائزز لاگت کے لحاظ سے موثر 4x H100 یا 2x B200 ہارڈویئر ٹوپولوجیز پر جدید ترین درجے (frontier-class) کا استدلال فراہم کر سکتے ہیں۔
پروڈکشن گریڈ کے خود مختار ایجنٹ جھنڈوں (swarms) کی تعمیر کرنے والی انجینئرنگ ٹیموں کے لیے، nvidia nemotron 3 super انٹرپرائز پرائیویسی، انتہائی تیز رفتار ٹوکن تھرو پٹ، اور جدید ترین درجے کے استدلال کا ایک بہترین سنگم فراہم کرتا ہے۔