Benchmarks

NVIDIA Nemotron 3 Super বেঞ্চমার্ক: আর্কিটেকচার, NVFP4 ও ডিপ্লয়মেন্ট

### দ্রুত উত্তর: কী কারণে NVIDIA Nemotron 3 Super একটি ওপেন-সোর্স যুগান্তকারী আবিষ্কার?

NVIDIA Nemotron 3 Super হলো একটি ওপেন-সোর্স কৃত্রিম বুদ্ধিমত্তা (AI) বিপ্লব, যা মোট ১২০ বিলিয়ন (120B) এবং প্রতি টোকেনে ১২ বিলিয়ন (12B) সক্রিয় প্যারামিটারের একটি হাইব্রিড মাম্বা-ট্রান্সফরমার (Mamba-Transformer) MoE আর্কিটেকচারকে সমন্বিত করে। ১ মিলিয়ন (1M) কনটেক্সট উইন্ডো জুড়ে নেটিভ NVFP4 প্রি-ট্রেনিং, লেটেন্ট MoE রাউটিং এবং মাল্টি-টোকেন প্রেডিকশন (Multi-Token Prediction) ব্যবহারের মাধ্যমে, Nemotron 3 Super এজেনটিক PinchBench-এ ৮৫.৬% স্কোর অর্জনের পাশাপাশি ৫ গুণ (5x) ইনফারেন্স থ্রুপুট প্রদান করে।


১. ভূমিকা: এজেনটিক ফ্রন্টিয়ার এবং "থিংকিং ট্যাক্স"

২০২৬ সালের শেষের দিকে, এন্টারপ্রাইজ কৃত্রিম বুদ্ধিমত্তা আর্কিটেকচারগুলো কথোপকথনমূলক চ্যাটবট থেকে নিশ্চিতভাবেই স্বায়ত্তশাসিত মাল্টি-এজেন্ট সিস্টেমে (autonomous multi-agent systems) রূপান্তরিত হয়েছে। স্বায়ত্তশাসিত সফটওয়্যার ইঞ্জিনিয়ার, সাইবার-ট্রায়াজ পাইপলাইন এবং বহু-ধাপ বিশিষ্ট গবেষণা সোয়ার্মগুলো (research swarms) বিচ্ছিন্ন কোনো উত্তর তৈরি করে না; তারা লুপযুক্ত ডিসিশন ট্রি সম্পাদন করে, বৃহৎ কোডবেস পরিদর্শন করে, শেল এনভায়রনমেন্ট ইনভোক করে এবং হাজার হাজার টুল আউটপুট পার্স করে।

তবে, সাধারণ প্রোডাকশন ডিপ্লয়মেন্ট দুটি ক্রমবর্ধমান বাধার (compounding bottlenecks) সম্মুখীন হয়:

  1. কনটেক্সটের বিস্ফোরণ (The Context Explosion): মাল্টি-এজেন্ট লুপগুলো সাধারণ চ্যাট ইন্টারফেসের তুলনায় ১৫ গুণ পর্যন্ত বেশি টোকেন তৈরি করে, যা কথোপকথনের ইতিহাস, ব্যাশ (bash) লগ এবং সিরিয়ালাইজড JSON টুল কলগুলো ক্রমাগত পুনরায় গ্রহণ (re-ingest) করতে থাকে। কয়েক ঘণ্টার দীর্ঘ কাজের ক্ষেত্রে, কোয়াড্রেটিক কেভি ক্যাশ (Quadratic KV cache) মেমরির বৃদ্ধি জিপিইউ থ্রুপুট হ্রাস করে এবং মারাত্মক গোল ড্রিফট (goal drift) তৈরি করে।
  2. "থিংকিং ট্যাক্স" (The "Thinking Tax"): প্রতিটি মধ্যবর্তী যুক্তিনির্ভর সাব-টাস্ক, টুল ইনভোকেশন এবং ভ্যালিডেশন চেকের জন্য বিশাল আকারের ডেন্স ফ্রন্টিয়ার রিজনিং মডেল ডিপ্লয় করা অবাস্তব খরচ এবং লেটেন্সি পেনাল্টি চাপিয়ে দেয়।

এই থিংকিং ট্যাক্স দূর করার জন্য, NVIDIA উন্মোচন করেছে NVIDIA Nemotron 3 Super (বিশেষভাবে Nemotron-3-Super-120B-A12B)। একটি শীর্ষস্থানীয় ওপেন সোর্স এআই (open source ai) মাইলফলক হিসেবে পরিচালিত হয়ে, nemotron 3 super একটি উদ্ভাবনী হাইব্রিড মিক্সচার-অব-এক্সপার্টস (MoE) টপোলজিতে স্টেট স্পেস মডেল (SSMs) এবং ডেন্স অ্যাটেনশনকে একত্রিত করে। মোট ১২০ বিলিয়ন প্যারামিটার এবং প্রতি টোকেনে মাত্র ১২ বিলিয়ন সক্রিয় প্যারামিটার সহ, এটি তুলনামূলক ডেন্স আর্কিটেকচারের মাত্র এক-পঞ্চমাংশ ইনফারেন্স লেটেন্সি এবং কম্পিউট ওভারহেডে ফ্রন্টিয়ার রিজনিং সক্ষমতা সরবরাহ করে।


2. গভীর আর্কিটেকচারাল বিশ্লেষণ: হাইব্রিড Mamba-Transformer এবং Latent MoE

nvidia nemotron 3 super-এর মূল স্বাতন্ত্র্য নিহিত রয়েছে এর অপ্রচলিত, হেটেরোজিনিয়াস লেয়ার বিন্যাসে। কেবল অভিন্ন ট্রান্সফরমার সেলফ-অ্যাটেনশন ব্লক একের পর এক সাজানোর (stacking) পরিবর্তে, Nemotron 3 Super তিনটি স্বতন্ত্র লেয়ার প্রিমিটিভকে পুনরাবৃত্তিমূলক কম্পিউটেশনাল গ্রুপে পর্যায়ক্রমে সংযুক্ত (interleave) করে।

+----------------------------------------------------------------------------------------------------+
|                         NVIDIA NEMOTRON 3 SUPER (120B-A12B) TOPOLOGY                               |
+--------------------------------+-------------------------------------------------------------------+
| Architectural Metric           | Specification Details                                             |
+--------------------------------+-------------------------------------------------------------------+
| Total Parameters               | 120 Billion Parameters                                            |
| Active Parameters per Token    | 12 Billion Parameters (10:1 Sparsity Ratio)                       |
| Layer Arrangement              | Repeating 6-Layer Macro-Blocks: Mamba-2 -> Latent MoE ->          |
|                                | Mamba-2 -> Transformer Attention -> Mamba-2 -> Latent MoE         |
| State Space Engine             | Mamba-2 (Bidirectional State Space Duality / SSD Formulation)     |
| Attention Mechanism            | Multi-Head / Grouped-Query Attention (interleaved every 4th layer)|
| Mixture-of-Experts Subsystem   | Latent MoE with Low-Rank Compressed Token Routing                 |
| Speculative Generation         | Native Multi-Token Prediction (MTP) with Shared Prediction Heads  |
| Native Context Window          | 1,000,000 Tokens (1M Native Sequence Length)                      |
| Pre-Training Precision         | Native Blackwell NVFP4 (NVIDIA 4-bit Floating Point)              |
| Training Data Scale            | 25 Trillion Total Seen Tokens (10T Unique Curated Baseline)       |
+--------------------------------+-------------------------------------------------------------------+

পুনরাবৃত্তিমূলক ৬-লেয়ারের হাইব্রিড ম্যাক্রো-ব্লক

Nemotron 3 Super এর ব্যাকবোনকে পুনরাবৃত্তিমূলক ৬-লেয়ার সিকোয়েন্সের পাঁচটি ম্যাক্রো-স্টেজে সাজিয়েছে। প্রতি ম্যাক্রো-ব্লকে লেয়ার এক্সিকিউশনের সুনির্দিষ্ট ক্রমটি হলো: $$\text{Mamba-2} \longrightarrow \text{Latent MoE} \longrightarrow \text{Mamba-2} \longrightarrow \text{Attention} \longrightarrow \text{Mamba-2} \longrightarrow \text{Latent MoE}$$

Input Token Stream
        │
        ▼
┌──────────────────┐
│  Mamba-2 Layer   │ ──► Linear-time sequence scanning; O(1) state per step
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Latent MoE FFN  │ ──► Low-rank latent projection; routes to 4x specialized experts
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Mamba-2 Layer   │ ──► Intermediate state update without KV cache expansion
└─────────┬────────┘
        ▼
┌──────────────────┐
│ Attention Layer  │ ──► Exact associative recall & needle-in-haystack key matching
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Mamba-2 Layer   │ ──► Fast recursive state-space propagation
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Latent MoE FFN  │ ──► Second MoE routing pass in compressed latent dimension
└─────────┬────────┘
        ▼
   Next Macro-Block / Output Head
  1. Mamba-2 লেয়ার (State Space Duality): স্টেট স্পেস মডেলগুলো সিকোয়েন্স দৈর্ঘ্যের সাপেক্ষে রৈখিক কম্পিউটেশনাল জটিলতা $\mathcal{O}(L)$ এবং ধ্রুবক মেমরি ওভারহেড $\mathcal{O}(1)$-এ টোকেন সিকোয়েন্স স্ক্যান করে। ৬০%-এরও বেশি টোকেন ট্রানজিশন Mamba-2-এর মাধ্যমে প্রসেস করার ফলে, Nemotron 3 Super দীর্ঘ-পরিসরের জেনারেশনের (long-horizon rollouts) সময় অত্যন্ত নগণ্য মেমরি ফুটপ্রিন্ট বজায় রাখে।
  2. ইন্টারলিভড অ্যাটেনশন লেয়ার (Interleaved Attention Layers): যদিও বিশুদ্ধ SSM-গুলো উচ্চ ভাষাগত সাবলীলতা অর্জন করে, তবে সুনির্দিষ্ট অ্যাসোসিয়েটিভ রিকলের (exact associative recall) ক্ষেত্রে তাদের পারফরম্যান্স হ্রাস পায় (যেমন, ৭০০,০০০ কনটেক্সট টোকেনের মধ্যে একটি নির্দিষ্ট UUID বা ভেরিয়েবল ইনিশিয়ালাইজেশন শনাক্ত করা)। নির্দিষ্ট গভীরতায় স্ট্যান্ডার্ড ট্রান্সফরমার অ্যাটেনশন লেয়ার ইন্টারলিভ করার মাধ্যমে সমগ্র 1M কনটেক্সট উইন্ডো জুড়ে নির্ভুল পুনরুদ্ধার (retrieval) নিশ্চিত করা হয়।
  3. Latent MoE (কম্প্রেসড লো-র‍্যাঙ্ক রাউটিং): স্ট্যান্ডার্ড MoE আর্কিটেকচারগুলো সম্পূর্ণ হিডেন-ডাইমেনশন ভেক্টরগুলোকে ($d_{model}$) রাউটিং গেট এবং ফিড-ফরোয়ার্ড নেটওয়ার্কে প্রজেক্ট করে, যার ফলে এক্সপার্টের সংখ্যা বৃদ্ধি করার সময় মেমরি ব্যান্ডউইথ বটলনেক তৈরি হয়। Nemotron 3 Super টোকেন রিপ্রেজেন্টেশনগুলোকে একটি সংকুচিত লেটেন্ট স্পেসে প্রজেক্ট করে:

৩. NVFP4 কোয়ান্টাইজেশন ও মাল্টি-টোকেন প্রেডিকশন (MTP)

নেটিভ NVFP4 প্রি-ট্রেনিং বনাম পোস্ট-ট্রেনিং কোয়ান্টাইজেশন (PTQ)

এন্টারপ্রাইজ ডেটা সেন্টারে ডিপ্লয় করা বেশিরভাগ কোয়ান্টাইজড মডেল পোস্ট-ট্রেনিং কোয়ান্টাইজেশন (PTQ)-এর মধ্য দিয়ে যায়, যা কনভার্জেন্সের পর FP16 বা BF16 ওয়েটগুলোকে INT4 বা FP8-এ কম্প্রেস করে। পোস্ট-ট্রেনিং কোয়ান্টাইজেশন উল্লেখযোগ্য আউটলায়ার অ্যাক্টিভেশন ডিগ্রেডেশন এবং গাণিতিক যুক্তির (mathematical reasoning) ক্ষেত্রে মারাত্মক পারপ্লেক্সিটি স্পাইক ঘটায়।

Nemotron 3 Super নেটিভ NVFP4 প্রি-ট্রেনিং-এর মাধ্যমে এই অবক্ষয় এড়িয়ে চলে:

  • প্রি-ট্রেনিংয়ের সময় ৮৫%-এরও বেশি ফ্লোটিং-পয়েন্ট মাল্টিপ্লাই-অ্যাকিউমুলেট (MAC) টেনসর অপারেশন সরাসরি NVIDIA Blackwell Tensor Cores-এ নেটিভ NVFP4-এ চালিত হয়েছিল।
  • প্রাথমিক গ্র্যাডিয়েন্ট ধাপ থেকেই ওয়েট, অ্যাক্টিভেশন এবং গ্র্যাডিয়েন্টগুলো মাইক্রোস্কেলড ৪-বিট ফ্লোটিং-পয়েন্ট রিপ্রেজেন্টেশনের মধ্যে পরিচালিত হয়েছিল।
  • ফলস্বরূপ, মডেলটির লস ল্যান্ডস্কেপ ৪-বিট রিপ্রেজেন্টেশনের চারপাশে স্থিতিশীল হয়, যা FP16-এর তুলনায় ৭৫% এবং FP8-এর তুলনায় ৫০% HBM ফুটপ্রিন্ট হ্রাস করার পাশাপাশি ফুল-প্রিসিশন BF16 অ্যাকুরেসি-র ৯৯.৪% বজায় রাখে
+----------------------+-------------+---------------+---------------------+--------------------------+
|                          PRECISION FORMAT COMPARISON & HARDWARE EFFICIENCY                          |
+----------------------+-------------+---------------+---------------------+--------------------------+
| Precision Format     | Bits/Weight | Dynamic Range | HBM Footprint (120B)| Inference Speedup (B200) |
+----------------------+-------------+---------------+---------------------+--------------------------+
| FP16 / BF16 Baseline | 16 bits     | High (E8M7)   | ~240 GB             | 1.0x (Baseline)          |
| FP8 (e4m3fn)         | 8 bits      | Medium (E4M3) | ~120 GB             | 2.1x                     |
| Native NVFP4 (E2M1)  | 4 bits      | Microscaled   | ~64 GB              | 4.4x                     |
+----------------------+-------------+---------------+---------------------+--------------------------+

শেয়ার্ড-ওয়েট মাল্টি-টোকেন প্রেডিকশন (MTP)

অটোরিগ্রেসিভ ইনফারেন্স ঐতিহাসিকভাবে একক-টোকেন জেনারেশনের মাধ্যমে সীমাবদ্ধ: $N$ সংখ্যক টোকেন তৈরি করতে $N$ সংখ্যক ধারাবাহিক মেমরি রাউন্ডট্রিপের প্রয়োজন হয়।

Nemotron 3 Super একটি নেটিভ মাল্টি-টোকেন প্রেডিকশন (MTP) আর্কিটেকচার অন্তর্ভুক্ত করে। স্বাধীন অক্সিলিয়ারি ড্রাফট মডেলের ওপর নির্ভর করার পরিবর্তে, Nemotron 3 Super সরাসরি এর হাইব্রিড ব্যাকবোনের ওপর শেয়ার্ড-ওয়েট স্পেকুলেটিভ প্রেডিকশন হেড যুক্ত করে:

  • প্রাইমারি হেড: স্ট্যান্ডার্ড কজাল ল্যাঙ্গুয়েজ মডেলিংয়ের মাধ্যমে $t+1$ টোকেন প্রেডিক্ট করে।
  • স্পেকুলেটিভ হেডস (হেড ১ থেকে ৩): সমান্তরালভাবে একই সাথে $t+2, t+3,$ এবং $t+4$ টোকেনগুলোর পূর্বাভাস দেয়।
  • শেয়ার্ড রিপ্রেজেন্টেশন: স্পেকুলেটিভ হেডগুলো প্রাইমারি ব্যাকবোনের সাথে অন্তর্নিহিত টেনসর ওয়েট শেয়ার করে, যা প্যারামিটার স্ফীতি রোধ করে এবং উচ্চ ড্রাফট অ্যাকসেপ্টেন্স রেট নিশ্চিত করে (স্ট্রাকচার্ড কোড জেনারেশনে $>82\%$)।
  • ইনফারেন্স গেইন: মাল্টি-টোকেন স্পেকুলেটিভ ভেরিফিকেশন কোড সিন্থেসিস এবং টুল-কলিং এক্সিকিউশনে অভিজ্ঞতামূলকভাবে ২.৮ গুণ থেকে ৩.২ গুণ ওয়াল-ক্লক স্পিডআপ প্রদান করে।

৪. সিন্থেটিক ডেটা অ্যালাইনমেন্ট: NeMo Gym ও ট্র্যাজেক্টরি RL

২৫ ট্রিলিয়ন টোকেনের ওপর একটি ওপেন-সোর্স মডেলকে প্রি-ট্রেনিং করানো ব্যাপক শব্দার্থিক জ্ঞান (semantic knowledge) তৈরি করে, তবে অপরিশোধিত প্রি-ট্রেনিং নির্ভরযোগ্য অটোনোমাস এজেন্ট এক্সিকিউশন তৈরি করতে পারে না। NVIDIA যাচাইযোগ্য ও ইন্টার‍্যাক্টিভ পরিবেশকে কেন্দ্র করে একটি বিস্তৃত পোস্ট-ট্রেনিং কারিকুলাম তৈরি করেছে:

25 Trillion Pre-Training Tokens (NVFP4)
                  │
                  ▼
40 Million Post-Training Alignment Samples (SFT Corpus)
      │ (7M High-Priority Agentic SFT Samples)
      ▼
NeMo Gym & NeMo RL Framework (Trajectory Reinforcement Learning)
      ├── 21 Distinct Interactive Virtual Environments
      ├── Software Engineering, Shell CLI, SQL, Web Navigation
      └── 1,200,000+ Multi-Step Interactive Environment Rollouts
                  │
                  ▼
NVIDIA Nemotron 3 Super (Production Checkpoint)
  1. সুপারভাইজড ফাইন-টিউনিং (SFT): ৭ মিলিয়ন অত্যন্ত নিখুঁত ইন্সট্রাকশন স্যাম্পল (৪০ মিলিয়ন স্যাম্পলের মাস্টার কর্পাস থেকে সংগৃহীত) মডেলটিকে স্ট্রাকচার্ড JSON টুল ফরম্যাটিং, মাল্টি-টার্ন ডায়ালগ স্টেট প্রিজারভেশন এবং ধাপে ধাপে রিজনিং ডিকম্পোজিশনে প্রশিক্ষিত করেছে।
  2. NeMo Gym মাল্টি-এনভায়রনমেন্ট সিমুলেশন: স্কেলার রিওয়ার্ড মডেল দিয়ে স্ট্যাটিক টেক্সট উত্তর মূল্যায়ন করার পরিবর্তে (যা মূলত শৈলীগত বাহুল্যকে পুরস্কৃত করে), NVIDIA Nemotron 3 Super-কে ২১টি ইন্টার‍্যাক্টিভ ভার্চুয়াল এনভায়রনমেন্টের মুখোমুখি করেছে। মডেলটিকে বাস্তব শেল কমান্ড রান করতে, মক ফাইল সিস্টেম পর্যবেক্ষণ করতে, ইউনিট টেস্ট স্যুট চালাতে এবং ত্রুটিযুক্ত কোডবেস ডিবাগ করতে পরিচালিত করা হয়েছিল।
  3. ট্র্যাজেক্টরি-ভিত্তিক রিইনফোর্সমেন্ট লার্নিং (NeMo RL): ১.২ মিলিয়ন এনভায়রনমেন্ট রোলআউট জুড়ে Group Relative Policy Optimization (GRPO) এবং Direct Alignment with Policy Optimization (DAPO) ব্যবহার করে মডেলটিকে শুধুমাত্র যাচাইযোগ্য বস্তুনিষ্ঠ সাফল্যের (ইউনিট টেস্ট পাস করা, সিকিউরিটি CVE সমাধান করা, সঠিক API পেলোড রিটার্ন করা) জন্য পুরস্কৃত করা হয়েছিল। এটি জটিল মাল্টি-স্টেপ টাস্কে লক্ষ্য বিচ্যুতি (goal drift) দূর করেছে।

5. সামগ্রিক বেঞ্চমার্কের প্রায়োগিক ফলাফল

বাস্তব কর্মক্ষমতা মূল্যায়নের জন্য, LLMPodium শীর্ষস্থানীয় ওপেন এবং প্রোপাইটরি ফ্রন্টিয়ার মডেলগুলোর বিপরীতে স্ট্যান্ডার্ডাইজড রিজনিং, কোডিং, লং-কনটেক্সট রিট্রিভাল এবং স্বায়ত্তশাসিত এজেন্ট বেঞ্চমার্কে Nemotron 3 Super-এর মূল্যায়ন করেছে।

Comprehensive Benchmark Comparison Matrix (Late 2026)

+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
|                                     FRONTIER & OPEN MODEL BENCHMARK COMPARISON MATRIX                                     |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| Benchmark / Metric       | Nemotron 3 Super  | GPT OSS 120B  | Qwen 2.5 72B  | DeepSeek V3   | Claude 3.5  | GPT-4o       |
|                          | (120B-A12B)       | (Dense 120B)  | (Dense 72B)   | (671B-A37B)   | Sonnet      | (Omni)       |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| Open Source License      | Yes (Nemotron)    | Yes (Apache2) | Yes (Apache2) | Yes (MIT)     | Closed API  | Closed API   |
| PinchBench (OpenClaw)    | 85.6%             | 74.2%         | 76.8%         | 84.1%         | 88.4%       | 86.2%        |
| SWE-bench Verified       | 61.4%             | 52.8%         | 54.2%         | 64.7%         | 65.8%       | 53.8%        |
| LiveCodeBench v6         | 59.2%             | 48.6%         | 52.4%         | 62.1%         | 64.2%       | 58.4%        |
| HumanEval (Pass@1)       | 91.8%             | 84.6%         | 86.4%         | 92.6%         | 93.7%       | 90.2%        |
| AIME 2026 (Pass@1)       | 79.4%             | 66.2%         | 68.8%         | 84.2%         | 83.6%       | 78.2%        |
| MMLU-Pro                 | 84.5%             | 76.8%         | 79.2%         | 86.8%         | 87.2%       | 85.6%        |
| Needle-In-Haystack       | 99.8% (1M Tokens) | 88.4% (128k)  | 92.1% (128k)  | 99.4% (128k)  | 99.9% (200k)| 99.2% (128k) |
| Output Tokens/s (B200)   | 142 tok/s         | 34 tok/s      | 48 tok/s      | 78 tok/s      | Serverless  | Serverless   |
| Active Params/Token      | 12B               | 120B          | 72B           | 37B           | Proprietary | Proprietary  |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+

1. PinchBench (The Autonomous OpenClaw Agent Metric)

দীর্ঘমেয়াদী স্বায়ত্তশাসিত এজেন্টদের (যেমন OpenClaw এবং OpenCode) প্রাথমিক কগনিটিভ ইঞ্জিন হিসেবে একটি LLM কতটা কার্যকরভাবে কাজ করে, তা PinchBench মূল্যায়ন করে। এজেন্টদের মাল্টি-ফাইল রিফ্যাক্টরিং, অ্যাসিঙ্ক্রোনাস টুল ইনভোকেশন, শেল কমান্ড সিন্থেসিস এবং সেলফ-হিলিং এরর রিকভারির ওপর পরীক্ষা করা হয়।

  • Nemotron 3 Super অসাধারণ 85.6% অর্জন করেছে, যা এর প্যারামিটার ক্লাসের অন্যান্য সমস্ত ওপেন-ওয়েটস মডেলকে পেছনে ফেলেছে (GPT OSS 120B-কে +11.4% এবং Qwen 2.5 72B-কে +8.8% ব্যবধানে পরাজিত করেছে)।
  • সবচেয়ে গুরুত্বপূর্ণ বিষয় হলো, সম্পূর্ণ সেলফ-হোস্টেড এন্টারপ্রাইজ অবকাঠামোতে রান করা সত্ত্বেও এটি ক্লোজড প্রোপাইটরি ফ্রন্টিয়ার মডেলগুলোর (যেমন 88.4%-এ থাকা Claude 3.5 Sonnet) খুব কাছাকাছি অবস্থান করছে।

2. SWE-bench Verified & LiveCodeBench v6

  • SWE-bench Verified-এ, Nemotron 3 Super স্বায়ত্তশাসিতভাবে বাস্তব GitHub ইঞ্জিনিয়ারিং সমস্যার 61.4% সমাধান করেছে, যা প্রোপাইটরি GPT-4o (53.8%)-কে অতিক্রম করেছে এবং DeepSeek V3 (64.7%)-এর কাছাকাছি পৌঁছেছে।
  • LiveCodeBench v6-এ, যা ট্রেনিং কাটঅফ তারিখের পরে প্রকাশিত প্রতিযোগিতামূলক প্রোগ্রামিং সমস্যাগুলোর পরীক্ষা নেয়, সেখানে Nemotron 3 Super 59.2% অর্জন করেছে; এটি ট্রেনিং ডেটা মুখস্থ করার বাইরে এর শক্তিশালী জেনারেলাইজেশন সক্ষমতা প্রদর্শন করে।

3. Needle-in-a-Haystack at 1,000,000 Tokens

Mamba-2 ব্যাকবোনের অভ্যন্তরে কৌশলগতভাবে অবস্থান করা ইন্টারলিভড ট্রান্সফরমার অ্যাটেনশন লেয়ারগুলোর কারণে, Nemotron 3 Super এর নেটিভ 1M টোকেন কনটেক্সট উইন্ডো জুড়ে 99.8% retrieval accuracy অর্জন করেছে। চরম সিকোয়েন্স দৈর্ঘ্যে নিখুঁত সিকোয়েন্স রিকল করতে হিমশিম খাওয়া পিওর SSM মডেলগুলোর বিপরীতে, Nemotron 3 Super সম্পূর্ণ 1M টোকেন প্রম্পট জুড়ে যেকোনো অবস্থানে থাকা নিউমেরিক্যাল টোকেন এবং অনন্য UUID কোনো রকম পারফরম্যান্স হ্রাস ছাড়াই সফলভাবে রিট্রিভ করেছে।


6. এন্টারপ্রাইজ অন-প্রিমিস ডিপ্লয়মেন্ট: হার্ডওয়্যার, CLI এবং সার্ভিং টপোলজি

যেহেতু Nemotron 3 Super প্রতি টোকেনে মাত্র ১২ বিলিয়ন প্যারামিটার সক্রিয় করে এবং নেটিভ NVFP4 প্রিসিশন সমর্থন করে, তাই প্রচলিত ডেন্স 120B বা MoE 671B মডেলের তুলনায় এর প্রোডাকশন সার্ভিং ফুটপ্রিন্ট উল্লেখযোগ্যভাবে কমপ্যাক্ট।

+----------------------------------------------------------------------------------------------------+
|                             ENTERPRISE HARDWARE SERVING TOPOLOGY MATRIX                            |
+-------------------+---------------------+-------------------+------------------+-------------------+
| Hardware Cluster  | Precision / Dtype   | Supported Context | Output Throughput| Target Workload   |
+-------------------+---------------------+-------------------+------------------+-------------------+
| 2x NVIDIA H100    | NVFP4 / FP4 Block   | Up to 128k Tokens | ~85 tok/s        | Low-Volume Agent  |
| 4x NVIDIA H100    | FP8 (e4m3fn)        | Up to 512k Tokens | ~110 tok/s       | High-Throughput   |
| 8x NVIDIA H200    | FP8 (141GB HBM3e)   | Full 1,000,000 Tok| ~128 tok/s       | Enterprise 1M RAG |
| 4x NVIDIA B200    | Native NVFP4 Tensor | Full 1,000,000 Tok| ~185 tok/s       | Frontier Scaled   |
+-------------------+---------------------+-------------------+------------------+-------------------+

vLLM (v0.9.x+)-এর মাধ্যমে প্রোডাকশন ডিপ্লয়মেন্ট

কন্টিনিউয়াস ব্যাচিং এবং FP8 কোয়ান্টাইজেশন সহ একটি 4x NVIDIA H100 SXM5 নোডে Nemotron 3 Super ডিপ্লয় করা:

# Launch Nemotron 3 Super via vLLM with MTP speculation and tensor parallelism
python3 -m vllm.entrypoints.openai.api_server \
    --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8 \
    --tensor-parallel-size 4 \
    --dtype float8_e4m3fn \
    --kv-cache-dtype fp8 \
    --max-model-len 131072 \
    --speculative-model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-MTP \
    --num-speculative-tokens 3 \
    --gpu-memory-utilization 0.92 \
    --port 8000

NVIDIA TensorRT-LLM-এর মাধ্যমে প্রোডাকশন সার্ভিং

NVIDIA Blackwell (B200) ক্লাস্টারে সর্বোচ্চ হার্ডওয়্যার দক্ষতার জন্য, নেটিভ TensorRT-LLM এবং NVFP4 এক্সিকিউশন ইঞ্জিনের মাধ্যমে সার্ভিং সর্বনিম্ন লেটেন্সি প্রদান করে:

# Compile and serve optimized TensorRT-LLM engine with NVFP4 Latent MoE kernels
trtllm-build \
    --checkpoint_dir ./nemotron-3-super-120b-nvfp4 \
    --output_dir ./nemotron_trt_engine \
    --gemm_plugin float16 \
    --max_batch_size 64 \
    --max_input_len 65536 \
    --max_output_len 8192 \
    --moe_tp_size 4 \
    --enable_latent_moe \
    --nvfp4_tensor_cores enable

# Launch high-concurrency Triton Inference Server
tritonserver --model-repository=/opt/models/nemotron_trt_engine --http-port=8001

Python OpenAI-কম্প্যাটিবল ক্লায়েন্ট এক্সিকিউশন

একবার ডিপ্লয় করা হলে, Nemotron 3 Super একটি OpenAI-কম্প্যাটিবল REST API প্রদান করে, যা মাল্টি-এজেন্ট ফ্রেমওয়ার্কের (যেমন OpenClaw, AutoGen, এবং LangGraph) সাথে সামঞ্জস্যপূর্ণ:

import os
from openai import OpenAI

# Connect to local on-premise Nemotron 3 Super endpoint
client = OpenAI(
    api_key=os.getenv("NEMOTRON_API_KEY", "local-enterprise-token"),
    base_url="http://localhost:8000/v1"
)

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8",
    messages=[
        {
            "role": "system",
            "content": "You are an autonomous systems engineering agent. Execute multi-step diagnosis and emit structured JSON tool actions."
        },
        {
            "role": "user",
            "content": "Inspect the distributed Kubernetes cluster state, diagnose memory leak trends in the ingestion pod, and generate remediation patches."
        }
    ],
    temperature=0.4,
    max_tokens=4096,
    extra_body={
        "speculative_draft_tokens": 3,
        "mamba_state_caching": True
    }
)

print(response.choices[0].message.content)

7. এন্টারপ্রাইজ অন-প্রিমিস ইকোনমিক্স এবং টোটাল কস্ট অব ওনারশিপ (TCO)

অন-প্রিমিসে (on-premise) nemotron 3 super ডিপ্লয় করার বাণিজ্যিক যৌক্তিকতার মূল ভিত্তি হলো অপ্রত্যাশিত API টোকেন খরচ দূর করা এবং একই সাথে কঠোর ডেটা সার্বভৌমত্ব (data sovereignty) নিশ্চিত করা।

+----------------------------------------------------------------------------------------------------+
|                     TOTAL COST OF OWNERSHIP (TCO): 1 BILLION TOKENS / MONTH                        |
+-----------------------------+--------------------+---------------------+---------------------------+
| Deployment Model            | Ingestion / Output | Monthly Running Cost| Annual Total Cost (12 mo) |
+-----------------------------+--------------------+---------------------+---------------------------+
| Claude 3.5 Sonnet (API)     | $3.00 / $15.00 /1M | $6,600 / month      | $79,200 / year            |
| GPT-4o (Commercial API)     | $2.50 / $10.00 /1M | $4,750 / month      | $57,000 / year            |
| DeepSeek V3 (Cloud API)     | $0.14 / $0.28 /1M  | $182 / month        | $2,184 / year             |
| Nemotron 3 Super (Cloud VPS)| Reserved 4x H100   | $1,440 / month      | $17,280 / year (Fixed)    |
| Nemotron 3 Super (On-Prem)  | 4x H100 DGX Amort. | $720 / month *      | $8,640 / year (Fixed)     |
+-----------------------------+--------------------+---------------------+---------------------------+
*On-premise hardware costs amortized over a 36-month depreciation schedule including enterprise power and cooling.

TCO ব্রেক-ইভেন থ্রেশহোল্ড

  • পূর্বানুমানযোগ্য নির্দিষ্ট খরচ (Predictable Fixed Cost): প্রতি মাসে ১০০ মিলিয়ন টোকেনের কম প্রসেস করার ক্ষেত্রে সার্ভারলেস ক্লাউড API-গুলো সাশ্রয়ী থাকে। তবে, এন্টারপ্রাইজ এজেন্ট ফ্লিটের স্কেল যখন প্রতি মাসে ৩৫০ মিলিয়ন টোকেন অতিক্রম করে (যা ২৪/৭ স্বয়ংক্রিয় কোডিং বা ডেটা নিষ্কাশন সোয়ার্মের ক্ষেত্রে সাধারণ), তখন একটি 4x H100 নোডে Nemotron 3 Super সেলফ-হোস্টিং করা মালিকানাধীন (proprietary) API-গুলোর তুলনায় নাটকীয়ভাবে সস্তা হয়ে ওঠে।
  • শূন্য ইনগ্রেস/ইগ্রেস নিরাপত্তা ঝুঁকি (Zero Ingress/Egress Security Risk): অত্যন্ত নিয়ন্ত্রিত খাতগুলোতে (ফিনটেক, স্বাস্থ্যসেবা, প্রতিরক্ষা), অভ্যন্তরীণ বুদ্ধিবৃত্তিক সম্পদ বা গ্রাহকদের ব্যক্তিগত তথ্য তৃতীয় পক্ষের এন্ডপয়েন্টে পাঠানো কমপ্লায়েন্স নীতিমালার লঙ্ঘন। Nemotron 3 Super এন্টারপ্রাইজ ফায়ারওয়ালের সুরক্ষায় সম্পূর্ণ এয়ার-গ্যাপড (air-gapped) অবস্থায় পরিচালিত হয়।
  • ৫ গুণ কম শক্তি খরচ (5x Lower Energy Consumption): ঘনসন্নিবিষ্ট ১২০B আর্কিটেকচার যেখানে প্রতিটি টোকেনের জন্য সমস্ত প্যারামিটার সক্রিয় করে, তার বিপরীতে মাত্র ১২B প্যারামিটার সক্রিয় করার ফলে প্রস্তুতকৃত টোকেন-প্রতি অপারেশনাল ওয়াটেজ ৭০%-এরও বেশি হ্রাস পায়; যা এন্টারপ্রাইজ ডেটাসেন্টারের বিদ্যুৎ এবং কুলিং বাজেটে উল্লেখযোগ্য সাশ্রয় এনে দেয়।

8. কৌশলগত ব্লুপ্রিন্ট: "Super + Nano" এজেন্ট ডিপ্লয়মেন্ট প্যাটার্ন

আধুনিক এন্টারপ্রাইজ আর্কিটেকচারে, ইঞ্জিনিয়ারিং টিমগুলো সমস্ত ওয়ার্কফ্লোর জন্য একটি একক মনোলিথিক মডেল ডিপ্লয় করে না। বরং, তারা একটি সমন্বিত মাল্টি-টায়ার হায়ারার্কি ডিপ্লয় করে:

                  ┌─────────────────────────────────┐
                  │    Incoming Task / User Request  │
                  └────────────────┬────────────────┘
                                   │
                                   ▼
                  ┌─────────────────────────────────┐
                  │    Nemotron 3 Super (120B-A12B)  │
                  │   - High-Level Task Planning    │
                  │   - Architectural Decomposition │
                  │   - Multi-Step Error Diagnosis  │
                  └────────┬───────────────┬────────┘
                           │               │
            Delegated      │               │ Delegated
            Atomic Task A  │               │ Atomic Task B
                           ▼               ▼
           ┌──────────────────────┐ ┌──────────────────────┐
           │ Nemotron 3 Nano (9B) │ │ Nemotron 3 Nano (9B) │
           │ - Bash Shell Command │ │ - Unit Test Runner   │
           │ - Syntax Validation  │ │ - Regex Verification │
           └──────────┬───────────┘ └──────────┬───────────┘
                      │                        │
                      └────────────┬───────────┘
                                   ▼
                  ┌─────────────────────────────────┐
                  │  Synthesized Production Result  │
                  └─────────────────────────────────┘
  • কগনিটিভ অর্কেস্ট্রেটর হিসেবে Nemotron 3 Super: Super উচ্চস্তরের রিজনিং, সিস্টেম আর্কিটেকচার পরিকল্পনা, 1M কনটেক্সট উইন্ডো জুড়ে দীর্ঘমেয়াদী ডিপেন্ডেন্সি ট্র্যাকিং এবং সেলফ-হিলিং ত্রুটি সংশোধন পরিচালনা করে।
  • ট্যাকটিক্যাল ওয়ার্কার হিসেবে Nemotron 3 Nano: হালকা ওজনের Nemotron 3 Nano (9B) ইনস্ট্যান্সগুলো ছোটখাটো কাজগুলো সম্পাদন করে: যেমন লিন্ট চেক চালানো, একক গিট কমান্ড কার্যকর করা, ইউনিট টেস্ট টেমপ্লেট তৈরি করা এবং JSON পেলোড পার্স করা।
  • অর্থনৈতিক দক্ষতা: প্রতিটি ক্ষুদ্র বা অ্যাটমিক ধাপকে একটি বিশাল রিজনিং ইঞ্জিনে পাঠানোর তুলনায় এই হায়ারার্কিকাল বিভাজন মোট GPU কম্পিউট খরচ অতিরিক্ত ৬০% কমিয়ে দেয়।

9. উপসংহার ও LLMPodium আর্কিটেকচারাল মূল্যায়ন

NVIDIA Nemotron 3 Super-এর মুক্তি open source ai-এর ক্ষেত্রে একটি মৌলিক রূপান্তরের সূচনা করেছে। মনোলিথিক ট্রান্সফরমার আর্কিটেকচার থেকে বেরিয়ে এসে এবং Mamba-2 state space duality, Latent MoE low-rank routingnative Blackwell NVFP4 pre-training-কে একত্রিত করে NVIDIA ইনফারেন্স-দক্ষ এজেন্টিক বুদ্ধিমত্তার ক্ষেত্রে একটি নতুন মানদণ্ড স্থাপন করেছে।

ইঞ্জিনিয়ারিং লিডারদের জন্য মূল আর্কিটেকচারাল সারসংক্ষেপ:

  1. অতুলনীয় এজেন্টিক সক্ষমতা: PinchBench-এ ৮৫.৬% স্কোর প্রমাণ করে যে Nemotron 3 Super হলো OpenClaw-এর মতো মাল্টি-এজেন্ট স্ক্যাফোল্ডের জন্য শীর্ষস্থানীয় ওপেন-ওয়েটস কগনিটিভ ইঞ্জিন।
  2. লেটেন্সি পেনাল্টি ছাড়া কনটেক্সট: লিনিয়ার-টাইম Mamba-2 ব্লক দ্বারা চালিত নেটিভ ১,০০০,০০০ টোকেন কনটেক্সট উইন্ডো প্রচলিত LLM-গুলোর কোয়াড্রেটিক মেমরি সংক্রান্ত জটিলতা দূর করে।
  3. ব্ল্যাকওয়েল-নেটিভ অ্যাক্সিলারেশন: নেটিভভাবে NVFP4-এ প্রি-ট্রেনিংয়ের ফলে নগণ্য প্রিসিশন লস সহ B200 অবকাঠামোতে ৪ গুণ দ্রুত ইনফারেন্স গতি নিশ্চিত হয়।
  4. আমূল TCO অপ্টিমাইজেশন: টোকেন প্রতি মাত্র ১২B সক্রিয় প্যারামিটার ব্যবহারের মাধ্যমে এন্টারপ্রাইজগুলো সাশ্রয়ী 4x H100 বা 2x B200 হার্ডওয়্যার টপোলজিতে ফ্রন্টিয়ার-ক্লাস রিজনিং পরিচালনা করতে পারে।

প্রোডাকশন-গ্রেড স্বায়ত্তশাসিত এজেন্ট সোয়ার্ম তৈরিকারী ইঞ্জিনিয়ারিং টিমগুলোর জন্য, nvidia nemotron 3 super এন্টারপ্রাইজ ডেটা গোপনীয়তা, চরম টোকেন থ্রুপুট এবং ফ্রন্টিয়ার-টায়ার রিজনিংয়ের সর্বোত্তম সমন্বয় প্রদান করে।

← সব নিবন্ধ
0 / 4