Benchmarks

เบนช์มาร์ก NVIDIA Nemotron 3 Super: สถาปัตยกรรม, NVFP4 และการปรับใช้งานจริง

### คำตอบสั้นๆ: อะไรทำให้ NVIDIA Nemotron 3 Super เป็นนวัตกรรมโอเพนซอร์สที่พลิกวงการ?

NVIDIA Nemotron 3 Super คือนวัตกรรม AI โอเพนซอร์สที่ผสานสถาปัตยกรรม Hybrid Mamba-Transformer MoE ขนาด 120B พารามิเตอร์รวม (โดยมีพารามิเตอร์ที่แอกทีฟ 12B) ด้วยการใช้ประโยชน์จากการพรีเทรนระดับเนทีฟด้วย NVFP4, การเราต์แบบ Latent MoE และ Multi-Token Prediction บนหน้าต่างบริบท (Context Window) ขนาด 1M ส่งผลให้ Nemotron 3 Super ให้ Throughput ในการรัน Inference สูงขึ้นถึง 5 เท่า พร้อมทำคะแนนได้ 85.6% บนเบนช์มาร์กระบบเอเจนต์ PinchBench


1. บทนำ: ขอบเขตใหม่ของระบบเอเจนต์และต้นทุนการใช้เหตุผล (Thinking Tax)

ในช่วงปลายปี 2026 สถาปัตยกรรมปัญญาประดิษฐ์ระดับองค์กรได้เปลี่ยนผ่านอย่างชัดเจนจากแชตบอตสนทนาไปสู่ระบบมัลติเอเจนต์อัตโนมัติ (Autonomous Multi-Agent Systems) โดยวิศวกรซอฟต์แวร์อัตโนมัติ, ไปป์ไลน์คัดกรองภัยคุกคามทางไซเบอร์ และเครือข่ายเอเจนต์วิจัยแบบหลายขั้นตอนไม่ได้สร้างข้อความตอบกลับแบบแยกเดี่ยวอีกต่อไป แต่จะทำงานตามแผนผังการตัดสินใจแบบวนรอบ (Looped Decision Trees), ตรวจสอบโค้ดเบสขนาดใหญ่, เรียกใช้งานเชลล์ (Shell Environments) และประมวลผลเอาต์พุตจากเครื่องมือต่างๆ นับพันรายการ

อย่างไรก็ตาม การปรับใช้งานในสภาพแวดล้อมการผลิตจริงแบบมาตรฐานมักเผชิญกับคอขวดที่ซ้ำซ้อนสองประการ:

  1. การระเบิดของบริบท (The Context Explosion): ลูปของมัลติเอเจนต์สร้างโทเคนมากกว่าอินเทอร์เฟซแชตทั่วไปถึง 15 เท่า โดยต้องดึงประวัติการสนทนา, ล็อกคำสั่ง bash และการเรียกใช้เครื่องมือในรูปแบบ serialized JSON กลับเข้ามาประมวลผลใหม่อย่างต่อเนื่อง ในงานที่ใช้เวลาทำงานหลายชั่วโมง การเติบโตของหน่วยความจำ KV Cache ในอัตราส่วน Quadratic จะลดทอน Throughput ของ GPU และก่อให้เกิดปัญหาการหลุดเป้าหมายหลัก (Goal Drift) อย่างรุนแรง
  2. "ภาษีการใช้เหตุผล" (The "Thinking Tax"): การนำโมเดลการคิดเชิงเหตุผลระดับแนวหน้า (Frontier Reasoning Models) ขนาดใหญ่ที่เป็นโมเดลแบบ Dense มาใช้งานกับทุกๆ งานย่อยของการใช้เหตุผลระหว่างทาง, การเรียกใช้เครื่องมือ และการตรวจสอบความถูกต้อง ก่อให้เกิดภาระด้านค่าใช้จ่ายและความหน่วง (Latency) ที่สูงจนไม่สามารถรองรับการใช้งานระยะยาวได้อย่างยั่งยืน

เพื่อกำจัด Thinking Tax นี้ NVIDIA จึงได้เปิดตัว NVIDIA Nemotron 3 Super (โดยเฉพาะรุ่น Nemotron-3-Super-120B-A12B) ซึ่งทำหน้าที่เป็นหมุดหมายสำคัญของ AI โอเพนซอร์ส (open source ai) ชั้นนำ โดย Nemotron 3 Super ได้ผสาน State Space Models (SSMs) และ Dense Attention เข้าไว้ด้วยกันในโครงสร้าง Mixture-of-Experts (MoE) แบบไฮบริดที่ล้ำสมัย ด้วยพารามิเตอร์รวม 1.2 แสนล้านพารามิเตอร์ (120B) และมีพารามิเตอร์ที่แอกทีฟเพียง 1.2 หมื่นล้านพารามิเตอร์ (12B) ต่อโทเคน ทำให้โมเดลนี้สามารถมอบคุณความสามารถในการใช้เหตุผลระดับแนวหน้าได้โดยมีความหน่วงในการรัน Inference และภาระการคำนวณเพียงหนึ่งในห้าเมื่อเทียบกับสถาปัตยกรรมแบบ Dense ในระดับเดียวกัน


2. เจาะลึกโครงสร้างสถาปัตยกรรม: ไฮบริด Mamba-Transformer และ Latent MoE

จุดเด่นที่สร้างความแตกต่างหลักของ nvidia nemotron 3 super อยู่ที่การจัดเรียงเลเยอร์แบบต่างชนิด (heterogeneous) ซึ่งไม่ใช่รูปแบบมาตรฐาน แทนที่จะเป็นการวางซ้อนบล็อก Transformer self-attention แบบเดียวกันซ้ำ ๆ Nemotron 3 Super ได้สลับการทำงานของเลเยอร์พื้นฐานที่แตกต่างกัน 3 รูปแบบเข้าด้วยกันเป็นกลุ่มการคำนวณที่ทำซ้ำเป็นชุด

+----------------------------------------------------------------------------------------------------+
|                         NVIDIA NEMOTRON 3 SUPER (120B-A12B) TOPOLOGY                               |
+--------------------------------+-------------------------------------------------------------------+
| Architectural Metric           | Specification Details                                             |
+--------------------------------+-------------------------------------------------------------------+
| Total Parameters               | 120 Billion Parameters                                            |
| Active Parameters per Token    | 12 Billion Parameters (10:1 Sparsity Ratio)                       |
| Layer Arrangement              | Repeating 6-Layer Macro-Blocks: Mamba-2 -> Latent MoE ->          |
|                                | Mamba-2 -> Transformer Attention -> Mamba-2 -> Latent MoE         |
| State Space Engine             | Mamba-2 (Bidirectional State Space Duality / SSD Formulation)     |
| Attention Mechanism            | Multi-Head / Grouped-Query Attention (interleaved every 4th layer)|
| Mixture-of-Experts Subsystem   | Latent MoE with Low-Rank Compressed Token Routing                 |
| Speculative Generation         | Native Multi-Token Prediction (MTP) with Shared Prediction Heads  |
| Native Context Window          | 1,000,000 Tokens (1M Native Sequence Length)                      |
| Pre-Training Precision         | Native Blackwell NVFP4 (NVIDIA 4-bit Floating Point)              |
| Training Data Scale            | 25 Trillion Total Seen Tokens (10T Unique Curated Baseline)       |
+--------------------------------+-------------------------------------------------------------------+

แมโครบล็อกไฮบริด 6 เลเยอร์แบบทำซ้ำ (The Repeating 6-Layer Hybrid Macro-Block)

Nemotron 3 Super จัดโครงสร้างหลัก (backbone) ออกเป็น 5 แมโครสเตจ (macro-stages) ที่ประกอบด้วยลำดับ 6 เลเยอร์ที่ทำซ้ำ โดยลำดับการประมวลผลของเลเยอร์ที่แน่นอนต่อหนึ่งแมโครบล็อกคือ: $$\text{Mamba-2} \longrightarrow \text{Latent MoE} \longrightarrow \text{Mamba-2} \longrightarrow \text{Attention} \longrightarrow \text{Mamba-2} \longrightarrow \text{Latent MoE}$$

Input Token Stream
        │
        ▼
┌──────────────────┐
│  Mamba-2 Layer   │ ──► Linear-time sequence scanning; O(1) state per step
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Latent MoE FFN  │ ──► Low-rank latent projection; routes to 4x specialized experts
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Mamba-2 Layer   │ ──► Intermediate state update without KV cache expansion
└─────────┬────────┘
        ▼
┌──────────────────┐
│ Attention Layer  │ ──► Exact associative recall & needle-in-haystack key matching
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Mamba-2 Layer   │ ──► Fast recursive state-space propagation
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Latent MoE FFN  │ ──► Second MoE routing pass in compressed latent dimension
└─────────┬────────┘
        ▼
   Next Macro-Block / Output Head
  1. เลเยอร์ Mamba-2 (State Space Duality): สถาปัตยกรรมแบบจำลองสเตตสเปซ (State space models) จะสแกนลำดับโทเค็นด้วยความซับซ้อนในการคำนวณเชิงเส้น (linear computational complexity) $\mathcal{O}(L)$ และมีภาระหน่วยความจำคงที่ (constant memory overhead) $\mathcal{O}(1)$ สัมพันธ์กับความยาวของลำดับ การประมวลผลการเปลี่ยนสถานะของโทเค็นมากกว่า 60% ผ่าน Mamba-2 ช่วยให้ Nemotron 3 Super สามารถรักษาการใช้หน่วยความจำให้อยู่ในระดับต่ำมากจนแทบไม่มีผลกระทบในระหว่างการอนุมานต่อเนื่องระยะยาว (long-horizon rollouts)
  2. เลเยอร์ Attention แบบสลับแทรก (Interleaved Attention Layers): แม้ว่า SSM แบบล้วน (pure SSMs) จะมีความคล่องแคล่วทางภาษาขั้นสูง แต่จะมีประสิทธิภาพลดลงในด้านการดึงข้อมูลแบบเชื่อมโยงที่แม่นยำ (exact associative recall) (เช่น การค้นหาตำแหน่งของ UUID เดี่ยว หรือการกำหนดค่าตัวแปรเริ่มต้นท่ามกลาง 700,000 โทเค็นบริบท) การสลับแทรกเลเยอร์ Transformer attention มาตรฐานไว้ที่ระดับความลึกสำคัญ จึงช่วยรับประกันการดึงข้อมูลได้อย่างไร้ที่ติตลอดทั้งหน้าต่างบริบท (context window) ขนาด 1M โทเค็น
  3. Latent MoE (การกำหนดเส้นทางแบบบีบอัดอันดับต่ำ - Compressed Low-Rank Routing): สถาปัตยกรรม MoE มาตรฐานทั่วไปจะโปรเจกต์เวกเตอร์มิติซ่อนแบบเต็ม ($d_{model}$) ไปยัง routing gates และ feed-forward networks ส่งผลให้เกิดปัญหาคอขวดของแบนด์วิดท์หน่วยความจำเมื่อขยายจำนวน expert Nemotron 3 Super จึงโปรเจกต์การแทนค่าของโทเค็นเข้าสู่ latent space ที่ถูกบีบอัดแทน:

3. การทำ Quantization ด้วย NVFP4 และ Multi-Token Prediction (MTP)

Native NVFP4 Pre-Training เทียบกับ Post-Training Quantization (PTQ)

โมเดลที่ผ่านการทำ Quantization ส่วนใหญ่ซึ่งนำไปปรับใช้ในดาต้าเซ็นเตอร์ระดับองค์กรมักจะผ่านกระบวนการ Post-Training Quantization (PTQ) โดยทำการบีบอัดค่าน้ำหนัก (Weights) จาก FP16 หรือ BF16 ไปเป็น INT4 หรือ FP8 ภายหลังจากการลู่เข้า (Convergence) ของการเทรน อย่างไรก็ตาม Post-Training Quantization มักนำไปสู่การเสื่อมถอยของคุณภาพอย่างมีนัยสำคัญจาก Outlier Activation และทำให้ค่า Perplexity พุ่งสูงขึ้นอย่างรุนแรง (Catastrophic Perplexity Spikes) ในงานด้านการให้เหตุผลทางคณิตศาสตร์

Nemotron 3 Super หลีกเลี่ยงการลดทอนประสิทธิภาพดังกล่าวด้วย Native NVFP4 Pre-Training:

  • มากกว่า 85% ของการคำนวณ Multiply-Accumulate (MAC) ของเทนเซอร์แบบ Floating-point ในระหว่างขั้นตอน Pre-training ทำงานบนฟอร์แมตเนทีฟ NVFP4 โดยตรงบน Tensor Cores ของสถาปัตยกรรม NVIDIA Blackwell
  • ค่าน้ำหนัก (Weights), แอ็กทิเวชัน (Activations) และเกรเดียนต์ (Gradients) ทำงานภายใต้รูปแบบการแทนค่า Floating-point ขนาด 4 บิตแบบ Microscaled ตั้งแต่สเต็ปแรกของการอัปเดตเกรเดียนต์
  • ส่งผลให้ Loss Landscape ของโมเดลมีเสถียรภาพสอดรับกับการแทนค่าแบบ 4 บิตอย่างสมบูรณ์ โดยสามารถรักษา ความแม่นยำไว้ได้ถึง 99.4% เมื่อเทียบกับ Full-Precision BF16 พร้อมทั้งลดขนาดการใช้หน่วยความจำ HBM ลงถึง 75% เมื่อเทียบกับ FP16 และลดลง 50% เมื่อเทียบกับ FP8
+----------------------+-------------+---------------+---------------------+--------------------------+
|                          PRECISION FORMAT COMPARISON & HARDWARE EFFICIENCY                          |
+----------------------+-------------+---------------+---------------------+--------------------------+
| Precision Format     | Bits/Weight | Dynamic Range | HBM Footprint (120B)| Inference Speedup (B200) |
+----------------------+-------------+---------------+---------------------+--------------------------+
| FP16 / BF16 Baseline | 16 bits     | High (E8M7)   | ~240 GB             | 1.0x (Baseline)          |
| FP8 (e4m3fn)         | 8 bits      | Medium (E4M3) | ~120 GB             | 2.1x                     |
| Native NVFP4 (E2M1)  | 4 bits      | Microscaled   | ~64 GB              | 4.4x                     |
+----------------------+-------------+---------------+---------------------+--------------------------+

Shared-Weight Multi-Token Prediction (MTP)

แต่เดิม การทำ Inference แบบ Autoregressive มีข้อจำกัดจากการสร้างโทเคนทีละหนึ่งตัว (Single-token generation) โดยการสร้างโทเคนจำนวน $N$ ตัวจำเป็นต้องอาศัยการเข้าถึงหน่วยความจำ (Memory roundtrips) เรียงตามลำดับจำนวน $N$ ครั้ง

Nemotron 3 Super ได้ผสานสถาปัตยกรรม Multi-Token Prediction (MTP) แบบเนทีฟ เข้ามาใช้งาน โดยแทนที่จะต้องพึ่งพาโมเดลเสริม (Auxiliary draft models) ที่แยกส่วนกัน Nemotron 3 Super ได้ติดตั้งส่วนหัวสำหรับการทำนายเชิงคาดการณ์แบบใช้ค่าน้ำหนักร่วมกัน (Shared-weight speculative prediction heads) เข้ากับโครงสร้างหลักแบบไฮบริด (Hybrid backbone) โดยตรง:

  • Primary Head: ทำนายโทเคน $t+1$ ผ่าน Causal Language Modeling แบบมาตรฐาน
  • Speculative Heads (Heads 1 ถึง 3): คาดการณ์โทเคน $t+2, t+3,$ และ $t+4$ พร้อมกันแบบคู่ขนาน (Parallel)
  • Shared Representation: ส่วนหัวแบบ Speculative จะแชร์ค่าน้ำหนักของเทนเซอร์ระดับล่างร่วมกับโครงข่ายหลัก เพื่อป้องกันไม่ให้จำนวนพารามิเตอร์ขยายตัวจนเกินจำเป็น (Parameter bloat) และช่วยรักษาอัตราการยอมรับผลคาดการณ์ (Draft acceptance rate) ในระดับสูง ($>82\%$ สำหรับการสร้างโค้ดเชิงโครงสร้าง)
  • Inference Gain: การตรวจสอบเชิงคาดการณ์แบบหลายโทเคนพร้อมกันนี้ ช่วยเพิ่มความเร็วเชิงประจักษ์ (Wall-clock speedup) ได้ถึง 2.8x ถึง 3.2x ในกระบวนการสังเคราะห์โค้ดและการประมวลผลคำสั่งเรียกใช้เครื่องมือ (Tool-calling execution)

4. Synthetic Data Alignment: NeMo Gym และ Trajectory RL

แม้การทำ Pre-training โมเดลโอเพนซอร์สด้วยชุดข้อมูลขนาด 25 ล้านล้านโทเคน (Trillion tokens) จะช่วยสร้างองค์ความรู้ทางความหมาย (Semantic knowledge) ในระดับที่กว้างขวาง แต่โมเดลดิบที่ได้จากการ Pre-training เพียงอย่างเดียวนั้นยังไม่สามารถทำงานในฐานะ Autonomous Agent ได้อย่างน่าเชื่อถือ ด้วยเหตุนี้ NVIDIA จึงได้ออกแบบกระบวนการฝึกอบรมหลังการเทรน (Post-training curriculum) อย่างครอบคลุม โดยมุ่งเน้นไปที่สภาพแวดล้อมเชิงโต้ตอบที่สามารถตรวจสอบผลลัพธ์ได้อย่างแม่นยำ (Verifiable, interactive environments):

25 Trillion Pre-Training Tokens (NVFP4)
                  │
                  ▼
40 Million Post-Training Alignment Samples (SFT Corpus)
      │ (7M High-Priority Agentic SFT Samples)
      ▼
NeMo Gym & NeMo RL Framework (Trajectory Reinforcement Learning)
      ├── 21 Distinct Interactive Virtual Environments
      ├── Software Engineering, Shell CLI, SQL, Web Navigation
      └── 1,200,000+ Multi-Step Interactive Environment Rollouts
                  │
                  ▼
NVIDIA Nemotron 3 Super (Production Checkpoint)
  1. Supervised Fine-Tuning (SFT): ตัวอย่างคำสั่งที่ผ่านการคัดสรรอย่างเข้มงวดจำนวน 7 ล้านตัวอย่าง (คัดกรองมาจากคลังข้อมูลหลักขนาด 40 ล้านตัวอย่าง) ถูกนำมาใช้ฝึกโมเดลในด้านการจัดรูปแบบเครื่องมือแบบ JSON เชิงโครงสร้าง, การคงสถานะของบทสนทนาแบบหลายรอบ (Multi-turn dialogue state preservation) และการแยกย่อยกระบวนการให้เหตุผลแบบทีละขั้นตอน (Step-by-step reasoning decomposition)
  2. NeMo Gym Multi-Environment Simulation: แทนที่จะให้คะแนนคำตอบที่เป็นข้อความแบบสแตติกด้วยโมเดลวัดผลตอบแทนแบบสเกลาร์ (Scalar reward models) ซึ่งมักให้รางวัลกับคำตอบที่ยาวเยิ่นเย้อในเชิงสำนวนภาษา NVIDIA ได้นำ Nemotron 3 Super ไปทดสอบใน สภาพแวดล้อมเสมือนจริงเชิงโต้ตอบจำนวน 21 รูปแบบ โดยบีบให้โมเดลต้องรันคำสั่งเชลล์ (Shell commands) จริง, ตรวจสอบโครงสร้างไฟล์จำลอง, รันชุดทดสอบ Unit test และแก้ไขข้อผิดพลาดในโค้ดเบสที่มีปัญหา
  3. Trajectory-Based Reinforcement Learning (NeMo RL): การประยุกต์ใช้วิธี Group Relative Policy Optimization (GRPO) และ Direct Alignment with Policy Optimization (DAPO) ผ่านกระบวนการ Environment Rollouts มากกว่า 1.2 ล้านครั้ง โดยโมเดลจะได้รับผลตอบแทน (Reward) จากความสำเร็จของเป้าหมายที่สามารถตรวจสอบได้อย่างเป็นรูปธรรมเท่านั้น (เช่น ผ่านชุดทดสอบ Unit test, แก้ไขช่องโหว่ความปลอดภัย CVE สำเร็จ, ส่งคืน Payload ของ API ได้อย่างถูกต้อง) แนวทางนี้ช่วยกำจัดปัญหาการเบี่ยงเบนจากเป้าหมาย (Goal drift) ในภารกิจที่มีความซับซ้อนและมีหลายขั้นตอน

5. ผลการทดสอบ Benchmark เชิงประจักษ์แบบครอบคลุม

เพื่อประเมินประสิทธิภาพการทำงานในโลกแห่งความเป็นจริง LLMPodium ได้ทำการประเมิน Nemotron 3 Super ผ่านชุดทดสอบเกณฑ์มาตรฐาน (benchmarks) ทั้งด้านการใช้เหตุผล (reasoning), การเขียนโค้ด (coding), การค้นคืนข้อมูลในบริบทขนาดยาว (long-context retrieval) และ autonomous agent โดยเปรียบเทียบกับโมเดลระดับ frontier ชั้นนำทั้งแบบโอเพนซอร์สและแบบ proprietary

Comprehensive Benchmark Comparison Matrix (Late 2026)

+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
|                                     FRONTIER & OPEN MODEL BENCHMARK COMPARISON MATRIX                                     |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| Benchmark / Metric       | Nemotron 3 Super  | GPT OSS 120B  | Qwen 2.5 72B  | DeepSeek V3   | Claude 3.5  | GPT-4o       |
|                          | (120B-A12B)       | (Dense 120B)  | (Dense 72B)   | (671B-A37B)   | Sonnet      | (Omni)       |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| Open Source License      | Yes (Nemotron)    | Yes (Apache2) | Yes (Apache2) | Yes (MIT)     | Closed API  | Closed API   |
| PinchBench (OpenClaw)    | 85.6%             | 74.2%         | 76.8%         | 84.1%         | 88.4%       | 86.2%        |
| SWE-bench Verified       | 61.4%             | 52.8%         | 54.2%         | 64.7%         | 65.8%       | 53.8%        |
| LiveCodeBench v6         | 59.2%             | 48.6%         | 52.4%         | 62.1%         | 64.2%       | 58.4%        |
| HumanEval (Pass@1)       | 91.8%             | 84.6%         | 86.4%         | 92.6%         | 93.7%       | 90.2%        |
| AIME 2026 (Pass@1)       | 79.4%             | 66.2%         | 68.8%         | 84.2%         | 83.6%       | 78.2%        |
| MMLU-Pro                 | 84.5%             | 76.8%         | 79.2%         | 86.8%         | 87.2%       | 85.6%        |
| Needle-In-Haystack       | 99.8% (1M Tokens) | 88.4% (128k)  | 92.1% (128k)  | 99.4% (128k)  | 99.9% (200k)| 99.2% (128k) |
| Output Tokens/s (B200)   | 142 tok/s         | 34 tok/s      | 48 tok/s      | 78 tok/s      | Serverless  | Serverless   |
| Active Params/Token      | 12B               | 120B          | 72B           | 37B           | Proprietary | Proprietary  |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+

1. PinchBench (The Autonomous OpenClaw Agent Metric)

PinchBench ทำการประเมินว่า LLM มีประสิทธิภาพเพียงใดในการทำหน้าที่เป็นกลไกการรับรู้หลัก (cognitive engine) สำหรับ autonomous agent ที่ทำงานต่อเนื่องระยะยาว (เช่น OpenClaw และ OpenCode) โดย agent จะได้รับการทดสอบในด้านการรีแฟกเตอร์โค้ดข้ามหลายไฟล์ (multi-file refactoring), การเรียกใช้เครื่องมือแบบอะซิงโครนัส (asynchronous tool invocations), การสังเคราะห์คำสั่ง shell และการกู้คืนข้อผิดพลาดด้วยตนเอง (self-healing error recovery)

  • Nemotron 3 Super ทำคะแนนได้สูงเป็นพิเศษถึง 85.6% ซึ่งมีประสิทธิภาพเหนือกว่าโมเดลแบบ open-weights อื่นๆ ทุกตัวในระดับพารามิเตอร์เดียวกัน (เอาชนะ GPT OSS 120B ได้ +11.4% และชนะ Qwen 2.5 72B ได้ +8.8%)
  • สิ่งสำคัญคือ โมเดลนี้ทำคะแนนไล่เลี่ยกับโมเดลระดับ frontier แบบ proprietary (Claude 3.5 Sonnet อยู่ที่ 88.4%) อย่างสูสี ในขณะที่สามารถรันบนโครงสร้างพื้นฐานระดับองค์กรที่โฮสต์เองได้ทั้งหมด (self-hosted enterprise infrastructure)

2. SWE-bench Verified & LiveCodeBench v6

  • ใน SWE-bench Verified Nemotron 3 Super สามารถแก้ไขปัญหาทางวิศวกรรมจริงบน GitHub ได้โดยอัตโนมัติถึง 61.4% ซึ่งมีประสิทธิภาพเหนือกว่าโมเดลแบบ proprietary อย่าง GPT-4o (53.8%) และใกล้เคียงกับ DeepSeek V3 (64.7%)
  • ใน LiveCodeBench v6 ซึ่งทดสอบโจทย์การแข่งขันการเขียนโปรแกรม (competitive programming) ที่เผยแพร่หลังวันตัดรอบการฝึกฝน (training cutoff dates) Nemotron 3 Super ทำคะแนนได้ 59.2% ซึ่งแสดงให้เห็นถึงความสามารถในการวางนัยทั่วไป (generalization) ที่แข็งแกร่ง นอกเหนือไปจากการจดจำข้อมูลที่ใช้ฝึกฝน

3. Needle-in-a-Haystack at 1,000,000 Tokens

ด้วยชั้นประมวลผล Transformer attention แบบสลับแทรก (interleaved) ที่จัดวางตำแหน่งไว้อย่างมีกลยุทธ์ภายในโครงสร้างหลักของ Mamba-2 ส่งผลให้ Nemotron 3 Super บรรลุ retrieval accuracy ถึง 99.8% ตลอดหน้าต่างบริบทดั้งเดิมขนาด 1M โทเค็น แตกต่างจากโมเดล pure SSM ที่มักมีปัญหาในการดึงข้อมูลลำดับที่แม่นยำ (precise sequence recall) ณ ความยาวบริบทระดับสุดขั้ว Nemotron 3 Super สามารถค้นคืนโทเค็นตัวเลขที่อยู่ในตำแหน่งใดๆ และค่า UUID ที่ไม่ซ้ำกันตลอดทั้งพรอมต์ขนาด 1M โทเค็นได้อย่างแม่นยำโดยไม่มีประสิทธิภาพลดลงแม้แต่น้อย


6. การติดตั้งใช้งานระดับองค์กรแบบ On-Premise: ฮาร์ดแวร์, CLI และ Serving Topologies

เนื่องจาก Nemotron 3 Super มีการเปิดใช้งาน (activate) พารามิเตอร์เพียง 12 พันล้านพารามิเตอร์ต่อโทเค็น และรองรับความแม่นยำระดับ native NVFP4 ในตัว ทำให้ production serving footprint มีขนาดกะทัดรัดอย่างน่าทึ่ง เมื่อเปรียบเทียบกับโมเดลแบบ dense ขนาด 120B หรือ MoE ขนาด 671B ทั่วไป

+----------------------------------------------------------------------------------------------------+
|                             ENTERPRISE HARDWARE SERVING TOPOLOGY MATRIX                            |
+-------------------+---------------------+-------------------+------------------+-------------------+
| Hardware Cluster  | Precision / Dtype   | Supported Context | Output Throughput| Target Workload   |
+-------------------+---------------------+-------------------+------------------+-------------------+
| 2x NVIDIA H100    | NVFP4 / FP4 Block   | Up to 128k Tokens | ~85 tok/s        | Low-Volume Agent  |
| 4x NVIDIA H100    | FP8 (e4m3fn)        | Up to 512k Tokens | ~110 tok/s       | High-Throughput   |
| 8x NVIDIA H200    | FP8 (141GB HBM3e)   | Full 1,000,000 Tok| ~128 tok/s       | Enterprise 1M RAG |
| 4x NVIDIA B200    | Native NVFP4 Tensor | Full 1,000,000 Tok| ~185 tok/s       | Frontier Scaled   |
+-------------------+---------------------+-------------------+------------------+-------------------+

การติดตั้งใช้งานจริงในระดับ Production ด้วย vLLM (v0.9.x+)

การติดตั้งใช้งาน Nemotron 3 Super บนโหนด 4x NVIDIA H100 SXM5 พร้อม continuous batching และ FP8 quantization:

# Launch Nemotron 3 Super via vLLM with MTP speculation and tensor parallelism
python3 -m vllm.entrypoints.openai.api_server \
    --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8 \
    --tensor-parallel-size 4 \
    --dtype float8_e4m3fn \
    --kv-cache-dtype fp8 \
    --max-model-len 131072 \
    --speculative-model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-MTP \
    --num-speculative-tokens 3 \
    --gpu-memory-utilization 0.92 \
    --port 8000

การให้บริการบน Production ด้วย NVIDIA TensorRT-LLM

เพื่อประสิทธิภาพฮาร์ดแวร์สูงสุดบนคลัสเตอร์ NVIDIA Blackwell (B200) การให้บริการด้วย TensorRT-LLM แบบ native และ execution engine ของ NVFP4 จะให้อัตราความหน่วง (latency) ที่ต่ำที่สุด:

# Compile and serve optimized TensorRT-LLM engine with NVFP4 Latent MoE kernels
trtllm-build \
    --checkpoint_dir ./nemotron-3-super-120b-nvfp4 \
    --output_dir ./nemotron_trt_engine \
    --gemm_plugin float16 \
    --max_batch_size 64 \
    --max_input_len 65536 \
    --max_output_len 8192 \
    --moe_tp_size 4 \
    --enable_latent_moe \
    --nvfp4_tensor_cores enable

# Launch high-concurrency Triton Inference Server
tritonserver --model-repository=/opt/models/nemotron_trt_engine --http-port=8001

การเรียกใช้งานไคลเอนต์ Python ที่เข้ากันได้กับมาตรฐาน OpenAI

เมื่อติดตั้งแล้ว Nemotron 3 Super จะเปิดให้บริการ REST API ที่เข้ากันได้กับ OpenAI ซึ่งรองรับการทำงานร่วมกับ multi-agent framework ต่าง ๆ (เช่น OpenClaw, AutoGen และ LangGraph):

import os
from openai import OpenAI

# Connect to local on-premise Nemotron 3 Super endpoint
client = OpenAI(
    api_key=os.getenv("NEMOTRON_API_KEY", "local-enterprise-token"),
    base_url="http://localhost:8000/v1"
)

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8",
    messages=[
        {
            "role": "system",
            "content": "You are an autonomous systems engineering agent. Execute multi-step diagnosis and emit structured JSON tool actions."
        },
        {
            "role": "user",
            "content": "Inspect the distributed Kubernetes cluster state, diagnose memory leak trends in the ingestion pod, and generate remediation patches."
        }
    ],
    temperature=0.4,
    max_tokens=4096,
    extra_body={
        "speculative_draft_tokens": 3,
        "mamba_state_caching": True
    }
)

print(response.choices[0].message.content)

7. เศรษฐศาสตร์ของการติดตั้งแบบ On-Premise ระดับองค์กร และต้นทุนรวมในการเป็นเจ้าของ (TCO)

เหตุผลเชิงพาณิชย์ในการติดตั้งใช้งาน nemotron 3 super แบบ on-premise มุ่งเน้นไปที่การขจัดค่าใช้จ่าย API token ที่คาดเดาไม่ได้ พร้อมทั้งรับประกันการรักษาอธิปไตยของข้อมูล (Data Sovereignty) ให้อยู่ภายใต้การควบคุมอย่างเข้มงวด

+----------------------------------------------------------------------------------------------------+
|                     TOTAL COST OF OWNERSHIP (TCO): 1 BILLION TOKENS / MONTH                        |
+-----------------------------+--------------------+---------------------+---------------------------+
| Deployment Model            | Ingestion / Output | Monthly Running Cost| Annual Total Cost (12 mo) |
+-----------------------------+--------------------+---------------------+---------------------------+
| Claude 3.5 Sonnet (API)     | $3.00 / $15.00 /1M | $6,600 / month      | $79,200 / year            |
| GPT-4o (Commercial API)     | $2.50 / $10.00 /1M | $4,750 / month      | $57,000 / year            |
| DeepSeek V3 (Cloud API)     | $0.14 / $0.28 /1M  | $182 / month        | $2,184 / year             |
| Nemotron 3 Super (Cloud VPS)| Reserved 4x H100   | $1,440 / month      | $17,280 / year (Fixed)    |
| Nemotron 3 Super (On-Prem)  | 4x H100 DGX Amort. | $720 / month *      | $8,640 / year (Fixed)     |
+-----------------------------+--------------------+---------------------+---------------------------+
*On-premise hardware costs amortized over a 36-month depreciation schedule including enterprise power and cooling.

จุดคุ้มทุนของ TCO (The TCO Break-Even Threshold)

  • ต้นทุนคงที่ที่คาดการณ์ได้ (Predictable Fixed Cost): เมื่อประมวลผลน้อยกว่า 100 ล้านโทเคนต่อเดือน Serverless Cloud API จะยังคงมีความคุ้มค่าด้านต้นทุน อย่างไรก็ตาม เมื่อกลุ่มเอเจนต์ (Agent fleet) ระดับองค์กรขยายขนาดเกินกว่า 350 ล้านโทเคนต่อเดือน (ซึ่งพบได้ทั่วไปสำหรับกลุ่มเอเจนต์ที่ทำงานอัตโนมัติตลอด 24/7 ในการเขียนโค้ดหรือการสกัดข้อมูล) การโฮสต์ Nemotron 3 Super ด้วยตนเองบนโหนด 4x H100 จะประหยัดกว่าการใช้ Proprietary API อย่างมหาศาล
  • ความเสี่ยงด้านความปลอดภัยจากการรับ-ส่งข้อมูลเป็นศูนย์ (Zero Ingress/Egress Security Risk): ในกลุ่มอุตสาหกรรมที่มีการกำกับดูแลอย่างเข้มงวด (ฟินเทค, การดูแลสุขภาพ, ความมั่นคง) การส่งทรัพย์สินทางปัญญาภายในหรือข้อมูลส่วนบุคคลของลูกค้าไปยังเอนด์พอยต์ของบุคคลที่สามถือเป็นการละเมิดข้อกำหนดด้านการปฏิบัติตามกฎระเบียบ (Compliance mandates) ทั้งนี้ Nemotron 3 Super สามารถทำงานในระบบเครือข่ายที่ตัดขาดจากการเชื่อมต่อภายนอกโดยสมบูรณ์ (Air-gapped) ภายใต้ไฟร์วอลล์ขององค์กร
  • การใช้พลังงานลดลง 5 เท่า (5x Lower Energy Consumption): เมื่อเทียบกับสถาปัตยกรรมแบบ Dense ขนาด 120B ที่ต้องเปิดใช้งานพารามิเตอร์ทั้งหมดในทุกๆ โทเคน การเปิดใช้งานพารามิเตอร์เพียง 12B จะช่วยลดกำลังวัตต์ในการทำงานต่อโทเคนที่สร้างขึ้นได้มากกว่า 70% ซึ่งช่วยประหยัดงบประมาณด้านพลังงานไฟฟ้าและการระบายความร้อนของดาต้าเซ็นเตอร์ระดับองค์กรได้อย่างมาก

8. พิมพ์เขียวเชิงกลยุทธ์: รูปแบบการปรับใช้เอเจนต์แบบ "Super + Nano"

ในสถาปัตยกรรมระดับองค์กรยุคใหม่ ทีมวิศวกรรมจะไม่ปรับใช้โมเดลเดี่ยวขนาดใหญ่ (Monolithic model) สำหรับทุกเวิร์กโฟลว์ แต่จะปรับใช้โครงสร้างลำดับชั้นหลายระดับที่ทำงานประสานกัน:

                  ┌─────────────────────────────────┐
                  │    Incoming Task / User Request  │
                  └────────────────┬────────────────┘
                                   │
                                   ▼
                  ┌─────────────────────────────────┐
                  │    Nemotron 3 Super (120B-A12B)  │
                  │   - High-Level Task Planning    │
                  │   - Architectural Decomposition │
                  │   - Multi-Step Error Diagnosis  │
                  └────────┬───────────────┬────────┘
                           │               │
            Delegated      │               │ Delegated
            Atomic Task A  │               │ Atomic Task B
                           ▼               ▼
           ┌──────────────────────┐ ┌──────────────────────┐
           │ Nemotron 3 Nano (9B) │ │ Nemotron 3 Nano (9B) │
           │ - Bash Shell Command │ │ - Unit Test Runner   │
           │ - Syntax Validation  │ │ - Regex Verification │
           └──────────┬───────────┘ └──────────┬───────────┘
                      │                        │
                      └────────────┬───────────┘
                                   ▼
                  ┌─────────────────────────────────┐
                  │  Synthesized Production Result  │
                  └─────────────────────────────────┘
  • Nemotron 3 Super ในฐานะ Cognitive Orchestrator: Super จะทำหน้าที่จัดการการใช้เหตุผลระดับสูง, การวางแผนสถาปัตยกรรมระบบ, การติดตามความเชื่อมโยงระยะยาวตลอด Context Window ขนาด 1M และการกู้คืนข้อผิดพลาดแบบแก้ไขตัวเองได้ (Self-healing error recovery)
  • Nemotron 3 Nano ในฐานะ Tactical Workers: อินสแตนซ์ Nemotron 3 Nano (9B) ที่มีน้ำหนักเบาจะทำหน้าที่ดำเนินงานย่อย (Micro-tasks) เช่น การรัน Lint check, การรันคำสั่ง Git เดี่ยวๆ, การสร้างเทมเพลต Unit test และการแยกวิเคราะห์ (Parse) เพย์โหลด JSON
  • ประสิทธิภาพเชิงเศรษฐศาสตร์ (Economic Efficiency): การแบ่งงานตามลำดับชั้นนี้ช่วยลดค่าใช้จ่ายในการประมวลผลของ GPU โดยรวมลงได้อีกถึง 60% เมื่อเทียบกับการส่งทุกขั้นตอนย่อย (Atomic step) ไปยังเอนจินการใช้เหตุผลขนาดใหญ่

9. บทสรุปและการประเมินเชิงสถาปัตยกรรมโดย LLMPodium

การเปิดตัว NVIDIA Nemotron 3 Super ถือเป็นจุดเปลี่ยนครั้งสำคัญของวงการ open source ai ด้วยการกล้าที่จะก้าวข้ามสถาปัตยกรรม Transformer แบบเดิม พร้อมผสานรวม Mamba-2 state space duality, Latent MoE low-rank routing และ native Blackwell NVFP4 pre-training ทำให้ NVIDIA สามารถสร้างมาตรฐานระดับโกลด์สแตนดาร์ดขึ้นมาใหม่ สำหรับระบบอัจฉริยะเชิงเอเจนต์ (Agentic intelligence) ที่ประมวลผล Inference ได้อย่างทรงประสิทธิภาพสูงสุด

ข้อสรุปเชิงสถาปัตยกรรมที่สำคัญสำหรับผู้นำด้านวิศวกรรม:

  1. ขีดความสามารถด้าน Agentic ที่ไร้คู่แข่ง: คะแนน 85.6% บน PinchBench พิสูจน์ให้เห็นว่า Nemotron 3 Super คือเอนจินการคิดแบบ Open-weights ชั้นนำสำหรับเฟรมเวิร์ก Multi-agent เช่น OpenClaw
  2. บริบทมหาศาลโดยไม่มีค่า Latency แฝง (Context Without Latency Penalty): Context Window ระดับ 1,000,000 โทเคนแบบเนทีฟ ซึ่งขับเคลื่อนด้วยบล็อก Mamba-2 แบบเวลาเชิงเส้น (Linear-time) ช่วยทลายกำแพงหน่วยความจำระดับ Quadratic ของ LLM แบบดั้งเดิมได้อย่างสมบูรณ์
  3. การเร่งความเร็วระดับเนทีฟบน Blackwell: การทำ Pre-training ในรูปแบบ NVFP4 โดยตรง ช่วยปลดล็อกความเร็วในการทำ Inference เพิ่มขึ้นถึง 4 เท่า บนโครงสร้างพื้นฐาน B200 โดยแทบไม่มีการสูญเสียความแม่นยำ
  4. การปรับลด TCO ขั้นสูงสุด: ด้วยการเปิดใช้งานพารามิเตอร์เพียง 12B ต่อโทเคน องค์กรจึงสามารถให้บริการการใช้เหตุผลระดับแถวหน้า (Frontier-class reasoning) บนโทโพโลยีฮาร์ดแวร์ที่คุ้มค่า เช่น 4x H100 หรือ 2x B200 ได้อย่างมีประสิทธิภาพ

สำหรับทีมวิศวกรรมที่กำลังพัฒนาฝูงเอเจนต์อัตโนมัติระดับ Production นั้น nvidia nemotron 3 super มอบจุดบรรจบที่สมบูรณ์แบบระหว่างความเป็นส่วนตัวระดับองค์กร, อัตรา Throughput ของโทเคนที่สูงเป็นพิเศษ และประสิทธิภาพการใช้เหตุผลระดับแนวหน้า (Frontier-tier reasoning)

← บทความทั้งหมด
0 / 4