### 快速解答:是什么让 NVIDIA Nemotron 3 Super 成为开源领域的重大突破?
NVIDIA Nemotron 3 Super 是开源 AI 领域的一项重大突破,采用了总参数 120B、激活参数 12B 的 Mamba-Transformer 混合 MoE 架构。通过利用原生 NVFP4 预训练、隐空间 MoE 路由(Latent MoE routing)以及跨 1M 上下文窗口的多 Token 预测(Multi-Token Prediction),Nemotron 3 Super 实现了 5 倍的推理吞吐量提升,并在 Agent 基准评测 PinchBench 中取得了 85.6% 的优异成绩。
1. 引言:Agent 时代的前沿与“思考税”
在 2026 年末,企业级人工智能架构已经彻底从对话式聊天机器人转向自主多 Agent 系统(autonomous multi-agent systems)。无论是自主软件工程师、网络安全分诊流水线,还是多步骤协同研究集群,它们都不再只是生成孤立的文本补全,而是在循环决策树中持续运行:检视大型代码库、调用 Shell 环境并解析数以千计的工具输出。
然而,常规的生产级部署正受到两个相互交织的瓶颈制约:
- 上下文爆炸(The Context Explosion):多 Agent 循环生成的 Token 数量可达传统聊天界面的 15 倍以上,需要持续不断地重新吸纳对话历史、Bash 日志以及序列化的 JSON 工具调用。在跨越数小时的复杂任务中,KV Cache 显存的二次方级增长不仅严重削弱 GPU 吞吐量,还会诱发严重的目标漂移(goal drift)。
- “思考税”(The "Thinking Tax"):如果针对每一个中间推理子任务、工具调用和校验步骤都部署庞大、稠密的前沿推理模型,将带来不可持续的成本负担与延迟惩罚。
为了消除这种“思考税”,NVIDIA 推出了 NVIDIA Nemotron 3 Super(具体型号为 Nemotron-3-Super-120B-A12B)。作为开源 AI 领域的标志性里程碑,Nemotron 3 Super 在创新的混合专家(MoE)拓扑中深度融合了状态空间模型(SSM)与稠密注意力机制。凭借 1200 亿(120B)总参数和每个 Token 仅 120 亿(12B)激活参数,它在保持前沿级推理能力的同时,推理延迟与算力开销仅为同级别稠密架构的五分之一。
2. 深度架构剖析:混合 Mamba-Transformer 与 Latent MoE
nvidia nemotron 3 super 的核心差异化优势在于其非标准的异构层排布。Nemotron 3 Super 并没有堆叠均一的 Transformer 自注意力块,而是将三种不同的层原语交错组合为重复的计算组。
+----------------------------------------------------------------------------------------------------+
| NVIDIA NEMOTRON 3 SUPER (120B-A12B) TOPOLOGY |
+--------------------------------+-------------------------------------------------------------------+
| Architectural Metric | Specification Details |
+--------------------------------+-------------------------------------------------------------------+
| Total Parameters | 120 Billion Parameters |
| Active Parameters per Token | 12 Billion Parameters (10:1 Sparsity Ratio) |
| Layer Arrangement | Repeating 6-Layer Macro-Blocks: Mamba-2 -> Latent MoE -> |
| | Mamba-2 -> Transformer Attention -> Mamba-2 -> Latent MoE |
| State Space Engine | Mamba-2 (Bidirectional State Space Duality / SSD Formulation) |
| Attention Mechanism | Multi-Head / Grouped-Query Attention (interleaved every 4th layer)|
| Mixture-of-Experts Subsystem | Latent MoE with Low-Rank Compressed Token Routing |
| Speculative Generation | Native Multi-Token Prediction (MTP) with Shared Prediction Heads |
| Native Context Window | 1,000,000 Tokens (1M Native Sequence Length) |
| Pre-Training Precision | Native Blackwell NVFP4 (NVIDIA 4-bit Floating Point) |
| Training Data Scale | 25 Trillion Total Seen Tokens (10T Unique Curated Baseline) |
+--------------------------------+-------------------------------------------------------------------+
重复的 6 层混合宏块
Nemotron 3 Super 将其主干网络划分为由重复 6 层序列构成的五个宏阶段。每个宏块的具体层执行顺序为: $$\text{Mamba-2} \longrightarrow \text{Latent MoE} \longrightarrow \text{Mamba-2} \longrightarrow \text{Attention} \longrightarrow \text{Mamba-2} \longrightarrow \text{Latent MoE}$$
Input Token Stream
│
▼
┌──────────────────┐
│ Mamba-2 Layer │ ──► Linear-time sequence scanning; O(1) state per step
└─────────┬────────┘
▼
┌──────────────────┐
│ Latent MoE FFN │ ──► Low-rank latent projection; routes to 4x specialized experts
└─────────┬────────┘
▼
┌──────────────────┐
│ Mamba-2 Layer │ ──► Intermediate state update without KV cache expansion
└─────────┬────────┘
▼
┌──────────────────┐
│ Attention Layer │ ──► Exact associative recall & needle-in-haystack key matching
└─────────┬────────┘
▼
┌──────────────────┐
│ Mamba-2 Layer │ ──► Fast recursive state-space propagation
└─────────┬────────┘
▼
┌──────────────────┐
│ Latent MoE FFN │ ──► Second MoE routing pass in compressed latent dimension
└─────────┬────────┘
▼
Next Macro-Block / Output Head
- Mamba-2 层(状态空间对偶性 / State Space Duality):状态空间模型以相对于序列长度呈线性的计算复杂度 $\mathcal{O}(L)$ 和恒定的内存开销 $\mathcal{O}(1)$ 扫描 Token 序列。通过使用 Mamba-2 处理超过 60% 的 Token 转移,Nemotron 3 Super 在长程展开(long-horizon rollouts)生成期间能够保持微不足道的内存占用。
- 交错注意力层:虽然纯 SSM 架构能够实现极高的语言流畅度,但它们在精确关联召回(exact associative recall,例如在横跨 700,000 个上下文 Token 中定位单个 UUID 或变量初始化)方面表现会有所下降。在关键深度交错插入标准 Transformer 注意力层,可确保在整个 1M 上下文窗口内实现完美无瑕的检索。
- Latent MoE(压缩低秩路由):标准的 MoE 架构将完整的隐藏维度向量($d_{model}$)投影到路由门控和前馈网络中,这在扩展专家数量时会导致内存带宽瓶颈。Nemotron 3 Super 将 Token 表征投影到一个压缩的潜空间中:
3. NVFP4 量化与多 Token 预测(MTP)
原生 NVFP4 预训练 vs. 训练后量化(PTQ)
部署在企业数据中心的大多数经过量化的模型都采用训练后量化(PTQ),即在模型收敛后将 FP16 或 BF16 权重压缩为 INT4 或 FP8。训练后量化会导致严重的离群激活值退化(outlier activation degradation),并在数学推理中引发灾难性的困惑度激增。
Nemotron 3 Super 通过原生 NVFP4 预训练规避了这种退化:
- 预训练期间超过 85% 的浮点乘加累加(MAC)张量运算直接在 NVIDIA Blackwell Tensor Core 上以原生 NVFP4 运行。
- 权重、激活值和梯度从初始梯度步起,便在微缩放(microscaled)4 位浮点表征下运行。
- 最终,模型的损失曲面稳定在 4 位表征附近,保留了全精度 BF16 99.4% 的准确率,同时相比 FP16 降低了 75% 的 HBM 显存占用,相比 FP8 降低了 50%。
+----------------------+-------------+---------------+---------------------+--------------------------+
| PRECISION FORMAT COMPARISON & HARDWARE EFFICIENCY |
+----------------------+-------------+---------------+---------------------+--------------------------+
| Precision Format | Bits/Weight | Dynamic Range | HBM Footprint (120B)| Inference Speedup (B200) |
+----------------------+-------------+---------------+---------------------+--------------------------+
| FP16 / BF16 Baseline | 16 bits | High (E8M7) | ~240 GB | 1.0x (Baseline) |
| FP8 (e4m3fn) | 8 bits | Medium (E4M3) | ~120 GB | 2.1x |
| Native NVFP4 (E2M1) | 4 bits | Microscaled | ~64 GB | 4.4x |
+----------------------+-------------+---------------+---------------------+--------------------------+
共享权重多 Token 预测(MTP)
自回归推理在传统上一直受制于单 Token 生成机制:生成 $N$ 个 Token 需要执行 $N$ 次串行显存访存往返。
Nemotron 3 Super 集成了原生多 Token 预测(MTP)架构。Nemotron 3 Super 没有依赖独立的辅助草稿模型,而是直接在其混合骨干网络(hybrid backbone)之上集成了共享权重的推测预测头:
- 主预测头(Primary Head):通过标准因果语言建模预测 Token $t+1$。
- 推测预测头(Heads 1 至 3):同时并行预测 Token $t+2, t+3,$ 以及 $t+4$。
- 共享表征(Shared Representation):推测头与主干网络共享底层张量权重,防止参数膨胀,并确保了高草稿接受率(在结构化代码生成中 $(>82\%)$)。
- 推理收益(Inference Gain):多 Token 推测验证在代码合成与工具调用执行中带来了实测 2.8 倍至 3.2 倍的端到端运行耗时(wall-clock)加速。
4. 合成数据对齐:NeMo Gym 与轨迹强化学习(Trajectory RL)
在 25 万亿(25 trillion)Token 上预训练开源模型建立了广泛的语义知识,但纯粹的原生预训练并不能带来可靠的自主智能体(Agent)执行能力。NVIDIA 设计了一套以可验证的交互式环境为核心的全面后训练课程:
25 Trillion Pre-Training Tokens (NVFP4)
│
▼
40 Million Post-Training Alignment Samples (SFT Corpus)
│ (7M High-Priority Agentic SFT Samples)
▼
NeMo Gym & NeMo RL Framework (Trajectory Reinforcement Learning)
├── 21 Distinct Interactive Virtual Environments
├── Software Engineering, Shell CLI, SQL, Web Navigation
└── 1,200,000+ Multi-Step Interactive Environment Rollouts
│
▼
NVIDIA Nemotron 3 Super (Production Checkpoint)
- 监督微调(SFT):从 4000 万样本的主语料库中精选出 700 万个高质量指令样本,针对结构化 JSON 工具格式、多轮对话状态保持以及逐步推理拆解对模型进行了训练。
- NeMo Gym 多环境仿真:NVIDIA 没有采用标量奖励模型对静态文本回答进行评分(这种方式容易奖励文风上的冗长表达),而是将 Nemotron 3 Super 置于 21 个交互式虚拟环境中。模型必须执行真实的 Shell 命令、检查模拟文件系统、运行单元测试套件,并对故障代码库进行调试。
- 基于轨迹的强化学习(NeMo RL):通过在 120 万次环境推演(rollouts)中应用群体相对策略优化(GRPO)与策略优化直接对齐(DAPO),模型仅因可验证的客观成功(通过单元测试、修复安全 CVE 漏洞、返回正确的 API 载荷)获得奖励。这彻底消除了复杂多步任务中的目标漂移(goal drift)现象。
5. 综合基准实证评估结果
为评估真实场景下的性能表现,LLMPodium 在标准化推理、代码生成、长上下文检索以及自主智能体基准上,针对 Nemotron 3 Super 与主流开源及专有前沿模型进行了对比评测。
综合基准对比矩阵(2026 年末)
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| FRONTIER & OPEN MODEL BENCHMARK COMPARISON MATRIX |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| Benchmark / Metric | Nemotron 3 Super | GPT OSS 120B | Qwen 2.5 72B | DeepSeek V3 | Claude 3.5 | GPT-4o |
| | (120B-A12B) | (Dense 120B) | (Dense 72B) | (671B-A37B) | Sonnet | (Omni) |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| Open Source License | Yes (Nemotron) | Yes (Apache2) | Yes (Apache2) | Yes (MIT) | Closed API | Closed API |
| PinchBench (OpenClaw) | 85.6% | 74.2% | 76.8% | 84.1% | 88.4% | 86.2% |
| SWE-bench Verified | 61.4% | 52.8% | 54.2% | 64.7% | 65.8% | 53.8% |
| LiveCodeBench v6 | 59.2% | 48.6% | 52.4% | 62.1% | 64.2% | 58.4% |
| HumanEval (Pass@1) | 91.8% | 84.6% | 86.4% | 92.6% | 93.7% | 90.2% |
| AIME 2026 (Pass@1) | 79.4% | 66.2% | 68.8% | 84.2% | 83.6% | 78.2% |
| MMLU-Pro | 84.5% | 76.8% | 79.2% | 86.8% | 87.2% | 85.6% |
| Needle-In-Haystack | 99.8% (1M Tokens) | 88.4% (128k) | 92.1% (128k) | 99.4% (128k) | 99.9% (200k)| 99.2% (128k) |
| Output Tokens/s (B200) | 142 tok/s | 34 tok/s | 48 tok/s | 78 tok/s | Serverless | Serverless |
| Active Params/Token | 12B | 120B | 72B | 37B | Proprietary | Proprietary |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
1. PinchBench(自主 OpenClaw 智能体评估基准)
PinchBench 旨在评估大语言模型作为长期运行的自主智能体(例如 OpenClaw 和 OpenCode)核心认知引擎的有效性。测试覆盖了多文件代码重构、异步工具调用、Shell 命令合成以及自我修复错误恢复等关键能力。
- Nemotron 3 Super 取得了极其出色的 85.6%,超越了同参数量级的所有其他开放权重模型(相比 GPT OSS 120B 领先 +11.4%,相比 Qwen 2.5 72B 领先 +8.8%)。
- 至关重要的是,它在完全运行于企业自托管基础设施的同时,性能紧随闭源商业前沿模型(Claude 3.5 Sonnet 为 88.4%)。
2. SWE-bench Verified 与 LiveCodeBench v6
- 在 SWE-bench Verified 上,Nemotron 3 Super 自主解决了 61.4% 的真实 GitHub 工程问题,优于专有模型 GPT-4o(53.8%),并逼近 DeepSeek V3(64.7%)。
- 在 LiveCodeBench v6(用于评测训练数据截止日期之后发布的竞赛编程题)上,Nemotron 3 Super 达到了 59.2%,展现出超越训练数据机械记忆的强大泛化能力。
3. 1,000,000 Tokens 下的 Needle-in-a-Haystack
得益于在 Mamba-2 骨干网络中战略性插入的交织 Transformer 注意力层,Nemotron 3 Super 在其原生 1M token 上下文窗口内实现了 99.8% 的检索准确率。与在极端序列长度下难以实现精确序列召回的纯 SSM 模型相比,Nemotron 3 Super 能够在整整 1M token 的提示词中无衰减地精准检索任意位置的数值 token 与唯一 UUID。
6. 企业私有化部署:硬件、CLI 与服务拓扑
得益于 Nemotron 3 Super 每个 token 仅激活 120 亿(12B)参数,并支持原生 NVFP4 精度,与传统的 120B 稠密模型或 671B MoE 模型相比,其生产环境服务部署的硬件占用极为紧凑。
+----------------------------------------------------------------------------------------------------+
| ENTERPRISE HARDWARE SERVING TOPOLOGY MATRIX |
+-------------------+---------------------+-------------------+------------------+-------------------+
| Hardware Cluster | Precision / Dtype | Supported Context | Output Throughput| Target Workload |
+-------------------+---------------------+-------------------+------------------+-------------------+
| 2x NVIDIA H100 | NVFP4 / FP4 Block | Up to 128k Tokens | ~85 tok/s | Low-Volume Agent |
| 4x NVIDIA H100 | FP8 (e4m3fn) | Up to 512k Tokens | ~110 tok/s | High-Throughput |
| 8x NVIDIA H200 | FP8 (141GB HBM3e) | Full 1,000,000 Tok| ~128 tok/s | Enterprise 1M RAG |
| 4x NVIDIA B200 | Native NVFP4 Tensor | Full 1,000,000 Tok| ~185 tok/s | Frontier Scaled |
+-------------------+---------------------+-------------------+------------------+-------------------+
使用 vLLM (v0.9.x+) 进行生产级部署
在 4x NVIDIA H100 SXM5 节点上利用持续批处理(continuous batching)与 FP8 量化部署 Nemotron 3 Super:
# Launch Nemotron 3 Super via vLLM with MTP speculation and tensor parallelism
python3 -m vllm.entrypoints.openai.api_server \
--model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8 \
--tensor-parallel-size 4 \
--dtype float8_e4m3fn \
--kv-cache-dtype fp8 \
--max-model-len 131072 \
--speculative-model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-MTP \
--num-speculative-tokens 3 \
--gpu-memory-utilization 0.92 \
--port 8000
使用 NVIDIA TensorRT-LLM 进行生产级推理服务
为了在 NVIDIA Blackwell (B200) 集群上实现极致的硬件效率,采用原生 TensorRT-LLM 和 NVFP4 执行引擎提供服务可获得最低的延迟:
# Compile and serve optimized TensorRT-LLM engine with NVFP4 Latent MoE kernels
trtllm-build \
--checkpoint_dir ./nemotron-3-super-120b-nvfp4 \
--output_dir ./nemotron_trt_engine \
--gemm_plugin float16 \
--max_batch_size 64 \
--max_input_len 65536 \
--max_output_len 8192 \
--moe_tp_size 4 \
--enable_latent_moe \
--nvfp4_tensor_cores enable
# Launch high-concurrency Triton Inference Server
tritonserver --model-repository=/opt/models/nemotron_trt_engine --http-port=8001
兼容 OpenAI 格式的 Python 客户端调用
部署完成后,Nemotron 3 Super 会暴露一个兼容 OpenAI 格式的 REST API,可无缝对接各类多智能体框架(例如 OpenClaw、AutoGen 和 LangGraph):
import os
from openai import OpenAI
# Connect to local on-premise Nemotron 3 Super endpoint
client = OpenAI(
api_key=os.getenv("NEMOTRON_API_KEY", "local-enterprise-token"),
base_url="http://localhost:8000/v1"
)
response = client.chat.completions.create(
model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8",
messages=[
{
"role": "system",
"content": "You are an autonomous systems engineering agent. Execute multi-step diagnosis and emit structured JSON tool actions."
},
{
"role": "user",
"content": "Inspect the distributed Kubernetes cluster state, diagnose memory leak trends in the ingestion pod, and generate remediation patches."
}
],
temperature=0.4,
max_tokens=4096,
extra_body={
"speculative_draft_tokens": 3,
"mamba_state_caching": True
}
)
print(response.choices[0].message.content)
7. 企业本地部署经济效益与总拥有成本 (TCO)
在本地部署 nemotron 3 super 的商业逻辑核心在于消除不可预测的 API Token 支出,同时确保严格的数据主权。
+----------------------------------------------------------------------------------------------------+
| 总拥有成本 (TCO):每月 10 亿 Token |
+-----------------------------+--------------------+---------------------+---------------------------+
| 部署模式 | 输入 / 输出 | 月度运行成本 | 年度总成本 (12 个月) |
+-----------------------------+--------------------+---------------------+---------------------------+
| Claude 3.5 Sonnet (API) | $3.00 / $15.00 /1M | $6,600 / 月 | $79,200 / 年 |
| GPT-4o (商业 API) | $2.50 / $10.00 /1M | $4,750 / 月 | $57,000 / 年 |
| DeepSeek V3 (云端 API) | $0.14 / $0.28 /1M | $182 / 月 | $2,184 / 年 |
| Nemotron 3 Super (云端 VPS) | 预留 4x H100 | $1,440 / 月 | $17,280 / 年 (固定) |
| Nemotron 3 Super (本地部署) | 4x H100 DGX 折旧 | $720 / 月 * | $8,640 / 年 (固定) |
+-----------------------------+--------------------+---------------------+---------------------------+
*本地部署硬件成本按 36 个月折旧期分摊,包含企业级电力和冷却成本。
TCO 盈亏平衡阈值
- 可预测的固定成本:当月处理 Token 数量低于 1 亿时,无服务器(Serverless)云端 API 仍具成本效益。然而,一旦企业级 Agent 集群规模超过每月 3.5 亿 Token(在 7x24 小时自动化编程或数据提取集群中十分常见),在 4x H100 节点上自托管 Nemotron 3 Super 将比专有商业 API 显著便宜得多。
- 零入站/出站安全风险:在受到高度监管的行业(金融科技、医疗健康、国防)中,将内部知识产权或客户隐私记录传输至第三方端点会违反合规要求。Nemotron 3 Super 可完全在企业防火墙后进行物理隔离(Air-gapped)运行。
- 能耗降低 5 倍:与在每个 Token 上激活全部参数的稠密 120B 架构相比,仅激活 12B 参数可将每个生成 Token 的运行功耗降低 70% 以上,从而大幅节省企业数据中心的电力与散热冷却预算。
8. 战略蓝图:“Super + Nano” Agent 部署模式
在现代企业级架构中,工程团队不会为所有工作流部署单一的单体模型。相反,他们会部署协调的多层分级架构:
┌─────────────────────────────────┐
│ Incoming Task / User Request │
└────────────────┬────────────────┘
│
▼
┌─────────────────────────────────┐
│ Nemotron 3 Super (120B-A12B) │
│ - High-Level Task Planning │
│ - Architectural Decomposition │
│ - Multi-Step Error Diagnosis │
└────────┬───────────────┬────────┘
│ │
Delegated │ │ Delegated
Atomic Task A │ │ Atomic Task B
▼ ▼
┌──────────────────────┐ ┌──────────────────────┐
│ Nemotron 3 Nano (9B) │ │ Nemotron 3 Nano (9B) │
│ - Bash Shell Command │ │ - Unit Test Runner │
│ - Syntax Validation │ │ - Regex Verification │
└──────────┬───────────┘ └──────────┬───────────┘
│ │
└────────────┬───────────┘
▼
┌─────────────────────────────────┐
│ Synthesized Production Result │
└─────────────────────────────────┘
- Nemotron 3 Super 作为认知编排器(Cognitive Orchestrator):Super 负责高级推理、系统架构规划、跨 1M 上下文窗口的长程依赖跟踪以及自愈式错误恢复。
- Nemotron 3 Nano 作为战术执行节点(Tactical Workers):轻量级 Nemotron 3 Nano (9B) 实例负责执行微任务:运行代码检查(lint checks)、执行单个 git 命令、生成单元测试模板以及解析 JSON 载荷。
- 经济效益:与将每个原子步骤都路由至大型推理引擎相比,这种分层分工可使 GPU 总算力支出进一步降低 60%。
9. 结论与 LLMPodium 架构评定
NVIDIA Nemotron 3 Super 的发布标志着开源 AI(open source ai)领域的根本性拐点。通过大胆摒弃单体 Transformer 架构,并将 Mamba-2 状态空间对偶性(Mamba-2 state space duality)、Latent MoE 低秩路由(Latent MoE low-rank routing)以及原生 Blackwell NVFP4 预训练相结合,NVIDIA 树立了推理高效型 Agent 智能的全新黄金标准。
工程主管需掌握的核心架构要点:
- 无与伦比的 Agent 能力:在 PinchBench 上取得 85.6% 的优异得分,证实了 Nemotron 3 Super 是适用于 OpenClaw 等多 Agent 框架的顶级开源权重认知引擎。
- 无延迟惩罚的超长上下文:由线性时间 Mamba-2 模块驱动的原生 1,000,000 Token 上下文窗口,彻底消除了传统 LLM 的二次方复杂度内存墙。
- 原生 Blackwell 加速:原生采用 NVFP4 进行预训练,在 B200 基础设施上实现了 4 倍的推理加速,且精度损失几乎可以忽略不计。
- 极致的 TCO 优化:每个 Token 仅激活 12B 参数,使企业能够在极具成本效益的 4x H100 或 2x B200 硬件拓扑上提供前沿级别的推理能力。
对于构建生产级自主 Agent 集群的工程团队而言,nvidia nemotron 3 super 实现了企业级隐私、极致 Token 吞吐量与前沿级推理能力的最优融合。