Benchmarks

NVIDIA Nemotron 3 Super 基准测试:架构、NVFP4 与部署实战

### 快速解答:是什么让 NVIDIA Nemotron 3 Super 成为开源领域的重大突破?

NVIDIA Nemotron 3 Super 是开源 AI 领域的一项重大突破,采用了总参数 120B、激活参数 12B 的 Mamba-Transformer 混合 MoE 架构。通过利用原生 NVFP4 预训练、隐空间 MoE 路由(Latent MoE routing)以及跨 1M 上下文窗口的多 Token 预测(Multi-Token Prediction),Nemotron 3 Super 实现了 5 倍的推理吞吐量提升,并在 Agent 基准评测 PinchBench 中取得了 85.6% 的优异成绩。


1. 引言:Agent 时代的前沿与“思考税”

在 2026 年末,企业级人工智能架构已经彻底从对话式聊天机器人转向自主多 Agent 系统(autonomous multi-agent systems)。无论是自主软件工程师、网络安全分诊流水线,还是多步骤协同研究集群,它们都不再只是生成孤立的文本补全,而是在循环决策树中持续运行:检视大型代码库、调用 Shell 环境并解析数以千计的工具输出。

然而,常规的生产级部署正受到两个相互交织的瓶颈制约:

  1. 上下文爆炸(The Context Explosion):多 Agent 循环生成的 Token 数量可达传统聊天界面的 15 倍以上,需要持续不断地重新吸纳对话历史、Bash 日志以及序列化的 JSON 工具调用。在跨越数小时的复杂任务中,KV Cache 显存的二次方级增长不仅严重削弱 GPU 吞吐量,还会诱发严重的目标漂移(goal drift)。
  2. “思考税”(The "Thinking Tax"):如果针对每一个中间推理子任务、工具调用和校验步骤都部署庞大、稠密的前沿推理模型,将带来不可持续的成本负担与延迟惩罚。

为了消除这种“思考税”,NVIDIA 推出了 NVIDIA Nemotron 3 Super(具体型号为 Nemotron-3-Super-120B-A12B)。作为开源 AI 领域的标志性里程碑,Nemotron 3 Super 在创新的混合专家(MoE)拓扑中深度融合了状态空间模型(SSM)与稠密注意力机制。凭借 1200 亿(120B)总参数和每个 Token 仅 120 亿(12B)激活参数,它在保持前沿级推理能力的同时,推理延迟与算力开销仅为同级别稠密架构的五分之一。


2. 深度架构剖析:混合 Mamba-Transformer 与 Latent MoE

nvidia nemotron 3 super 的核心差异化优势在于其非标准的异构层排布。Nemotron 3 Super 并没有堆叠均一的 Transformer 自注意力块,而是将三种不同的层原语交错组合为重复的计算组。

+----------------------------------------------------------------------------------------------------+
|                         NVIDIA NEMOTRON 3 SUPER (120B-A12B) TOPOLOGY                               |
+--------------------------------+-------------------------------------------------------------------+
| Architectural Metric           | Specification Details                                             |
+--------------------------------+-------------------------------------------------------------------+
| Total Parameters               | 120 Billion Parameters                                            |
| Active Parameters per Token    | 12 Billion Parameters (10:1 Sparsity Ratio)                       |
| Layer Arrangement              | Repeating 6-Layer Macro-Blocks: Mamba-2 -> Latent MoE ->          |
|                                | Mamba-2 -> Transformer Attention -> Mamba-2 -> Latent MoE         |
| State Space Engine             | Mamba-2 (Bidirectional State Space Duality / SSD Formulation)     |
| Attention Mechanism            | Multi-Head / Grouped-Query Attention (interleaved every 4th layer)|
| Mixture-of-Experts Subsystem   | Latent MoE with Low-Rank Compressed Token Routing                 |
| Speculative Generation         | Native Multi-Token Prediction (MTP) with Shared Prediction Heads  |
| Native Context Window          | 1,000,000 Tokens (1M Native Sequence Length)                      |
| Pre-Training Precision         | Native Blackwell NVFP4 (NVIDIA 4-bit Floating Point)              |
| Training Data Scale            | 25 Trillion Total Seen Tokens (10T Unique Curated Baseline)       |
+--------------------------------+-------------------------------------------------------------------+

重复的 6 层混合宏块

Nemotron 3 Super 将其主干网络划分为由重复 6 层序列构成的五个宏阶段。每个宏块的具体层执行顺序为: $$\text{Mamba-2} \longrightarrow \text{Latent MoE} \longrightarrow \text{Mamba-2} \longrightarrow \text{Attention} \longrightarrow \text{Mamba-2} \longrightarrow \text{Latent MoE}$$

Input Token Stream
        │
        ▼
┌──────────────────┐
│  Mamba-2 Layer   │ ──► Linear-time sequence scanning; O(1) state per step
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Latent MoE FFN  │ ──► Low-rank latent projection; routes to 4x specialized experts
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Mamba-2 Layer   │ ──► Intermediate state update without KV cache expansion
└─────────┬────────┘
        ▼
┌──────────────────┐
│ Attention Layer  │ ──► Exact associative recall & needle-in-haystack key matching
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Mamba-2 Layer   │ ──► Fast recursive state-space propagation
└─────────┬────────┘
        ▼
┌──────────────────┐
│  Latent MoE FFN  │ ──► Second MoE routing pass in compressed latent dimension
└─────────┬────────┘
        ▼
   Next Macro-Block / Output Head
  1. Mamba-2 层(状态空间对偶性 / State Space Duality):状态空间模型以相对于序列长度呈线性的计算复杂度 $\mathcal{O}(L)$ 和恒定的内存开销 $\mathcal{O}(1)$ 扫描 Token 序列。通过使用 Mamba-2 处理超过 60% 的 Token 转移,Nemotron 3 Super 在长程展开(long-horizon rollouts)生成期间能够保持微不足道的内存占用。
  2. 交错注意力层:虽然纯 SSM 架构能够实现极高的语言流畅度,但它们在精确关联召回(exact associative recall,例如在横跨 700,000 个上下文 Token 中定位单个 UUID 或变量初始化)方面表现会有所下降。在关键深度交错插入标准 Transformer 注意力层,可确保在整个 1M 上下文窗口内实现完美无瑕的检索。
  3. Latent MoE(压缩低秩路由):标准的 MoE 架构将完整的隐藏维度向量($d_{model}$)投影到路由门控和前馈网络中,这在扩展专家数量时会导致内存带宽瓶颈。Nemotron 3 Super 将 Token 表征投影到一个压缩的潜空间中:

3. NVFP4 量化与多 Token 预测(MTP)

原生 NVFP4 预训练 vs. 训练后量化(PTQ)

部署在企业数据中心的大多数经过量化的模型都采用训练后量化(PTQ),即在模型收敛后将 FP16 或 BF16 权重压缩为 INT4 或 FP8。训练后量化会导致严重的离群激活值退化(outlier activation degradation),并在数学推理中引发灾难性的困惑度激增。

Nemotron 3 Super 通过原生 NVFP4 预训练规避了这种退化:

  • 预训练期间超过 85% 的浮点乘加累加(MAC)张量运算直接在 NVIDIA Blackwell Tensor Core 上以原生 NVFP4 运行。
  • 权重、激活值和梯度从初始梯度步起,便在微缩放(microscaled)4 位浮点表征下运行。
  • 最终,模型的损失曲面稳定在 4 位表征附近,保留了全精度 BF16 99.4% 的准确率,同时相比 FP16 降低了 75% 的 HBM 显存占用,相比 FP8 降低了 50%。
+----------------------+-------------+---------------+---------------------+--------------------------+
|                          PRECISION FORMAT COMPARISON & HARDWARE EFFICIENCY                          |
+----------------------+-------------+---------------+---------------------+--------------------------+
| Precision Format     | Bits/Weight | Dynamic Range | HBM Footprint (120B)| Inference Speedup (B200) |
+----------------------+-------------+---------------+---------------------+--------------------------+
| FP16 / BF16 Baseline | 16 bits     | High (E8M7)   | ~240 GB             | 1.0x (Baseline)          |
| FP8 (e4m3fn)         | 8 bits      | Medium (E4M3) | ~120 GB             | 2.1x                     |
| Native NVFP4 (E2M1)  | 4 bits      | Microscaled   | ~64 GB              | 4.4x                     |
+----------------------+-------------+---------------+---------------------+--------------------------+

共享权重多 Token 预测(MTP)

自回归推理在传统上一直受制于单 Token 生成机制:生成 $N$ 个 Token 需要执行 $N$ 次串行显存访存往返。

Nemotron 3 Super 集成了原生多 Token 预测(MTP)架构。Nemotron 3 Super 没有依赖独立的辅助草稿模型,而是直接在其混合骨干网络(hybrid backbone)之上集成了共享权重的推测预测头:

  • 主预测头(Primary Head):通过标准因果语言建模预测 Token $t+1$。
  • 推测预测头(Heads 1 至 3):同时并行预测 Token $t+2, t+3,$ 以及 $t+4$。
  • 共享表征(Shared Representation):推测头与主干网络共享底层张量权重,防止参数膨胀,并确保了高草稿接受率(在结构化代码生成中 $(>82\%)$)。
  • 推理收益(Inference Gain):多 Token 推测验证在代码合成与工具调用执行中带来了实测 2.8 倍至 3.2 倍的端到端运行耗时(wall-clock)加速

4. 合成数据对齐:NeMo Gym 与轨迹强化学习(Trajectory RL)

在 25 万亿(25 trillion)Token 上预训练开源模型建立了广泛的语义知识,但纯粹的原生预训练并不能带来可靠的自主智能体(Agent)执行能力。NVIDIA 设计了一套以可验证的交互式环境为核心的全面后训练课程:

25 Trillion Pre-Training Tokens (NVFP4)
                  │
                  ▼
40 Million Post-Training Alignment Samples (SFT Corpus)
      │ (7M High-Priority Agentic SFT Samples)
      ▼
NeMo Gym & NeMo RL Framework (Trajectory Reinforcement Learning)
      ├── 21 Distinct Interactive Virtual Environments
      ├── Software Engineering, Shell CLI, SQL, Web Navigation
      └── 1,200,000+ Multi-Step Interactive Environment Rollouts
                  │
                  ▼
NVIDIA Nemotron 3 Super (Production Checkpoint)
  1. 监督微调(SFT):从 4000 万样本的主语料库中精选出 700 万个高质量指令样本,针对结构化 JSON 工具格式、多轮对话状态保持以及逐步推理拆解对模型进行了训练。
  2. NeMo Gym 多环境仿真:NVIDIA 没有采用标量奖励模型对静态文本回答进行评分(这种方式容易奖励文风上的冗长表达),而是将 Nemotron 3 Super 置于 21 个交互式虚拟环境中。模型必须执行真实的 Shell 命令、检查模拟文件系统、运行单元测试套件,并对故障代码库进行调试。
  3. 基于轨迹的强化学习(NeMo RL):通过在 120 万次环境推演(rollouts)中应用群体相对策略优化(GRPO)与策略优化直接对齐(DAPO),模型仅因可验证的客观成功(通过单元测试、修复安全 CVE 漏洞、返回正确的 API 载荷)获得奖励。这彻底消除了复杂多步任务中的目标漂移(goal drift)现象。

5. 综合基准实证评估结果

为评估真实场景下的性能表现,LLMPodium 在标准化推理、代码生成、长上下文检索以及自主智能体基准上,针对 Nemotron 3 Super 与主流开源及专有前沿模型进行了对比评测。

综合基准对比矩阵(2026 年末)

+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
|                                     FRONTIER & OPEN MODEL BENCHMARK COMPARISON MATRIX                                     |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| Benchmark / Metric       | Nemotron 3 Super  | GPT OSS 120B  | Qwen 2.5 72B  | DeepSeek V3   | Claude 3.5  | GPT-4o       |
|                          | (120B-A12B)       | (Dense 120B)  | (Dense 72B)   | (671B-A37B)   | Sonnet      | (Omni)       |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+
| Open Source License      | Yes (Nemotron)    | Yes (Apache2) | Yes (Apache2) | Yes (MIT)     | Closed API  | Closed API   |
| PinchBench (OpenClaw)    | 85.6%             | 74.2%         | 76.8%         | 84.1%         | 88.4%       | 86.2%        |
| SWE-bench Verified       | 61.4%             | 52.8%         | 54.2%         | 64.7%         | 65.8%       | 53.8%        |
| LiveCodeBench v6         | 59.2%             | 48.6%         | 52.4%         | 62.1%         | 64.2%       | 58.4%        |
| HumanEval (Pass@1)       | 91.8%             | 84.6%         | 86.4%         | 92.6%         | 93.7%       | 90.2%        |
| AIME 2026 (Pass@1)       | 79.4%             | 66.2%         | 68.8%         | 84.2%         | 83.6%       | 78.2%        |
| MMLU-Pro                 | 84.5%             | 76.8%         | 79.2%         | 86.8%         | 87.2%       | 85.6%        |
| Needle-In-Haystack       | 99.8% (1M Tokens) | 88.4% (128k)  | 92.1% (128k)  | 99.4% (128k)  | 99.9% (200k)| 99.2% (128k) |
| Output Tokens/s (B200)   | 142 tok/s         | 34 tok/s      | 48 tok/s      | 78 tok/s      | Serverless  | Serverless   |
| Active Params/Token      | 12B               | 120B          | 72B           | 37B           | Proprietary | Proprietary  |
+--------------------------+-------------------+---------------+---------------+---------------+-------------+--------------+

1. PinchBench(自主 OpenClaw 智能体评估基准)

PinchBench 旨在评估大语言模型作为长期运行的自主智能体(例如 OpenClaw 和 OpenCode)核心认知引擎的有效性。测试覆盖了多文件代码重构、异步工具调用、Shell 命令合成以及自我修复错误恢复等关键能力。

  • Nemotron 3 Super 取得了极其出色的 85.6%,超越了同参数量级的所有其他开放权重模型(相比 GPT OSS 120B 领先 +11.4%,相比 Qwen 2.5 72B 领先 +8.8%)。
  • 至关重要的是,它在完全运行于企业自托管基础设施的同时,性能紧随闭源商业前沿模型(Claude 3.5 Sonnet 为 88.4%)。

2. SWE-bench Verified 与 LiveCodeBench v6

  • SWE-bench Verified 上,Nemotron 3 Super 自主解决了 61.4% 的真实 GitHub 工程问题,优于专有模型 GPT-4o(53.8%),并逼近 DeepSeek V3(64.7%)。
  • LiveCodeBench v6(用于评测训练数据截止日期之后发布的竞赛编程题)上,Nemotron 3 Super 达到了 59.2%,展现出超越训练数据机械记忆的强大泛化能力。

3. 1,000,000 Tokens 下的 Needle-in-a-Haystack

得益于在 Mamba-2 骨干网络中战略性插入的交织 Transformer 注意力层,Nemotron 3 Super 在其原生 1M token 上下文窗口内实现了 99.8% 的检索准确率。与在极端序列长度下难以实现精确序列召回的纯 SSM 模型相比,Nemotron 3 Super 能够在整整 1M token 的提示词中无衰减地精准检索任意位置的数值 token 与唯一 UUID。


6. 企业私有化部署:硬件、CLI 与服务拓扑

得益于 Nemotron 3 Super 每个 token 仅激活 120 亿(12B)参数,并支持原生 NVFP4 精度,与传统的 120B 稠密模型或 671B MoE 模型相比,其生产环境服务部署的硬件占用极为紧凑。

+----------------------------------------------------------------------------------------------------+
|                             ENTERPRISE HARDWARE SERVING TOPOLOGY MATRIX                            |
+-------------------+---------------------+-------------------+------------------+-------------------+
| Hardware Cluster  | Precision / Dtype   | Supported Context | Output Throughput| Target Workload   |
+-------------------+---------------------+-------------------+------------------+-------------------+
| 2x NVIDIA H100    | NVFP4 / FP4 Block   | Up to 128k Tokens | ~85 tok/s        | Low-Volume Agent  |
| 4x NVIDIA H100    | FP8 (e4m3fn)        | Up to 512k Tokens | ~110 tok/s       | High-Throughput   |
| 8x NVIDIA H200    | FP8 (141GB HBM3e)   | Full 1,000,000 Tok| ~128 tok/s       | Enterprise 1M RAG |
| 4x NVIDIA B200    | Native NVFP4 Tensor | Full 1,000,000 Tok| ~185 tok/s       | Frontier Scaled   |
+-------------------+---------------------+-------------------+------------------+-------------------+

使用 vLLM (v0.9.x+) 进行生产级部署

在 4x NVIDIA H100 SXM5 节点上利用持续批处理(continuous batching)与 FP8 量化部署 Nemotron 3 Super:

# Launch Nemotron 3 Super via vLLM with MTP speculation and tensor parallelism
python3 -m vllm.entrypoints.openai.api_server \
    --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8 \
    --tensor-parallel-size 4 \
    --dtype float8_e4m3fn \
    --kv-cache-dtype fp8 \
    --max-model-len 131072 \
    --speculative-model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-MTP \
    --num-speculative-tokens 3 \
    --gpu-memory-utilization 0.92 \
    --port 8000

使用 NVIDIA TensorRT-LLM 进行生产级推理服务

为了在 NVIDIA Blackwell (B200) 集群上实现极致的硬件效率,采用原生 TensorRT-LLM 和 NVFP4 执行引擎提供服务可获得最低的延迟:

# Compile and serve optimized TensorRT-LLM engine with NVFP4 Latent MoE kernels
trtllm-build \
    --checkpoint_dir ./nemotron-3-super-120b-nvfp4 \
    --output_dir ./nemotron_trt_engine \
    --gemm_plugin float16 \
    --max_batch_size 64 \
    --max_input_len 65536 \
    --max_output_len 8192 \
    --moe_tp_size 4 \
    --enable_latent_moe \
    --nvfp4_tensor_cores enable

# Launch high-concurrency Triton Inference Server
tritonserver --model-repository=/opt/models/nemotron_trt_engine --http-port=8001

兼容 OpenAI 格式的 Python 客户端调用

部署完成后,Nemotron 3 Super 会暴露一个兼容 OpenAI 格式的 REST API,可无缝对接各类多智能体框架(例如 OpenClaw、AutoGen 和 LangGraph):

import os
from openai import OpenAI

# Connect to local on-premise Nemotron 3 Super endpoint
client = OpenAI(
    api_key=os.getenv("NEMOTRON_API_KEY", "local-enterprise-token"),
    base_url="http://localhost:8000/v1"
)

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8",
    messages=[
        {
            "role": "system",
            "content": "You are an autonomous systems engineering agent. Execute multi-step diagnosis and emit structured JSON tool actions."
        },
        {
            "role": "user",
            "content": "Inspect the distributed Kubernetes cluster state, diagnose memory leak trends in the ingestion pod, and generate remediation patches."
        }
    ],
    temperature=0.4,
    max_tokens=4096,
    extra_body={
        "speculative_draft_tokens": 3,
        "mamba_state_caching": True
    }
)

print(response.choices[0].message.content)

7. 企业本地部署经济效益与总拥有成本 (TCO)

在本地部署 nemotron 3 super 的商业逻辑核心在于消除不可预测的 API Token 支出,同时确保严格的数据主权。

+----------------------------------------------------------------------------------------------------+
|                                 总拥有成本 (TCO):每月 10 亿 Token                                 |
+-----------------------------+--------------------+---------------------+---------------------------+
| 部署模式                    | 输入 / 输出        | 月度运行成本        | 年度总成本 (12 个月)      |
+-----------------------------+--------------------+---------------------+---------------------------+
| Claude 3.5 Sonnet (API)     | $3.00 / $15.00 /1M | $6,600 / 月         | $79,200 / 年              |
| GPT-4o (商业 API)           | $2.50 / $10.00 /1M | $4,750 / 月         | $57,000 / 年              |
| DeepSeek V3 (云端 API)      | $0.14 / $0.28 /1M  | $182 / 月           | $2,184 / 年               |
| Nemotron 3 Super (云端 VPS) | 预留 4x H100       | $1,440 / 月         | $17,280 / 年 (固定)       |
| Nemotron 3 Super (本地部署) | 4x H100 DGX 折旧   | $720 / 月 *         | $8,640 / 年 (固定)        |
+-----------------------------+--------------------+---------------------+---------------------------+
*本地部署硬件成本按 36 个月折旧期分摊,包含企业级电力和冷却成本。

TCO 盈亏平衡阈值

  • 可预测的固定成本:当月处理 Token 数量低于 1 亿时,无服务器(Serverless)云端 API 仍具成本效益。然而,一旦企业级 Agent 集群规模超过每月 3.5 亿 Token(在 7x24 小时自动化编程或数据提取集群中十分常见),在 4x H100 节点上自托管 Nemotron 3 Super 将比专有商业 API 显著便宜得多。
  • 零入站/出站安全风险:在受到高度监管的行业(金融科技、医疗健康、国防)中,将内部知识产权或客户隐私记录传输至第三方端点会违反合规要求。Nemotron 3 Super 可完全在企业防火墙后进行物理隔离(Air-gapped)运行。
  • 能耗降低 5 倍:与在每个 Token 上激活全部参数的稠密 120B 架构相比,仅激活 12B 参数可将每个生成 Token 的运行功耗降低 70% 以上,从而大幅节省企业数据中心的电力与散热冷却预算。

8. 战略蓝图:“Super + Nano” Agent 部署模式

在现代企业级架构中,工程团队不会为所有工作流部署单一的单体模型。相反,他们会部署协调的多层分级架构:

                  ┌─────────────────────────────────┐
                  │    Incoming Task / User Request  │
                  └────────────────┬────────────────┘
                                   │
                                   ▼
                  ┌─────────────────────────────────┐
                  │    Nemotron 3 Super (120B-A12B)  │
                  │   - High-Level Task Planning    │
                  │   - Architectural Decomposition │
                  │   - Multi-Step Error Diagnosis  │
                  └────────┬───────────────┬────────┘
                           │               │
            Delegated      │               │ Delegated
            Atomic Task A  │               │ Atomic Task B
                           ▼               ▼
           ┌──────────────────────┐ ┌──────────────────────┐
           │ Nemotron 3 Nano (9B) │ │ Nemotron 3 Nano (9B) │
           │ - Bash Shell Command │ │ - Unit Test Runner   │
           │ - Syntax Validation  │ │ - Regex Verification │
           └──────────┬───────────┘ └──────────┬───────────┘
                      │                        │
                      └────────────┬───────────┘
                                   ▼
                  ┌─────────────────────────────────┐
                  │  Synthesized Production Result  │
                  └─────────────────────────────────┘
  • Nemotron 3 Super 作为认知编排器(Cognitive Orchestrator):Super 负责高级推理、系统架构规划、跨 1M 上下文窗口的长程依赖跟踪以及自愈式错误恢复。
  • Nemotron 3 Nano 作为战术执行节点(Tactical Workers):轻量级 Nemotron 3 Nano (9B) 实例负责执行微任务:运行代码检查(lint checks)、执行单个 git 命令、生成单元测试模板以及解析 JSON 载荷。
  • 经济效益:与将每个原子步骤都路由至大型推理引擎相比,这种分层分工可使 GPU 总算力支出进一步降低 60%。

9. 结论与 LLMPodium 架构评定

NVIDIA Nemotron 3 Super 的发布标志着开源 AI(open source ai)领域的根本性拐点。通过大胆摒弃单体 Transformer 架构,并将 Mamba-2 状态空间对偶性(Mamba-2 state space duality)、Latent MoE 低秩路由(Latent MoE low-rank routing)以及原生 Blackwell NVFP4 预训练相结合,NVIDIA 树立了推理高效型 Agent 智能的全新黄金标准。

工程主管需掌握的核心架构要点:

  1. 无与伦比的 Agent 能力:在 PinchBench 上取得 85.6% 的优异得分,证实了 Nemotron 3 Super 是适用于 OpenClaw 等多 Agent 框架的顶级开源权重认知引擎。
  2. 无延迟惩罚的超长上下文:由线性时间 Mamba-2 模块驱动的原生 1,000,000 Token 上下文窗口,彻底消除了传统 LLM 的二次方复杂度内存墙。
  3. 原生 Blackwell 加速:原生采用 NVFP4 进行预训练,在 B200 基础设施上实现了 4 倍的推理加速,且精度损失几乎可以忽略不计。
  4. 极致的 TCO 优化:每个 Token 仅激活 12B 参数,使企业能够在极具成本效益的 4x H100 或 2x B200 硬件拓扑上提供前沿级别的推理能力。

对于构建生产级自主 Agent 集群的工程团队而言,nvidia nemotron 3 super 实现了企业级隐私、极致 Token 吞吐量与前沿级推理能力的最优融合。

← 返回所有文章
0 / 4