跳到主要内容

NVIDIA Rubin

NVIDIA Rubin GPU 在 CES 2026(2026年1月)正式发布,是 NVIDIA 继 Blackwell 之后的新一代 AI 加速芯片,采用全新六芯片架构(Vera CPU + Rubin GPU + NVLink 6 + BlueField-4 DPU + ConnectX-9 SuperNIC + Spectrum-6 以太网交换机),构成完整统一的 AI 系统。

核心规格​

参数规格
架构Rubin 架构(Blackwell 继任者)
制程工艺TSMC 3nm(N3/N3P)
晶体管数量3360亿个
芯片设计双计算 chiplet + 双 I/O chiplet MCM 设计(NV-HBI 跨 die 互联)
显存容量288 GB HBM4
显存带宽22 TB/s
FP4 算力50 PFLOPS(推理口径)
计算单元224 SM / 896 Tensor Core(Hot Chips 2026 官方披露)
发布时间2026年1月(CES 2026 预览)/ GTC 2026 全面投产
TDP2300 W
量产时间2026 H2 全面量产爬坡(8/21 官方确认已向超大规模客户出货,微软首家部署)

显存规格​

参数规格
显存类型HBM4
显存容量288GB
显存带宽22 TB/s
单栈带宽>3.0 TB/s
单引脚速率>11 Gbps
HBM4 栈数量8 个
接口宽度2048 位/栈(较 HBM3e 翻倍)

算力规格​

精度算力
FP4(推理)50 PFLOPS
FP4(训练)35 PFLOPS
FP8约 25 PFLOPS(dense,推理;NVFP4 为其 2×)
FP16待公布
FP32待公布
INT8待公布

功耗与散热​

参数规格
单 GPU 功耗1800W - 2300W
散热方案100% 液冷(无风冷配置)
NVL72 机架功耗120-130 kW
NVL144 CPX 机架功耗~260 kW
NVL576 机架功耗~600 kW

互联技术​

参数规格
NVLink 版本NVLink 6
单 GPU NVLink 带宽3.6 TB/s(是 Blackwell NVLink 5 的 2 倍)
CPU-GPU 互联NVLink-C2C,带宽 1.8 TB/s
网络ConnectX-9 SuperNIC + Spectrum-6 以太网交换机

架构特点​

1. 第三代 Transformer 引擎​

  • 支持 NVFP4 自适应压缩
  • 无需手动调整即可自动优化精度格式
  • 兼顾性能和精度

2. 同步多线程(SMT)​

  • 单 GPU 支持 176 线程
  • 提升并行处理能力

3. 全栈 AI 工厂方案​

Rubin 平台由 6 款芯片协同设计:

  • Vera CPU:控制平面
  • Rubin GPU:计算核心
  • NVLink 6:GPU 间高速互联
  • BlueField-4 DPU:数据中心基础设施处理
  • ConnectX-9 SuperNIC:网络连接
  • Spectrum-6 以太网交换机:网络交换

所有组件为协同设计,消除多厂商部署的瓶颈。

4. Dynamo 推理调度框架​

  • 支持推理任务拆分
  • 预填充阶段:分配给 Vera CPU / Rubin NVL144 CPX 机架
  • 解码阶段:分配给 Rubin GPU
  • 大幅提升推理能效

5. 与 Groq 3 LPU 异构协同​

  • 通过 Spectrum X 网络互联
  • 无需修改 CUDA 代码即可将万亿参数模型的解码任务卸载到 LPU
  • 推理任务调度由 Dynamo 层自动完成

系统配置​

Rubin NVL72​

  • GPU 数量:72 个 Rubin GPU
  • 机架功耗:120-130 kW
  • 适用场景:大规模训练、推理

Rubin NVL144 CPX​

  • GPU 数量:144 个 Rubin GPU
  • 机架功耗:~260 kW
  • 适用场景:超大规模推理

Rubin NVL576​

  • GPU 数量:576 个 Rubin GPU
  • 机架功耗:~600 kW
  • 适用场景:超大规模 AI 工厂

与 Blackwell 对比​

参数Blackwell(B200)Rubin(Rubin GPU)
制程TSMC 4nmTSMC 3nm
晶体管2080亿3360亿
HBMHBM3e 192GBHBM4 288GB
HBM 带宽8 TB/s22 TB/s
FP4 算力? PFLOPS50 PFLOPS
TDP1000W1800W-2300W
NVLinkNVLink 5(1.8 TB/s)NVLink 6(3.6 TB/s)

发布时间与可用性​

阶段时间
发布2026年1月(CES 2026 预览)/ GTC 2026 全面投产
样品交付2026年Q2(已向超大规模客户出货)
规模量产2026 H2 量产爬坡(8/21 官方确认)
早期客户交付2026年下半年(微软首家部署)

量产与出货节奏(2026-09 更新)​

阶段时间 / 状态
ES 工程样品2026-05(已向最顶级客户提供)
PS 量产样品2026-09 中旬起,新一代计算板 / 交换板全面切换为 PS 版本
机柜级量产2026-09 中旬起,面向全球十余家主要 ODM / OEM 正式启动
2026 出货量约 100 万颗出头(新产品爬坡节奏)
2027 出货量预计大幅放量,为真正的主力出货年

📌 口径提示:同期 B300 / GB300 在 2026 年预计出货 500 多万颗,仍是当年出货主力;Rubin 的规模上量要到 2027 年。

已确认部署方​

AWS、Google Cloud、Microsoft Azure、Oracle Cloud、CoreWeave、Lambda、Nebius、Nscale 均已确认首批部署。印度 Yotta 宣布在 Noida D4(120MW)部署 4 万颗 Vera Rubin、Navi Mumbai NM2(80MW)部署 4 万颗 GB300,合计约 120 亿美元投资——这是首个非美国超大规模厂商、非主权基金背景的同类规模订单。

实测性能口径(Hot Chips 2026)​

NVIDIA 在 Hot Chips 2026 把叙事从规格切换到实测:Vera Rubin NVL72 跑 DeepSeek-V4-Pro 的 AgentX 基准,官方口径为每兆瓦吞吐最高 30×、token 成本最高降低 35×(对比 GB300 NVL72)。优势最大的正是高交互性 / 低延迟场景。

⚠️ 30× / 35× 为 NVIDIA 营销数字,独立基准(InferenceX)复核尚未完成,采信前需打折。

架构路线变化:Kyber NVL144 移出 2027 路线图​

原定 2027 年量产的 Kyber NVL144 已从 Rubin Ultra 的产品路标中移除,主因是**正交中板(orthogonal midplane)**制造难度导致进度严重滞后。2027 年主线转向 NVL72 及基于 NVL72 扩展的 NVL576;NVL8 等单机形态继续保留。Kyber 形态本身并未彻底终止,可能要等到 2028 年之后结合 Feynman 架构再看。

Vera CPU(同平台关键配套)​

  • 88 核自研核(代号 Olympus,ARM v9.2,非 Neoverse 公版)
  • 176 线程(SMT-X 空间多线程)、164MB L3、单片 die
  • 1.2 TB/s SOCAMM2 内存带宽
  • 官方口径:agentic 任务完成速度较传统 x86 快 1.8 倍、能效 2 倍
  • 已随 Vera Rubin 系统全面量产,NVIDIA 借此进入服务器 CPU 市场

参考链接​


标签:GPU Training Inference NVIDIA Rubin 2026 HBM4 NVLink 6