NVIDIA Rubin
NVIDIA Rubin GPU 在 CES 2026(2026年1月)正式发布,是 NVIDIA 继 Blackwell 之后的新一代 AI 加速芯片,采用全新六芯片架构(Vera CPU + Rubin GPU + NVLink 6 + BlueField-4 DPU + ConnectX-9 SuperNIC + Spectrum-6 以太网交换机),构成完整统一的 AI 系统。
核心规格
| 参数 | 规格 |
|---|---|
| 架构 | Rubin 架构(Blackwell 继任者) |
| 制程工艺 | TSMC 3nm(N3/N3P) |
| 晶体管数量 | 3360亿个 |
| 芯片设计 | 双计算 chiplet + 双 I/O chiplet MCM 设计(NV-HBI 跨 die 互联) |
| 显存容量 | 288 GB HBM4 |
| 显存带宽 | 22 TB/s |
| FP4 算力 | 50 PFLOPS(推理口径) |
| 计算单元 | 224 SM / 896 Tensor Core(Hot Chips 2026 官方披露) |
| 发布时间 | 2026年1月(CES 2026 预览)/ GTC 2026 全面投产 |
| TDP | 2300 W |
| 量产时间 | 2026 H2 全面量产爬坡(8/21 官方确认已向超大规模客户出货,微软首家部署) |
显存规格
| 参数 | 规格 |
|---|---|
| 显存类型 | HBM4 |
| 显存容量 | 288GB |
| 显存带宽 | 22 TB/s |
| 单栈带宽 | >3.0 TB/s |
| 单引脚速率 | >11 Gbps |
| HBM4 栈数量 | 8 个 |
| 接口宽度 | 2048 位/栈(较 HBM3e 翻倍) |
算力规格
| 精度 | 算力 |
|---|---|
| FP4(推理) | 50 PFLOPS |
| FP4(训练) | 35 PFLOPS |
| FP8 | 约 25 PFLOPS(dense,推理;NVFP4 为其 2×) |
| FP16 | 待公布 |
| FP32 | 待公布 |
| INT8 | 待公布 |
功耗与散热
| 参数 | 规格 |
|---|---|
| 单 GPU 功耗 | 1800W - 2300W |
| 散热方案 | 100% 液冷(无风冷配置) |
| NVL72 机架功耗 | 120-130 kW |
| NVL144 CPX 机架功耗 | ~260 kW |
| NVL576 机架功耗 | ~600 kW |
互联技术
| 参数 | 规格 |
|---|---|
| NVLink 版本 | NVLink 6 |
| 单 GPU NVLink 带宽 | 3.6 TB/s(是 Blackwell NVLink 5 的 2 倍) |
| CPU-GPU 互联 | NVLink-C2C,带宽 1.8 TB/s |
| 网络 | ConnectX-9 SuperNIC + Spectrum-6 以太网交换机 |
架构特点
1. 第三代 Transformer 引擎
- 支持 NVFP4 自适应压缩
- 无需手动调整即可自动优化精度格式
- 兼顾性能和精度
2. 同步多线程(SMT)
- 单 GPU 支持 176 线程
- 提升并行处理能力
3. 全栈 AI 工厂方案
Rubin 平台由 6 款芯片协同设计:
- Vera CPU:控制平面
- Rubin GPU:计算核心
- NVLink 6:GPU 间高速互联
- BlueField-4 DPU:数据中心基础设施处理
- ConnectX-9 SuperNIC:网络连接
- Spectrum-6 以太网交换机:网络交换
所有组件为协同设计,消除多厂商部署的瓶颈。
4. Dynamo 推理调度框架
- 支持推理任务拆分
- 预填充阶段:分配给 Vera CPU / Rubin NVL144 CPX 机架
- 解码阶段:分配给 Rubin GPU
- 大幅提升推理能效
5. 与 Groq 3 LPU 异构协同
- 通过 Spectrum X 网络互联
- 无需修改 CUDA 代码即可将万亿参数模型的解码任务卸载到 LPU
- 推理任务调度由 Dynamo 层自动完成
系统配置
Rubin NVL72
- GPU 数量:72 个 Rubin GPU
- 机架功耗:120-130 kW
- 适用场景:大规模训练、推理
Rubin NVL144 CPX
- GPU 数量:144 个 Rubin GPU
- 机架功耗:~260 kW
- 适用场景:超大规模推理
Rubin NVL576
- GPU 数量:576 个 Rubin GPU
- 机架功耗:~600 kW
- 适用场景:超大规模 AI 工厂
与 Blackwell 对比
| 参数 | Blackwell(B200) | Rubin(Rubin GPU) |
|---|---|---|
| 制程 | TSMC 4nm | TSMC 3nm |
| 晶体管 | 2080亿 | 3360亿 |
| HBM | HBM3e 192GB | HBM4 288GB |
| HBM 带宽 | 8 TB/s | 22 TB/s |
| FP4 算力 | ? PFLOPS | 50 PFLOPS |
| TDP | 1000W | 1800W-2300W |
| NVLink | NVLink 5(1.8 TB/s) | NVLink 6(3.6 TB/s) |
发布时间与可用性
| 阶段 | 时间 |
|---|---|
| 发布 | 2026年1月(CES 2026 预览)/ GTC 2026 全面投产 |
| 样品交付 | 2026年Q2(已向超大规模客户出货) |
| 规模量产 | 2026 H2 量产爬坡(8/21 官方确认) |
| 早期客户交付 | 2026年下半年(微软首家部署) |
量产与出货节奏(2026-09 更新)
| 阶段 | 时间 / 状态 |
|---|---|
| ES 工程样品 | 2026-05(已向最顶级客户提供) |
| PS 量产样品 | 2026-09 中旬起,新一代计算板 / 交换板全面切换为 PS 版本 |
| 机柜级量产 | 2026-09 中旬起,面向全球十余家主要 ODM / OEM 正式启动 |
| 2026 出货量 | 约 100 万颗出头(新产品爬坡节奏) |
| 2027 出货量 | 预计大幅放量,为真正的主力出货年 |
📌 口径提示:同期 B300 / GB300 在 2026 年预计出货 500 多万颗,仍是当年出货主力;Rubin 的规模上量要到 2027 年。
已确认部署方
AWS、Google Cloud、Microsoft Azure、Oracle Cloud、CoreWeave、Lambda、Nebius、Nscale 均已确认首批部署。印度 Yotta 宣布在 Noida D4(120MW)部署 4 万颗 Vera Rubin、Navi Mumbai NM2(80MW)部署 4 万颗 GB300,合计约 120 亿美元投资——这是首个非美国超大规模厂商、非主权基金背景的同类规模订单。
实测性能口径(Hot Chips 2026)
NVIDIA 在 Hot Chips 2026 把叙事从规格切换到实测:Vera Rubin NVL72 跑 DeepSeek-V4-Pro 的 AgentX 基准,官方口径为每兆瓦吞吐最高 30×、token 成本最高降低 35×(对比 GB300 NVL72)。优势最大的正是高交互性 / 低延迟场景。
⚠️ 30× / 35× 为 NVIDIA 营销数字,独立基准(InferenceX)复核尚未完成,采信前需打折。
架构路线变化:Kyber NVL144 移出 2027 路线图
原定 2027 年量产的 Kyber NVL144 已从 Rubin Ultra 的产品路标中移除,主因是**正交中板(orthogonal midplane)**制造难度导致进度严重滞后。2027 年主线转向 NVL72 及基于 NVL72 扩展的 NVL576;NVL8 等单机形态继续保留。Kyber 形态本身并未彻底终止,可能要等到 2028 年之后结合 Feynman 架构再看。
Vera CPU(同平台关键配套)
- 88 核自研核(代号 Olympus,ARM v9.2,非 Neoverse 公版)
- 176 线程(SMT-X 空间多线程)、164MB L3、单片 die
- 1.2 TB/s SOCAMM2 内存带宽
- 官方口径:agentic 任务完成速度较传统 x86 快 1.8 倍、能效 2 倍
- 已随 Vera Rubin 系统全面量产,NVIDIA 借此进入服务器 CPU 市场
参考链接
标签:GPU Training Inference NVIDIA Rubin 2026 HBM4 NVLink 6