跳到主要内容

2 篇博文 含有标签「AI Factory」

AI factory and datacenter infrastructure

查看所有标签

AWS 再加购 200 万颗英伟达 GPU:Vera CPU 首次登陆 AWS,10 万颗专供美国政府 AI 工厂

· 阅读需 5 分钟
Industry Research Team

本文基于 AWS 与 NVIDIA 官方公告(2026 年 9 月 5 日)及双方高管公开表态整理。

2026 年 9 月 5 日,AWS 与英伟达宣布扩大战略合作:在 GTC 2026 已宣布的「2026 年起新增 100 万颗 GPU」计划之上,再追加部署 200 万颗 NVIDIA GPU,覆盖 Blackwell Ultra、Rubin 与 Rubin Ultra 三代架构,时间窗口为 2027-2028 年。需求增长超出此前所有预测,是双方给出的直接理由。

这不再是单纯的「买卡」,而是一次覆盖 GPU、CPU、互联、内存、开源模型与软件的全栈合作。我们把关键信息拆成六点。

一、200 万颗 GPU 的构成与节奏​

  • 规模:200 万颗(在原有 100 万颗计划之上追加,总承诺规模翻了三倍)
  • 架构:Blackwell Ultra、Rubin、Rubin Ultra
  • 时间:2027-2028 年,部署于 AWS 全球基础设施(含新建 AI 工厂)
  • 背景:亚马逊 2026 年资本支出指引已从 2000 亿美元上调至 2200 亿美元,CEO 安迪·贾西明确表示仍不足以满足 AI 算力需求

作为参照,GTC 2026 上黄仁勋给出的口径是:Blackwell 与 Rubin 两大平台至 2027 年的累计订单与需求规模已上看 1 万亿美元(GTC 2025 时对 2026 年的判断约为 5000 亿美元)。AWS 的加购是这个大盘子里最重的一块拼图之一。

二、Vera CPU 首次登陆 AWS​

这是本次合作里最具结构性的变化:NVIDIA Vera CPU 基础设施将进入 AWS。

Vera CPU 是 Vera Rubin 平台中面向 agentic AI 设计的通用处理器,定位是把 AI 资源高效转化为「完成的智能体任务」。随着智能体工作负载兴起,CPU 侧的任务编排、内存管理、数据调度压力同步上升——纯 GPU 扩容已经不够,AWS 需要与之配套的高性能 CPU 层。这也与 AWS「从自研芯片(Graviton/Trainium)到合作伙伴芯片提供最广算力选择」的策略一致:Vera 不替代 Trainium,而是补齐加速基础设施旁边的 CPU 算力层。

在 re:Invent 2025 上,AWS 宣布下一代 Trainium 芯片支持 NVIDIA NVLink Fusion 高速互联。本次双方把合作再推进一步:

  • 亚马逊 Annapurna Labs 将支持英伟达新的定制高带宽内存 NVHBM(与内存供应商合作开发)
  • Trainium 由此可以获得更快、更省电的内存选项
  • Trainium 与 GPU 可以在同一机架级架构内协同,共享 scale-up 互联

对芯片行业来说,这是一个值得盯紧的信号:NVLink Fusion + NVHBM 意味着英伟达的互联与内存技术开始向竞品 ASIC「供货」。自研 ASIC 阵营(Trainium、TPU、MTIA)与英伟达 GPU 阵营的边界,正在从「二选一」变成「混布」。

四、10 万颗 GPU:美国政府主权 AI 工厂​

合作中专门划出一块公共部门业务:AWS 与英伟达将为美国政府建造 AI 工厂,在安全 AWS 基础设施上部署 10 万颗 GPU,承载联邦与国家安全负载(Impact Level 6 及以上),支持在强监管框架内开发先进 AI 模型。

主权 AI 从口号变成明确数字,是本轮周期的显著特征——政府客户正在成为 AI 算力的一等买家。

五、软件与物理 AI 同步深化​

硬件之外,软件层合作也在加码:

  • NVIDIA Nemotron 开源模型继续登陆 Amazon Bedrock 与 SageMaker
  • Amazon EMR 数据处理与 OpenSearch 向量索引用 cuDF / cuVS 加速
  • Amazon Robotics 正式采用 NVIDIA 物理 AI 平台(Jetson、Omniverse、Isaac),用于仓储自动化与下一代机器人

物理 AI(机器人、具身智能)正在成为云厂商算力叙事的新增长极,这与国内京东、特斯拉等把具身智能写进算力采购逻辑是同一趋势。

六、对算力买家的启示​

观察含义
需求「跑赢所有预测」供给紧张不是短期现象,2027-2028 的算力窗口现在就要锁定
三代架构混采Rubin/Rubin Ultra 量产爬坡期间,Blackwell Ultra 仍是交付主力,采购需要跨代规划
CPU 层被重估agentic AI 把瓶颈从 GPU 推向 CPU 编排与内存带宽,选型时别只盯加速卡
主权 AI 落地政府级订单入场,进一步收紧高端 GPU 的可分配供给

对自建与租用的决策者而言,云巨头的每一次天量加购都在重定价未来的租金曲线。如果你正在评估 GPU 采购或租用方案,建议用 TCO 计算器 做一次量化测算:输入芯片价格、功耗、利用率与租用单价,即可对比 3 年持有成本。

小结​

200 万颗 GPU、Vera CPU 上云、NVHBM 开放、10 万颗主权算力——AWS 与英伟达这轮扩盟把「AI 工厂」竞赛推进到全栈时代。算力的稀缺性在 2027 年之前大概率只紧不松,无论是买卡、租卡还是押注国产替代,尽早锁定供给与成本曲线,都是当前最确定的动作。

(本文数据均来自 AWS/NVIDIA 官方公告与双方高管公开表态;架构性能口径以厂商发布为准。)

NVIDIA Vera Rubin 全面投产:智能体AI工厂时代正式开启

· 阅读需 6 分钟
Industry Research Team

2026年6月1日,NVIDIA创始人兼首席执行官黄仁勋在COMPUTEX 2026(台北国际电脑展)上正式宣布:Vera Rubin平台全面投产。这标志着AI硬件从"离散加速器"向"整体化AI工厂"的根本性范式转变。

核心亮点​

  • Rubin GPU:下一代AI计算芯片,FP4算力是Blackwell的3.6×
  • Vera CPU:88个自定义Arm核心(176线程),替代Grace CPU
  • NVLink 6:GPU间互联带宽达260 TB/s(相比Blackwell翻倍)
  • CX8 SuperNIC:800Gb/s网络,ConnectX-9链路达28.8 TB/s
  • HBM4显存:单芯片288GB,带宽13 TB/s
  • 智能体吞吐量:相比Grace Blackwell提升10×

Vera Rubin 平台完整规格​

Vera Rubin不是一个单独的GPU,而是一个完整的AI工厂平台,包含7款芯片:

芯片名称类型用途
Rubin GPU主力AI计算芯片训练+推理
Rubin Ultra GPU旗舰版超大尺度推理
Vera CPU配合Rubin的CPUHost CPU + 数据预处理
NVLink 6互联芯片GPU间高速互联(260 TB/s)
CX8 SuperNIC网卡800Gb/s网络
XDR 800G 交换机数据中心网络跨机架通信
Rubin平台POD整机柜预配置的AI工厂(144 GPU)

Rubin GPU 详细规格(推测)​

参数Rubin GPURubin UltraBlackwell (B200)
架构RubinRubin UltraBlackwell
制程TSMC 3nm(推测)TSMC 3nmTSMC 4NP
显存288GB HBM4288GB HBM4E(推测)192GB HBM3e
显存带宽13 TB/s13+ TB/s8 TB/s
FP4 算力~3,600 TFLOPS(推测)~5,000 TFLOPS(推测)2,250 TFLOPS
TDP1,000W(推测)1,200W(推测)700-1000W
互联NVLink 6(260 TB/s)NVLink 6NVLink 5(1800 GB/s)
量产时间2026 Q32027 下半年2024 Q4

📌 注:Rubin具体规格尚未完全公开,上表部分为推测值。

Vera CPU:替代Grace的新一代Host CPU​

Vera CPU是NVIDIA自研的Arm架构CPU,取代此前的Grace CPU:

参数Vera CPUGrace CPU
核心数88核(176线程)72核(144线程)
架构自定义Armv9(推测)Arm Neoverse V2
接口NVLink 5.0(1.8 TB/s)NVLink 4.0(900 GB/s)
TDP~500W(推测)350-500W
用途AI工厂Host CPU超算/AI Host

关键升级:Vera与Rubin GPU的协同设计,使其在计算、数据加载、预处理上实现端到端优化,对标Google TPU 8t的Arm Axion集成。

与Blackwell的性能对比​

NVIDIA官方宣称,在相同POD配置(144个GPU芯片)下:

指标Grace Blackwell (GB200 NVL72)Vera Rubin NVL144提升
FP4 算力1.1 PFLOPS3.6 PFLOPS3.3×
显存容量288GB×72 = 20.7TB288GB×144 = 41.4TB2×
显存带宽8 TB/s×7213 TB/s×144~3.3×
NVLink 带宽1800 GB/s×72260 TB/s(全POD)~2×
智能体吞吐量基准10×10×
每瓦性能基准25×(与单独CPU比)25×

💡 为何是"10×智能体吞吐量"? 智能体AI(Agentic AI)工作负载与训练/推理不同:一个提示词可能触发包含推理、检索、工具调用、响应生成的多个环节,涉及数千个步骤。Rubin平台专为这种长链条、高并发工作负载优化。

MGX 第三代机架级系统​

Vera Rubin采用MGX第三代开源机架级系统设计:

  • 五机架协同:Vera Rubin NVL72系统 + Vera CPU + Groq 3 LPX + Vera BlueField-4 STX存储 + Spectrum-6 SPX以太网
  • 全球供应链:30个国家、350+工厂、数百家合作伙伴(Dell、HPE、Lenovo、Supermicro、Asus、Foxconn等)
  • Spectrum-X 以太网硅光技术:全球首款基于CPO(光电一体化封装)、支持200Gb/s SerDes的交换机,现已量产

量产时间表​

时间事件
2026年1月CES 2026首次公布Rubin平台
2026年6月1日COMPUTEX 2026宣布全面投产
2026年秋季Vera Rubin正式启动量产并开始出货
2027年下半年Rubin Ultra发布(HBM4E升级)
2028年Feynman架构(下一代)

AI工厂:从卖芯片到卖"智能生产线"​

黄仁勋在发布会上说了一句让业界震动的话:

"Rubin的Agentic AI吞吐量,是Blackwell的10倍。Rubin是一个完整的AI工厂平台。"

这标志着NVIDIA商业模式的根本转变:

  • 过去:卖GPU(H100/B200),客户自己搭建系统
  • 现在:卖"AI工厂成套解决方案"(Vera Rubin POD),包含GPU、CPU、网络、存储、软件栈
  • 未来:成为全球AI基础设施的"台积电"(提供智能生产能力)

与竞品对比​

厂商产品定位优势劣势
NVIDIAVera RubinAI工厂整体方案生态最完整、软件最成熟价格昂贵、功耗极高
AMDMI455X(MI400系列)训练竞品性价比、开放生态软件生态差距
GoogleTPU 8i/8t云上训练/推理与Gemini深度集成仅Google Cloud
华为昇腾910C/950国产替代中国本土化、昇思框架受出口管制影响

行业影响​

  1. AI实验室:Frontier模型训练时间从"数月"缩短到"数周"
  2. 云服务商:必须决定是否采购Vera Rubin POD(与自研芯片战略冲突)
  3. 超大规模数据中心:AI工厂成为新的竞争维度(谁有最强算力,谁就能训练最强模型)
  4. 国产芯片:昇腾910C/950、寒武纪MLU590等必须在2026-2027年追上Blackwell,否则差距将扩大到Rubin时代

相关芯片​

参考资料​


本文基于NVIDIA官方公告及公开资料整理,部分规格为推测值,以官方最终发布为准。