跳到主要内容

14 篇博文 含有标签「NVIDIA」

NVIDIA AI chips and GPUs

查看所有标签

英伟达中国份额崩至 8%,昇腾升至 50%:一份 9 月报告里的中国 AI 算力市场剧变

· 阅读需 5 分钟
Industry Research Team

本文基于 Bloomberg Intelligence 与 Bernstein 2026 年 9 月发布的市场分析及公开报道整理;市场份额与营收为分析师预测口径,非官方披露。

9 月 28 日,两份华尔街报告同时描摹出一个戏剧性的画面:中国 AI 算力市场的份额天平,在 12 个月内完成了几乎彻底的翻转。

一、份额翻转:40% → 8%,昇腾 → 50%​

Bernstein 最新预测:

  • 英伟达在中国 AI 芯片市场的份额,将从约 40% 跌至今年年底的约 8%
  • 华为昇腾升至接近 50%
  • 直接导火索:9 月中国对英伟达 H20 新订单的禁令,关上了英伟达重返中国市场的最后通道
  • 字节跳动、阿里、腾讯均已下出大额昇腾订单

时间线上看,这不是一次突变,而是出口管制三年收紧的累积结果:英伟达在中国 AI 芯片市场的份额一度高达 95%,随着高端芯片断供,中国超大规模云厂商整体转向华为与国产替代;即便 2026 年 1 月华盛顿放开 H200 对华销售,转向的齿轮已经咬合,回不去了。

二、昇腾 950PR:分析师眼里的「中国版 H200」​

支撑这份份额数据的,是产品力本身:

  • 昇腾 950PR 今年 3 月量产,FP4 算力最高 2 PFLOPS,搭载 128GB 国产 HBM
  • 分析师将其评为大致对标英伟达 H200
  • 华为 AI 芯片营收预计今年达 120 亿美元,较 2025 年的 75 亿美元增长 60%

950 系列的完整规格可参考我们此前的深度文章:昇腾 950PR/950DT 双配置解析 与 昇腾 960 官宣发布——960 已提前三个季度就绪,确认一年一代节奏。

三、模型侧:中国开源模型拿下 OpenRouter token 大盘​

芯片份额翻转的同时,模型使用侧的数据同样惊人(OpenRouter 平台统计):

指标数据
DeepSeek token 份额(6 月)16.3%,超过 Google、Anthropic、OpenAI 各自单独份额,居第一
中国开放权重模型合计 token 份额(5 月)约 61%(DeepSeek、Qwen、MiniMax、腾讯混元等)
中国模型周 token 消耗约 18 万亿,美国模型约 5.5 万亿,3 倍以上差距且一年内完成反超
中美前沿模型性能差距(6 月)收窄至 6%,创历史新低(5 月为 9%)

算力与模型形成正循环:买不到的卡倒逼国产算力放量,放量的国产算力养出便宜的 token,便宜的 token 让中国开源模型吃下全球推理流量的大头。

四、但股票市场没有买单​

Bloomberg Intelligence 同期指出一个矛盾:中国科技八巨头(China Tech 8)相对美股「七巨头」(Magnificent Seven)的估值折价达到年内最宽的 超过 50%,BI 认为只有「真正的 AI 突破」才能弥合。个股年内表现:阿里约 -7%、腾讯约 -23%,而美国 AI 基础设施龙头普涨 15% 以上。

这种背离有两种解读:要么市场低估了中国 AI 基本面,要么盈利执行(阿里上季 EPS 低于预期 17.3%、百度低 36%)拖累了 AI 叙事的兑现。对产业观察者而言,值得注意的是:算力侧的数据(份额、营收、出货)已经先行,应用侧的变现仍在路上。

五、对算力采购者的三点提示​

  1. 在华部署,昇腾生态已是默认选项。 从 CUDA 迁移到 CANN 的成本是一次性的,而供给不确定性是持续性的;9 月禁令后,新采购英伟达卡在中国市场已无合规路径。
  2. 国产算力「对标 H200」是分水岭。 过去国产替代的隐含假设是「性能打折、价格打折」;当单卡性能追平 H200 世代,采购决策就回归纯粹的 TCO 与供应安全计算——建议用 TCO 计算器 把电费、折旧、利用率放进同一张表里算。
  3. token 成本曲线决定应用格局。 中国模型 61% 的 OpenRouter token 份额说明:算力自主 → token 降价 → 应用繁荣的链条已经跑通第一段,接下来看推理成本能否继续下探。

小结​

40% 到 8%,不是一句口号,而是一个由禁令、产品力与模型生态共同驱动的市场重排。对中国市场而言,昇腾 950/960 的量产节奏与 CANN 生态成熟度,将决定这份份额能否守住;对全球市场而言,中国算力「内循环 + 开源模型出海」的组合,正在改写推理流量的地理分布。

(市场份额与营收预测来自 Bernstein / Bloomberg Intelligence 分析师报告,实际数字以各公司财报为准。)

Groq 3 LPX 全面量产:三星 4nm 代工、单机架 315 PFLOPS FP8,英伟达把 LPU 变成 Vera Rubin 的第七颗芯片

· 阅读需 5 分钟
Industry Research Team

本文基于 NVIDIA 官方产品页、2026 年 3 月 GTC 架构博客及第三方基准数据整理;性能口径为厂商架构对比,实际收益需以自测为准。

英伟达确认,Groq 3 LPX——Vera Rubin 平台的「第七颗芯片」——已进入全面量产,由三星平泽园区代工。这是继 2025 年 12 月英伟达斥资约 200 亿美元获得 Groq 非独占 IP 授权与核心工程团队之后,这笔交易第一次以量产硅的形式落地。

对推理硬件格局而言,这是一次范式级事件:英伟达第一次把「别家定义的专用推理架构」纳入自家旗舰平台,且不是外挂销售,而是深度协同设计。

一、Groq 3 LPU 芯片与 LPX 机架:规格速览​

单颗 Groq 3 LPU(4nm,三星代工):

项目数值
编译器管理的片上 SRAM500 MB
SRAM 带宽150 TB/s
片间 scale-up 带宽2.5 TB/s(96 条 chip-to-chip 链路,每条 112 Gbps)

单个 LPX 机架(32 个 1U 液冷托盘,每托盘 8 颗 LPU):

项目数值
LPU 总数256 颗
FP8 算力315 PFLOPS
片上 SRAM 总量128 GB
SRAM 聚合带宽40 PB/s
机架内 scale-up 带宽640 TB/s
DDR5 内存12 TB(承载大模型权重)

每颗 LPU 500MB 的 SRAM 看起来不大,但乘上 256 颗、再叠加 40PB/s 的聚合带宽,构成了「确定性低延迟解码」的物理基础——LPU 的设计哲学正是用编译器静态调度片上 SRAM,彻底消除推理解码阶段的内存取数停顿,而这恰恰是 GPU 推理最典型的瓶颈。

二、AFD:注意力与 FFN 分家,GPU 和 LPU 各干各的​

LPX 不是替代 GPU,而是与 Vera Rubin NVL72 组成异构系统,核心是 AFD(Attention-FFN Disaggregation,注意力-前馈解耦):

  1. Rubin GPU 负责 prefill 与 attention——在大上下文上构建 KV cache、执行注意力层,吃 HBM 容量与高吞吐;
  2. Groq 3 LPU 负责 FFN / MoE 专家层解码——延迟敏感、模式可预测,恰好是 SRAM 确定性调度的主场;
  3. 中间激活在两个引擎间逐 token 交换,由 NVIDIA Dynamo 编排路由,GPU 算每一层注意力,LPU 算每一层前馈,协同完成每个输出 token。

这套分工的逻辑很清晰:智能体应用消耗的 token 量可达传统 AI 应用的 15 倍,瓶颈从「能不能算完」变成「能不能以稳定低延迟持续吐 token」。让 HBM 大容器去跑 attention、让 SRAM 确定性引擎去跑 decode,各取所长。

三、实测与官方口径​

  • 第三方实测(Artificial Analysis):Gemma 4 31B、100K token 上下文下,LPX 输出约 3400 tokens/s——单 token 间隔低于 1 毫秒,长上下文智能体场景的交互感质变
  • 官方架构对比:与 LPX 组合后,Vera Rubin NVL72 对万亿参数模型的每兆瓦吞吐最高提升 35 倍;「高价值 token」场景下每瓦收入机会最高 10 倍
  • 首发客户:Nebius 率先部署 LPX 机架扩展其 token 产能;CoreWeave 已在生产环境用 Spectrum-X Multiplane 连接 Vera Rubin 机架

需要强调:35 倍/10 倍是特定高交互工作点的架构对比数字,不是普适结论。训练、大吞吐批量推理、需要 CUDA 生态灵活性的负载,GPU 仍是正解;LPX 的主场是「单用户交互延迟即产品」的场景——智能体循环、实时编码助手、长上下文对话。

四、三个行业信号​

1. 专用推理芯片被收编,而非对抗。 过去 LPU 是「GPU 挑战者」的叙事,现在变成了 Vera Rubin 的组成部分。推理硬件的终局可能不是一种架构赢,而是「GPU + 专用解码引擎」的异构组合成为标配。对其他推理芯片创业公司(Cerebras、Etched 等),这既是天花板抬高的证明,也是「要么被集成、要么找差异化」的警示。

2. 三星代工拿到高端 AI 订单。 在台积电几乎垄断 AI 主芯片的背景下,三星 4nm 承接 LPX 量产意义重大——叠加此前特斯拉 AI6 的 2nm 订单,三星代工有望在 2027 年重回全年盈利。

3. 推理经济性进入「按 MW 定价」时代。 当厂商开始用 tokens/MW 和每瓦收入讲故事,算力选型的核心 KPI 已经从峰值算力(TFLOPS)彻底转向单位能耗的 token 产出。这与我们在 TCO 计算器 里内置的功耗-电费模型逻辑一致:峰值参数好看的芯片,未必是每 token 成本最低的芯片。

小结​

Groq 3 LPX 量产标志着推理硬件进入「GPU 管吞吐、LPU 管延迟」的异构时代。对于正在选型推理集群的团队,建议把工作负载拆开评估:批量离线推理留在 GPU,交互式长上下文智能体值得单独测算 LPX 类方案的单位成本。拿不准的话,先用 TCO 计算器 跑一遍两种架构的 3 年持有成本再拍板。

(本文性能数据来自 NVIDIA 官方架构对比与 Artificial Analysis 第三方实测,实际部署请以自测为准。)

Vera Rubin NVL72 MLPerf v6.1 首秀:Qwen3-VL 吞吐 3.7 倍于 GB300,CoreWeave 同日上线多机架集群

· 阅读需 5 分钟
Industry Research Team

9 月 16 日,MLCommons 公布 MLPerf Inference v6.1 Closed Division 结果,NVIDIA Vera Rubin NVL72 完成基准首秀。同一天,CoreWeave 宣布在自家云上上线多机架 Vera Rubin 集群——"新硬件首发即可租用"的节奏,正在把新一代算力从发布到可计费产出的周期压缩到季度级别。


1. 首秀成绩:3.7 倍与 2.5 倍​

NVIDIA 以预览提交(entries 6.1-0106 / 6.1-0074)给出两代旗舰的同口径对比:

基准模型Vera Rubin NVL72 vs GB300 NVL72软件栈
Qwen3-VL-235B-A22B(235B 多模态 MoE)吞吐最高 3.7 倍(离线 / 服务器 / 交互三场景)vLLM + NVIDIA Dynamo
DeepSeek-R1-671B(671B 推理模型)吞吐最高 2.5 倍TensorRT-LLM

支撑数字的三项技术:

  • NVFP4 精度:压缩模型权重、注意力张量与 KV Cache 的显存占用,等效批尺寸显著提升;
  • 分离式服务(Disaggregated Serving):prefill(算力密集)与 decode(带宽密集)拆到不同 GPU 池独立优化;
  • 专家并行:MoE 专家层跨卡分布式路由,配合第六代 NVLink / NVLink Switch(NVIDIA 宣称包速率较现成以太网高 10 倍、时延低 3 倍)。

2. 同场亮点:扩展效率与软件红利​

  • GB300 四机架 288 卡 99% 扩展效率:DeepSeek-R1 离线场景下,从单机架 72 卡扩展到 4 机架 288 卡几乎无折损(entries 6.1-0073 / 6.1-0074)——机架级互联的扩展效率第一次在 288 卡规模上得到验证;
  • 软件仍在释放红利:同一 GB300 硬件上,v6.1 软件优化较 v6.0 带来最高 1.6 倍 Qwen3-VL 提升;NVIDIA 还报告了 GPT-OSS-120B 与 DLRMv3 的提交后增益(未经 MLCommons 验证);
  • 19 家合作伙伴提交,其中 8 家采用多节点 Blackwell NVL72 配置(ASUS、Azure、Cisco、CoreWeave、Crusoe、Dell、Fujitsu、HPE、Lambda、Nebius、OCI、Supermicro 等);Nebius 也提交了 Vera Rubin 预览成绩。

3. CoreWeave 同日上线:首发即可租用​

CoreWeave 在 MLPerf 结果公布同日宣布其云上多机架 Vera Rubin NVL72 集群上线:

  • Spectrum-X 网络将数百颗 Rubin GPU 组成单一横向扩展集群,每颗 GPU 配 2 颗 ConnectX-9 SuperNIC(1.6Tb/s 横向扩展带宽);
  • AI 对象存储 LOTA 将读取时延降低 8 倍;
  • 运维侧:Valvey 软件定义液冷(NVIDIA 规格 45°C 液冷进液)、Racky 机架控制层与 Rack LifeCycle Controller 把整个 NVL72 机架当作单一可编程实体管理;
  • 此前 7 月,CoreWeave 自测 Vera Rubin 对 GB200 NVL72 在 DeepSeek R1 上达到 10 倍 tokens/s/MW(公司口径,非 MLCommons 验证)。

4. 竞争侧写​

  • AMD + Crusoe:以 512 卡创下 575 万 tokens/秒的 MLPerf 历史最高聚合吞吐(AMD 本轮提交覆盖面最广);
  • SemiAnalysis AgentX 预览:Vera Rubin 在 agentic 负载上较 GB300 最高 30 倍(预览口径);MLPerf Endpoints 基准 forthcoming,将把 agentic 推理纳入标准化测量;
  • 待验证项:Vera Rubin 成绩为预览提交、尚待独立复现;NVFP4"几乎无损"未给出量化质量指标;每 token 成本与功耗的规模化对比数据均未公布。Google TPU v7 与 AMD MI455X UALoE72 的对标提交预计 2026 年内出现。

站内规格对照:Rubin R200(288GB / 22TB/s)、B300 Ultra(GB300 核心)。

5. 小结​

  • Vera Rubin NVL72 首秀:Qwen3-VL 3.7 倍、DeepSeek-R1 2.5 倍于 GB300 NVL72(预览口径);
  • GB300 四机架 288 卡 99% 扩展效率,机架级互联进入可用区间;
  • CoreWeave 同日多机架上线——新一代算力从发布到可计费的周期进入季度级;
  • 看什么:独立复现与正式(非预览)提交、TPU v7 / MI455X 对标结果、每 MW 实测 token 产能。

相关阅读​

参考资料​

  • NVIDIA Blog:Vera Rubin NVL72 首度亮相 MLPerf Inference v6.1(2026-09-16)
  • MLCommons:MLPerf Inference v6.1 Closed Division 结果(entries 6.1-0073 / 6.1-0074 / 6.1-0106)
  • CoreWeave 投资者关系:多机架 Vera Rubin NVL72 上线公告(2026-09-16)
  • AMD Blogs:MLPerf Inference v6.1 提交结果

本文基于 MLCommons 公开结果与厂商官方口径整理。Vera Rubin 成绩为预览提交,部分增益数据未经 MLCommons 验证,已逐项标注。

AI 算力周报(9.1-9.5):DeepSeek 订 16 万颗昇腾 950DT、英伟达 129 亿美元收购 Hugging Face、Rubin Ultra 显存减配

· 阅读需 9 分钟
Industry Research Team

本周(2026 年 9 月 1 日–5 日)AI 算力行业的题眼,是两条相反方向的成本重构:海外,英伟达以史上最大并购吞下开发者生态入口,同时给旗舰减配显存——"内存太贵"倒逼硬件从单卡堆料走向系统级互联;国内,DeepSeek 16 万颗昇腾订单把"国产替代"从口号变成头部实验室的资产负债表决策,字节近 300 亿美元融资为算力扩张装上杠杆。


1. DeepSeek 拟购 16 万颗昇腾 950DT:国产算力的"标志性订单"​

彭博社 9 月 4 日报道,DeepSeek 计划在内蒙古乌兰察布新建的约 1GW 数据中心部署至少 16 万颗华为昇腾 950DT,主要用于推理而非训练。按每颗约 11.1 万元的市场价估算,订单总额约 178 亿元人民币(约 25.6 亿美元)——这是迄今已知规模最大的昇腾集群,是半年前深圳首个万卡级集群的 16 倍。

三个关键读数:

  • 主动选择,而非被迫替代:DeepSeek 是公认最会"榨干"算力的实验室。创始人梁文锋 7 月曾直言:华为超节点能完成 GB300 的任务、延迟没有明显差别,但约需 4 颗昇腾才抵 1 颗英伟达、技术上落后约两年。选择昇腾跑推理,是在综合成本、供应链安全与本土化后的理性决策——推理对软件生态依赖较浅,正是国产芯片的突破口;
  • 瓶颈在供给端:受高端内存(HBM)短缺制约,昇腾 950DT 今年产量仅数十万颗(2026 年全部昇腾 die 计划约 160 万颗),DeepSeek 希望加购更多但产能所限,整单交付或需一年以上——国产 HBM 与先进封装成为整条链的胜负手;
  • 过渡性押注:DeepSeek 同时在与中芯国际合作开发自研推理芯片,并于 6 月完成约 500 亿元融资、继续洽谈数十亿美元基建融资。国产算力的终局是多元自主,而非单一依赖。

单颗 950DT:144GB HBM、4.0TB/s 带宽、2.0TB/s 互联,原生支持 FP8/FP4/HiF8,详见昇腾 950DT 规格页。

2. 英伟达 129.3 亿美元收购 Hugging Face:买下"铲子的交易所"​

当地时间 9 月 3 日,英伟达宣布以 129.3 亿美元收购全球最大开源 AI 平台 Hugging Face,超过 2020 年 69 亿美元收购 Mellanox,成为其史上最大并购。交易含约 119 亿美元股权款与最高约 10 亿美元员工留任计划,预计 2027 年上半年完成,待监管批准。

Hugging Face 托管超 300 万个模型、50 万个数据集,服务超 1800 万名开发者。黄仁勋承诺平台继续开放中立运营:不强制绑定英伟达资源、开源属性完整保留。

解读:算力霸主的护城河从"芯片 + 网络 + 软件栈"一路修到了"模型分发 + 开发者生态"——卖铲人开始收购铲子的交易所。平台的"中立性"承诺能否兑现,将成为全球监管与竞争性云厂商持续盯防的焦点;对国内产业而言,模型托管、权重分发这类"轻资产 AI 基础设施"与芯片一样,正在成为大国科技博弈的卡点。

3. Rubin Ultra 显存减配:内存占 TCO 40% 后的算术题​

SemiAnalysis 最新报告(科创板日报 9 月 3 日转引)显示,英伟达已将旗舰 Rubin Ultra 的 HBM 配置从 HBM4E 12-Hi(384GB 档)下调至 HBM4 8-Hi(192GB),三星正配合开发 8 层产品。

  • 动因:HBM/DRAM 涨价后,内存已占整机 TCO 约 40%;减配后 HBM 成本降超 50%,即便计入 2026 年 HBM 涨价预期,内存占总资本开支比例也将从 40% 压至 28%;
  • 钱去了哪:转向 Scale-up 纵向扩展网络——以 NVL576 NPO 方案测算,光模块取代机架间互连后,Scale-up 网络占机架总支出比例从 4% 升至 12%;
  • 连锁反应:TrendForce 显示英伟达自 2026 Q3 起并行评估 HBM4E 8-Hi / 12-Hi / HBM4 8-Hi 多套方案,部分云厂商也在考虑下调下一代自研 ASIC 的 HBM 容量。

连定价权最强的英伟达都给旗舰"减配求量",等于官宣:当前 AI 硬件最紧的约束是内存(美光高管称新增内存供应 2028 年前难有实质放量),单卡堆料的军备竞赛告一段落,硬件价值重心正迁移到光互联、CPO、高速交换与 PTFE 背板。华泰测算 2027 年存储供需缺口将从约 -7% 收窄至 -3%——上行周期未逆转,但从"普涨"走向"结构性紧缺"。

详见本站已同步更新的 Rubin Ultra 规格页与HBM4 量产竞速分析。

4. 推理 ASIC 军备提速:谷歌"一年两款",Jalapeño 规格落地​

  • 谷歌 TPU 迭代周期从两年一代压缩至"每年两款"(华创证券 9 月 4 日研报):第八代已拆分为训练(8t)与推理(8i)双架构,8i 把内存/算力配比拉到 8t 的 1.65 倍,专为推理放量设计;
  • OpenAI Jalapeño 规格披露:6 堆栈 HBM4 共 216GB、带宽 15.4TB/s、700W,围绕投机解码设计;OpenAI 称在 DeepSeek R1 负载下 tokens/kW 达 GB300 的 1.7 倍;RTL 冻结到流片 9 个月,首批硅片后约 10 周承载 ChatGPT 流量。详见规格页(本站已更新);
  • workload-specific 时代开场:训练、推理、推荐各自长出专用芯片,上游 HBM/封装/光互联的供应节奏必须跟上"半年一代"。

5. 国内动态:字节 296 亿美元加杠杆,摩尔线程 Token 超节点投产​

  • 字节跳动获约 296 亿美元融资安排(彭博 9 月 3 日),较最初约 200 亿美元目标大幅上调,用于数据中心与 AI 基建;另据产业报道正洽谈在内蒙古新增 5-6GW 算力产能——中国 AI 公司迄今最大规模基建融资之一,算力正被当作可融资、可证券化的重资产经营;
  • 摩尔线程 × 趋境科技 "Token 超节点"投产(光明网 9 月 4 日):以 MTT S500 承担 Prefill 与 KV Cache 生成、高带宽 GPU 专注 Decode 的 PD 异构方案,实测平均生成速度超 50 TPS、KV Cache 命中率超 90%、稳定性 99.9%,已承接头部模型厂商官方业务流量——超节点竞争维度从"单卡参数"转向"单位 Token 生产成本";
  • OpenAI 发布 GPT-6 Astra(9 月 4 日):超 10 万颗 GPU 在 Stargate 集群完成训练,推理放量与超大规模集群仍是全球算力叙事主线;
  • SemiAnalysis 基准:AMD MI355X 新提交在 AgentX 基准低交互区间tokens/$ TCO 击败 B300——vLLM + LMCache 软件栈的贡献首次被独立机构量化认可。

6. 市场:中美算力资产一涨一调​

美东 9 月 4 日,美国 8 月非农仅增 8.9 万人(预期 16 万),10 年期美债收益率回落至 3.78%,成长股走强:科技板块 XLK 周涨 4.2%,英伟达周涨 8.7% 收于 230.36 美元。A股 9 月 4 日反向回调:AI 算力芯片板块 -1.99%、服务器 -2.51%、超节点 -2.86%,浪潮信息跌停、寒武纪 -2.54%——基本面无恶化(博通、戴尔、中际旭创订单与财报持续验证景气),更多是交易层面获利兑现。

下周起三连催化密集:CIOE 光博会(9/9-11)→ 华为全联接大会(9/17-19)→ 云栖大会(9/22-24)。国产超节点从"发布会 PPT"到"批量交付"的成色,将迎来集中检验。

本周一句话​

内存太贵改变了所有人的算法:英伟达给旗舰减配显存、把钱投给互联;DeepSeek 用 16 万颗昇腾买推理确定性;谷歌把 TPU 迭代压到半年一代。2026 年 Q4 起,"每兆瓦/每美元 token 数"将取代"单卡 PFLOPS",成为算力采购的第一指标。


相关链接​

参考资料​


本文基于彭博社、科创板日报、SemiAnalysis、TrendForce、华创证券研报及光明网等公开报道整理。订单金额与市场数据为媒体/机构预估口径,实际以相关公司正式披露为准。

AWS 再加购 200 万颗英伟达 GPU:Vera CPU 首次登陆 AWS,10 万颗专供美国政府 AI 工厂

· 阅读需 5 分钟
Industry Research Team

本文基于 AWS 与 NVIDIA 官方公告(2026 年 9 月 5 日)及双方高管公开表态整理。

2026 年 9 月 5 日,AWS 与英伟达宣布扩大战略合作:在 GTC 2026 已宣布的「2026 年起新增 100 万颗 GPU」计划之上,再追加部署 200 万颗 NVIDIA GPU,覆盖 Blackwell Ultra、Rubin 与 Rubin Ultra 三代架构,时间窗口为 2027-2028 年。需求增长超出此前所有预测,是双方给出的直接理由。

这不再是单纯的「买卡」,而是一次覆盖 GPU、CPU、互联、内存、开源模型与软件的全栈合作。我们把关键信息拆成六点。

一、200 万颗 GPU 的构成与节奏​

  • 规模:200 万颗(在原有 100 万颗计划之上追加,总承诺规模翻了三倍)
  • 架构:Blackwell Ultra、Rubin、Rubin Ultra
  • 时间:2027-2028 年,部署于 AWS 全球基础设施(含新建 AI 工厂)
  • 背景:亚马逊 2026 年资本支出指引已从 2000 亿美元上调至 2200 亿美元,CEO 安迪·贾西明确表示仍不足以满足 AI 算力需求

作为参照,GTC 2026 上黄仁勋给出的口径是:Blackwell 与 Rubin 两大平台至 2027 年的累计订单与需求规模已上看 1 万亿美元(GTC 2025 时对 2026 年的判断约为 5000 亿美元)。AWS 的加购是这个大盘子里最重的一块拼图之一。

二、Vera CPU 首次登陆 AWS​

这是本次合作里最具结构性的变化:NVIDIA Vera CPU 基础设施将进入 AWS。

Vera CPU 是 Vera Rubin 平台中面向 agentic AI 设计的通用处理器,定位是把 AI 资源高效转化为「完成的智能体任务」。随着智能体工作负载兴起,CPU 侧的任务编排、内存管理、数据调度压力同步上升——纯 GPU 扩容已经不够,AWS 需要与之配套的高性能 CPU 层。这也与 AWS「从自研芯片(Graviton/Trainium)到合作伙伴芯片提供最广算力选择」的策略一致:Vera 不替代 Trainium,而是补齐加速基础设施旁边的 CPU 算力层。

在 re:Invent 2025 上,AWS 宣布下一代 Trainium 芯片支持 NVIDIA NVLink Fusion 高速互联。本次双方把合作再推进一步:

  • 亚马逊 Annapurna Labs 将支持英伟达新的定制高带宽内存 NVHBM(与内存供应商合作开发)
  • Trainium 由此可以获得更快、更省电的内存选项
  • Trainium 与 GPU 可以在同一机架级架构内协同,共享 scale-up 互联

对芯片行业来说,这是一个值得盯紧的信号:NVLink Fusion + NVHBM 意味着英伟达的互联与内存技术开始向竞品 ASIC「供货」。自研 ASIC 阵营(Trainium、TPU、MTIA)与英伟达 GPU 阵营的边界,正在从「二选一」变成「混布」。

四、10 万颗 GPU:美国政府主权 AI 工厂​

合作中专门划出一块公共部门业务:AWS 与英伟达将为美国政府建造 AI 工厂,在安全 AWS 基础设施上部署 10 万颗 GPU,承载联邦与国家安全负载(Impact Level 6 及以上),支持在强监管框架内开发先进 AI 模型。

主权 AI 从口号变成明确数字,是本轮周期的显著特征——政府客户正在成为 AI 算力的一等买家。

五、软件与物理 AI 同步深化​

硬件之外,软件层合作也在加码:

  • NVIDIA Nemotron 开源模型继续登陆 Amazon Bedrock 与 SageMaker
  • Amazon EMR 数据处理与 OpenSearch 向量索引用 cuDF / cuVS 加速
  • Amazon Robotics 正式采用 NVIDIA 物理 AI 平台(Jetson、Omniverse、Isaac),用于仓储自动化与下一代机器人

物理 AI(机器人、具身智能)正在成为云厂商算力叙事的新增长极,这与国内京东、特斯拉等把具身智能写进算力采购逻辑是同一趋势。

六、对算力买家的启示​

观察含义
需求「跑赢所有预测」供给紧张不是短期现象,2027-2028 的算力窗口现在就要锁定
三代架构混采Rubin/Rubin Ultra 量产爬坡期间,Blackwell Ultra 仍是交付主力,采购需要跨代规划
CPU 层被重估agentic AI 把瓶颈从 GPU 推向 CPU 编排与内存带宽,选型时别只盯加速卡
主权 AI 落地政府级订单入场,进一步收紧高端 GPU 的可分配供给

对自建与租用的决策者而言,云巨头的每一次天量加购都在重定价未来的租金曲线。如果你正在评估 GPU 采购或租用方案,建议用 TCO 计算器 做一次量化测算:输入芯片价格、功耗、利用率与租用单价,即可对比 3 年持有成本。

小结​

200 万颗 GPU、Vera CPU 上云、NVHBM 开放、10 万颗主权算力——AWS 与英伟达这轮扩盟把「AI 工厂」竞赛推进到全栈时代。算力的稀缺性在 2027 年之前大概率只紧不松,无论是买卡、租卡还是押注国产替代,尽早锁定供给与成本曲线,都是当前最确定的动作。

(本文数据均来自 AWS/NVIDIA 官方公告与双方高管公开表态;架构性能口径以厂商发布为准。)

Vera Rubin 全面量产:100% 全液冷 + 800V 直流供电,AI 数据中心基础设施范式重构

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月初,供应链信息确认:英伟达 Vera Rubin 平台已于 8 月正式量产、9 月启动批量出货,无延期、无卡顿。与 Blackwell 迭代初期的产能波折不同,这次量产节奏异常平稳——谷歌云、微软 Azure、CoreWeave、甲骨文云等头部云厂商已启动机架部署。但真正值得产业记住的,不是"又一代 GPU 量产了",而是 Rubin 把液冷从"可选配置"变成了"硬性前置条件"。


1. 量产节奏:史上最平稳的一次平台切换​

根据产业链调研与券商跟踪信息:

  • 2026 年 8 月:Vera Rubin 正式量产;
  • 2026 年 9 月:批量出货启动;
  • 2026 下半年:CoreWeave、谷歌云、微软 Azure、甲骨文云机架部署落地;
  • 2026 年:上代 GB 架构机柜出货量有望达 6 万台(同比翻倍);
  • 2027 年:GB 与 Rubin 两代平台合计出货体量有望接近 10 万台,Rubin 新机柜远期产能目标为每天 1000 个 NVL72 机柜。

需求侧同样在加码:华尔街报告披露,英伟达管理层表示 FY28 同比增长 70% 的目标并非需求上限——若供应不受限,增速可能超过 100%。当前主要约束已从需求端转向先进晶圆与 HBM 供应。

2. 单卡 2300W:风冷时代的终结​

Rubin 平台与前代最根本的差异不在算力,而在功耗密度:

指标H100GB300Rubin
单 GPU TDP700W~1400W2300W
机柜功耗~40kW~140kW190–230kW
散热方案风冷为主风液混合100% 全液冷
供电架构48V48V800V 高压直流

单芯片 TDP 从 700W 升至 2300W、单机柜功率密度突破风冷物理极限——这意味着 液冷不再是高端算力的选配升级,而是运行 Rubin 服务器的先决条件。英伟达官方将 Rubin 全液冷架构定义为"数据中心历史上最重要的能效突破之一",并已写入 DSX AI 工厂参考设计:所有跟随英伟达技术路线的云厂商和数据中心运营商,都必须采用全面液冷方案。

三个关键架构变化:

  1. 无风扇整机:GPU、CPU、交换机、DPU 全部器件强制采用直接冷板式液冷,45℃ 温水冷板成为出厂标配;
  2. 液冷边界延伸:散热覆盖范围从 GPU 冷板延伸至 CPU、DPU、交换机乃至光模块(液冷 Cage/鼠笼开始从"可选"变"刚需"),整套液冷系统价值量较 GB300 提升约 40%;
  3. 800VDC 供电:替代传统 48V 机架配电,整机电源 BOM 价值增长 30% 以上,PSU 电源模块从 5.5kW 向 18.3kW 迭代,固态变压器、高压直流 CDU 成为数据中心新增核心设备。

3. 对产业链的三重传导​

第一重:液冷从"配套"变"主角"。 2026 下半年以小规模部署验证为主,真正的放量窗口在 2027 年——Rubin 机架大规模铺货后,冷板、快速接头、CDU、液冷泵进入业绩兑现期。台系供应链 7 月数据已率先验证:AVC 奇鋐 7 月营收 185.9 亿新台币创历史新高(同比 +57.4%),双鸿、健策 7 月同比分别 +116.7%、+91.0%。

第二重:国产液冷供应链进入核心 BOM。 国内厂商由外围冷源和代工环节逐步进入芯片平台、服务器 ODM 和海外云厂商供应体系,替代路径从 Manifold、管路推进至高可靠快接头和冷板。英维克 26H1 海外收入占比 71.4%,飞龙股份液冷泵小功率平台订单超 5 万台——液冷全核心零部件自主可控正在成为现实。

第三重:供电与散热边界融合。 800VDC 架构下,电源模块、PDB 配电单元、高速交换芯片自身发热也达到很高水平,部分电源组件同样需要液冷辅助散热——电源与温控两条产业链正在合并成一条。

4. 需求矩阵扩容:云厂商之外,太空算力入场​

Rubin 的客户矩阵已从传统云厂商扩展至三个层次:

  • 全球云厂商:谷歌云、Azure、甲骨文云、CoreWeave;
  • AI 科技巨头:马斯克公开披露 2027 年 8GW 超大规模 IDC 建设规划;SpaceX 将 Vera Rubin 架构定义为"最优 AI 计算架构",计划地面与太空双向部署,支撑 "Starmind" 卫星算力项目;
  • 主权与边缘:远期 Rubin Ultra 及 2027 年后更高功耗机型单机柜有望冲击 600kW+。

普华永道预计全球数据中心累计投资到 2035 年将达 31.6 万亿美元。AI 基础设施建设的确定性,已经从"是否建设"变成"多快建设"。

5. 对采购方的启示​

  • 机房规划前置:2027 年起采购 Rubin 级算力,液冷改造(单千瓦改造成本较高)或按全液冷标准新建,必须在预算周期一开始就纳入;
  • 看 PUE 也看水温:45℃ 温水直冷允许更高进水温度,可利用自然冷源压低 PUE——选址时人工冷源依赖度成为新的评估维度;
  • 供应商组合即风险对冲:HBM 与先进封装供应是当前核心瓶颈(详见本站 HBM4 竞速分析),供应链多元化比单点性能更重要。

相关链接​

参考资料​


本文基于 2026 年 9 月初供应链调研、券商研报与英伟达官方披露整理。出货量与功耗数据为产业链预估口径,实际以英伟达及客户正式披露为准。

Hot Chips 2026 全景总结:Rubin、MI455X、Crescent Island 同台,AI 算力交付进入"系统级"时代

· 阅读需 8 分钟
Industry Research Team

2026年8月23日至25日,第38届 Hot Chips(HC38)在斯坦福纪念礼堂举行。作为全球高性能芯片架构的风向标,本届大会恰好撞上 AI 算力军备竞赛最焦灼的时刻——官方议程共 48 个条目,其中 AI 加速器 7 个、存储教程 6 个、CPU 6 个、GPU 与网络各 4 个。如果把各家演讲摆在一起,一个共识浮出水面:AI 算力的竞争单位,已经从"单颗芯片"变成了"整机柜 / 整个系统"。


1. 概览:三天议程,几乎就是 2027 年 AI 机柜市场的预演​

周一(8/24)下午的 GPU 专场是全场焦点,四家演讲几乎是 2027 年 AI 机架市场的对撞:

  • NVIDIA Rubin GPU("Driving the Era of Agentic AI"):首个 chiplet 架构 GPU,288GB HBM4、FP4 约 50 PFLOPS,搭配 88 核 Arm 架构 Vera CPU 组成 NVL72 / NVL144 机柜,2026 下半年量产。
  • AMD Instinct MI400 连讲两场(架构 + 系统架构):把"机架级"故事讲透。
  • Intel Crescent Island:专为 Agentic AI 推理设计的 350W 风冷卡。

周二(8/25)下午的 AI 专场,则几乎是"超算厂商去 NVIDIA 化"的阅兵式:Google 第八代 TPU、OpenAI 首颗自研芯片、微软 Maia 200、Meta MTIA、Cerebras 晶圆级机架同台。

每一个登台厂商,都在开场两页 PPT 内用到了 "Agentic AI"(智能体 AI)这个词——这不是巧合,而是 2026 年 AI 负载设计目标的集体转向。


2. NVIDIA Rubin:一个机柜,就是一台超级计算机​

英伟达在 Hot Chips 上主讲的不是单颗 GPU,而是 Vera Rubin NVL72 整机柜——72 颗 Rubin GPU + 36 颗 Vera CPU,18 个计算托盘 + 9 个 NVLink 交换托盘,约 130 万颗组件、近 1300 颗芯片,整柜重约 4000 磅(约 1.8 吨)。

单颗 Rubin GPU 的规格同样惊人:

指标Rubin GPU对比 Blackwell
晶体管3360 亿(TSMC 3nm 双 die)2080 亿(+61.5%)
显存288GB HBM4—
带宽22 TB/sBlackwell 的 2.8 倍
NVFP4 推理50 PFLOPSGB200 的 5 倍
训练算力35 PFLOPS3.5 倍

最颠覆性的设计在计算托盘:无电缆、无软管、无风扇,全部通过 PCB 背板互联。英伟达称组装时间从近 2 小时压缩到 5 分钟(快 20 倍),同时提升可维护性。

英伟达这次卖的不是 FLOPS,而是 tokens per megawatt(每兆瓦 token 数)。 其引用 SemiAnalysis 基于 DeepSeek-v4-PRO(140K+ 上下文、AgentX 负载)的基准称:Vera Rubin NVL72 在交互强度上升时,较 GB300 NVL72 提供 10× 至最高 30× 的 tokens/MW。单柜提供 3.6 EFLOPS 推理算力,整柜功耗 190–230kW;远期产能目标为 每天 1000 个 NVL72 机柜。


3. AMD MI455X + Helios:显存反超与开放互联​

AMD 的答案是与英伟达正面硬刚的 MI455X + Helios 机架。MI455X 采用 CDNA 5 架构,8 个 N2 制程加速器 die + N3P 制程互联 die,256 个工作组处理器、192MB 全局 L2。

指标MI455X对比 Rubin
显存432GB HBM4(12 层堆叠)比 Rubin 288GB 高 50%
带宽23.3 TB/s略胜一筹
MXFP4 算力40.26 PFLOPS—
系统(Helios 72 卡)FP4 推理 2.9 ExaFLOPS—
报价约 525 万美元/柜—

系统层面,AMD 押注 UALoE(以太网上的超加速器互联) 开放标准:每颗 GPU 提供 3.6 TB/s 双向互联带宽,交换托盘内两颗 512 端口 200G UALoE 交换芯片合计 10.8 TB/s——对标 NVLink 的同时把互联协议开放给整个产业。

量产节奏:AMD 计划 2026 下半年交付工程样品与小批量系统,2027 年 Q2 大规模放量。此前市场曾传出 Helios 因散热问题延期,AMD 官方未予确认。


4. Intel Crescent Island:风冷大显存的"性价比异类"​

英特尔给出一条完全不同的路:Crescent Island——一颗 350W、风冷、标准 PCIe 槽位的推理 GPU,专为 Agentic AI 设计,核心指标是 tokens per watt。

指标Crescent Island说明
架构Xe3P,32 个 Xe 核心,32MB 统一 L2Hot Chips 披露
内存Intel 自牌卡 160GB / ODM 最高 480GB LPDDR5X比 Rubin 288GB HBM4 还多
形态350W 风冷 PCIe直插标准机架,免液冷改造
RASECC、动态页离线、硬封装修复、PCIe 高级错误上报回应"静默数据损坏"

英特尔的逻辑很清晰:推理场景对显存容量的需求远大于带宽,用低成本 LPDDR5X 堆容量、用风冷省掉液冷基础设施,就能把单位 token 成本打下来。配合 Diamond Rapids 至强(256 性能核、1.28GB 缓存、128 条 PCIe Gen6),英特尔试图用"CPU + 推理 GPU + 开放软件栈"从边缘到数据中心全场景围堵。


5. 自研 ASIC 大集结:Google、OpenAI、微软、Meta 同台​

周二下午的 AI 专场,是本届最有历史意义的一场——"超算厂商去 NVIDIA 化"的阅兵:

芯片厂商 / 合作定位关键规格 / 进度
TPU 8t(Sunfish)Google × Broadcom训练单 pod 9600 卡、121 FP4 ExaFLOPS、2PB 共享 HBM
TPU 8i(Zebrafish)Google × MediaTek推理288GB HBM、384MB 片上 SRAM(3× 上代)、ICI 19.2 Tb/s
JalapeñoOpenAI × Broadcom推理9 个月端到端设计,目标 token 成本降 ~50%,2026 底商用
Maia 200微软(TSMC 3nm)推理1400 亿+ 晶体管、10+ PFLOPS FP4、216GB HBM3E,已在得梅因数据中心服务 GPT-5.2
MTIA 300–500Meta(RISC-V)× Broadcom训推双使命最高 25× 算力增益,2027 前每 6 个月一款

Google 首次将 TPU 拆分为训练(8t)与推理(8i)两款专用架构,是其十年来最大的架构转向。Norm Jouppi 亲自登台主讲 TPU v8。


6. 存储与网络两条暗线:HBM4 元年 + AI 工厂操作系统​

除 GPU/ASIC 外,两场暗线同样关键:

  • 存储:三星 HBM Base Die(逻辑工艺做基础裸片)与 SK 海力士先进封装同台,HBM4 时代"基础裸片代工化"产业变局开启;HBF(高带宽闪存)、LPDDR5X-PIM、3D DRAM、CXL 计算存储集中展示"存算一体"从论文走向产品。
  • 网络:NVIDIA BlueField-4(DPU)与 Spectrum-X Multiplane 架构(Gilad Shainer 主讲)——网络正成为 gigascale AI 的决定性架构,规模从数十万卡向百万卡迈进;博通 Thor Ultra 以太网 NIC 持续进逼;Mojo Vision 展示芯片级光 I/O。

7. 三条路线,一个共识​

同一场大会上,三家给出了三种截然不同的 AI 算力交付哲学:

  1. 英伟达:全栈封闭整合——GPU、CPU、DPU、交换芯片全部自研,用极致软硬件协同把系统性能推到极致,代价是客户被深度绑定。
  2. AMD:开放标准追赶——用更大 HBM4 容量 + UALoE 开放互联打"性价比 + 开放"牌,配合 Meta、OpenAI 的 12GW 级订单撕开推理缺口。
  3. 英特尔:风冷性价比——放弃液冷、放弃 HBM,用 LPDDR5X 大显存 + 标准 PCIe 切入,赌"大多数推理不需要 200kW 机柜"。

但三家的共同结论是:竞争的单位不再是芯片,而是协同设计的系统(rack / system)。对采购方而言,2027 年的算力规划,要比对的不是"单卡 PFLOPS",而是"每兆瓦 token 数、时延、可用性与全周期成本"。

相关链接​

参考资料​


本文基于 Hot Chips 2026(8月23-25日)官方演讲与 ServeTheHome、SemiAnalysis、TechPowerUp 等现场报道整理。性能数据均为厂商公布口径,实际表现以量产产品为准。

HBM4 量产元年:三星良率突破80%、三巨头齐过英伟达认证,AI 算力供给的最后一道瓶颈

· 阅读需 6 分钟
Industry Research Team

如果说 2025 年是 HBM3E 的产能爬坡年,那么 2026 年就是 HBM4 的量产元年。NVIDIA Vera Rubin 与 AMD MI400 两代旗舰同时押注 HBM4,让这块"AI 芯片上的内存"第一次成为决定整机柜交付节奏的战略物资。而 8 月密集披露的良率与认证数据,正在重写全球 HBM 供应版图。


1. 黄金良率突破:三星六个月从不足六成冲上 80%​

据韩国《首尔经济日报》8 月 9 日披露,三星电子 HBM4 良率已于 8 月初正式跨过 80% 的"黄金良率"门槛——较其原定年底达成的目标提前了四个多月。

时间节点三星 HBM4 良率备注
2026 年 2 月(量产启动)不足 60%产线爬坡期
2026 年 8 月初约 80%跨过规模量产 / 稳定盈利分水岭

半导体行业素有"80% 良率为黄金良率"之说——它既是晶圆厂竞争力的标尺,也被视为大规模商业化供给的财务转正点。推动这一跃迁的关键,是三星在 热压非导电薄膜(TC-NCF)键合工艺 上的突破,以及底层 1c DRAM 良率早已站上 80% 所提供的稳定基底。同期,三星 HBM4E 可靠性测试良率也已突破 70%。

业界评估,SK 海力士的 HBM4 良率同样迈入 80% 区间。两大巨头在量产品质上的差距正被快速抹平。


2. 供应版图:SK 海力士握有 Rubin 六至七成分配​

黄仁勋 6 月 5 日在首尔公开确认:三星、SK 海力士、美光三家均已通过 Vera Rubin 的 HBM4 认证——这是三大存储厂首次同时获得同一平台的公开认证。

但认证只是"进门券",分配份额才是话语权:

厂商2026 年 Rubin HBM4 分配(估算)备注
SK 海力士60%–70%凭借 HBM3/3E 世代积累的客户关系与 MR-MUF 封装工艺
三星25%–30%良率跃迁后份额快速提升
美光剩余部分HBM4 曝光有限,份额相对稳定

Counterpoint Research 预测 2026 年 HBM4 市场格局为 SK 海力士 54% / 三星 28% / 美光 18%。三星已设定阶梯式追赶目标:Q3 HBM4 营收环比三倍增长、下半年 HBM4 占 HBM 总营收超 60%、年底 HBM 整体市占率向 38% 靠拢。


3. 真正的瓶颈:从晶圆转向"后端堆叠"​

随着前端良率企稳,AI 加速器供应链的节奏,不再取决于"能产多少晶圆",而取决于后端堆叠、键合、测试、出货的速度。

  • 行业分析师将 HBM 堆叠列为 AI 芯片供应链第二严重的瓶颈,仅次于 TSMC 的 CoWoS 先进封装产能。
  • HBM 占 2026 年 DRAM 晶圆产量的约 25%;每片 HBM 晶圆消耗约 3–4 倍于普通 DRAM 晶圆的资源(额外 TSV 与堆叠步骤),每redirect一片晶圆就等于从现货市场抽走 3–4 单位商品内存。
  • 三星正考虑将部分传统内存后端产线(天安、温阳)迁往越南以释放 HBM 后端产能——侧面印证后端吞吐已是整条链最紧的环节。

4. HBM4 规格速览:带宽与能效的代际跃迁​

规格HBM4(12-Hi / 16-Hi)HBM4E
单栈容量36 GB / 48 GB—
引脚速率11.7–13.0 Gbps16 Gbps
单栈带宽最高 3.3 TB/s最高 3.6 TB/s
总线位宽2048-bit—
能效较 HBM3E 提升 40%—
热阻 / 散热改善 10% / 提升 30%—

三星 HBM4 于 2026 年 2 月量产,11.7 Gbps 的引脚速率已超出 Vera Rubin 兼容所需的 8 Gbps 行业基线;HBM4E 样品则于 5 月 29 日率先发往主要客户。


5. 价格权力延续至 2027:供给仍将是紧平衡​

TrendForce 判断,HBM 供应商的定价权将贯穿 2027 年,原因是供给持续受限:

  • 2027 年 HBM bit 出货量预计年增 50%–60%,但仍跟不上需求增速,市场维持紧缺;
  • 行业已预期显著涨价;
  • 对 NVIDIA 与 AMD 而言,一个更强的三星意味着更多供货选择与更从容的交期——在内存成为 AI 服务器最紧一环的市场里,第二、第三供应商的存在本身就是缓冲。

对整机柜而言,HBM 成本已是最大推手:Rubin Ultra 机柜预估售价高达 2100 万美元,HBM 占其中相当比重。


6. 对中国的启示:HBM 出口管制加速国产迭代​

HBM 是当前 AI 芯片管制的核心环节之一。在海外 HBM4 军备竞赛白热化的同时,国产 HBM 技术迭代被同步推快——华为昇腾路线图已明确将"推动国产 HBM 技术迭代"写入产品节奏(950 系列推进国产 HBM 配套,960/970 系列规划于 2027–2028 年陆续推出)。

短期看,HBM4 的紧缺会直接传导到 Rubin / MI400 的交付节奏;长期看,谁能锁定稳定的 HBM4 供给,谁就握住了 2027 年 AI 算力扩张的阀门。

相关链接​

参考资料​


本文基于 TrendForce、Seoul Economic Daily、TechTimes 等 2026 年 8 月公开报道整理。HBM 分配份额与市占率为第三方机构估算,非厂商官方确认数据。

NVIDIA Vera Rubin正式出货:首台VR200 NVL72交付,三星HBM4量产,Rubin Ultra机柜天价

· 阅读需 5 分钟
Industry Research Team

2026年7月,NVIDIA 下一代 AI 计算平台 Vera Rubin 正式启动首批出货,接替 Blackwell 架构,并计划在 2026 年下半年进入大规模量产。首批客户包括微软、谷歌、亚马逊、Meta、Oracle 等大型云服务商。

1. 全球首台 VR200 NVL72 交付(里程碑)​

CoreWeave 联合 Dell 宣布,全球首台 NVIDIA Vera Rubin VR200 NVL72 机柜已正式交付,并一次性通过 L11 全机柜级硬件诊断测试。这标志着 Rubin 从路线图走向实物,供应链核心环节(HBM4、先进封装、液冷、超高功率电源)未出现重大卡点。

VR200 NVL72 核心配置​

指标Vera Rubin VR200 NVL72
机柜代号Oberon
GPU72 块 Rubin GPU
CPU36 颗 Vera CPU
单 GPU 显存288 GB HBM4
单 CPU 内存1.5 TB LPDDR5X
整柜 HBM420.7 TB(20,736 GB)
整柜 LPDDR5X54 TB
互联NVLink 6 全互联
推理性能~3.6 exaFLOPS 级别
散热液冷
代际提升单 GPU 计算约 3.5×、内存带宽约 2.8×(对比 Blackwell)

Vera CPU 集成 88 个定制 Olympus ARM 核心,与 GPU 间互联带宽 1.8 TB/s,可作为 GPU 显存扩展池。NVIDIA 已于 5 月完成对 Anthropic、OpenAI、xAI 及 Oracle Cloud 的首批 Vera CPU 交付。

2. 三星 HBM4 量产:关键瓶颈松动​

2026年7月8日,三星电子正式启动面向 Vera Rubin 平台的 HBM4 量产,据报道其 HBM4 量产良率达到 70%(超出 60–65% 的初始预期)。这一关键供应链环节的确认,为 Rubin 大规模部署扫清障碍。

HBM 供应格局(2026 Q1)份额
SK 海力士45%
三星40%
美光15%

HBM4 采用 8 层堆叠(12 层设计计划 2028 年),价格约为 HBM3e 的 2.8 倍。TrendForce 预测 HBM 供给将年增 65%,到 2027 Q4 HBM4 占总产出的 35%。

3. Rubin Ultra 天价:HBM 成本主导​

据美国银行全球研究(BofA Global Research)测算,Rubin 一代将把单台服务器成本推向历史新高:

成本项Rubin VR200(Oberon)对比
单柜 HBM4 用量20,736 GB—
HBM4 单价~$18.40 / GBBlackwell(HBM3e)~$11.26 / GB
仅 HBM4 成本~$38.2 万尚未计入 LPDDR5X
Rubin Ultra 机柜预估售价~$2,100 万IT 之家 / BofA 估算

4. Rubin Ultra 设计调整:原 4 芯片方案取消(据 SemiAnalysis)​

半导体研究机构 SemiAnalysis(2026-06-30) 披露,GTC 2026 发布的原版 4 芯片 Rubin Ultra GPU 已被取消,2027 年实际出货的版本规模与性能均缩减约一半:

  • 取消原因:原版在单一 CoWoS-L 封装内集成 4 颗计算 die + 16 颗 HBM4E,基板在 4 die 配置下出现翘曲(warpage),导致计算 die 与基板接触失效、良率崩塌;替代方案 CoPoS 量产要等到 2028 年底以后,赶不上 2027 节点。
  • 新方案:改为 双 die(与标准 Rubin 同构)+ HBM4E,单 GPU 约 384 GB HBM4E(高于标准 Rubin 的 288 GB),但总算力与带宽仅为原版一半;为逼近原设计的聚合算力,NVIDIA 预计在 Kyber 机架内以"2+2"板级配置 拼出四 die 等效规模。
  • Kyber 机架延迟:配套 Kyber NVL144 机架因中板 PCB 制造难题推迟 12 个月以上至 2028 年,800V 直流供电方案同样推迟至 2028 年。

⚠️ 口径提示:NVIDIA 未就上述设计调整发表官方评论;X 平台亦有声音认为"芯片数量并未改变、属旧闻翻炒"。本段基于 SemiAnalysis 公开报告整理,最终以 NVIDIA 官方披露为准。我们已在 Rubin Ultra 预览卡 中标注"规格待官方确认"。

产业解读​

  1. "Never doubt"时刻兑现:Rubin 首发交付一次性通过 L11,打消了市场对"Rubin 延期"的疑虑,2026 H2 AI 算力供应确定性提前锁定。
  2. 专为 Agentic AI 设计:Rubin 面向智能体工作流、超长上下文推理,将进一步压低万亿参数模型的训练/推理成本曲线。
  3. HBM 是全链条赢家:单机柜 20.7 TB HBM4 用量巨大,SK 海力士、三星、美光及先进封装(CoWoS-L)、液冷、电力改造全链条受益,同时也成为成本与产能的最大约束。

相关链接​

参考资料​


本文持续跟踪 Vera Rubin 量产爬坡与 HBM4 供应链动态。

2026年H1 AI芯片行业复盘:Blackwell Ultra、国产三强与推理新时代

· 阅读需 12 分钟
Industry Research Team

2026年上半年,AI芯片产业发生了历史性转折——产业重心从"训练竞赛"转向"推理效率",国产芯片市场份额首次突破40%,NVIDIA以Blackwell Ultra筑高壁垒,推理专用芯片赛道百花齐放。


一、算力再翻番:NVIDIA Blackwell Ultra 发布(6月1日)​

2026年6月1日,NVIDIA CEO黄仁勋在**台北国际电脑展(Computex 2026)**上揭晓新一代AI芯片 Blackwell Ultra,为未来两年的AI基础设施竞赛划定新起跑线。

关键规格​

指标Blackwell UltraB200提升
FP8算力20 petaFLOPS~10 petaFLOPS100%
架构Blackwell UltraBlackwell升级
预计交付2027年Q12026年Q1—
定位超大规模训练+推理训练+推理旗舰

产业意义​

  1. 算力翻倍的直接影响:20 petaFLOPS FP8意味着千亿参数模型训练时间大幅缩短,万亿参数模型训练从"科学实验"走向"工程常态"
  2. 系统级平衡:Blackwell Ultra不仅是芯片,更是NVLink、HBM、散热、供电的系统级工程突破
  3. 路线图确定性:2027年Q1交付时间表,让云厂商和AI实验室可以提前18个月规划基础设施预算

挑战​

  • 能耗危机:性能翻倍伴随功耗大幅上升,数据中心供电和冷却设计面临极限挑战
  • 可及性问题:顶级算力优先供应顶级云厂商,中小开发者和研究机构如何通过云服务以合理成本触达算力
  • 软件栈适配:新硬件需要匹配的CUDA版本和框架支持,软件生态成熟度成为算力转化的关键瓶颈

二、国产AI芯片:从"可用"到"好用"的临界点​

2026年6月16日,信创世界发布**《2026中国国产AI芯片厂商能力象限》**,清晰勾勒出国产AI芯片的整体格局。

2.1 能力象限排名​

象限代表厂商
领导者象限华为昇腾、海光信息、寒武纪、阿里平头哥、摩尔线程
远见者象限百度昆仑芯、壁仞科技、燧原科技、沐曦股份、瀚博半导体
竞争者象限清微智能、黑芝麻智能、芯驰科技、砺算科技、后摩智能
挑战者象限登临科技、知存科技、芯原股份、瑞芯微、云天励飞

2.2 华为昇腾:国产算力的定海神针​

市场地位​

  • 2025年昇腾系列出货 81.2万张,占国产AI加速卡 49% 份额,稳居国产第一
  • 昇腾950PR单卡FP8算力达 1P(PetaFLOPS)、FP4算力达 2P
  • 推理性能约为NVIDIA H20的 2.87倍,定价仅 7.2-7.5万元,性价比优势显著

全栈优势​

华为"端管云芯"一体化战略是昇腾的核心壁垒:

  • 芯片设计:Da Vinci 3.0架构持续迭代
  • 操作系统:鸿蒙/欧拉OS深度优化
  • 网络通信:欧拉网络协议栈
  • 云服务:华为云ModelArts平台无缝集成

最新进展​

  • 2026年6月5日,深圳河套学院联合哈工大(深圳)、华为团队,依托昇腾910C集群完成 1.6万亿参数DeepSeek V4 Pro大模型全参数后训练
  • 这是国产AI芯片首次完成万亿参数级大模型训练,标志着"国产替代"从推理迈向训练

2.3 寒武纪:率先盈利的国产AI芯片标杆​

业绩爆发​

指标2025年全年2026年Q1同比增长
营收64.97亿元28.85亿元+453% / +160%
净利润20.59亿元(首次年度盈利)10.13亿元— / +185%

核心产品:思元590​

  • 在DeepSeek R1推理场景下,TPS可达 942,比H20高出约 50%
  • 与字节跳动多年联合优化,具备短期最强的云端推理部署能力
  • 2026年Q1营收28.85亿元中,思元590贡献超过70%

潜在风险​

在2026年第2号《安全可靠测评结果公告》中缺席,原因尚未明确,将对其国内政企市场表现产生影响。

2.4 清微智能:可重构芯片的"第三路线"​

技术路线​

清微智能采用与Groq LPU同源的可重构数据流架构,在GPU通用性与ASIC极致效率之间找到了平衡点。

指标清微智能 TX81传统GPU方案优势
推理成本基准+100%降低50%
能效比基准基准提升3倍
架构可重构数据流SIMT/SIMD更适合推理

落地进展​

  • 可重构芯片累计出货量已超 3000万颗
  • 在全国十余座千卡规模智算中心实现规模化落地
  • 已启动A股IPO辅导,有望成为"可重构芯片第一股"

三、推理芯片赛道:产业重心转移的核心信号​

2026年6月4日,TrendForce发布深度报告**《推理经济时代来临:AI芯片的规则正被重写》,指出AI产业的算力竞争重心正在从训练转向推理**。

3.1 为什么是现在?​

成本结构改变​

  • 训练是一次性成本:模型训练完成后,边际成本趋近于零
  • 推理是持续性成本:每一次API调用、每一个生成token,都代表算力消耗与毛利压力
  • 单位推理成本与能效表现将直接影响毛利率与规模扩张能力

模型精简技术成熟​

  • 1.58-bit量化技术与权重剪枝,使模型可在极低内存占用下维持推理准确度
  • MoE(混合专家)架构通过"部分唤醒"机制,每次推理仅激活少数专家子网络,大幅降低实际运算量
  • 精简模型的崛起,为硬式编码推理芯片提供了商业可行性

3.2 NVIDIA的百亿押注:收购Groq(2025年12月)​

2025年12月24日,NVIDIA以 200亿美元取得Groq的Inference技术授权与核心团队,这是NVIDIA历史上最大规模的并购/技术收购之一。

战略意图:

  1. 补全推理短板:NVIDIA GPU在训练领域无可撼动,但推理效率一直不是最强
  2. 对抗专用推理芯片:Cerebras、Taalas、SambaNova等初创公司正在蚕食推理市场
  3. 布局Agentic AI:Agentic AI需要极低延迟、极高吞吐的推理能力

3.3 Taalas HC1:硬式编码推理的概念验证​

2026年2月20日,加拿大AI芯片初创公司Taalas发布推理芯片 Taalas HC1,将Meta的开源AI模型Llama 3.1 8B直接刻印在芯片中。

关键指标​

指标Taalas HC1NVIDIA B200(throughput optimized)优势
推理速率16,960 tokens/s/user基准~4-5x
每百万tokens成本0.75 cents3.79 cents降低80%
功耗~250W~700W降低64%
制程TSMC N6TSMC 4nm更成熟
HBM❌ 不使用✅ HBM3e成本更低

技术原理​

Taalas HC1采用**存储内运算(Computing-in-Memory, CIM)**的激进实现:

  • 将模型权重直接固化于Mask ROM中(完全硬体定义)
  • 以片上SRAM处理动态资料(KV cache和LoRA微调权重)
  • 仅需修改2层光罩就能产出另一个AI模型的专用芯片,将一个AI模型转化为实体芯片仅需2个月

局限性​

  • 缺乏弹性:硬式编码无法应对快速迭代的模型更新
  • 生态壁垒:当前云端市场仍依赖通用平台,客户可能更偏好可随模型升级的弹性方案
  • NRE成本:一次性工程费用高,需要足够大规模的部署才能摊薄

3.4 Cerebras:晶圆级整合的上市之路​

2026年5月14日,Cerebras Systems正式在纳斯达克挂牌上市,成为首家上市的晶圆级AI芯片公司。

核心技术:Wafer-Scale Integration(WSI)​

  • WSE-3(第三代晶圆级引擎):整片12英寸晶圆做成单一芯片
  • 44GB片上SRAM:无需外部HBM,彻底消除内存带宽瓶颈
  • 21 PB/s带宽:片上通信带宽,是GPU的千倍级别
  • 与OpenAI合作:已签署逾200亿美元、规模750MW的三年算力合作协议

上市意义​

Cerebras的上市是推理专用芯片赛道成熟的标志:

  1. 资本市场开始为这类公司定价
  2. 证明"非GPU"技术路线具备商业可行性
  3. 为其他推理芯片初创公司(Groq、SambaNova、Taalas等)提供了估值参照

3.5 推理芯片格局:多元技术路线并存​

公司技术路线核心优势代表产品
Taalas硬式编码(Mask ROM)极致推理效率、低成本HC1
Cerebras晶圆级整合(WSI)超高带宽、大模型推理WSE-3
GroqSRAM-first架构确定性延迟、高吞吐LPU(已被NVIDIA收购)
d-Matrix数字存储内运算(DIMC)灵活性强于硬式编码Corsair
EtchedHard-wired Transformer所有Transformer模型适用Sohu
Axelera AI数字存储内运算(D-IMC)+ RISC-V高能效比Metis AIPU

TrendForce预测:

  • 通用GPU仍主导训练与多模型环境
  • 但在成熟、可预测场景中,通用GPU的利润空间将受到压缩
  • 产业格局从通用算力垄断,走向通用与专用并行的双轨结构

四、2026年H1国产AI芯片整体格局​

4.1 行业进入放量期​

指标2025年2026年Q1趋势
国产AI加速卡出货量165万张(占比41%)—持续上升
中国AI加速卡总出货量~400万张——
海光信息营收增速—翻倍增长↑
寒武纪营收增速—+160%↑
摩尔线程营收增速—翻倍增长↑

头部厂商集体进入业绩兑现通道,行业从"技术验证"迈向"规模商用"。

4.2 三大核心发展趋势​

趋势一:资本化浪潮重塑格局​

  • 2025年底至2026年初,摩尔线程、沐曦股份登陆科创板
  • 壁仞科技登陆港股
  • 燧原科技科创板IPO获受理
  • 昆仑芯、平头哥启动上市进程
  • 清微智能、瀚博半导体等推进IPO

资本化带来双重效应:

  • ✅ 正面:为研发和生态建设提供支撑
  • ⚠️ 负面:估值泡沫和业绩兑现压力

趋势二:产能成为最大制约变量​

国产AI芯片爆发式需求与有限先进制程产能的矛盾日益尖锐:

厂商先进制程产能需求实际获得
华为昇腾每月1.5万片(7nm级)优先保障
中芯国际总产能每月约2万片(7nm级)—
其他厂商合计约5000片/月极度紧张

能否拿到稳定晶圆产能直接决定厂商生死。寒武纪75.4%的营收占比存货,本质是对产能的锁定。

趋势三:竞争从"可用"转向"好用"​

早期竞争聚焦"能否跑通模型",当前升级为"运行效率、部署成本"的比拼:

竞争维度"可用"时代"好用"时代
硬件性能能否跑通模型运行效率、能效比
软件栈基本适配成熟度、框架广度
生态有无开发者社区活跃度
部署成本不敏感核心竞争要素

五、2026年H2展望​

5.1 即将到来的关键事件​

时间事件影响
2026年Q3NVIDIA Rubin架构详情公布下一代旗舰规格揭晓
2026年Q3华为昇腾950PR/950DT正式发布国产推理芯片新标杆
2026年Q4AMD MI350X规模化交付NVIDIA Blackwell竞品
2026年Q4寒武纪思元690发布(推测)新一代训练芯片
2027年Q1NVIDIA Blackwell Ultra交付算力新标杆落地

5.2 未来三年关键竞争要素​

  1. 晶圆产能获取能力:先进制程产能是稀缺资源,绑定中芯国际、TSMC的厂商具备先天优势
  2. 资本运作效率:IPO窗口期有限,能否在资本市场上融到足够资金决定研发持续性
  3. 软件生态建设深度:硬件性能只是入场券,软件栈成熟度、框架适配广度、开发者社区活跃度才是核心壁垒

六、结语:多元生态终将形成​

2026年H1,AI芯片产业正在经历从"一家独大"到"多元并存"的历史性转变。

  • NVIDIA以Blackwell Ultra筑高训练壁垒,同时以收购Groq布局推理效率
  • 华为昇腾以全栈能力守住国产算力的基本盘,950PR在推理性能上开始超越H20
  • 寒武纪以率先盈利证明国产AI芯片的商业化可行性,思元590在特定场景超越国际竞品
  • Cerebras、Taalas等推理专用芯片公司开辟了"非GPU"的第三路线
  • 清微智能的可重构架构为中国AI芯片提供了技术路线的多元化选择

未来三年,国产AI芯片终局将形成GPU、ASIC、可重构计算三大技术路线并存,云端与边缘协同发展的多元生态。"国产替代"不再是口号,而是正在发生的产业现实。


数据来源:

  • 信创世界《2026中国国产AI芯片厂商能力象限》(2026-06-16)
  • TrendForce《推理经济时代来临:AI芯片的规则正被重写》(2026-06-04)
  • RayByte《算力再翻番!英伟达Blackwell Ultra芯片发布》(2026-06-02)
  • 各公司官方财报和公告

相关阅读: