跳到主要内容

6 篇博文 含有标签「HBM4」

HBM4 high bandwidth memory

查看所有标签

AI 算力周报(9.1-9.5):DeepSeek 订 16 万颗昇腾 950DT、英伟达 129 亿美元收购 Hugging Face、Rubin Ultra 显存减配

· 阅读需 9 分钟
Industry Research Team

本周(2026 年 9 月 1 日–5 日)AI 算力行业的题眼,是两条相反方向的成本重构:海外,英伟达以史上最大并购吞下开发者生态入口,同时给旗舰减配显存——"内存太贵"倒逼硬件从单卡堆料走向系统级互联;国内,DeepSeek 16 万颗昇腾订单把"国产替代"从口号变成头部实验室的资产负债表决策,字节近 300 亿美元融资为算力扩张装上杠杆。


1. DeepSeek 拟购 16 万颗昇腾 950DT:国产算力的"标志性订单"​

彭博社 9 月 4 日报道,DeepSeek 计划在内蒙古乌兰察布新建的约 1GW 数据中心部署至少 16 万颗华为昇腾 950DT,主要用于推理而非训练。按每颗约 11.1 万元的市场价估算,订单总额约 178 亿元人民币(约 25.6 亿美元)——这是迄今已知规模最大的昇腾集群,是半年前深圳首个万卡级集群的 16 倍。

三个关键读数:

  • 主动选择,而非被迫替代:DeepSeek 是公认最会"榨干"算力的实验室。创始人梁文锋 7 月曾直言:华为超节点能完成 GB300 的任务、延迟没有明显差别,但约需 4 颗昇腾才抵 1 颗英伟达、技术上落后约两年。选择昇腾跑推理,是在综合成本、供应链安全与本土化后的理性决策——推理对软件生态依赖较浅,正是国产芯片的突破口;
  • 瓶颈在供给端:受高端内存(HBM)短缺制约,昇腾 950DT 今年产量仅数十万颗(2026 年全部昇腾 die 计划约 160 万颗),DeepSeek 希望加购更多但产能所限,整单交付或需一年以上——国产 HBM 与先进封装成为整条链的胜负手;
  • 过渡性押注:DeepSeek 同时在与中芯国际合作开发自研推理芯片,并于 6 月完成约 500 亿元融资、继续洽谈数十亿美元基建融资。国产算力的终局是多元自主,而非单一依赖。

单颗 950DT:144GB HBM、4.0TB/s 带宽、2.0TB/s 互联,原生支持 FP8/FP4/HiF8,详见昇腾 950DT 规格页。

2. 英伟达 129.3 亿美元收购 Hugging Face:买下"铲子的交易所"​

当地时间 9 月 3 日,英伟达宣布以 129.3 亿美元收购全球最大开源 AI 平台 Hugging Face,超过 2020 年 69 亿美元收购 Mellanox,成为其史上最大并购。交易含约 119 亿美元股权款与最高约 10 亿美元员工留任计划,预计 2027 年上半年完成,待监管批准。

Hugging Face 托管超 300 万个模型、50 万个数据集,服务超 1800 万名开发者。黄仁勋承诺平台继续开放中立运营:不强制绑定英伟达资源、开源属性完整保留。

解读:算力霸主的护城河从"芯片 + 网络 + 软件栈"一路修到了"模型分发 + 开发者生态"——卖铲人开始收购铲子的交易所。平台的"中立性"承诺能否兑现,将成为全球监管与竞争性云厂商持续盯防的焦点;对国内产业而言,模型托管、权重分发这类"轻资产 AI 基础设施"与芯片一样,正在成为大国科技博弈的卡点。

3. Rubin Ultra 显存减配:内存占 TCO 40% 后的算术题​

SemiAnalysis 最新报告(科创板日报 9 月 3 日转引)显示,英伟达已将旗舰 Rubin Ultra 的 HBM 配置从 HBM4E 12-Hi(384GB 档)下调至 HBM4 8-Hi(192GB),三星正配合开发 8 层产品。

  • 动因:HBM/DRAM 涨价后,内存已占整机 TCO 约 40%;减配后 HBM 成本降超 50%,即便计入 2026 年 HBM 涨价预期,内存占总资本开支比例也将从 40% 压至 28%;
  • 钱去了哪:转向 Scale-up 纵向扩展网络——以 NVL576 NPO 方案测算,光模块取代机架间互连后,Scale-up 网络占机架总支出比例从 4% 升至 12%;
  • 连锁反应:TrendForce 显示英伟达自 2026 Q3 起并行评估 HBM4E 8-Hi / 12-Hi / HBM4 8-Hi 多套方案,部分云厂商也在考虑下调下一代自研 ASIC 的 HBM 容量。

连定价权最强的英伟达都给旗舰"减配求量",等于官宣:当前 AI 硬件最紧的约束是内存(美光高管称新增内存供应 2028 年前难有实质放量),单卡堆料的军备竞赛告一段落,硬件价值重心正迁移到光互联、CPO、高速交换与 PTFE 背板。华泰测算 2027 年存储供需缺口将从约 -7% 收窄至 -3%——上行周期未逆转,但从"普涨"走向"结构性紧缺"。

详见本站已同步更新的 Rubin Ultra 规格页与HBM4 量产竞速分析。

4. 推理 ASIC 军备提速:谷歌"一年两款",Jalapeño 规格落地​

  • 谷歌 TPU 迭代周期从两年一代压缩至"每年两款"(华创证券 9 月 4 日研报):第八代已拆分为训练(8t)与推理(8i)双架构,8i 把内存/算力配比拉到 8t 的 1.65 倍,专为推理放量设计;
  • OpenAI Jalapeño 规格披露:6 堆栈 HBM4 共 216GB、带宽 15.4TB/s、700W,围绕投机解码设计;OpenAI 称在 DeepSeek R1 负载下 tokens/kW 达 GB300 的 1.7 倍;RTL 冻结到流片 9 个月,首批硅片后约 10 周承载 ChatGPT 流量。详见规格页(本站已更新);
  • workload-specific 时代开场:训练、推理、推荐各自长出专用芯片,上游 HBM/封装/光互联的供应节奏必须跟上"半年一代"。

5. 国内动态:字节 296 亿美元加杠杆,摩尔线程 Token 超节点投产​

  • 字节跳动获约 296 亿美元融资安排(彭博 9 月 3 日),较最初约 200 亿美元目标大幅上调,用于数据中心与 AI 基建;另据产业报道正洽谈在内蒙古新增 5-6GW 算力产能——中国 AI 公司迄今最大规模基建融资之一,算力正被当作可融资、可证券化的重资产经营;
  • 摩尔线程 × 趋境科技 "Token 超节点"投产(光明网 9 月 4 日):以 MTT S500 承担 Prefill 与 KV Cache 生成、高带宽 GPU 专注 Decode 的 PD 异构方案,实测平均生成速度超 50 TPS、KV Cache 命中率超 90%、稳定性 99.9%,已承接头部模型厂商官方业务流量——超节点竞争维度从"单卡参数"转向"单位 Token 生产成本";
  • OpenAI 发布 GPT-6 Astra(9 月 4 日):超 10 万颗 GPU 在 Stargate 集群完成训练,推理放量与超大规模集群仍是全球算力叙事主线;
  • SemiAnalysis 基准:AMD MI355X 新提交在 AgentX 基准低交互区间tokens/$ TCO 击败 B300——vLLM + LMCache 软件栈的贡献首次被独立机构量化认可。

6. 市场:中美算力资产一涨一调​

美东 9 月 4 日,美国 8 月非农仅增 8.9 万人(预期 16 万),10 年期美债收益率回落至 3.78%,成长股走强:科技板块 XLK 周涨 4.2%,英伟达周涨 8.7% 收于 230.36 美元。A股 9 月 4 日反向回调:AI 算力芯片板块 -1.99%、服务器 -2.51%、超节点 -2.86%,浪潮信息跌停、寒武纪 -2.54%——基本面无恶化(博通、戴尔、中际旭创订单与财报持续验证景气),更多是交易层面获利兑现。

下周起三连催化密集:CIOE 光博会(9/9-11)→ 华为全联接大会(9/17-19)→ 云栖大会(9/22-24)。国产超节点从"发布会 PPT"到"批量交付"的成色,将迎来集中检验。

本周一句话​

内存太贵改变了所有人的算法:英伟达给旗舰减配显存、把钱投给互联;DeepSeek 用 16 万颗昇腾买推理确定性;谷歌把 TPU 迭代压到半年一代。2026 年 Q4 起,"每兆瓦/每美元 token 数"将取代"单卡 PFLOPS",成为算力采购的第一指标。


相关链接​

参考资料​


本文基于彭博社、科创板日报、SemiAnalysis、TrendForce、华创证券研报及光明网等公开报道整理。订单金额与市场数据为媒体/机构预估口径,实际以相关公司正式披露为准。

HBM4 从送样竞速进入量产爬坡竞速:SK 海力士率先交付 Rubin、美光产能翻倍、三星直逼王座

· 阅读需 6 分钟
Industry Research Team

9 月第一周,存储行业传来三组关键信号:SK 海力士面向英伟达 Vera Rubin 平台量产交付全球首款 12 层 HBM4;三星 Q2 HBM 份额飙升至 33%、直逼王座;美光宣布年底 HBM 月产能翻倍至约 10 万片晶圆。 HBM4 的竞争,已经从"谁能造出来"变成"谁能最快量产爬坡、谁绑定的客户最深"。


1. 三巨头战报:领跑者、追赶者与搅局者​

维度SK 海力士三星电子美光
HBM4 关键节点2026 年中向 Vera Rubin 量产交付 12 层 HBM4(全球首款完整质量认证)2026 年 2 月全球首家大规模量产出货2026 Q2 量产 12 层 HBM4,批量出货
DRAM 核心裸片1b(第五代 10nm 级)1c(第六代)—
Base Die 代工台积电 12nm自家 4nm拟转台积电(1γ 工艺代)
2026 HBM4 份额预测~54%~28%~18%
Q2 HBM 营收份额50%(环比 -14pct)33%(环比 +12pct)18%
HBM 产能~15–20 万片/月~15–20 万片/月年底冲刺 10 万片/月(现为 4–5 万)

三个关键读数:

  • 三星的反扑是真的:从去年 Q2 份额低至 15%(落后美光 6 个百分点)到今年 Q2 的 33%,三星用一年时间把与 SK 海力士的差距缩小到 17 个百分点。三星预计 HBM4 将占其下半年 HBM 收入的 60% 以上,且现有 HBM4 产能已被客户预订售罄,2026 年 HBM 总产能计划提升约 50%;
  • 美光的追赶也是真的:CEO 梅赫罗特拉透露 12 层 HBM4 爬坡速度约为 HBM3E 的两倍、累计收入已超 10 亿美元;年底若如期达成 10 万片月产能,与两强的差距将缩小一半;
  • SK 海力士的护城河依然深:与英伟达签署多年期 HBM/DRAM 供应协议、率先完成 2027 年 HBM4 价格谈判,在英伟达 HBM4 采购中占比约 60%(乐观情形 70%)。

2. 变局核心:封装比 DRAM 制程更值钱​

HBM4 与 HBM3E 时代最大的不同,是胜负手从存储颗粒转向了封装与 Base Die:

  • I/O 通道数从 1024 条翻倍至 2048 条,单颗 12 层封装吞吐超 2TB/s,能效较前代提升逾 40%;
  • Base Die 首次引入晶圆代工厂先进逻辑工艺——SK 海力士用台积电 12nm,三星用自家 4nm,美光计划在 1γ(首次导入 EUV)世代转由台积电代工;
  • 存储原厂与代工厂的协作深度,第一次成为决定出货速度的关键变量——这正是 Hot Chips 2026 上"三星 HBM Base Die 逻辑工艺化"议题的产业注脚。

SEMI 数据显示,2026 年全球 HBM 市场规模预计增长 58% 至 546 亿美元,约占 DRAM 市场四成。行业预计 HBM4 销售占比将在 2026 年 Q4 正式超越 HBM3E,成为市场主流。

3. 客户端信号:Rubin 加码,Rubin CPX 重生​

需求端同样在 9 月出现重要变化:

  • Vera Rubin 全面量产(详见本站专文):每颗 Rubin GPU 搭载 288GB HBM4、带宽 22TB/s,NVL72 整柜 75TB 快速内存——HBM4 供给直接决定 Rubin 出货上限,这也是英伟达把"先进晶圆与 HBM 供应"列为当前第一约束的原因;
  • Rubin CPX 项目重启:据 CFM 闪存市场 9 月 2 日简讯,英伟达重启此前搁置的 Rubin CPX 机柜项目,内存规格由 128GB GDDR7 改为 168GB HBM4,机架改为独立 MGX ETL 设计,客户可选 64/128/192/256 颗 GPU 配置——推理专用卡也全面转向 HBM4,进一步放大了 HBM4 需求;
  • 供给协议长期化:英伟达已与 SK 海力士、美光签署多年期 HBM 及 DRAM 供应协议,锁供给、锁价格、锁产能成为巨头标配动作。

4. 下半场:HBM4E 已经鸣枪​

下一代产品的竞争在 2026 年同步开启:

  • SK 海力士:HBM4E 送样提前至 2026 年年中(原计划下半年),COMPUTEX 2026 已展出 12 层样品,单引脚速率最高 16Gbps、单堆栈带宽约 4TB/s,计划 2027 年量产;
  • 三星:2026 年 Q2 起向头部客户交付业界首批 HBM4E 样品(48GB),目标 2027 年拿下 HBM4E 市场 50% 以上份额;
  • 美光:HBM4E 预计 2027 年量产,首批样品采用 1γ 制程 DRAM。

5. 对采购方与投资观察者的启示​

  • 供应商组合成为第一优先级采购变量:同样买 Rubin 平台,采用哪家 HBM 供应商的整机,交付周期可能相差数月;
  • 国产链条的机会窗口:HBM 供不应求叠加出口管制,长鑫等国产存储玩家的 HBM 进展值得持续跟踪——国产 AI 芯片(昇腾 950 系列等)对 HBM 的需求同样在放量;
  • 跟踪三个领先指标:头部云厂商 Rubin 机架采购量、HBM 设备供应商订单(美光已加大 PO)、HBM4E 送样→量产的时间差。

相关链接​

参考资料​


本文基于 2026 年 9 月初 Counterpoint Research、CFM 闪存市场及韩媒报道整理。份额与产能数据均为研究机构/供应链预估口径,实际以各原厂财报为准。

HBM4 量产元年:三星良率突破80%、三巨头齐过英伟达认证,AI 算力供给的最后一道瓶颈

· 阅读需 6 分钟
Industry Research Team

如果说 2025 年是 HBM3E 的产能爬坡年,那么 2026 年就是 HBM4 的量产元年。NVIDIA Vera Rubin 与 AMD MI400 两代旗舰同时押注 HBM4,让这块"AI 芯片上的内存"第一次成为决定整机柜交付节奏的战略物资。而 8 月密集披露的良率与认证数据,正在重写全球 HBM 供应版图。


1. 黄金良率突破:三星六个月从不足六成冲上 80%​

据韩国《首尔经济日报》8 月 9 日披露,三星电子 HBM4 良率已于 8 月初正式跨过 80% 的"黄金良率"门槛——较其原定年底达成的目标提前了四个多月。

时间节点三星 HBM4 良率备注
2026 年 2 月(量产启动)不足 60%产线爬坡期
2026 年 8 月初约 80%跨过规模量产 / 稳定盈利分水岭

半导体行业素有"80% 良率为黄金良率"之说——它既是晶圆厂竞争力的标尺,也被视为大规模商业化供给的财务转正点。推动这一跃迁的关键,是三星在 热压非导电薄膜(TC-NCF)键合工艺 上的突破,以及底层 1c DRAM 良率早已站上 80% 所提供的稳定基底。同期,三星 HBM4E 可靠性测试良率也已突破 70%。

业界评估,SK 海力士的 HBM4 良率同样迈入 80% 区间。两大巨头在量产品质上的差距正被快速抹平。


2. 供应版图:SK 海力士握有 Rubin 六至七成分配​

黄仁勋 6 月 5 日在首尔公开确认:三星、SK 海力士、美光三家均已通过 Vera Rubin 的 HBM4 认证——这是三大存储厂首次同时获得同一平台的公开认证。

但认证只是"进门券",分配份额才是话语权:

厂商2026 年 Rubin HBM4 分配(估算)备注
SK 海力士60%–70%凭借 HBM3/3E 世代积累的客户关系与 MR-MUF 封装工艺
三星25%–30%良率跃迁后份额快速提升
美光剩余部分HBM4 曝光有限,份额相对稳定

Counterpoint Research 预测 2026 年 HBM4 市场格局为 SK 海力士 54% / 三星 28% / 美光 18%。三星已设定阶梯式追赶目标:Q3 HBM4 营收环比三倍增长、下半年 HBM4 占 HBM 总营收超 60%、年底 HBM 整体市占率向 38% 靠拢。


3. 真正的瓶颈:从晶圆转向"后端堆叠"​

随着前端良率企稳,AI 加速器供应链的节奏,不再取决于"能产多少晶圆",而取决于后端堆叠、键合、测试、出货的速度。

  • 行业分析师将 HBM 堆叠列为 AI 芯片供应链第二严重的瓶颈,仅次于 TSMC 的 CoWoS 先进封装产能。
  • HBM 占 2026 年 DRAM 晶圆产量的约 25%;每片 HBM 晶圆消耗约 3–4 倍于普通 DRAM 晶圆的资源(额外 TSV 与堆叠步骤),每redirect一片晶圆就等于从现货市场抽走 3–4 单位商品内存。
  • 三星正考虑将部分传统内存后端产线(天安、温阳)迁往越南以释放 HBM 后端产能——侧面印证后端吞吐已是整条链最紧的环节。

4. HBM4 规格速览:带宽与能效的代际跃迁​

规格HBM4(12-Hi / 16-Hi)HBM4E
单栈容量36 GB / 48 GB—
引脚速率11.7–13.0 Gbps16 Gbps
单栈带宽最高 3.3 TB/s最高 3.6 TB/s
总线位宽2048-bit—
能效较 HBM3E 提升 40%—
热阻 / 散热改善 10% / 提升 30%—

三星 HBM4 于 2026 年 2 月量产,11.7 Gbps 的引脚速率已超出 Vera Rubin 兼容所需的 8 Gbps 行业基线;HBM4E 样品则于 5 月 29 日率先发往主要客户。


5. 价格权力延续至 2027:供给仍将是紧平衡​

TrendForce 判断,HBM 供应商的定价权将贯穿 2027 年,原因是供给持续受限:

  • 2027 年 HBM bit 出货量预计年增 50%–60%,但仍跟不上需求增速,市场维持紧缺;
  • 行业已预期显著涨价;
  • 对 NVIDIA 与 AMD 而言,一个更强的三星意味着更多供货选择与更从容的交期——在内存成为 AI 服务器最紧一环的市场里,第二、第三供应商的存在本身就是缓冲。

对整机柜而言,HBM 成本已是最大推手:Rubin Ultra 机柜预估售价高达 2100 万美元,HBM 占其中相当比重。


6. 对中国的启示:HBM 出口管制加速国产迭代​

HBM 是当前 AI 芯片管制的核心环节之一。在海外 HBM4 军备竞赛白热化的同时,国产 HBM 技术迭代被同步推快——华为昇腾路线图已明确将"推动国产 HBM 技术迭代"写入产品节奏(950 系列推进国产 HBM 配套,960/970 系列规划于 2027–2028 年陆续推出)。

短期看,HBM4 的紧缺会直接传导到 Rubin / MI400 的交付节奏;长期看,谁能锁定稳定的 HBM4 供给,谁就握住了 2027 年 AI 算力扩张的阀门。

相关链接​

参考资料​


本文基于 TrendForce、Seoul Economic Daily、TechTimes 等 2026 年 8 月公开报道整理。HBM 分配份额与市占率为第三方机构估算,非厂商官方确认数据。

AMD Advancing AI 2026明日开幕:MI400三款CDNA5齐发,Helios机架3 exaFLOPS,OpenAI+Meta锁定12GW大单

· 阅读需 5 分钟
AI Hardware Analyst

AMD 已确认旗舰 AI 大会 Advancing AI 2026 将于 2026年7月22-23日 在旧金山 Moscone Center 举行,主题演讲定于 7 月 23 日,由董事长兼 CEO 苏姿丰(Lisa Su)主持。大会将补全 Instinct MI400 系列 的可用性时间线、定价与独立基准数据。

1. Instinct MI400 家族:三款 CDNA 5 加速器​

AMD 在 CES 2026 已完整公布 MI400 产品矩阵,三款加速器均基于 CDNA 5 架构、TSMC 2nm 制程,按精度与场景分工:

型号定位关键规格
MI455X(旗舰)大规模训练/推理(机架级)3200 亿晶体管、12 chiplet、432 GB HBM4(12×36GB)、19.6 TB/s、FP4 40 PFLOPS / FP8 20 PFLOPS
MI440X(企业版)本地企业 AI(8 卡节点)低精度 AI(FP4/FP8/BF16),可直接替换 MI300/MI350,兼容既有机房供电散热
MI430X(HPC/主权 AI)高精度科学计算 + AI完整 FP32/FP64,已部署橡树岭 Discovery、法国首台 exascale Alice Recoque

MI455X 与 MI440X 主攻低精度 AI(FP4/FP8/BF16),MI430X 补齐传统 HPC 高精度需求——通过"按精度裁减执行单元"提升能效与性价比。三者均支持 UALink(首批兼容该标准的加速器)与 Infinity Fabric 片间互联,机架扩展走 Ultra Ethernet。

苏姿丰在 2026 Q1 财报会上确认:已向核心客户送样 MI455X GPU,客户需求"超过公司对 2027 年的内部预期"。

2. Helios 机架:3 exaFLOPS 单柜​

AMD 以 Helios 机架级平台 切入超大规模市场:

指标Helios 机架
加速器72 × MI455X
聚合 HBM431 TB
总内存带宽1.4 PB/s
单柜算力最高 3 AI exaFLOPS(Q3 交付目标)
目标客户超大规模训练/推理集群

Helios 采用 AMD 自研 Zen 6 EPYC Venice CPU(每机架 18 颗)+ Pensando Vulcano 800G NIC,通过开放 ROCm 软件栈整合;AMD 还规划了 双宽 128 卡 Helios 变体,单柜算力可推高至 3 AI exaFLOPS 上限。更长远的 MI500 系列(CDNA 6、2nm、HBM4E) 计划 2027 年推出,官方称相对 MI300X 的 AI 性能提升最高达 1000 倍。

3. 12GW 大单:OpenAI + Meta 双重背书​

AMD 手握两份历史级别的算力协议,合计约 12 GW,全生命周期潜在收入或达 1000 亿美元:

客户规模首批部署结构
OpenAI6 GW(多代产品)首期 1 GW,2026 H2 用 MI450"compute-for-upside":授予最多 1.6 亿股认股权证,随里程碑与股价目标分阶段归属
Meta6 GW定制 MI450 芯片,2026 H2 起部署于下一代数据中心

财务预期​

指标2026 预测
MI400 系列营收~$72 亿(约占数据中心销售 25%)
数据中心 GPU 营收~$150 亿(同比 +114%)
数据中心总营收或达 $287 亿(同比 +73%)

⚠️ 执行风险:AMD 已提示 MI450 于 Q3 量产将拖累毛利率(新品低于公司平均);先进制程与先进封装(TSMC CoWoS)产能仍是主要约束。

产业解读​

  1. CUDA 护城河被撬动:当 Meta、OpenAI 这类构建全球最大训练集群的公司押注 AMD 硅片,AMD 长期 5–7% 的 GPU 份额天花板正被打破。
  2. 内存优势差异化:432 GB HBM4 / 19.6 TB/s 相较 NVIDIA Rubin 的 288 GB 具备容量优势,对大模型推理(KV Cache 受限场景)尤为关键。
  3. 对标节奏咬紧:MI450 与 NVIDIA Vera Rubin 同在 2026 H2 放量,两强在 HBM4 供应、CoWoS 产能上正面争夺。

相关链接​

参考资料​


本文写于 Advancing AI 2026(7月22-23日,明日开幕)前夕;大会主题演讲定于 7 月 23 日由苏姿丰主持,届时将揭晓 MI400 最终上市时间、定价与独立基准数据,我们将同步更新。

NVIDIA Vera Rubin正式出货:首台VR200 NVL72交付,三星HBM4量产,Rubin Ultra机柜天价

· 阅读需 5 分钟
Industry Research Team

2026年7月,NVIDIA 下一代 AI 计算平台 Vera Rubin 正式启动首批出货,接替 Blackwell 架构,并计划在 2026 年下半年进入大规模量产。首批客户包括微软、谷歌、亚马逊、Meta、Oracle 等大型云服务商。

1. 全球首台 VR200 NVL72 交付(里程碑)​

CoreWeave 联合 Dell 宣布,全球首台 NVIDIA Vera Rubin VR200 NVL72 机柜已正式交付,并一次性通过 L11 全机柜级硬件诊断测试。这标志着 Rubin 从路线图走向实物,供应链核心环节(HBM4、先进封装、液冷、超高功率电源)未出现重大卡点。

VR200 NVL72 核心配置​

指标Vera Rubin VR200 NVL72
机柜代号Oberon
GPU72 块 Rubin GPU
CPU36 颗 Vera CPU
单 GPU 显存288 GB HBM4
单 CPU 内存1.5 TB LPDDR5X
整柜 HBM420.7 TB(20,736 GB)
整柜 LPDDR5X54 TB
互联NVLink 6 全互联
推理性能~3.6 exaFLOPS 级别
散热液冷
代际提升单 GPU 计算约 3.5×、内存带宽约 2.8×(对比 Blackwell)

Vera CPU 集成 88 个定制 Olympus ARM 核心,与 GPU 间互联带宽 1.8 TB/s,可作为 GPU 显存扩展池。NVIDIA 已于 5 月完成对 Anthropic、OpenAI、xAI 及 Oracle Cloud 的首批 Vera CPU 交付。

2. 三星 HBM4 量产:关键瓶颈松动​

2026年7月8日,三星电子正式启动面向 Vera Rubin 平台的 HBM4 量产,据报道其 HBM4 量产良率达到 70%(超出 60–65% 的初始预期)。这一关键供应链环节的确认,为 Rubin 大规模部署扫清障碍。

HBM 供应格局(2026 Q1)份额
SK 海力士45%
三星40%
美光15%

HBM4 采用 8 层堆叠(12 层设计计划 2028 年),价格约为 HBM3e 的 2.8 倍。TrendForce 预测 HBM 供给将年增 65%,到 2027 Q4 HBM4 占总产出的 35%。

3. Rubin Ultra 天价:HBM 成本主导​

据美国银行全球研究(BofA Global Research)测算,Rubin 一代将把单台服务器成本推向历史新高:

成本项Rubin VR200(Oberon)对比
单柜 HBM4 用量20,736 GB—
HBM4 单价~$18.40 / GBBlackwell(HBM3e)~$11.26 / GB
仅 HBM4 成本~$38.2 万尚未计入 LPDDR5X
Rubin Ultra 机柜预估售价~$2,100 万IT 之家 / BofA 估算

4. Rubin Ultra 设计调整:原 4 芯片方案取消(据 SemiAnalysis)​

半导体研究机构 SemiAnalysis(2026-06-30) 披露,GTC 2026 发布的原版 4 芯片 Rubin Ultra GPU 已被取消,2027 年实际出货的版本规模与性能均缩减约一半:

  • 取消原因:原版在单一 CoWoS-L 封装内集成 4 颗计算 die + 16 颗 HBM4E,基板在 4 die 配置下出现翘曲(warpage),导致计算 die 与基板接触失效、良率崩塌;替代方案 CoPoS 量产要等到 2028 年底以后,赶不上 2027 节点。
  • 新方案:改为 双 die(与标准 Rubin 同构)+ HBM4E,单 GPU 约 384 GB HBM4E(高于标准 Rubin 的 288 GB),但总算力与带宽仅为原版一半;为逼近原设计的聚合算力,NVIDIA 预计在 Kyber 机架内以"2+2"板级配置 拼出四 die 等效规模。
  • Kyber 机架延迟:配套 Kyber NVL144 机架因中板 PCB 制造难题推迟 12 个月以上至 2028 年,800V 直流供电方案同样推迟至 2028 年。

⚠️ 口径提示:NVIDIA 未就上述设计调整发表官方评论;X 平台亦有声音认为"芯片数量并未改变、属旧闻翻炒"。本段基于 SemiAnalysis 公开报告整理,最终以 NVIDIA 官方披露为准。我们已在 Rubin Ultra 预览卡 中标注"规格待官方确认"。

产业解读​

  1. "Never doubt"时刻兑现:Rubin 首发交付一次性通过 L11,打消了市场对"Rubin 延期"的疑虑,2026 H2 AI 算力供应确定性提前锁定。
  2. 专为 Agentic AI 设计:Rubin 面向智能体工作流、超长上下文推理,将进一步压低万亿参数模型的训练/推理成本曲线。
  3. HBM 是全链条赢家:单机柜 20.7 TB HBM4 用量巨大,SK 海力士、三星、美光及先进封装(CoWoS-L)、液冷、电力改造全链条受益,同时也成为成本与产能的最大约束。

相关链接​

参考资料​


本文持续跟踪 Vera Rubin 量产爬坡与 HBM4 供应链动态。

AMD MI455X CES 2026 震撼发布:4年AI芯片性能涨1000倍

· 阅读需 7 分钟
Industry Research Team

2026年1月5日,在CES 2026(国际消费电子展)首日,AMD董事会主席兼CEO苏姿丰博士在主题演讲中震撼发布:Instinct MI400系列AI加速卡。

其中最引人注目的是MI455X——AMD史上性能最强的AI加速卡,采用2nm + 3nm混合制程、432GB HBM4显存、FP4算力高达40 PFLOPS(FP8为20 PFLOPS)。

核心亮点​

  • MI455X:FP4算力40 PFLOPS,FP8算力20 PFLOPS,相比MI355X提升10×
  • MI450:高性价比版,FP4算力28 PFLOPS,288GB HBM4
  • 制程升级:全球首款采用2nm + 3nm混合制程的AI芯片(GCD用2nm,MCD用3nm)
  • 显存升级:从MI350X的288GB HBM3e升级到432GB HBM4(MI455X)
  • 带宽升级:从MI350X的8 TB/s升级到19.6 TB/s(提升2.45×)
  • 架构升级:从CDNA 4升级到CDNA 5
  • 量产时间:MI455X 2026年Q4,MI450 2026年Q3

MI400系列完整规格​

📌 重要更正(2026-06-16):经官方规格核对,MI455X 显存为 432GB HBM4(非早期报道的 288GB),FP4 算力为 40 PFLOPS。特此更正。

型号定位显存FP4 算力FP8 算力TDP(推测)
MI455X旗舰训练+推理432GB HBM440 PFLOPS20 PFLOPS~1,000W
MI450高性价比训练288GB HBM428 PFLOPS14 PFLOPS~800W
MI440X企业推理216GB HBM425 PFLOPS12.5 PFLOPS~600W
MI430XHPC / 科学计算192GB HBM420 PFLOPS10 PFLOPS~500W
MI400X通用 / 边缘推理128GB HBM412 PFLOPS6 PFLOPS~400W

关键升级(vs MI350系列):

  • 显存:HBM3e → HBM4,容量提升 50%(432GB vs 288GB)
  • 带宽:19.6 TB/s(vs MI350的 8 TB/s,提升 2.45×)
  • 算力:FP4 40 PFLOPS(vs MI355X的 20 PFLOPS,提升 2×)
  • 制程:2nm + 3nm 混合制程(GCD用2nm,MCD用3nm)
  • 架构:CDNA 5(vs MI350的 CDNA 4)

与MI355X的性能对比​

指标MI355X(2025)MI455X(2026)提升
FP4算力20 PFLOPS40 PFLOPS2×
FP8算力10 PFLOPS20 PFLOPS2×
显存容量288GB HBM3e432GB HBM41.5×
显存带宽8 TB/s19.6 TB/s2.45×
制程TSMC 3nm2nm + 3nm 混合新一代
架构CDNA 4CDNA 5新一代
TDP800-1000W~1,000W持平

苏姿丰在CES 2026上说:

"4年前,MI250的AI性能是X。现在,MI455X的性能提升了1000倍。这就是AI芯片的进步速度。"

CDNA 5架构详解​

MI400系列采用CDNA 5架构(MI355X用CDNA 4):

关键升级​

  1. Matrix Core 升级:支持FP8/INT8/FP16,稀疏化加速
  2. HBM4控制器:支持12层HBM4( vs HBM3e的8层)
  3. Infinity Fabric 4.0:Die间/Die-GPU间互联带宽提升50%
  4. 稀疏化原生支持:MoE模型的Expert Parallel优化
  5. 长上下文优化:1M+ token KV Cache加速

与NVIDIA Blackwell / Rubin对比​

指标AMD MI455XNVIDIA B200NVIDIA Rubin R200(2026 Q4)
FP4算力40 PFLOPS20 PFLOPS(稀疏 45 PFLOPS)~40 PFLOPS(推测)
FP8算力20 PFLOPS10 PFLOPS(稀疏 22.5 PFLOPS)~20 PFLOPS(推测)
显存432GB HBM4192GB HBM3e288GB HBM4
显存带宽19.6 TB/s8 TB/s13 TB/s
TDP~1,000W700-1000W~1,000W
制程2nm + 3nm 混合TSMC 4npTSMC 3nm
量产时间2026年Q42024年Q42026年Q4
软件生态ROCmCUDACUDA
优势显存容量、开放生态生态最成熟下一代架构
劣势软件生态差距显存较小尚未发布

结论:MI455X在FP4/FP8算力和显存容量/带宽上领先B200,但软件生态仍是短板。与Rubin R200相比,纸面性能相近,但Rubin有CUDA生态护城河。

量产时间表​

时间事件
2025年6月12日Advancing AI大会首次公布MI400系列规格
2026年1月5日CES 2026正式发布MI455X/MI450/MI440X
2026年Q3MI450开始送样
2026年Q4MI455X正式量产
2026年Q4MI440X(企业推理版)发布
2027年Q1MI430X/MI400X(HPC/边缘推理版)发布
2027年MI500系列(下一代)

AMD AI芯片路线图(2025-2027)​

时间产品制程备注
2024年Q4MI325XTSMC 5nmHBM3e升级版
2025年Q3MI355X(MI350系列)TSMC 3nmCDNA 4,288GB HBM3e
2026年Q4MI455X(MI400系列)2nm + 3nm 混合CDNA 5,432GB HBM4
2027年Q1MI500系列TSMC 2nm(推测)下一代,性能再提升

软件生态:ROCm的进步与挑战​

✅ 进步​

  • PyTorch 2.5+:原生支持MI300X/MI455X
  • Hugging Face Transformers:官方支持AMD GPU
  • vLLM 0.8+:MI300X推理支持(实验性)
  • JAX:AMD正在适配(对标Google TPU)

⚠️ 挑战​

  • 框架优化度:PyTorch在AMD GPU上的性能仍低于NVIDIA
  • 算子覆盖率:部分小众算子需要自己写HIP代码
  • 多卡通信:RCCL(对标NCCL)性能仍有差距
  • 开发者生态:教程、案例、社区活跃度远不及NVIDIA

与竞品对比​

厂商产品FP4算力显存量产时间优势劣势
AMDMI455X40 PFLOPS432GB HBM42026 Q4显存容量最大、开放生态软件生态差距
NVIDIAB20020 PFLOPS192GB HBM3e2024 Q4生态最成熟显存较小
NVIDIARubin R200~40 PFLOPS288GB HBM42026 Q4下一代架构、CUDA生态价格昂贵
华为昇腾910C~1.6 PFLOPS64GB HBM2026 Q2中国本土化受出口管制
GoogleTPU 8t~9.2 PFLOPS~256GB HBM3e2027年底与Gemini集成仅Google Cloud

行业影响​

1. 对NVIDIA的冲击​

AMD MI455X在纸面性能上已经追上B200(FP4 40 PFLOPS vs 20 PFLOPS),甚至在显存容量上大幅领先(432GB vs 192GB)。

但:

  • NVIDIA有CUDA生态护城河
  • NVIDIA有Vera Rubin平台(整体方案,2026 Q4发布)
  • AMD只能卖单卡/单机,NVIDIA卖AI工厂
  • MI455X量产时间(2026 Q4)与Rubin R200相同,正面竞争

2. 对国产芯片的压力​

MI455X的发布意味着:国际主流AI芯片在2026年将进入2nm + HBM4时代。

国产芯片(华为昇腾、寒武纪、沐曦等)需要:

  • 在2026-2027年追上5nm + HBM3e水平
  • 否则差距将从"1代"扩大到"2代"

3. 对云服务商的意义​

MI455X给云服务商提供了NVIDIA之外的第二选择:

  • 微软Azure:已部署MI355X,可能跟进MI455X
  • 谷歌Cloud:自研TPU,不会用AMD
  • 亚马逊AWS:自研Trainium/Inferentia,不会用AMD
  • 阿里云、腾讯云:可能采购MI455X作为NVIDIA替代方案

相关芯片​

参考资料​


本文基于AMD CES 2026官方公告、百度百科及知乎智东西现场报道整理,规格参数已核对官方来源。2026-06-16更新:修正MI455X显存(288GB → 432GB)和算力(FP8 6 PFLOPS → FP4 40 PFLOPS)