跳到主要内容

8 篇博文 含有标签「AI Infrastructure」

Data center, power and networking infrastructure for AI

查看所有标签

智能算力 2030 年冲 9800 EFLOPS:信息通信业「十五五」规划的五个硬指标

· 阅读需 5 分钟
Industry Research Team

本文基于工信部《信息通信行业发展「十五五」规划》(2026 年 9 月印发)及《人民邮电》报、澎湃新闻、华夏时报等官方解读整理。

9 月上旬,工信部印发《信息通信行业发展「十五五」规划》,用 13 个主要指标、26 项重点任务给未来五年的信息通信业画了路线图。对 AI 算力行业来说,这是含金量最高的一份政策文件——我们挑出五个硬指标,逐个拆解产业含义。

指标一:智能算力 1590 → 9800 EFLOPS,五年增长超 5 倍​

这是整份规划最亮眼的数字。作为参照系:

  • 截至 2026 年 6 月底,全国智能算力规模已达 2185 EFLOPS,同比增长 177%——上半年就超额完成了对 2025 年底(1590 EFLOPS)的跨越
  • 全国已建成 42 个万卡级智算集群;2026 年 7 月,首个全国产十万卡级 AI 算力集群曙光 8000 在郑州落成
  • 华为轮值董事长汪涛的判断:10 万卡以上超节点集群到 2027 年将成为基础配置

从 2185 到 9800,意味着未来四年还要再造 3.5 倍于当前存量的智算设施。规划同步要求「有序部署万卡、十万卡及以上智算集群」「加大力度适配国产算力芯片」——这是国产 AI 芯片未来五年最确定的需求底座。

指标二:信息基础设施累计投资 3.8 万亿元​

有观点拿「十四五」3.7 万亿对比,得出「投资见顶」的结论。官方解读明确反对这一说法:增量资金正从「规模铺量」转向「质效跃升」,精准投向智能算力基础设施、万兆光网、6G 等新赛道。产业链拉动效应也随之变化——AI 服务器、高速光互联、国产算力芯片、新型智能终端被点名为全链条受益方向。

指标三:新建大型算力设施 PUE 降至 1.2 以下​

「十四五」末这一数字是 1.25,五年内再降 0.05——听着不多,但在 AI 服务器常年高负荷、单机柜功率密度普遍超过 20kW 的今天,PUE 每降一点都是硬仗。规划给出的技术路径非常明确:液冷。

  • 《信息通信行业发展「十五五」规划》:引导算力设施采用高效节能设备以及液冷等先进技术
  • 《电子信息制造业发展「十五五」规划》(9 月 15 日由工信部、国家发改委联合印发):把液冷散热与高带宽内存池、全光交换并列为要突破的关键技术

产业侧的数据也在验证:据 Omdia 统计,液冷在全球数据中心冷却市场的占比从 2024 年约 20% 攀升至 2025 年约 37%,预计 2029 年渗透率超过 45%。算力扩张的上限正在从芯片供给转向电力供给,「算力向上、能耗向下」的能效约束会是未来五年的常态。

指标四:先进存力 1700 EB,增长超 2 倍​

智能算力翻 5 倍的同时,先进存力翻 2 倍——存算协同被放在同等重要的位置。逻辑在于:大模型训练的检查点、智能体推理的中间状态和上下文记忆,都分层存放在高性能存储中。截至 6 月底,全国存力总规模约 2021 EB,其中先进存力占比约 32%;到 2030 年 1700 EB 的先进存力目标,意味着结构升级比总量增长更重要。

对芯片选型的直接提示:KV cache 与长上下文正在吃掉内存预算,评估 AI 服务器时显存容量与内存带宽的权重应该高于峰值算力。

指标五:智能体互联网络首次写入规划​

这是本份规划最具前瞻性的部分:「智能体互联网络」占据独立专栏,部署四方面内容——构建智能体网络标识体系、加快智能体网络设施建设应用、推动全球互联互通、建设空间管控体系。同时明确「适时启动 6G 商用」。

AI 从「人的应用」变成「智能体基础设施」,通信网的角色从连接人升级为连接智能体——这为推理算力的分布式部署(边缘推理、算力调度)提供了国家级叙事。

对算力从业者的三点判断​

判断依据
国产算力需求确定性强规划明文「加大力度适配国产算力芯片」+ 十万卡集群建设周期启动
能效指标成为选址硬约束PUE 1.2 以下 + 液冷关键技术点名,高密度液冷方案优先
推理算力按需下沉「面向场景按需部署推理算力设施」,边缘与区域算力中心有政策窗口

算力规模翻 5 倍的目标之下,真正稀缺的从来不是规划,而是芯片、电力和交付能力。 对采购方来说,供给窗口期依然紧张;对方案选型而言,建议直接用 TCO 计算器 把 PUE 差异折算成电费成本——1.25 与 1.2 的差距,在万卡集群的电费账单上是千万级的。

小结​

「十五五」规划把智能算力写成了国家级工程:5 倍算力、2 倍存力、3.8 万亿投资、PUE 1.2、智能体互联网。五年后回看,2026 年下半年的国产十万卡集群潮,很可能就是这条曲线的起点。

(规划数据引自工信部文件及官方媒体解读;市场数据引自信通院、Omdia 等机构统计。)

GPU 租金又涨了:Nebius 10 月起 H100/B200 随需租金上调约 20%,自建 vs 租用的天平在移动

· 阅读需 5 分钟
Industry Research Team

据芯智讯 9 月下旬报道,Nebius 宣布10 月 1 日起 H100 / H200 / B200 随需(on-demand)租金平均上调约 20%。同月,财联社报道 CoreWeave 截至 8 月 11 日已签约电力增至 4.2 GW,并将"继续以更高价格签约新算力"。这是本轮 AI 周期里租赁市场连续第 N 次提价——对采购方来说,自建与租用的 TCO 天平正在移动。本文用站内 TCO 计算器的口径拆解这笔账。


1. 涨价的三个推手​

  • agentic 推理需求爆发:从 MLPerf v6.1 到 SemiAnalysis AgentX,agentic 负载成为推理增长主引擎——token 消耗量级远超聊天场景,推理算力从"够用"变成"永远不够";
  • 新一代平台的供给溢价:Vera Rubin NVL72 已在 CoreWeave 首发上线,新平台早期产能爬坡期定价天然偏高,同时抬高上一代卡(H100/H200/B200)的续租价格锚点;
  • 电力成为硬约束:CoreWeave 4.2GW 签约电力的表述说明——数据中心供给瓶颈已从 GPU 转向电力与机架,电力在手的企业没有理由降价。

2. 租金上涨 20% 对 TCO 意味着什么​

站内 TCO 计算器把总拥有成本拆成采购 + 能耗 + 运维 + 网络 + 折现五段。租金上涨不直接进入这个模型,但它改变了"租用基准线"——即自建方案要击败的机会成本:

场景租金涨 20% 前涨 20% 后
短期弹性负载(不足 1 年)租用占优租用仍占优(自建部署周期追不上)
稳定推理负载(2-3 年)临界区自建开始占优(机会成本抬高)
训练集群(3 年+)自建占优自建优势扩大

直觉化判断:

  • 24/7 满载跑 2 年以上的负载,租金上调 20% 通常足以让自建(哪怕按 1.5 倍采购溢价、含 PUE 1.3 能耗模型)在 30 个月内反超;
  • 潮汐型负载(白天高峰、夜间空闲)仍应租用——自建方案按 15% 空闲功耗持续付费的假设下,利用率低于约 50% 时自建几乎不可能回本;
  • 混合策略(自建基线 + 租用峰值)对租金上涨的敏感度最低,是当前利率与电价环境下的稳健解。

上述结论可在 TCO 计算器中自行复算:把"云租用单价"按 +20% 输入,对比采购价、电价与 PUE 两个情景。折现率默认 8%,采购成本不折现、逐年电费按 1.08^-y 折现。

3. 国产算力的定价含义​

租金上涨对国产 AI 芯片的采购决策有一层容易被忽略的影响:

  • 国产卡的租用市场尚未成熟:昇腾 / 寒武纪 / 摩尔线程的算力主要以一体机、整机柜和智算中心配额形式交付,公开随需租价稀缺——采购对比天然偏向"自建/整机"模型;
  • 相对 TCO 变化:NVIDIA 租金上涨 20% 等于抬高了所有国产替代方案的"相对吸引力",尤其是推理负载(910C / 950PR / P800 一级市场的实际成交价未公开,但整机报价对美元卡的价格差在扩大);
  • 供给节奏:DeepSeek 押注昇腾训练、16 万颗 950DT 采购传闻——头部需求先吃掉产能,后来者的排队周期在拉长,早决策本身有价值。

4. 小结​

  • Nebius 10 月起 H100/H200/B200 随需租金 +20%;CoreWeave 签约电力 4.2GW 且继续高价锁量——租赁市场供需仍紧;
  • agentic 推理 + Rubin 供给溢价 + 电力约束,三力推高租金,且短期难回头;
  • 决策口径:稳定负载 2 年+ → 自建窗口打开;潮汐负载 → 继续租用;混合策略最抗涨价;
  • 看什么:其他云厂商是否跟进调价、Rubin 租赁的正式定价、国产算力是否出现公开租用市场。

相关阅读​

参考资料​

  • 芯智讯:Nebius 上调 AI 芯片租用价格,10 月 1 日起 H100/H200/B200 随需租金平均上涨约 20%(2026-09-21)
  • 财联社 / 东方财富:CoreWeave 推出多机架 Vera Rubin NVL72 集群,已签约电力增至 4.2 吉瓦(2026-09)

本文基于公开报道整理;TCO 结论依赖利用率、电价、折现率等假设,请以 TCO 计算器按自身参数复算为准。

阿里真武 V900 云栖大会发布:性能 3 倍于 M890、216GB 显存、50 万卡集群,2027 Q1 量产

· 阅读需 6 分钟
Industry Research Team

继华为 9 月 17 日全联接大会官宣昇腾 960 之后仅五天,9 月 22 日阿里巴巴在杭州云栖大会发布新一代训推一体 AI 芯片真武 V900——阿里称之为"目前算力性能最强的中国自研 AI 芯片"。本文基于阿里官方发布口径与新浪科技、C114、环球网等多方报道整理。


1. 单芯片:3 倍于 M890,216GB + 1200GB/s​

指标真武 V900(本次发布)真武 M890(上一代)
性能真武 M890 的 3 倍(官方口径,绝对值未公布)FP16 600 TFLOPS(本站收录)
显存216 GB144 GB(HBM3)
片间互联1200 GB/s—
精度原生 FP8 / FP4(含高精度训练)—
定位训推一体(万亿级参数训练 + 低精度推理)训推一体
量产2027 Q1,阿里云数据中心规模化部署已规模应用

三个读数:

  • 显存跨入 200GB+ 区间:216GB 与昇腾 960DT(288GB 自研 HBM)、NVIDIA Rubin(288GB HBM4)站上同一容量档位,长上下文与超大 MoE 模型的容量门槛被拉平;
  • 片间互联 1200GB/s:为超节点"内存语义互联"打底——这是与 ICN Switch 配套的芯片级前提;
  • 精度覆盖全场景:官方表述为"高精度训练、低精度和超低精度推理的全场景",FP8/FP4 原生支持与 2026 年新卡通用口径对齐。

单芯片绝对算力数值官方未公布,本站以"3 倍于 M890"的官方相对口径收录;M890 规格详见真武 M890 规格页。

2. 系统级:ICN Switch + 磐久超节点,单集群 50 万卡​

V900 的真正卖点不在单芯片,而在系统级协同:

  • ICN Switch 自研互联芯片:连接后的超节点具备原生内存语义与内存统一编址能力,千卡全带宽高速互联——上千颗 V900 可"像一颗超级芯片一样协同工作";
  • 磐久超节点服务器:集成 V900(算力)+ ICN Switch(互联)+ 磐脉智能网卡(网络)+ 镇岳 SSD 主控(存储),算、存、网全栈自研协同;
  • 50 万卡单集群:结合阿里云新一代智算中心网络架构,单一集群可扩展至 50 万卡规模。

这与华为"11 颗关键芯片"的思路如出一辙:竞争单位已经从单芯片转向整套系统的交付能力——真武管算力、倚天管通用计算、磐脉管网络、镇岳管存储、ICN Switch 管互联。

3. 商业与路线图​

  • 真武系列已服务超 650 家企业客户(截至 2026 年 6 月),覆盖智驾、金融、大模型、具身智能、能源、制造;
  • 基于 M890 的超节点已大规模应用,跑通 Qwen3.8、Kimi K3 等超 2 万亿参数模型;阿里云 Q4 新增服务节点扩大超节点供给;
  • 路线图:V900 于 2027 Q1 量产售卖;真武 J900 计划 2027 Q3 发布;
  • CPU 协同:2027 年推出倚天 720 / 730(730 首次采用平头哥全自研 CPU 微架构,单核 SPECint2017/GHz 最高达倚天 710 的 1.4 倍);2029 年的倚天 750 将通过 ICN 总线与真武 AI 芯片直接互联;
  • 阿里巴巴集团 CEO 吴泳铭表示,平头哥 AI 芯片年出货量将大幅提升。

4. 竞争坐标:同一周,两把剑​

把 9 月中旬的两次发布放在一起看,国产 AI 芯片的"系统级竞争"格局已经清晰:

维度华为昇腾 960(9-17)阿里真武 V900(9-22)
发布节点HC2026云栖大会 2026
单卡显存288GB(自研 HBM)216GB
访存带宽9.6 TB/s未披露
互联灵衢 UnifiedBus / NPO 光互联ICN Switch 内存语义互联
超节点昇腾 960 超节点(4096 卡,8 EFLOPS FP8)磐久超节点(单集群 50 万卡)
上市2027 Q22027 Q1

华为走"超节点 + 开源 CANN 生态"路线,阿里走"云上全栈 + 开源模型生态"路线;单卡规格都仍有代差,但交付的是可采购、可运维的超大规模集群。对英伟达 CUDA 生态的替代逻辑,正在从"性能对标"转向"供给确定性 + 系统效率"。

5. 小结​

  • V900:3×M890、216GB、1200GB/s 片间互联、原生 FP8/FP4,2027 Q1 量产;
  • 系统:ICN Switch 千卡全带宽、磐久超节点算存网全栈、单集群 50 万卡;
  • 节奏:J900 2027 Q3、倚天 730 2027、倚天 750 2029——平头哥首次给出三年代际路线;
  • 看什么:2027 Q1 实际量产与阿里云部署规模、V900 绝对算力披露、ICN Switch 对外供货的可能性。

相关阅读​

参考资料​

  • 环球网:平头哥发布新一代训推一体 AI 芯片真武 V900(2026-09-22)
  • 新浪科技 / TechWeb:阿里平头哥发布新一代 AI 芯片真武 V900,2027 年第一季度量产
  • C114:阿里发布新一代 AI 芯片真武 V900,2027Q1 量产

本文基于阿里巴巴官方发布与公开报道整理。V900 单芯片绝对算力官方未公布;超节点与集群规模为官方口径,以未来实际交付为准。

昇腾 960 官宣发布:FP4 算力翻倍、全球首个 NPO 超节点,华为确认一年一代

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月 17 日,华为全联接大会(HC2026),华为常务董事、ICT 基础设施业务总裁汪涛正式发布昇腾 960。与 8 月数字中国峰会上的"路线图预告"不同,这次是完整的规格官宣——而且提前三个季度就绪。本文基于华为官网新闻稿及多方报道整理,逐项拆解 960 的规格、超节点与路线图含义。


1. 昇腾 960:双版本,训练先行​

昇腾 960 分为两个版本,节奏错开一个季度:

指标昇腾 960DT(训练版)昇腾 960PR(推理版)
FP8 算力2 PFLOPS(较 950 翻倍)待披露
FP4 算力4 PFLOPS待披露
显存288GB(自研 HBM)待披露
显存带宽9.6 TB/s待披露
配套超节点Atlas 860(风冷)Atlas 960(液冷)
就绪 / 上市2027 Q1 / 2027 Q22027 Q3

三个读数:

  • 提前三个季度就绪:960DT 原计划 2027 年 Q4,现在 2027 Q1 就绪、Q2 上市——与 950DT"提前上线华为云"一脉相承,路线图可信度在持续兑现;
  • 精度口径与英伟达对齐:FP8 / FP4 主口径(辅以自研 HiF8 / HiFP8),FP4 已是 2026 新卡的通用口径;
  • 288GB 自研 HBM + 9.6TB/s:显存容量与带宽同步翻倍,对训练长上下文大模型是实打实的容量红利。

单卡规格详见昇腾 960 规格页;上一代昇腾 950DT 规格页。

2. 昇腾 960 超节点:全球首个 NPO 超节点​

这是本场发布真正的"重器"——昇腾 960 超节点是全球第一个采用 NPO(近封装光学)的超节点:

指标昇腾 960 超节点
单节点规模4096 卡
系统算力8 EFLOPS FP8 / 16 EFLOPS FP4
HBM 总容量1 PB
互联 RTT低至 2μs
可用度99.8%

NPO 意味着什么:传统光模块挂在交换机面板上,信号要先出封装再转电—光;NPO 把光引擎挪到交换芯片封装近旁,大幅缩短 SerDes 距离、降低功耗与时延。华为的具体数字:

  • 5500 个自研 Hi-ONE 光引擎(业界首个量产 NPO,单引擎 7.2T);
  • 替代 4.8 万颗 800G 光模块;
  • 降低功耗 550kW 以上,同时支撑 2μs 级互联时延。

对比 8 月数字中国峰会的口径(Atlas 960 单超节点 15488 卡),官方最新口径为单超节点 4096 卡(1 个超集群可由多超节点组成)——以华为官网最新新闻稿为准。

⚠️ 华为还给出了"MFU 提升 2.75 倍""推理时延降低 70%"等收益数据,均出自华为马尔科夫实验室仿真,尚无独立第三方实测,阅读时注意口径。

3. 一年一代:970(2028)→ 980(2029)​

华为首次把"一年一代"从愿景变成官宣承诺:

年份产品状态
2026昇腾 950 系列950PR 已量产,950DT Q4 放量
2027昇腾 960本次官宣,提前就绪
2028昇腾 970HC2026 确认
2029昇腾 980HC2026 确认

支撑这一节奏的是华为提出的"韬定律":算力规格每代翻倍,访存带宽、访存容量、互联带宽同步大幅提升。

生态侧的同场数据也值得记录:CANN 外部开发者占比首次超过 61%、月活开发者 5200 人;910C 超节点部署已超 1000 套。

4. 竞争坐标:单卡有代差,系统级对打​

把 960DT 放到 2027 年的棋盘上看:

  • 对 NVIDIA Rubin(R200:288GB HBM4 / 50 PFLOPS FP4):单卡 FP4 算力约为 R200 的 8%(4 vs 50 PFLOPS),单卡代差客观存在;但 4096 卡超节点 + NPO 互联是系统级竞争——用"可交付的超大集群"对打单卡性能;
  • 对采购方:960 的价值主张是"在国产量产约束内拿到最大可用集群"。DeepSeek 拟采购 16 万颗 950DT 跑推理的订单已经证明:当供给与生态到位,头部实验室愿意主动选国产;
  • 对国产链条:950→960 的显存翻倍直接拉动国产 HBM 迭代,这是整条链的胜负手。

5. 小结​

  • 960DT:FP8 2P / FP4 4P、288GB HBM、9.6TB/s,2027 Q2 上市,提前三个季度;
  • 960 超节点:全球首个 NPO 超节点,4096 卡 / 8 EFLOPS FP8 / 1PB HBM / RTT 2μs;
  • 路线图:一年一代官宣至 2029,950、960 均提前兑现,规划可信度显著上升;
  • 看什么:2027 Q2 实际交付节奏、国产 HBM 产能、CANN 生态的第三方模型覆盖度。

相关阅读​

参考资料​

  • 华为官网:发布全球首个采用 NPO 的超节点(昇腾 960 超节点)(2026-09-17)
  • 电子工程专辑:国产 AI 芯片新突破!华为昇腾 960 芯片将提前发布
  • 环球网:华为全联接大会 2026 主题演讲报道

本文基于华为官网新闻稿与公开报道整理。MFU、时延等收益数据为华为实验室仿真口径;2028 / 2029 产品仅为路线图官宣,规格以未来发布为准。

AWS 再加购 200 万颗英伟达 GPU:Vera CPU 首次登陆 AWS,10 万颗专供美国政府 AI 工厂

· 阅读需 5 分钟
Industry Research Team

本文基于 AWS 与 NVIDIA 官方公告(2026 年 9 月 5 日)及双方高管公开表态整理。

2026 年 9 月 5 日,AWS 与英伟达宣布扩大战略合作:在 GTC 2026 已宣布的「2026 年起新增 100 万颗 GPU」计划之上,再追加部署 200 万颗 NVIDIA GPU,覆盖 Blackwell Ultra、Rubin 与 Rubin Ultra 三代架构,时间窗口为 2027-2028 年。需求增长超出此前所有预测,是双方给出的直接理由。

这不再是单纯的「买卡」,而是一次覆盖 GPU、CPU、互联、内存、开源模型与软件的全栈合作。我们把关键信息拆成六点。

一、200 万颗 GPU 的构成与节奏​

  • 规模:200 万颗(在原有 100 万颗计划之上追加,总承诺规模翻了三倍)
  • 架构:Blackwell Ultra、Rubin、Rubin Ultra
  • 时间:2027-2028 年,部署于 AWS 全球基础设施(含新建 AI 工厂)
  • 背景:亚马逊 2026 年资本支出指引已从 2000 亿美元上调至 2200 亿美元,CEO 安迪·贾西明确表示仍不足以满足 AI 算力需求

作为参照,GTC 2026 上黄仁勋给出的口径是:Blackwell 与 Rubin 两大平台至 2027 年的累计订单与需求规模已上看 1 万亿美元(GTC 2025 时对 2026 年的判断约为 5000 亿美元)。AWS 的加购是这个大盘子里最重的一块拼图之一。

二、Vera CPU 首次登陆 AWS​

这是本次合作里最具结构性的变化:NVIDIA Vera CPU 基础设施将进入 AWS。

Vera CPU 是 Vera Rubin 平台中面向 agentic AI 设计的通用处理器,定位是把 AI 资源高效转化为「完成的智能体任务」。随着智能体工作负载兴起,CPU 侧的任务编排、内存管理、数据调度压力同步上升——纯 GPU 扩容已经不够,AWS 需要与之配套的高性能 CPU 层。这也与 AWS「从自研芯片(Graviton/Trainium)到合作伙伴芯片提供最广算力选择」的策略一致:Vera 不替代 Trainium,而是补齐加速基础设施旁边的 CPU 算力层。

在 re:Invent 2025 上,AWS 宣布下一代 Trainium 芯片支持 NVIDIA NVLink Fusion 高速互联。本次双方把合作再推进一步:

  • 亚马逊 Annapurna Labs 将支持英伟达新的定制高带宽内存 NVHBM(与内存供应商合作开发)
  • Trainium 由此可以获得更快、更省电的内存选项
  • Trainium 与 GPU 可以在同一机架级架构内协同,共享 scale-up 互联

对芯片行业来说,这是一个值得盯紧的信号:NVLink Fusion + NVHBM 意味着英伟达的互联与内存技术开始向竞品 ASIC「供货」。自研 ASIC 阵营(Trainium、TPU、MTIA)与英伟达 GPU 阵营的边界,正在从「二选一」变成「混布」。

四、10 万颗 GPU:美国政府主权 AI 工厂​

合作中专门划出一块公共部门业务:AWS 与英伟达将为美国政府建造 AI 工厂,在安全 AWS 基础设施上部署 10 万颗 GPU,承载联邦与国家安全负载(Impact Level 6 及以上),支持在强监管框架内开发先进 AI 模型。

主权 AI 从口号变成明确数字,是本轮周期的显著特征——政府客户正在成为 AI 算力的一等买家。

五、软件与物理 AI 同步深化​

硬件之外,软件层合作也在加码:

  • NVIDIA Nemotron 开源模型继续登陆 Amazon Bedrock 与 SageMaker
  • Amazon EMR 数据处理与 OpenSearch 向量索引用 cuDF / cuVS 加速
  • Amazon Robotics 正式采用 NVIDIA 物理 AI 平台(Jetson、Omniverse、Isaac),用于仓储自动化与下一代机器人

物理 AI(机器人、具身智能)正在成为云厂商算力叙事的新增长极,这与国内京东、特斯拉等把具身智能写进算力采购逻辑是同一趋势。

六、对算力买家的启示​

观察含义
需求「跑赢所有预测」供给紧张不是短期现象,2027-2028 的算力窗口现在就要锁定
三代架构混采Rubin/Rubin Ultra 量产爬坡期间,Blackwell Ultra 仍是交付主力,采购需要跨代规划
CPU 层被重估agentic AI 把瓶颈从 GPU 推向 CPU 编排与内存带宽,选型时别只盯加速卡
主权 AI 落地政府级订单入场,进一步收紧高端 GPU 的可分配供给

对自建与租用的决策者而言,云巨头的每一次天量加购都在重定价未来的租金曲线。如果你正在评估 GPU 采购或租用方案,建议用 TCO 计算器 做一次量化测算:输入芯片价格、功耗、利用率与租用单价,即可对比 3 年持有成本。

小结​

200 万颗 GPU、Vera CPU 上云、NVHBM 开放、10 万颗主权算力——AWS 与英伟达这轮扩盟把「AI 工厂」竞赛推进到全栈时代。算力的稀缺性在 2027 年之前大概率只紧不松,无论是买卡、租卡还是押注国产替代,尽早锁定供给与成本曲线,都是当前最确定的动作。

(本文数据均来自 AWS/NVIDIA 官方公告与双方高管公开表态;架构性能口径以厂商发布为准。)

昇腾 950 超节点 Q4 上市,中兴、新华三、曙光全线跟进:国产超节点从概念走向交付

· 阅读需 6 分钟
Industry Research Team

芯片追不上,系统来补。这是国产算力过去一年最清晰的战略共识。2026 年下半年,国产超节点正式从"概念发布"进入"产品密集发布、联合适配和商业部署"阶段:华为 Atlas 950 SuperPoD 真机已亮相并计划 Q4 上市,中兴、新华三、中科曙光、壁仞、沐曦等一众厂商相继入局。


1. 华为 Atlas 950:业界最大 1024 卡超节点,Q4 上市​

继 7 月 WAIC 2026 真机首秀后,华为昇腾 950 超节点的商用脚步持续加快。核心规格:

指标Atlas 950 SuperPoD
互联规模最大 1024 × 昇腾 950DT(灵衢高速互联)
AI 算力1 EFLOPS FP8/mxFP8/HiF8、2 EFLOPS FP4
全局内存256TB 统一编址,片上内存最大 1024 × 96GB @ 4.0TB/s
互联带宽单柜最大 64 × 1.68 TB/s(双向),3μs 超低 RTT
形态满配 128 计算柜 + 32 互联柜,占地约 1000㎡,8192 颗 950DT
供电散热全液冷,100kW 供电,380V AC/336V DC/240V DC
上市时间2026 年第四季度

在 WAIC 展台之外,两个数字更能说明商业化进度:昇腾 384 超节点已商用落地 750 多套,规模应用于互联网、运营商、金融、教育、医疗等行业,并且是国内唯一训练出 SOTA 模型的超节点;更远期规划中,Atlas 950 SuperCluster(超 50 万颗昇腾芯片)同样定于 2026 Q4,Atlas 960 SuperPoD(15488 卡)与 Atlas 960 SuperCluster(超 100 万卡)将于 2027 Q4 接力。

华为的路线图背后是"Tau Scaling Law"——在 EUV 光刻机受限的前提下,通过系统级扩展突破单芯片物理极限,并计划到 2031 年将晶体管密度推升至 1.4nm 级工艺水平。

2. 超节点赛道全面开花:三条技术路线​

WAIC 之后,国产超节点形成了三类清晰的技术路线:

第一类:华为全栈自研。 同时掌握昇腾芯片、灵衢互联、Atlas 硬件、CANN 软件栈和 MindSpore 框架。CANN 已全面开源:社区上线 67 个项目、开源代码超 1244 万行、月活开发者突破 3500 人;昇腾开发者总数超 400 万。

第二类:中兴、新华三的兼容路线。 中兴发布 OEX 超节点新品,依托协议标准化与接口统一,全面兼容多元 GPU 生态;新华三 UniPoD S80000 系列可从 32 卡扩展至 1024 卡、最大支持 16384 卡互联,将 Scale-up/Scale-out 网络、液冷、供电、管理和故障恢复整合进同一套架构。

第三类:国产 GPU 联合创新。 中兴联合曦智、壁仞、沐曦、燧原、天数智芯等,基于 OEX+dOCS 架构打造国产高性能 Matrix 超节点;壁仞计划发布 BR20x 系列 GPU,基于自研 BLink 2.0 互联协议实现单超节点 1024 卡 Scale-up;沐曦推出"曦景"S 系列超节点。

在更大的 Scale-out 层面,中科曙光"曙光 8000(登峰)"全国产十万卡 AI 超集群已落成并接入国家超算互联网——它不是单体超节点,而是由大量计算节点、超节点和网络存储组成的超集群,检验的是国产算力的大规模调度、应用适配和工程交付能力。

3. 为什么"超节点"成了国产算力的主战场​

根本原因在于衡量标准变了:国产算力的评价体系,正从"比较单颗芯片的峰值性能"转为"一整套系统能够调动多少有效算力"。华为副董事长徐直军对此直言:单芯片上英伟达仍领先且短期难以追赶,但在超节点和集群层面,华为有信心。

这一转向的产业逻辑:

  • 出口管制下的现实选择:单卡制程受限 → 用高速互联把更多 NPU 组织成一台"大计算机";
  • 需求侧真实拉动:万亿参数 MoE 模型的训练与推理,天然需要大规模低时延互联,超节点恰是对症下药;
  • 生态护城河前移:CANN 开源 + MindSpore 兼容 PyTorch,把 CUDA 生态的竞争从"算子覆盖"层面拉回到"开发者规模"层面。

东兴证券指出,全球超节点赛道已聚集微软、Meta、亚马逊、三大运营商、阿里、字节、腾讯、百度、曙光、中兴、浪潮、新华三、海光、沐曦等数十家厂商——格局未定,但英伟达一家独大的局面正在被谷歌 TPU、AMD Helios、华为 Atlas 三股力量同时挑战。

4. 三道关卡:从"造出来"到"卖得动"​

业内人士普遍认为,国产超节点距离真正成熟还有三道坎:

  1. 单芯片性能与单柜算力密度:受制程限制,单卡性能差距仍存,现阶段靠多柜互联和规模扩展另辟蹊径;
  2. 规模扩展效率:超节点扩展到一定规模后性能提升边际递减,通信复杂度、能耗和容错成本持续上升;
  3. 可验证的商业价值:下一阶段的比拼是有效算力利用率、单位 token 成本、模型适配广度与客户复购意愿。

一句话总结:2026 年是"中国超节点元年",2027 年见真章——届时 Atlas 950 与 Vera Rubin NVL 系列将在全球两个平行市场各自接受规模化交付的检验。


相关链接​

参考资料​


本文基于 WAIC 2026 现场报道、昇腾社区官方规格与公开研报整理。超节点性能数据均为厂商公布口径,独立第三方评测结果尚待观察。

Vera Rubin 全面量产:100% 全液冷 + 800V 直流供电,AI 数据中心基础设施范式重构

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月初,供应链信息确认:英伟达 Vera Rubin 平台已于 8 月正式量产、9 月启动批量出货,无延期、无卡顿。与 Blackwell 迭代初期的产能波折不同,这次量产节奏异常平稳——谷歌云、微软 Azure、CoreWeave、甲骨文云等头部云厂商已启动机架部署。但真正值得产业记住的,不是"又一代 GPU 量产了",而是 Rubin 把液冷从"可选配置"变成了"硬性前置条件"。


1. 量产节奏:史上最平稳的一次平台切换​

根据产业链调研与券商跟踪信息:

  • 2026 年 8 月:Vera Rubin 正式量产;
  • 2026 年 9 月:批量出货启动;
  • 2026 下半年:CoreWeave、谷歌云、微软 Azure、甲骨文云机架部署落地;
  • 2026 年:上代 GB 架构机柜出货量有望达 6 万台(同比翻倍);
  • 2027 年:GB 与 Rubin 两代平台合计出货体量有望接近 10 万台,Rubin 新机柜远期产能目标为每天 1000 个 NVL72 机柜。

需求侧同样在加码:华尔街报告披露,英伟达管理层表示 FY28 同比增长 70% 的目标并非需求上限——若供应不受限,增速可能超过 100%。当前主要约束已从需求端转向先进晶圆与 HBM 供应。

2. 单卡 2300W:风冷时代的终结​

Rubin 平台与前代最根本的差异不在算力,而在功耗密度:

指标H100GB300Rubin
单 GPU TDP700W~1400W2300W
机柜功耗~40kW~140kW190–230kW
散热方案风冷为主风液混合100% 全液冷
供电架构48V48V800V 高压直流

单芯片 TDP 从 700W 升至 2300W、单机柜功率密度突破风冷物理极限——这意味着 液冷不再是高端算力的选配升级,而是运行 Rubin 服务器的先决条件。英伟达官方将 Rubin 全液冷架构定义为"数据中心历史上最重要的能效突破之一",并已写入 DSX AI 工厂参考设计:所有跟随英伟达技术路线的云厂商和数据中心运营商,都必须采用全面液冷方案。

三个关键架构变化:

  1. 无风扇整机:GPU、CPU、交换机、DPU 全部器件强制采用直接冷板式液冷,45℃ 温水冷板成为出厂标配;
  2. 液冷边界延伸:散热覆盖范围从 GPU 冷板延伸至 CPU、DPU、交换机乃至光模块(液冷 Cage/鼠笼开始从"可选"变"刚需"),整套液冷系统价值量较 GB300 提升约 40%;
  3. 800VDC 供电:替代传统 48V 机架配电,整机电源 BOM 价值增长 30% 以上,PSU 电源模块从 5.5kW 向 18.3kW 迭代,固态变压器、高压直流 CDU 成为数据中心新增核心设备。

3. 对产业链的三重传导​

第一重:液冷从"配套"变"主角"。 2026 下半年以小规模部署验证为主,真正的放量窗口在 2027 年——Rubin 机架大规模铺货后,冷板、快速接头、CDU、液冷泵进入业绩兑现期。台系供应链 7 月数据已率先验证:AVC 奇鋐 7 月营收 185.9 亿新台币创历史新高(同比 +57.4%),双鸿、健策 7 月同比分别 +116.7%、+91.0%。

第二重:国产液冷供应链进入核心 BOM。 国内厂商由外围冷源和代工环节逐步进入芯片平台、服务器 ODM 和海外云厂商供应体系,替代路径从 Manifold、管路推进至高可靠快接头和冷板。英维克 26H1 海外收入占比 71.4%,飞龙股份液冷泵小功率平台订单超 5 万台——液冷全核心零部件自主可控正在成为现实。

第三重:供电与散热边界融合。 800VDC 架构下,电源模块、PDB 配电单元、高速交换芯片自身发热也达到很高水平,部分电源组件同样需要液冷辅助散热——电源与温控两条产业链正在合并成一条。

4. 需求矩阵扩容:云厂商之外,太空算力入场​

Rubin 的客户矩阵已从传统云厂商扩展至三个层次:

  • 全球云厂商:谷歌云、Azure、甲骨文云、CoreWeave;
  • AI 科技巨头:马斯克公开披露 2027 年 8GW 超大规模 IDC 建设规划;SpaceX 将 Vera Rubin 架构定义为"最优 AI 计算架构",计划地面与太空双向部署,支撑 "Starmind" 卫星算力项目;
  • 主权与边缘:远期 Rubin Ultra 及 2027 年后更高功耗机型单机柜有望冲击 600kW+。

普华永道预计全球数据中心累计投资到 2035 年将达 31.6 万亿美元。AI 基础设施建设的确定性,已经从"是否建设"变成"多快建设"。

5. 对采购方的启示​

  • 机房规划前置:2027 年起采购 Rubin 级算力,液冷改造(单千瓦改造成本较高)或按全液冷标准新建,必须在预算周期一开始就纳入;
  • 看 PUE 也看水温:45℃ 温水直冷允许更高进水温度,可利用自然冷源压低 PUE——选址时人工冷源依赖度成为新的评估维度;
  • 供应商组合即风险对冲:HBM 与先进封装供应是当前核心瓶颈(详见本站 HBM4 竞速分析),供应链多元化比单点性能更重要。

相关链接​

参考资料​


本文基于 2026 年 9 月初供应链调研、券商研报与英伟达官方披露整理。出货量与功耗数据为产业链预估口径,实际以英伟达及客户正式披露为准。

云巨头自研芯片浪潮 2026:OpenAI Jalapeño、Maia 200、MTIA、TPU v8 集体"去英伟达化"

· 阅读需 6 分钟
Industry Research Team

2026 年 8 月 Hot Chips 的周二下午 AI 专场,是本届最有历史意义的一场——不是因为某颗芯片多强,而是因为登台的几乎全是"超算厂商去 NVIDIA 化"的自研 ASIC:Google 第八代 TPU、OpenAI 首颗自研芯片、微软 Maia、Meta MTIA、Cerebras 晶圆级机架同台。当全球最大的 AI 算力买家开始把 GPU 当作"可选项之一",AI 硬件的权力结构正在松动。


1. OpenAI Jalapeño:9 个月造出一颗芯片​

OpenAI 于 2026 年 6 月 24 日联合博通发布首款自研推理 ASIC Jalapeño,是"自研推理芯片俱乐部"的第五个成员。

维度Jalapeño
合作方博通(Broadcom)+ 台积电制造
定位推理专用 ASIC
设计周期端到端 9 个月(Greg Brockman 称借助 OpenAI 自有模型辅助设计)
成本目标较通用 GPU 栈 token 成本降约 50%
商用时间2026 年底首批部署,长期目标 10GW 自研芯片
合作规模与博通最高 100 亿美元战略合作(2029 年前部署加速器与网络)

演讲标题"You Can Just Build Things … Chips"本身就是信号:最大的 AI 算力买家不再默认 GPU 是唯一路径。


2. Google TPU v8:十年来最大架构转向——训练/推理分芯​

Google 拥有最悠久的自研芯片历史(2016 至今),第八代 TPU 首次将产品线一分为二:

型号代号合作方定位关键规格
TPU 8tSunfishBroadcom训练单 pod 9600 卡、121 FP4 ExaFLOPS、2PB 共享 HBM、ICI 带宽翻倍
TPU 8iZebrafishMediaTek推理288GB HBM、384MB 片上 SRAM(3× 上代)、ICI 19.2 Tb/s

产能方面,摩根士丹利基于供应链访谈估算 2026 年 Google TPU 产量可能超 300 万颗(券商预测,非官方目标)。Google 也是唯一实现自研芯片大规模部署并对外销售算力的厂商(Gemini 跑在 TPU 上)。


3. Meta MTIA:从推荐系统到 GenAI 双使命​

Meta 的自研之路起点最清晰——MTIA 最初为推荐排序硬件而生,正被生成式 AI 拉向双使命。

  • MTIA 300 已部署;400 / 450 / 500 计划在 2027 年前约每 6 个月推出一款;
  • 基于 RISC-V,Meta 称最高 25× 算力增益;
  • 节点沿行业节奏演进:100(7nm)→ 200(5nm)→ 300 系列(3nm + CoWoS);
  • 与 博通合作,据称另一颗代号 Iris 的芯片已于 2026 年 7 月通过测试;
  • Meta 计划 2026 年 9 月启动其中一款的量产,以将其整体算力翻倍。

4. 微软 Maia 200/300:部署最领先​

微软 Maia 200 于 2026 年 1 月 26 日发布,是四家中部署最先进的:

维度Maia 200
制程台积电 3nm,1400 亿+ 晶体管
算力10+ PFLOPS FP4 / 5 PFLOPS FP8
显存216GB HBM3E,7 TB/s
功耗750W
部署已在得梅因(Des Moines)数据中心运行,服务 OpenAI GPT-5.2 与 Microsoft 365 Copilot

微软称其在特定基准上约 3× 亚马逊 Trainium 性能。短期策略是"自研 Maia + 外购英伟达"双路线并行——自研芯片从设计到量产需要时间,英伟达成熟生态短期内无法替代。


5. 亚马逊 Trainium 3 与 Anthropic 自建团队​

  • 亚马逊:Trainium 系列已商用,累计部署 140 万颗(官方披露),是数十亿美元业务;优势在 AWS 客户基数——企业可在英伟达 GPU 与自研芯片间选择。Trainium 3 延续这一路线。
  • Anthropic:2026 年 8 月宣布组建自建芯片团队,尚无 tape-out 或量产时间表,初期定位为补充(而非取代)与 NVIDIA/AMD/AWS/Google Cloud 的现有合作,目标是为 Claude 架构量身打造、摆脱对单一 GPU 的依赖。

6. NVIDIA 的回应:不是更快的 GPU,而是全栈​

容易把叙事简化成"四家造芯片、英伟达防守 GPU"。但 NVIDIA 在 Hot Chips 拿了 6 个 slot:RISC-V 教程、Vera CPU、Rubin GPU、BlueField-4 DPU、Spectrum-X 多平面网络、以及 LPU 加速器。

一颗 hyperscaler ASIC 只替换了这五个支柱中的一个。如果 CPU、NIC、交换 fabric 与软件都来自同一家供应商,把加速器换掉省下的,比加速器那一行账单暗示的要少得多。Rubin 的打法是一个横跨七颗芯片、五种机柜的全栈 AI 工厂平台——竞争回应是"全栈位置",而非"更快的一颗芯"。


7. 趋势判断:推理去 GPU 化,训练仍 GPU 主导​

  • 推理侧:CUDA 护城河明显变浅。推理在端点层面可并行、可替换,自研 ASIC 通过剪掉通用性税(只实现 LLM 实际执行的操作)换取更低 cost/token。Groq LPU、Cerebras、各家 TPU/ASIC 都在同一指标上竞争。
  • 训练侧:Foundation model 仍用 GPU 训练,短期内无人认真挑战。NVIDIA 在训练的三道护城河(最快硅 + NVLink + CUDA)依旧牢固。
  • 结论:自研芯片不是"替代英伟达",而是在推理这一最大、增长最快的战场上,给买家一个可信的谈判外部选项——这本身就足以重塑 AI 基础设施的经济学。

相关链接​

参考资料​


本文基于 2026 年 8 月 Hot Chips 现场报道、企业公告与行业分析整理。部分产能与性能为券商估算或厂商公布口径,实际以量产产品为准。