跳到主要内容

Huawei Ascend 960 (昇腾 960)

产品概述​

Huawei Ascend 960 是昇腾第五代 AI 芯片,2026 年 9 月 17 日华为全联接大会(HUAWEI CONNECT 2026,上海)由轮值董事长汪涛正式官宣。与上代最大不同:960 不再是单纯的路线图预告,而是双版本(960DT 训练 / 960PR 推理)+ 双超节点(Atlas 860 风冷 / Atlas 960 液冷)的完整商用组合,且两款芯片均提前就绪——960DT 较原计划提前三个季度,960PR 提前一个季度。

同时官宣的还有全球首个采用 NPO(近封装光学)技术的超节点——昇腾 960 超节点:单节点 4096 卡互联、8 EFLOPS FP8、1PB HBM,基于「灵衢 UnifiedBus + Hi-ONE 光引擎」打造。华为同步确认一年一代迭代节奏:2028 年昇腾 970、2029 年昇腾 980。

⚠️ 信息口径说明:本卡单芯片规格以 HC2026 官方披露为准。2026 年 8 月数字中国建设峰会曾披露「Atlas 960 SuperPoD 支持 15488 张昇腾卡」,9 月官方口径为单超节点 4096 卡(约为此前 15488 说法的修订,本文以官方新闻稿为准)。

核心规格​

以下为 昇腾 960DT(训练版,官方披露值):

项目参数
架构Da Vinci v6(昇腾第六代)
FP8 算力2 PFLOPS
FP4 算力4 PFLOPS
显存288 GB(自研 HBM,最高配置)
显存带宽9.6 TB/s
TDP700 W(推测,官方未披露)
首发2027 Q2

📌 相比 950 系列(FP8 1 PFLOPS / FP4 2 PFLOPS),960 各核心指标翻倍:FP8 2→×2、FP4 4→×2、显存 288GB vs 144GB(950DT)、带宽 9.6TB/s vs 4TB/s。华为称这一持续翻倍路径为「韬定律」。

⚠️ TDP 为第三方推测值,官方未公布;风冷版本(Atlas 860)的存在意味着单卡功耗需控制在风冷散热可承受范围内。

960DT vs 960PR 双版本​

维度960DT(训练)960PR(推理)
FP8 算力2 PFLOPS未单独披露
就绪时间2027 Q1(提前 3 个季度)2027 Q3(提前 1 个季度)
上市时间2027 Q22027 Q3
配套超节点Atlas 860(风冷)Atlas 960(液冷)
定位十万亿参数模型训练 + 高并发推理大规模推理部署

昇腾 960 超节点(全球首个 NPO 超节点)​

指标昇腾 950 超节点昇腾 960 超节点
单节点卡数1024 卡(WAIC 2026 展出)4096 卡
FP8 算力8 EFLOPS(8192 卡满配)8 EFLOPS(单节点)
FP4 算力16 EFLOPS(8192 卡满配)16 EFLOPS(单节点)
HBM 总容量1152 TB(8192 卡满配)1 PB(4096 卡)
互联 RTT3 μs2 μs(全域 D2D)
光互联灵衢 2.0 总线NPO 光引擎 Hi-ONE(业界首个量产)

NPO(近封装光学)关键数据​

  • Hi-ONE 光引擎:单引擎传输容量 7.2T,业界首个量产 NPO 产品、当前传输能力最大、唯一内置光源
  • 5500 个 Hi-ONE 替代 48000 颗 800G 光模块,功耗降低超 550 kW
  • 系统无故障运行时间提升一倍,整体可用度达 99.8%
  • 为什么选 NPO 而非 CPO:NPO 在保留光引擎独立性的同时实现光电近距离握手,规避 CPO 的可靠性、可制造性、可维护性难题,延续现有光模块产业生态
  • MFU 收益(华为马尔科夫实验室仿真):4K 超节点组成的 10 万卡集群,相比 8 卡服务器组网,MFU 提升 2.75 倍——传统架构下集群内通信占训练时间超过 40%

集群扩展路径​

  • 多个 960 超节点经灵衢网络或 RoCE 互联:最大 51.2 万卡(二层 CLOS 四平面组网)
  • 叠加多轨道拓扑:最大 100 万卡昇腾超节点集群
  • 鲲鹏超节点同步升级:全光组网最大 4096 节点、256TB 统一内存池

一年一代路线图(韬定律)​

年份芯片状态
2026昇腾 950DT / 950PR已规模商用
2027昇腾 960DT / 960PR提前就绪,Q2 / Q3 上市
2028昇腾 970官宣,算力规格继续翻倍
2029昇腾 980官宣,访存带宽 / 容量 / 互联带宽同步大幅提升

生态与部署现状​

  • 部署底盘:昇腾 910C 超节点已部署超 1000 套,昇腾 950 超节点已规模商用——960 是踩着两级台阶向上
  • CANN 生态跨越拐点:外部开发者占比升至 61%(首次超越内部团队),月活跃开发者突破 5200 人,CANN 全面开源并进入常态化社区运营
  • 鲲鹏 + 昇腾:已汇聚 780 余万开发者,孵化 2 万多个行业解决方案
  • 存储配套:OceanStor M900 集群(灵衢总线一跳直连 PB 级 KV 缓存)同步发布

与竞品对比​

指标昇腾 960DTNVIDIA B200NVIDIA Rubin R200AMD MI455X
FP8 算力2 PFLOPS4.5 PFLOPS12.5 PFLOPS2.3 PFLOPS
FP4 算力4 PFLOPS9 PFLOPS50 PFLOPS4.6 PFLOPS
HBM 容量288 GB192 GB288 GB288 GB
HBM 带宽9.6 TB/s8 TB/s16 TB/s12 TB/s
制程SMIC 国产化(未官宣)TSMC 4NPTSMC 4NPTSMC 3NM
上市2027 Q2已上市已上市已上市

960 单卡绝对性能仍落后 NVIDIA 旗舰一代(Rubin R200 FP8 约为其 6 倍),华为的策略是以超节点系统级能力(统一内存编址、MFU 提升 2.75 倍、NPO 光互联)弥补单卡差距——评估国产算力不能只比单芯片 PFLOPS。

适用场景​

  • ✅ 十万亿参数级大模型训练(4096 卡超节点 + 统一内存编址)
  • ✅ 高并发推理(推理时延较前代降低约 70%,训练吞吐提升约 2.3 倍,官方口径)
  • ✅ 常规机房部署(Atlas 860 风冷超节点,无需液冷改造)
  • ❌ 单卡采购(以超节点 / 集群形态交付)
  • ❌ 2026 年内落地(芯片 2027 年上市)

厂商信息​

项目内容
制造商华为技术有限公司(海思半导体)
官网https://www.hiascend.com
官宣2026-09-17(华为全联接大会 2026,上海)
960DT 上市2027 Q2
960PR 上市2027 Q3

参考资料​

相关产品​