Huawei Ascend 960 (昇腾 960)
产品概述
Huawei Ascend 960 是昇腾第五代 AI 芯片,2026 年 9 月 17 日华为全联接大会(HUAWEI CONNECT 2026,上海)由轮值董事长汪涛正式官宣。与上代最大不同:960 不再是单纯的路线图预告,而是双版本(960DT 训练 / 960PR 推理)+ 双超节点(Atlas 860 风冷 / Atlas 960 液冷)的完整商用组合,且两款芯片均提前就绪——960DT 较原计划提前三个季度,960PR 提前一个季度。
同时官宣的还有全球首个采用 NPO(近封装光学)技术的超节点——昇腾 960 超节点:单节点 4096 卡互联、8 EFLOPS FP8、1PB HBM,基于「灵衢 UnifiedBus + Hi-ONE 光引擎」打造。华为同步确认一年一代迭代节奏:2028 年昇腾 970、2029 年昇腾 980。
⚠️ 信息口径说明:本卡单芯片规格以 HC2026 官方披露为准。2026 年 8 月数字中国建设峰会曾披露「Atlas 960 SuperPoD 支持 15488 张昇腾卡」,9 月官方口径为单超节点 4096 卡(约为此前 15488 说法的修订,本文以官方新闻稿为准)。
核心规格
以下为 昇腾 960DT(训练版,官方披露值):
| 项目 | 参数 |
|---|---|
| 架构 | Da Vinci v6(昇腾第六代) |
| FP8 算力 | 2 PFLOPS |
| FP4 算力 | 4 PFLOPS |
| 显存 | 288 GB(自研 HBM,最高配置) |
| 显存带宽 | 9.6 TB/s |
| TDP | 700 W(推测,官方未披露) |
| 首发 | 2027 Q2 |
📌 相比 950 系列(FP8 1 PFLOPS / FP4 2 PFLOPS),960 各核心指标翻倍:FP8 2→×2、FP4 4→×2、显存 288GB vs 144GB(950DT)、带宽 9.6TB/s vs 4TB/s。华为称这一持续翻倍路径为「韬定律」。
⚠️ TDP 为第三方推测值,官方未公布;风冷版本(Atlas 860)的存在意味着单卡功耗需控制在风冷散热可承受范围内。
960DT vs 960PR 双版本
| 维度 | 960DT(训练) | 960PR(推理) |
|---|---|---|
| FP8 算力 | 2 PFLOPS | 未单独披露 |
| 就绪时间 | 2027 Q1(提前 3 个季度) | 2027 Q3(提前 1 个季度) |
| 上市时间 | 2027 Q2 | 2027 Q3 |
| 配套超节点 | Atlas 860(风冷) | Atlas 960(液冷) |
| 定位 | 十万亿参数模型训练 + 高并发推理 | 大规模推理部署 |
昇腾 960 超节点(全球首个 NPO 超节点)
| 指标 | 昇腾 950 超节点 | 昇腾 960 超节点 |
|---|---|---|
| 单节点卡数 | 1024 卡(WAIC 2026 展出) | 4096 卡 |
| FP8 算力 | 8 EFLOPS(8192 卡满配) | 8 EFLOPS(单节点) |
| FP4 算力 | 16 EFLOPS(8192 卡满配) | 16 EFLOPS(单节点) |
| HBM 总容量 | 1152 TB(8192 卡满配) | 1 PB(4096 卡) |
| 互联 RTT | 3 μs | 2 μs(全域 D2D) |
| 光互联 | 灵衢 2.0 总线 | NPO 光引擎 Hi-ONE(业界首个量产) |
NPO(近封装光学)关键数据
- Hi-ONE 光引擎:单引擎传输容量 7.2T,业界首个量产 NPO 产品、当前传输能力最大、唯一内置光源
- 5500 个 Hi-ONE 替代 48000 颗 800G 光模块,功耗降低超 550 kW
- 系统无故障运行时间提升一倍,整体可用度达 99.8%
- 为什么选 NPO 而非 CPO:NPO 在保留光引擎独立性的同时实现光电近距离握手,规避 CPO 的可靠性、可制造性、可维护性难题,延续现有光模块产业生态
- MFU 收益(华为马尔科夫实验室仿真):4K 超节点组成的 10 万卡集群,相比 8 卡服务器组网,MFU 提升 2.75 倍——传统架构下集群内通信占训练时间超过 40%
集群扩展路径
- 多个 960 超节点经灵衢网络或 RoCE 互联:最大 51.2 万卡(二层 CLOS 四平面组网)
- 叠加多轨道拓扑:最大 100 万卡昇腾超节点集群
- 鲲鹏超节点同步升级:全光组网最大 4096 节点、256TB 统一内存池
一年一代路线图(韬定律)
| 年份 | 芯片 | 状态 |
|---|---|---|
| 2026 | 昇腾 950DT / 950PR | 已规模商用 |
| 2027 | 昇腾 960DT / 960PR | 提前就绪,Q2 / Q3 上市 |
| 2028 | 昇腾 970 | 官宣,算力规格继续翻倍 |
| 2029 | 昇腾 980 | 官宣,访存带宽 / 容量 / 互联带宽同步大幅提升 |
生态与部署现状
- 部署底盘:昇腾 910C 超节点已部署超 1000 套,昇腾 950 超节点已规模商用——960 是踩着两级台阶向上
- CANN 生态跨越拐点:外部开发者占比升至 61%(首次超越内部团队),月活跃开发者突破 5200 人,CANN 全面开源并进入常态化社区运营
- 鲲鹏 + 昇腾:已汇聚 780 余万开发者,孵化 2 万多个行业解决方案
- 存储配套:OceanStor M900 集群(灵衢总线一跳直连 PB 级 KV 缓存)同步发布
与竞品对比
| 指标 | 昇腾 960DT | NVIDIA B200 | NVIDIA Rubin R200 | AMD MI455X |
|---|---|---|---|---|
| FP8 算力 | 2 PFLOPS | 4.5 PFLOPS | 12.5 PFLOPS | 2.3 PFLOPS |
| FP4 算力 | 4 PFLOPS | 9 PFLOPS | 50 PFLOPS | 4.6 PFLOPS |
| HBM 容量 | 288 GB | 192 GB | 288 GB | 288 GB |
| HBM 带宽 | 9.6 TB/s | 8 TB/s | 16 TB/s | 12 TB/s |
| 制程 | SMIC 国产化(未官宣) | TSMC 4NP | TSMC 4NP | TSMC 3NM |
| 上市 | 2027 Q2 | 已上市 | 已上市 | 已上市 |
960 单卡绝对性能仍落后 NVIDIA 旗舰一代(Rubin R200 FP8 约为其 6 倍),华为的策略是以超节点系统级能力(统一内存编址、MFU 提升 2.75 倍、NPO 光互联)弥补单卡差距——评估国产算力不能只比单芯片 PFLOPS。
适用场景
- ✅ 十万亿参数级大模型训练(4096 卡超节点 + 统一内存编址)
- ✅ 高并发推理(推理时延较前代降低约 70%,训练吞吐提升约 2.3 倍,官方口径)
- ✅ 常规机房部署(Atlas 860 风冷超节点,无需液冷改造)
- ❌ 单卡采购(以超节点 / 集群形态交付)
- ❌ 2026 年内落地(芯片 2027 年上市)
厂商信息
| 项目 | 内容 |
|---|---|
| 制造商 | 华为技术有限公司(海思半导体) |
| 官网 | https://www.hiascend.com |
| 官宣 | 2026-09-17(华为全联接大会 2026,上海) |
| 960DT 上市 | 2027 Q2 |
| 960PR 上市 | 2027 Q3 |
参考资料
相关产品
- Huawei Ascend 950 - 前代超节点(8192 卡规划)
- Huawei Ascend 950DT - 前代训练卡(FP8 1 PFLOPS)
- Huawei Ascend 950PR - 前代推理卡
- Huawei Ascend 970 - 下一代(2028 官宣)
- 完整对比表