跳到主要内容

15 篇博文 含有标签「Domestic Chips」

Chinese domestic AI chip development

查看所有标签

DeepSeek 确认押注华为芯片训练大模型:从 16 万颗 950DT 传闻到"必须成功"的站队

· 阅读需 5 分钟
Industry Research Team

2026 年 9 月 22 日,多家媒体报道:DeepSeek CEO 明确表示公司正大力押注华为芯片,预计将收到新一批华为芯片用于大模型训练,并强调"这一选择必须成功"。这是继此前"DeepSeek 拟采购 16 万颗昇腾 950DT 跑推理"报道之后,国产算力生态迄今最重要的站队信号——从推理采购升级为训练押注。


1. 信号链:四步走到"训练押注"​

把过去半年的公开信息串起来,DeepSeek 与昇腾的合作有一条清晰的升级路径:

时间信号性质
2026 年中DeepSeek V4 完成从 CUDA 到 CANN 的生态迁移软件适配
2026 年 8 月报道:DeepSeek 拟采购 16 万颗昇腾 950DT 部署推理推理采购意向
2026-09-17HC2026:960DT 提前三个季度就绪,950DT Q4 放量供给兑现
2026-09-22DeepSeek CEO:押注华为芯片训练大模型,"必须成功"训练押注

关键变化是负载等级:推理部署是"用现成算力降本",训练押注则是"把下一代模型的存在性押在国产芯片上"——训练集群对稳定性、互联效率、软件栈成熟度的要求高一个量级。

2. 华为侧的兑现能力​

DeepSeek 敢于站队,背后是华为供给侧一系列可核验的进展(均为官方口径):

  • 一年一代兑现:950PR 已量产、950DT 2026 Q4 放量、960DT 从原计划 2027 Q4 提前三个季度至 2027 Q1 就绪 / Q2 上市——路线图可信度连续两次验证;
  • 部署规模:昇腾超节点已规模商用超 1000 套,覆盖互联网、金融、医疗、制造;
  • 生态成熟:CANN 进入常态化开源运营,外部开发者占比首次超过 61%,月活开发者 5200 人;基于昇腾的原生训练模型超过 40 个,是国内唯一支持预训练的技术路线;
  • 训练证据链:中国电信 9 月开源的星(Xing)4.0-29B-A4B agentic MoE 模型宣布在昇腾上端到端训练(公司口径)——昇腾"能训大模型"不再只有华为自证。

规格详见昇腾 950DT 与昇腾 960 规格页;超节点分析见昇腾 960 官宣发布。

3. 为什么是 DeepSeek?​

DeepSeek 的选择有强结构性动因:

  1. 供给确定性:在出口管制约束下,NVIDIA 旗舰对华供给持续收紧;国产算力是唯一可规划的大规模训练供给;
  2. 成本结构:DeepSeek 一贯以极致工程效率著称(V3 训练成本即为业内标杆),国产算力叠加超节点系统效率符合其路线;
  3. 对赌生态红利:CANN 开源 + 头部模型厂商深度绑定,模型厂商可以参与定义工具链走向——这在 CUDA 封闭体系内不可能发生;
  4. 示范效应自我实现:头部实验室公开站队会反向拉动华为产能排期、上游 HBM 与整机的投入,"必须成功"因此是理性承诺而非口号。

4. 风险与待验证项​

冷静看,这条路线仍有三处需要时间验证:

  • 实际训练规模:新一批芯片的数量、型号(950DT 还是 960DT)、交付节奏均未披露;
  • MFU 口径:华为给出的 MFU / 时延收益均出自马尔科夫实验室仿真,尚无独立第三方实测;训练集群的真实有效算力要看大规模生产环境的长期数据;
  • 单卡代差:960DT FP4 4 PFLOPS 对比 Rubin R200 的 50 PFLOPS(FP4),单卡代差客观存在——训练效率取决于超节点规模与软件优化能否补足,这正是"系统级竞争"的胜负手。

5. 小结​

  • DeepSeek 确认押注华为芯片训练大模型——国产算力首个头部实验室训练级站队;
  • 信号链:CUDA→CANN 迁移 → 16 万颗 950DT 推理采购传闻 → 960 提前就绪 → 训练押注;
  • 支撑面:一年一代兑现、超节点 1000+ 套、CANN 开源生态外部开发者 61%;
  • 看什么:新一批芯片的实际到货与训练集群规模、第三方 MFU 数据、下一次 DeepSeek 发版的训练算力披露。

相关阅读​

参考资料​

  • 今日头条·今日科技早报:DeepSeek 确认押注华为芯片用于大模型训练(2026-09-22)
  • 华为全联接大会 2026 官方发布(2026-09-17)
  • 此前报道:DeepSeek 拟采购 16 万颗昇腾 950DT(2026-08)

本文基于公开报道与厂商官方口径整理。芯片数量、训练集群规模等细节以 DeepSeek 与华为后续披露为准。

国产算力生态一周三信号:中国电信开源昇腾训练模型、浪潮 128 卡推理一体机、奕行智能融资 20 亿

· 阅读需 5 分钟
Industry Research Team

昇腾 960 官宣、真武 V900 发布之外,9 月下旬还有三条容易被头条淹没、但结构性意义不输旗舰芯片的生态信号:运营商开源昇腾训练的模型、整机厂交付百卡级国产推理系统、初创公司拿到云端算力芯片的新一轮融资。本文逐条拆解。


1. 中国电信开源 Xing4.0:昇腾端到端训练的运营商级背书​

9 月 23 日(报道时间),中国电信开源 Xing4.0-29B-A4B——一个 agentic 混合专家(MoE)模型,公司口径宣布在华为昇腾加速器上端到端训练。

为什么重要:

  • "能训"的第三方证据:过去"昇腾能不能训大模型"主要靠华为自证(原生训练模型 40+);运营商以自己的数据、工程团队和集群跑通训练并开源,是第一个非华为体系的规模化训练案例;
  • agentic 定位:29B-A4B(29B 总参 / 4B 激活)的 MoE 形态直接面向 agent 工作负载——与 DeepSeek、Qwen 的开源节奏对齐,而非试验性小模型;
  • 开源外溢:模型权重 + 训练配方公开,意味着昇腾上的训练工程经验可以复用到其他机构——这正是生态扩散的标准动作。

配合华为侧披露的"CANN 进入常态化开源运营、外部开发者占比 61%",昇腾生态正从"厂商主导"转向"社区运营"。

2. 浪潮 MetaBrain SD200 Ultra:128 颗国产芯片的推理吞吐实测口径​

浪潮同期发布 MetaBrain SD200 Ultra 推理系统:

指标数值(公司口径)
国产 AI 芯片128 颗(厂商未披露具体型号)
服务模型Kimi K3
Token 吞吐2.8T tokens(该口径下的系统吞吐成绩)
时延5.85 ms

三个读数:

  • 百卡级系统集成:128 卡异构协同跑超大规模 MoE 推理,考验的是互联拓扑、调度与容错——整机厂把国产芯片"攒成大系统"的能力已经就位;
  • 面向头部开源模型:以 Kimi K3(已上线 AWS Bedrock)为目标负载,说明国产推理系统的验收标准是"跑通当下最受欢迎的模型",而非自说自话的 demo;
  • 注意口径:2.8T token 吞吐与 5.85ms 时延均为厂商宣称,测试模型版本、并发与批尺寸未披露,采购评估时需按实际负载复测。

3. 奕行智能 B+ 轮 20 亿元:云端算力芯片赛道仍在加注​

奕行智能(EVAS)完成 B+ 轮 20 亿元融资,投后估值近 150 亿元,和利资本追投;此前上半年已完成 15 亿元 B 轮并引入中国移动战略投资。公司主攻新一代云端算力芯片。

在旗舰芯片格局(昇腾 / 寒武纪 / 摩尔线程 / 海光 / 真武)看似已定的 2026 年,云端算力芯片新势力仍能拿到 20 亿级融资,说明:

  • 一级市场对"国产算力第二梯队"的需求判断:头部厂商产能排期到 2027 年,溢出需求给了新势力窗口;
  • 运营商战投的角色:中国移动既是采购方也是投资方,国产算力的需求侧在用资本锁定供给侧;
  • 云端推理 DSA 路线的差异化空间仍在(参考清微、后摩等路线的生态卡位)。

4. 一周信号拼图:闭环正在成形​

把三条信号与本月旗舰发布拼在一起,国产算力的产业闭环每一段都有人补位:

环节本月证据
旗舰芯片昇腾 960 提前官宣(9-17)、真武 V900 发布(9-22)
训练验证中国电信 Xing4.0 昇腾端到端训练并开源、DeepSeek 押注昇腾训练
推理系统浪潮 SD200 Ultra 128 卡跑 Kimi K3
软件生态CANN 常态化开源、外部开发者 61%
资本供给奕行智能 B+ 轮 20 亿(投后近 150 亿)
需求侧DeepSeek 站队、Kimi K3 上线海外云平台

"芯片—系统—模型—资本"四段都有独立玩家在投入,这是与 2024-2025 年"单点突破"最大的不同。

5. 小结​

  • 中国电信 Xing4.0-29B:首个非华为体系的昇腾端到端训练开源模型;
  • 浪潮 SD200 Ultra:128 颗国产芯片推理系统,2.8T token 吞吐 / 5.85ms(公司口径,待复测);
  • 奕行智能 20 亿 B+ 轮:云端算力芯片第二梯队仍在获得真金白银;
  • 看什么:Xing4.0 的训练集群规模与 MFU、SD200 Ultra 的第三方复测、奕行智能流片节奏。

相关阅读​

参考资料​

  • The GPU Daily(2026-09-24):China Telecom open-sources Xing4.0-29B;Inspur MetaBrain SD200 Ultra
  • 今日头条:奕行智能完成 B+ 轮 20 亿元融资,投后估值近 150 亿元(2026-09-21)
  • CSDN·AI 日报(2026-09-21):华为 CANN 常态化开源运营、OceanStor M900 发布

本文基于公开报道整理。Xing4.0 训练细节与 SD200 Ultra 性能数据均为公司口径,测试条件以后续披露为准。

阿里真武 V900 云栖大会发布:性能 3 倍于 M890、216GB 显存、50 万卡集群,2027 Q1 量产

· 阅读需 6 分钟
Industry Research Team

继华为 9 月 17 日全联接大会官宣昇腾 960 之后仅五天,9 月 22 日阿里巴巴在杭州云栖大会发布新一代训推一体 AI 芯片真武 V900——阿里称之为"目前算力性能最强的中国自研 AI 芯片"。本文基于阿里官方发布口径与新浪科技、C114、环球网等多方报道整理。


1. 单芯片:3 倍于 M890,216GB + 1200GB/s​

指标真武 V900(本次发布)真武 M890(上一代)
性能真武 M890 的 3 倍(官方口径,绝对值未公布)FP16 600 TFLOPS(本站收录)
显存216 GB144 GB(HBM3)
片间互联1200 GB/s—
精度原生 FP8 / FP4(含高精度训练)—
定位训推一体(万亿级参数训练 + 低精度推理)训推一体
量产2027 Q1,阿里云数据中心规模化部署已规模应用

三个读数:

  • 显存跨入 200GB+ 区间:216GB 与昇腾 960DT(288GB 自研 HBM)、NVIDIA Rubin(288GB HBM4)站上同一容量档位,长上下文与超大 MoE 模型的容量门槛被拉平;
  • 片间互联 1200GB/s:为超节点"内存语义互联"打底——这是与 ICN Switch 配套的芯片级前提;
  • 精度覆盖全场景:官方表述为"高精度训练、低精度和超低精度推理的全场景",FP8/FP4 原生支持与 2026 年新卡通用口径对齐。

单芯片绝对算力数值官方未公布,本站以"3 倍于 M890"的官方相对口径收录;M890 规格详见真武 M890 规格页。

2. 系统级:ICN Switch + 磐久超节点,单集群 50 万卡​

V900 的真正卖点不在单芯片,而在系统级协同:

  • ICN Switch 自研互联芯片:连接后的超节点具备原生内存语义与内存统一编址能力,千卡全带宽高速互联——上千颗 V900 可"像一颗超级芯片一样协同工作";
  • 磐久超节点服务器:集成 V900(算力)+ ICN Switch(互联)+ 磐脉智能网卡(网络)+ 镇岳 SSD 主控(存储),算、存、网全栈自研协同;
  • 50 万卡单集群:结合阿里云新一代智算中心网络架构,单一集群可扩展至 50 万卡规模。

这与华为"11 颗关键芯片"的思路如出一辙:竞争单位已经从单芯片转向整套系统的交付能力——真武管算力、倚天管通用计算、磐脉管网络、镇岳管存储、ICN Switch 管互联。

3. 商业与路线图​

  • 真武系列已服务超 650 家企业客户(截至 2026 年 6 月),覆盖智驾、金融、大模型、具身智能、能源、制造;
  • 基于 M890 的超节点已大规模应用,跑通 Qwen3.8、Kimi K3 等超 2 万亿参数模型;阿里云 Q4 新增服务节点扩大超节点供给;
  • 路线图:V900 于 2027 Q1 量产售卖;真武 J900 计划 2027 Q3 发布;
  • CPU 协同:2027 年推出倚天 720 / 730(730 首次采用平头哥全自研 CPU 微架构,单核 SPECint2017/GHz 最高达倚天 710 的 1.4 倍);2029 年的倚天 750 将通过 ICN 总线与真武 AI 芯片直接互联;
  • 阿里巴巴集团 CEO 吴泳铭表示,平头哥 AI 芯片年出货量将大幅提升。

4. 竞争坐标:同一周,两把剑​

把 9 月中旬的两次发布放在一起看,国产 AI 芯片的"系统级竞争"格局已经清晰:

维度华为昇腾 960(9-17)阿里真武 V900(9-22)
发布节点HC2026云栖大会 2026
单卡显存288GB(自研 HBM)216GB
访存带宽9.6 TB/s未披露
互联灵衢 UnifiedBus / NPO 光互联ICN Switch 内存语义互联
超节点昇腾 960 超节点(4096 卡,8 EFLOPS FP8)磐久超节点(单集群 50 万卡)
上市2027 Q22027 Q1

华为走"超节点 + 开源 CANN 生态"路线,阿里走"云上全栈 + 开源模型生态"路线;单卡规格都仍有代差,但交付的是可采购、可运维的超大规模集群。对英伟达 CUDA 生态的替代逻辑,正在从"性能对标"转向"供给确定性 + 系统效率"。

5. 小结​

  • V900:3×M890、216GB、1200GB/s 片间互联、原生 FP8/FP4,2027 Q1 量产;
  • 系统:ICN Switch 千卡全带宽、磐久超节点算存网全栈、单集群 50 万卡;
  • 节奏:J900 2027 Q3、倚天 730 2027、倚天 750 2029——平头哥首次给出三年代际路线;
  • 看什么:2027 Q1 实际量产与阿里云部署规模、V900 绝对算力披露、ICN Switch 对外供货的可能性。

相关阅读​

参考资料​

  • 环球网:平头哥发布新一代训推一体 AI 芯片真武 V900(2026-09-22)
  • 新浪科技 / TechWeb:阿里平头哥发布新一代 AI 芯片真武 V900,2027 年第一季度量产
  • C114:阿里发布新一代 AI 芯片真武 V900,2027Q1 量产

本文基于阿里巴巴官方发布与公开报道整理。V900 单芯片绝对算力官方未公布;超节点与集群规模为官方口径,以未来实际交付为准。

昇腾 960 官宣发布:FP4 算力翻倍、全球首个 NPO 超节点,华为确认一年一代

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月 17 日,华为全联接大会(HC2026),华为常务董事、ICT 基础设施业务总裁汪涛正式发布昇腾 960。与 8 月数字中国峰会上的"路线图预告"不同,这次是完整的规格官宣——而且提前三个季度就绪。本文基于华为官网新闻稿及多方报道整理,逐项拆解 960 的规格、超节点与路线图含义。


1. 昇腾 960:双版本,训练先行​

昇腾 960 分为两个版本,节奏错开一个季度:

指标昇腾 960DT(训练版)昇腾 960PR(推理版)
FP8 算力2 PFLOPS(较 950 翻倍)待披露
FP4 算力4 PFLOPS待披露
显存288GB(自研 HBM)待披露
显存带宽9.6 TB/s待披露
配套超节点Atlas 860(风冷)Atlas 960(液冷)
就绪 / 上市2027 Q1 / 2027 Q22027 Q3

三个读数:

  • 提前三个季度就绪:960DT 原计划 2027 年 Q4,现在 2027 Q1 就绪、Q2 上市——与 950DT"提前上线华为云"一脉相承,路线图可信度在持续兑现;
  • 精度口径与英伟达对齐:FP8 / FP4 主口径(辅以自研 HiF8 / HiFP8),FP4 已是 2026 新卡的通用口径;
  • 288GB 自研 HBM + 9.6TB/s:显存容量与带宽同步翻倍,对训练长上下文大模型是实打实的容量红利。

单卡规格详见昇腾 960 规格页;上一代昇腾 950DT 规格页。

2. 昇腾 960 超节点:全球首个 NPO 超节点​

这是本场发布真正的"重器"——昇腾 960 超节点是全球第一个采用 NPO(近封装光学)的超节点:

指标昇腾 960 超节点
单节点规模4096 卡
系统算力8 EFLOPS FP8 / 16 EFLOPS FP4
HBM 总容量1 PB
互联 RTT低至 2μs
可用度99.8%

NPO 意味着什么:传统光模块挂在交换机面板上,信号要先出封装再转电—光;NPO 把光引擎挪到交换芯片封装近旁,大幅缩短 SerDes 距离、降低功耗与时延。华为的具体数字:

  • 5500 个自研 Hi-ONE 光引擎(业界首个量产 NPO,单引擎 7.2T);
  • 替代 4.8 万颗 800G 光模块;
  • 降低功耗 550kW 以上,同时支撑 2μs 级互联时延。

对比 8 月数字中国峰会的口径(Atlas 960 单超节点 15488 卡),官方最新口径为单超节点 4096 卡(1 个超集群可由多超节点组成)——以华为官网最新新闻稿为准。

⚠️ 华为还给出了"MFU 提升 2.75 倍""推理时延降低 70%"等收益数据,均出自华为马尔科夫实验室仿真,尚无独立第三方实测,阅读时注意口径。

3. 一年一代:970(2028)→ 980(2029)​

华为首次把"一年一代"从愿景变成官宣承诺:

年份产品状态
2026昇腾 950 系列950PR 已量产,950DT Q4 放量
2027昇腾 960本次官宣,提前就绪
2028昇腾 970HC2026 确认
2029昇腾 980HC2026 确认

支撑这一节奏的是华为提出的"韬定律":算力规格每代翻倍,访存带宽、访存容量、互联带宽同步大幅提升。

生态侧的同场数据也值得记录:CANN 外部开发者占比首次超过 61%、月活开发者 5200 人;910C 超节点部署已超 1000 套。

4. 竞争坐标:单卡有代差,系统级对打​

把 960DT 放到 2027 年的棋盘上看:

  • 对 NVIDIA Rubin(R200:288GB HBM4 / 50 PFLOPS FP4):单卡 FP4 算力约为 R200 的 8%(4 vs 50 PFLOPS),单卡代差客观存在;但 4096 卡超节点 + NPO 互联是系统级竞争——用"可交付的超大集群"对打单卡性能;
  • 对采购方:960 的价值主张是"在国产量产约束内拿到最大可用集群"。DeepSeek 拟采购 16 万颗 950DT 跑推理的订单已经证明:当供给与生态到位,头部实验室愿意主动选国产;
  • 对国产链条:950→960 的显存翻倍直接拉动国产 HBM 迭代,这是整条链的胜负手。

5. 小结​

  • 960DT:FP8 2P / FP4 4P、288GB HBM、9.6TB/s,2027 Q2 上市,提前三个季度;
  • 960 超节点:全球首个 NPO 超节点,4096 卡 / 8 EFLOPS FP8 / 1PB HBM / RTT 2μs;
  • 路线图:一年一代官宣至 2029,950、960 均提前兑现,规划可信度显著上升;
  • 看什么:2027 Q2 实际交付节奏、国产 HBM 产能、CANN 生态的第三方模型覆盖度。

相关阅读​

参考资料​

  • 华为官网:发布全球首个采用 NPO 的超节点(昇腾 960 超节点)(2026-09-17)
  • 电子工程专辑:国产 AI 芯片新突破!华为昇腾 960 芯片将提前发布
  • 环球网:华为全联接大会 2026 主题演讲报道

本文基于华为官网新闻稿与公开报道整理。MFU、时延等收益数据为华为实验室仿真口径;2028 / 2029 产品仅为路线图官宣,规格以未来发布为准。

昇腾 950 超节点 Q4 上市,中兴、新华三、曙光全线跟进:国产超节点从概念走向交付

· 阅读需 6 分钟
Industry Research Team

芯片追不上,系统来补。这是国产算力过去一年最清晰的战略共识。2026 年下半年,国产超节点正式从"概念发布"进入"产品密集发布、联合适配和商业部署"阶段:华为 Atlas 950 SuperPoD 真机已亮相并计划 Q4 上市,中兴、新华三、中科曙光、壁仞、沐曦等一众厂商相继入局。


1. 华为 Atlas 950:业界最大 1024 卡超节点,Q4 上市​

继 7 月 WAIC 2026 真机首秀后,华为昇腾 950 超节点的商用脚步持续加快。核心规格:

指标Atlas 950 SuperPoD
互联规模最大 1024 × 昇腾 950DT(灵衢高速互联)
AI 算力1 EFLOPS FP8/mxFP8/HiF8、2 EFLOPS FP4
全局内存256TB 统一编址,片上内存最大 1024 × 96GB @ 4.0TB/s
互联带宽单柜最大 64 × 1.68 TB/s(双向),3μs 超低 RTT
形态满配 128 计算柜 + 32 互联柜,占地约 1000㎡,8192 颗 950DT
供电散热全液冷,100kW 供电,380V AC/336V DC/240V DC
上市时间2026 年第四季度

在 WAIC 展台之外,两个数字更能说明商业化进度:昇腾 384 超节点已商用落地 750 多套,规模应用于互联网、运营商、金融、教育、医疗等行业,并且是国内唯一训练出 SOTA 模型的超节点;更远期规划中,Atlas 950 SuperCluster(超 50 万颗昇腾芯片)同样定于 2026 Q4,Atlas 960 SuperPoD(15488 卡)与 Atlas 960 SuperCluster(超 100 万卡)将于 2027 Q4 接力。

华为的路线图背后是"Tau Scaling Law"——在 EUV 光刻机受限的前提下,通过系统级扩展突破单芯片物理极限,并计划到 2031 年将晶体管密度推升至 1.4nm 级工艺水平。

2. 超节点赛道全面开花:三条技术路线​

WAIC 之后,国产超节点形成了三类清晰的技术路线:

第一类:华为全栈自研。 同时掌握昇腾芯片、灵衢互联、Atlas 硬件、CANN 软件栈和 MindSpore 框架。CANN 已全面开源:社区上线 67 个项目、开源代码超 1244 万行、月活开发者突破 3500 人;昇腾开发者总数超 400 万。

第二类:中兴、新华三的兼容路线。 中兴发布 OEX 超节点新品,依托协议标准化与接口统一,全面兼容多元 GPU 生态;新华三 UniPoD S80000 系列可从 32 卡扩展至 1024 卡、最大支持 16384 卡互联,将 Scale-up/Scale-out 网络、液冷、供电、管理和故障恢复整合进同一套架构。

第三类:国产 GPU 联合创新。 中兴联合曦智、壁仞、沐曦、燧原、天数智芯等,基于 OEX+dOCS 架构打造国产高性能 Matrix 超节点;壁仞计划发布 BR20x 系列 GPU,基于自研 BLink 2.0 互联协议实现单超节点 1024 卡 Scale-up;沐曦推出"曦景"S 系列超节点。

在更大的 Scale-out 层面,中科曙光"曙光 8000(登峰)"全国产十万卡 AI 超集群已落成并接入国家超算互联网——它不是单体超节点,而是由大量计算节点、超节点和网络存储组成的超集群,检验的是国产算力的大规模调度、应用适配和工程交付能力。

3. 为什么"超节点"成了国产算力的主战场​

根本原因在于衡量标准变了:国产算力的评价体系,正从"比较单颗芯片的峰值性能"转为"一整套系统能够调动多少有效算力"。华为副董事长徐直军对此直言:单芯片上英伟达仍领先且短期难以追赶,但在超节点和集群层面,华为有信心。

这一转向的产业逻辑:

  • 出口管制下的现实选择:单卡制程受限 → 用高速互联把更多 NPU 组织成一台"大计算机";
  • 需求侧真实拉动:万亿参数 MoE 模型的训练与推理,天然需要大规模低时延互联,超节点恰是对症下药;
  • 生态护城河前移:CANN 开源 + MindSpore 兼容 PyTorch,把 CUDA 生态的竞争从"算子覆盖"层面拉回到"开发者规模"层面。

东兴证券指出,全球超节点赛道已聚集微软、Meta、亚马逊、三大运营商、阿里、字节、腾讯、百度、曙光、中兴、浪潮、新华三、海光、沐曦等数十家厂商——格局未定,但英伟达一家独大的局面正在被谷歌 TPU、AMD Helios、华为 Atlas 三股力量同时挑战。

4. 三道关卡:从"造出来"到"卖得动"​

业内人士普遍认为,国产超节点距离真正成熟还有三道坎:

  1. 单芯片性能与单柜算力密度:受制程限制,单卡性能差距仍存,现阶段靠多柜互联和规模扩展另辟蹊径;
  2. 规模扩展效率:超节点扩展到一定规模后性能提升边际递减,通信复杂度、能耗和容错成本持续上升;
  3. 可验证的商业价值:下一阶段的比拼是有效算力利用率、单位 token 成本、模型适配广度与客户复购意愿。

一句话总结:2026 年是"中国超节点元年",2027 年见真章——届时 Atlas 950 与 Vera Rubin NVL 系列将在全球两个平行市场各自接受规模化交付的检验。


相关链接​

参考资料​


本文基于 WAIC 2026 现场报道、昇腾社区官方规格与公开研报整理。超节点性能数据均为厂商公布口径,独立第三方评测结果尚待观察。

国产 AI 芯片半年报大检阅:寒武纪净赚 23 亿、壁仞营收暴涨 20 倍、燧原登板,"抢芯大战"白热化

· 阅读需 6 分钟
Industry Research Team

8 月底至 9 月初,国产 AI 芯片厂商半年报密集披露,加上燧原科技 9 月 2 日启动 IPO 申购,被称为"国产四小龙"的摩尔线程、沐曦、壁仞、燧原全部完成上市,加上早已在科创板的寒武纪——国产 AI 芯片的资本市场拼图就此补齐。更重要的是,财报数字第一次集体印证了一件事:国产算力正从"能用"跨向"好用",商业化拐点已现。


1. 半年报成绩单:增长是主旋律,盈利是分水岭​

厂商2026H1 营收同比盈利状态技术路线
寒武纪59.96 亿元+108.1%归母净利 23.11 亿自研 MLU 指令集(DSA)
摩尔线程17.36 亿元+147.4%净亏 1156 万(收窄)全功能 GPU(兼容 CUDA 路线)
壁仞科技12.36 亿元+1997.6%未盈利通用 GPU
沐曦13.24 亿元+44.7%净利 6.12 亿(首次扭亏)通用 GPU
燧原11.20 亿元+279.1%未盈利DSA 专用架构(TopsRider)

几个值得注意的细节:

  • 沐曦率先跨过盈利线:8 月 31 日披露的半年报显示净利润 6.12 亿元、同比扭亏(上年同期亏损 1.86 亿);不过扣非净利润仍为 -4900 万(亏损收窄 75.8%)——含金量仍在爬坡。
  • 壁仞低基数暴增:近 20 倍的同比增速来自上年同期极低的收入基数,但 12.36 亿的绝对体量已与燧原、沐曦同量级,第二梯队座次重新洗牌。
  • 研发强度惊人:沐曦研发费用占营收 39.7%、摩尔线程 44.3%、壁仞高达 65%——高研发投入是全员未完全盈利的根本原因,也是未来竞争力的来源。
  • 摩尔线程毛利率承压:从 78% 降至 57%,成本增速(+245%)远超营收增速(+147%)——大规模量产期的品控与爬坡成本开始显现。

2. 燧原登板:四小龙资本拼图补齐​

燧原科技 9 月 2 日启动公开申购,发行 4303 万股新股(约占上市后总股本 10%),募资目标 60 亿元,采用 DSA 专用架构 + 自研 TopsRider 软件平台(不兼容 CUDA)。至此:

  • 科创板:寒武纪(2020 年)、摩尔线程、沐曦、壁仞(2026 年)
  • 燧原:2026 年 9 月完成上市

国产 AI 芯片第一梯队全部进入公开市场,融资通道打开后,研发投入的"军备竞赛"将进一步升级。

3. 需求端:百万卡缺口,订单排到三年后​

财报爆发的另一面,是需求端的极度饥渴:

  • 产能缺口:行业调研显示,2026 年国产 AI 芯片需求规模约 400 万颗,实际交付约 300 万颗,存在百万级缺口;
  • 订单周期:内蒙古乌兰察布远景星河基地(规划支撑百万卡级并行算力)表示"在手订单已排到三年后";
  • 供给创新:算力紧缺催生"集装箱式算力中心"——20/40 英尺标准集装箱为载体,插电接水即可在 24 小时内完成部署,把传统"一年工期"压缩到"一天上线";
  • 市场空间:IDC 数据显示 2025 年中国 AI 加速卡出货约 400 万片,国产占约 41%(165 万片);CIC 预测中国 AI 加速器市场 2028 年将超万亿元,其中国产方案份额约 90%。

4. 两种路线的两种赌注​

市场研究机构预测 2026 年中国高端 AI 芯片市场中,国产方案份额将接近 90%,其中华为约 62%、寒武纪约 14%,剩余由摩尔线程、沐曦、壁仞等共同占据。而寒武纪与摩尔线程这对"双龙头",正在押注两种截然不同的未来:

寒武纪:用现金买确定性。 半年报资产负债表上,存货 82.48 亿 + 预付款 29.14 亿,两项合计 111.6 亿、占总资产 61%——在实体清单限制下"产能即订单",提前锁定未来 12-18 个月的晶圆产能,代价是经营现金流净额同比下滑 66%,且上半年已计提存货跌价损失 3.97 亿。底气来自订单确定性:57 亿元股权激励计划的考核目标是 2026 年营收不低于 135 亿、2026-2028 年累计不低于 1000 亿。

摩尔线程:用亏损买时间。 全功能 GPU 的"大而全"路线(AI 计算 + 图形渲染 + 物理仿真 + 视频编解码)前期投入巨大,需要在现金流耗尽之前跨过规模化的门槛。上半年亏损已收窄至千万级,IPO 募资到位后,时间窗口正在变宽。

5. 软件生态:被忽视的胜负手​

需求外溢(英伟达 H20 系列在中国市场遇冷)推动 DeepSeek、智谱 GLM、月之暗面 Kimi 等头部模型纷纷适配国产加速器(昇腾、沐曦、摩尔线程等),这给了国产芯片难得的"真实负载打磨机会"。但正如行业共识:芯片可以三年一代,生态需要十年之功。寒武纪自研指令集的封闭高效、摩尔线程 MUSA 对 CUDA 生态的兼容路线、燧原 DSA 的专用极致——哪条路能沉淀出真正的开发者生态,才是决定 2030 年格局的关键变量。


相关链接​

参考资料​


本文基于上市公司半年报、Pandaily 与央视财经等公开报道整理。财务数据为公司披露口径,市场份额为研究机构预测,不构成任何投资建议。

国产三强 2026 H2:国产化率突破40%向60%迈进,昇腾960官宣发布、MLU690与S5000生态齐发力

· 阅读需 8 分钟
Industry Research Team

2026 年,中国 AI 芯片市场格局已从"英伟达单极主导"转向"海外厂商领先、国产多路线追赶"。据产业研究数据,2025 年中国 AI 加速卡整体市场约 400 万张,其中国产出货 165 万张,份额首次突破 40%;随着产品迭代与晶圆厂配套跟进,2027 年国产化率有望提升至 60%–70%。本文聚焦华为昇腾、寒武纪、摩尔线程"国产三强"的 2026 下半年最新进展。

📌 更新(2026-09-18):华为已于 9 月 17 日全联接大会正式官宣昇腾 960(详见第 1 节),本文 960 部分已按官方披露更新。


1. 华为昇腾:950 产能排满,960 官宣提前发布​

昇腾以"架构 + 生态全栈协同"为核心优势,2025 年出货约 80 万颗,占国产厂商总份额 50%。产品迭代节奏清晰:

时间产品说明
2025 Q1昇腾 910C主力过渡型号,超节点已部署超 1000 套
2026 Q1昇腾 950PR推理旗舰
2026 Q4(计划)昇腾 950DT训练旗舰,推动国产 HBM 迭代
2027 Q2昇腾 960DT官宣提前三个季度就绪(2027 Q1)
2027 Q3昇腾 960PR提前一个季度就绪
2028 / 2029昇腾 970 / 980一年一代路线图官宣

950 系列产能已进入"排满"状态:950PR 于 2026 年 4 月量产,6 月月产能跳升至 50–60 万片(环比近 10 倍),全年目标 120 万片、确定性 100%;字节跳动以 56 亿美元锁定 35 万片,腾讯 / 阿里 / 百度合计锁定 40 万片。

昇腾 960 官宣规格(2026-09-17 华为全联接大会,汪涛):

指标昇腾 960DT(训练版)
FP8 算力2 PFLOPS(较 950 翻倍)
FP4 算力4 PFLOPS
显存288GB(自研 HBM)
显存带宽9.6 TB/s
就绪 / 上市2027 Q1 / 2027 Q2(配套 Atlas 860 风冷超节点)

960PR(推理版)2027 Q3 上市,配套 Atlas 960 液冷超节点。同场发布的昇腾 960 超节点是全球首个采用 NPO(近封装光学)的超节点:单节点 4096 卡、8 EFLOPS FP8 / 16 EFLOPS FP4、1PB HBM、互联 RTT 低至 2μs;5500 个自研 Hi-ONE 光引擎(业界首个量产 NPO,单引擎 7.2T)替代 4.8 万颗 800G 光模块,功耗降低超 550kW,系统可用度 99.8%。

  • 上一代昇腾 384 超节点已累计商用超 750 套,落地互联网、运营商、金融、教育、医疗等 20 多个行业;910C 超节点部署超 1000 套,950 超节点已规模商用。
  • 华为同步确认一年一代节奏:2028 昇腾 970、2029 昇腾 980,依托"韬定律"持续算力翻倍。
  • ⚠️ MFU 提升 2.75 倍、推理时延降低 70% 等收益数据出自华为马尔科夫实验室仿真,非第三方实测。

2. 寒武纪 MLU690:下半年量产,切入字节招标窗口​

寒武纪是昇腾未上市背景下的核心国产算力龙头,技术代差持续缩小:

  • 思元 590(7nm):性能等效 A100 的 80%,已支持 DeepSeek,持续适配千问 3、GLM 等主流大模型;
  • 思元 690 系列:将于 2026 下半年正式量产,有望在下半年字节招投标窗口期实现订单放量;
  • 业绩确定性:股权激励目标显示未来 3 年营收增速均超 100%,2026 年营收目标 135 亿元、2027 年 270 亿元、2028 年 600 亿元。

寒武纪充分受益于"国产 CSP 资本开支 + 国产大模型与国芯全面适配"的行业红利,是国产化率提升最直接的弹性标的。


3. 摩尔线程 MTT S5000:全功能 GPU + 生态突围​

摩尔线程走"全功能 GPU"差异化路线,旗舰 MTT S5000 基于第四代"平湖"MUSA 架构:

指标MTT S5000
稠密 AI 算力1000 TFLOPS
显存80GB
显存带宽1.6 TB/s
卡间互联784 GB/s
精度FP8 到 FP64 全精度(训推一体)
安全可靠首批通过国家《安全可靠测评》(I 级)

其工程化能力已获验证:基于 S5000 的夸娥(KUAE)智算集群训练线性扩展效率达 95%,万卡扩展计算效率损耗控制在 5% 以内;已支持断点续训,有效训练时长占比超 90%;并从零完整训练出语料超 25 万亿 Token 的 MoE-236B 基础大模型。

生态是摩尔线程最深的护城河:MUSA 已实现 100% 核心数学库兼容、3000+ PyTorch 算子兼容、覆盖 55 类核心 AI 算子,获 vLLM 与 SGLang 官方支持,主流模型 Day-0 适配,开发者突破 80 万人。其 PD 异构分离方案以 2:1 比例实现 S5000 对国际高端 GPU 的等效替代,显著降低推理成本。

第五代"花港"架构(2025-12 发布)支持 FP4 到 FP64 全精度,算力密度较上一代提升 50%、能效提升 10 倍,可支持十万卡以上集群;基于该架构的"华山"(训推一体)与"庐山"(图形渲染)新芯片研发累计投入已超 9 亿元。


4. 软件生态决胜:Day-0 适配常态化​

硬件之外,软件生态的兑现是 2026 年国产算力的分水岭:

  • 华为 CANN 异构计算架构与 MindSeries 套件已全面开源,社区孵化 67 个项目、超 1244 万行代码;据 HC2026 披露,CANN 外部开发者占比升至 61%(首次超越内部团队),月活开发者突破 5200 人;
  • 国产大模型与国产芯片"发布即适配"闭环基本成型:腾讯混元 T3(295B)、DeepSeek-V4、GLM-5.2 均完成 Day-0 适配;
  • 2026 年被视为"国产超节点元年",华泰证券测算 2028 年中国超节点架构市场规模有望达 3414 亿元,2026–2028 年复合增长率 194%。

5. 产业判断:从"能不能做出来"到"能不能用得好"​

国产三强正沿三条路径收敛:

  1. 华为:以超节点系统级能力 + 全栈软件锁定政企与互联网大客户;
  2. 寒武纪:以训练侧代差缩小 + 大客户招标放量冲击营收拐点;
  3. 摩尔线程:以全功能 GPU 通用性 + 成熟 CUDA 兼容生态覆盖云边端全场景。

三家的共同短板仍在于高端制程与 HBM 供给——这恰是海外管制的核心环节。但随着国产 HBM 迭代与晶圆厂配套跟进,2027 年国产化率向 60%–70% 迈进具备现实路径。

相关链接​

参考资料​


本文基于 2026 年 8 月公开产业研究、券商观点与企业公告整理。部分出货量与市占率为第三方估算,非官方确认数据。

WAIC 2026回顾:华为Atlas 950 SuperPoD真机斩获SAIL大奖,国产算力进入"系统级"决战

· 阅读需 6 分钟
Industry Research Team

2026世界人工智能大会(WAIC) 于 2026年7月17日至20日 在上海世博中心举行,主题"智能伙伴 共创未来"。本届大会 1100余家企业 集中展出 3000余项展品,超300款产品全球首发。对计算卡行业而言,这场国产算力的集中检阅传递出一个清晰信号:竞争主线正从"单芯片峰值算力"转向"超节点系统级有效算力"。

1. 华为Atlas 950 SuperPoD:真机首秀,斩获SAIL最高奖​

华为 Atlas 950 SuperPoD 真机 在 WAIC 2026 首次公开亮相,现场搭载 16 台计算柜、共计 1024 张昇腾算力卡,凭"超大带宽、超低时延、统一内存编址"三大系统级创新,从数百项海内外参评项目中脱颖而出,荣膺大会最高荣誉 SAIL(卓越人工智能引领者)大奖。

核心参数(WAIC 现场确认)​

指标Atlas 950 SuperPoD
展出规模16 计算柜 / 1024 张昇腾卡
最大互联规模8,192 张昇腾 NPU 卡 全互联(满配)
互联协议华为自研"灵衢"(UnifiedBus)2.0
总算力1 EFLOPS FP8 / 2 EFLOPS FP4(1024卡);满配 8192 卡约 8 EFLOPS FP8
统一内存256 TB 全局统一内存编址空间
互联时延3 μs 超低 RTT;TB 级 NPU 互联带宽
满配形态128 计算柜 + 32 互联柜 = 160 机柜,占地约 1000 ㎡,搭载 8192 颗昇腾 950DT
上市时间满配版本计划 2026 年 Q4 上市
散热全液冷盲插架构

华为首次披露:上一代 昇腾 384 超节点已累计商用超 750 套,落地互联网、运营商、金融、教育、医疗、交通、制造等 20 多个行业,并称其为"国内唯一训练出 SOTA 模型的超节点"。

2. 软件生态:CANN 全开源,开发者规模化​

硬件之外,华为重点展示开源软件生态进展:

  • CANN 异构计算架构与 MindSeries 基础软件套件已于 2025 年底全面开源;
  • CANN 开源社区已孵化 67 个项目、超 1244 万行代码,月活开发者 超 3500 人;
  • 华为已与 超 3000 家行业伙伴 联合开发 7000+ 解决方案,服务 2000+ 核心政企客户;
  • WAIC 现场展出 60+ 真实业务场景、20+ 标杆案例,覆盖从技术突破到规模商业落地的全链条。

3. 国产芯片 Day-0 适配常态化​

2026年7月6日 腾讯发布混合专家模型 混元 T3(295B 参数、256K 上下文),国产芯片迅速完成 Day-0 适配:

厂商芯片适配情况
摩尔线程MTT S5000完成混元 T3 极速适配(此前已适配 DeepSeek-V4、GLM-5.2)
沐曦股份曦云 C 系列自研 MXMACA 软件栈率先全链路 Day-0 适配,支持零代码部署

摩尔线程在 WAIC 还展示了 MTT C256 超节点(首创一层 Scale-up 256 卡全互联、亚微秒级时延)与"模型训练工厂 / 词元生产工厂 / 智能体生产工厂"三大 AI 工厂方案。

4. 更多国产算力首发看点​

厂商 / 产品亮点
东方算芯 DF1000全球首颗"软件定义 + 近存计算"3D 芯片,互连间距压缩至亚微米级
中昊芯英"须臾"国产全自研新一代 TPU 架构 AI 专用芯片,配套泰则 2.0 服务器
燧原科技 × 天数智芯基于 OEX+dOCS 架构的国产高性能 Matrix 超节点,入围大会"卓越 AI 引领者奖"
镕铭微电子推进下一代 VPU,从视频处理向"视觉智能体算力基座"演进

参展国产 AI 芯片阵容还包括:摩尔线程、沐曦、燧原科技、后摩智能、此芯科技、算能、芯驰科技、飞腾、爱芯元智、瀚博半导体、天数智芯等。

产业解读:从"能不能做出来"到"能不能用得好"​

WAIC 2026 折射出国产 AI 芯片竞争阶段的根本转变:

  1. 超节点成为主战场:单芯片性能之外,"卡间互联 + 集群规模 + 散热"的系统级能力成为突围关键。华为灵衢、燧原/天数 OEX 均在此发力。华泰证券将 2026 年定义为"国产超节点元年",测算 2028 年中国超节点架构市场规模有望达 3414 亿元,2026–2028 年复合增长率 194%。
  2. 软件生态兑现:Day-0 适配从口号变为常态,国产大模型(DeepSeek-V4、GLM-5.2、混元 T3)与国产芯片"发布即适配"闭环基本成型。
  3. 需求侧背书:中国移动此前发布 2026–2027 年 AI 超节点集采公告,规模约 6208 卡、金额超 20 亿元,国产超节点规模化商用提速。

相关链接​

参考资料​


本文基于 WAIC 2026(7月17-20日)现场与官方披露整理,将持续跟踪 950 超节点 Q4 上市进展。

国产GPU上市潮:四小龙资本市场集结,摩尔线程MTT S5000对标H100

· 阅读需 5 分钟
Industry Research Team

从 2025 年 12 月到 2026 年 7 月,短短半年,至少 6 家 AI 芯片企业登陆或即将登陆资本市场。加上已上市的寒武纪、海光信息、天数智芯,国产 GPU 军团总市值正逼近 2 万亿元。这标志着国产 GPU 从"能用"迈向"好用"的关键爬坡期。

1. "四小龙"资本市场集结​

企业上市状态拟募资 / 发行价保荐机构
摩尔线程已上市(科创板 sh688795,2025-12-05)发行价 114.28 元,募资 80 亿元中信证券
沐曦股份IPO 受理(2026-06-30)39.04 亿元(投资总额 50 亿元)华泰联合
燧原科技过会(2026-06-15)60 亿元—
壁仞科技港股 / 冲刺中——

已上市阵营:寒武纪(sh688256,2020-07-20 科创板)、海光信息、天数智芯(港股)。摩尔线程一季度实现账面盈利 2,935 万元,沐曦亏损收窄 57.7% 并给出 2026 年盈亏平衡时间表。

2. 摩尔线程 MTT S5000:对标 H100​

摩尔线程宣布旗舰 AI 训推一体 GPU MTT S5000 成功完成智谱新一代大模型 GLM-5 全流程适配验证,实测性能"突破国产算力天花板":

指标MTT S5000
架构第四代"平湖"架构
FP8 算力1 PFLOPS(1,000 TFLOPS)
显存带宽1.6 TB/s
定位训推一体全功能 GPU,对标 NVIDIA H100
量产状态已规模量产,集群已上线支持万亿参数训练

落地验证:联合智源研究院完成具身大脑模型 RoboBrain 2.5 全流程训练;联手硅基流动实现 DeepSeek-V3 高性能推理,单卡速度接近国际顶尖产品。募投资金投向三大方向:新一代 AI 训推一体芯片、新一代图形芯片、新一代 AI SoC 芯片。

WAIC 2026 新进展:摩尔线程展出 MTT C256 超节点(首创一层 Scale-up 256 卡全互联、亚微秒级时延)与"模型训练工厂 / 词元生产工厂 / 智能体生产工厂"三大 AI 工厂方案;公司预告 2026 年上半年营收 16.5–17.5 亿元,同比增 135%–149%。

3. 寒武纪:思元590/690 双旗舰​

芯片制程算力显存客户 / 状态
思元590(MLU590)7nm ChipletINT8 512 TOPS / FP16 345 TFLOPS96 GB HBM2e字节推理主力,综合性能约 A100 的 80%,2026 初规模出货
思元690(MLU690)5nm 级(中芯 N+2)FP16 700+ TFLOPS / INT8 2800+ TOPS196 GB HBM3(带宽 3.35 TB/s)双 die 封装、MLU-Link 890 Gbps;对标 H100 约 70%(纯推理 80–90%);字节为最大客户,2026 初量产

寒武纪是国内唯一"端边云统一架构"AI 芯片厂商,统一 MLU 指令集覆盖思元 220(端)→ 370(边)→ 590/690(云),同一套 NeuWare 工具链跨算力层级部署。

资本与业绩双爆发:寒武纪 2026 年 6 月 30 日总市值突破万亿元,成为科创板首支"万亿股",年内涨幅超 75%。业绩层面,2026 Q1 营收 28.85 亿元(同比 +160%)、扣非净利 9.34 亿元;2025 全年营收 64.97 亿元(同比 +453%)、归母净利 20.59 亿元,终结长期亏损。字节跳动累计部署超 10 万张思元 590/690,为最大客户。

4. DeepSeek-V4 效应:改变预期坐标系​

2026 年 4 月 24 日,DeepSeek 发布万亿参数旗舰 DeepSeek-V4。与一年前 V3 发布时"国产芯片能不能跑大模型"的争论不同,这次华为昇腾、寒武纪、海光、沐曦、摩尔线程、昆仑芯、平头哥、天数智芯等多家国产芯片在发布当天即完成适配。

评判坐标系正在改变:从"性能达到英伟达同代产品的百分之多少",转向"能不能承接头部大模型的真实工作负载"。

产业解读​

  1. 资本弹药到位:密集 IPO 为国产 GPU 的研发迭代与产能扩张提供充足资金,从"技术突破"迈向"商业正循环"。
  2. 训推一体成主流路线:摩尔线程走全功能 GPU 路线(图形+AI+通用计算),与华为昇腾"专注 AI"形成差异化。
  3. 软件生态是胜负手:Day-0 适配、统一软件栈(MUSA / NeuWare / MXMACA)的成熟度,正取代单纯的峰值算力,成为国产 GPU"好用"的核心标尺。

相关链接​

参考资料​


本文持续跟踪国产 GPU 上市进程与产品迭代。

华为昇腾950系列产能与订单深度:950PR月产能跳升10倍,字节56亿美元锁定35万片

· 阅读需 5 分钟
Industry Research Team

昇腾 950 系列(950PR 推理 / 950DT 训练)已成为国产 AI 算力的核心供给。据多家券商与行业调研,950 系列产能已 100% 排满、现货稀缺,全年 120 万片目标"确定性 100%",并存在上调至 150 万片的预期。本文汇总截至 2026 年 7 月的产能与订单数据。

1. 产能节奏:6月环比近10倍跳升​

时间950PR 月产能备注
2026年5月5–6 万片基本满产
2026年6月50–60 万片环比接近 10 倍;中芯、华虹一供全线加班
2026年 Q3(预计)70–80 万片单月
2026 全年目标120 万片有上调至 150 万片预期

产业链交付吃紧:高速背板、液冷连接器交货周期从 2 周拉长至 6–8 周,订单已排至 2027 年。

2. 订单结构:头部云厂 + 运营商 + 海外​

客户锁定量金额 / 备注
字节跳动35 万片 950PR56 亿美元,2026 Q3 起集中交付
腾讯 / 阿里 / 百度约 25 万片 950PR + 15 万片 950DT合计约 40 万片
三大运营商超 20 万片集采,用于智算中心与 AI 专网
海外韩国 2,000 片、马来西亚 3,000 台服务器、俄罗斯万卡级集群从试点转向商用

3. 出货预测:稳居国产第一​

据科智咨询测算:

指标20252026(预测)
华为昇腾总出货量81.2 万张102.6 万张
其中 950PR—约 80 万片
其中 950DT—约 10–20 万片

华为已完成由 910 系列向 950 系列的产品切换。互联网行业已成为昇腾最大应用市场,竞争优势正由单一硬件性能延伸至软件生态与系统能力。

4. 出海:Q4 正式入韩​

据韩媒 ETNews 报道,华为计划 2026 Q4 以昇腾系列及 Atlas 950 SuperPod 正式进入韩国市场:

  • 已完成本土分销商协议,选定 SK Shieldus 等两家渠道伙伴;
  • 主力产品为 950PR(4 月已量产交付) 与 950DT(Q4 同步推出);
  • 官方口径:950PR 推理性能达 H20 的 2.87 倍,定价约为其 1/4。

5. WAIC 2026:1024 卡真机首秀确认​

WAIC 2026(7月17–20日上海)上,华为 Atlas 950 SuperPoD 真机首次公开亮相,现场展出 16 台计算柜、1024 张昇腾卡 规模,并斩获大会最高荣誉 SAIL 大奖:

  • 核心指标:总算力 1 EFLOPS FP8 / 2 EFLOPS FP4,256 TB 全局统一内存编址,灵衢 2.0 互联、3 μs 超低 RTT 时延;
  • 满配形态:128 计算柜 + 32 互联柜 = 160 机柜、占地约 1000 ㎡,搭载 8192 颗昇腾 950DT,计划 2026 年 Q4 上市;
  • 商用基础:上一代 384 超节点已累计商用超 750 套,落地 20+ 行业;
  • 软件生态:CANN 已于 2025 年底全面开源,社区孵化 67 个项目、超 1244 万行代码,月活开发者超 3500 人。

WAIC 首秀确认了 950 系列"超节点优先"的产品逻辑:单卡算力之外,系统级有效算力(互联带宽 + 统一内存 + 低时延)才是国产算力对标国际旗舰的关键维度。

昇腾路线图回顾​

产品定位关键指标(官方路线图)
950PR推理1 PFLOPS(FP8)/ 2 PFLOPS(FP4),互联 2 TB/s
950DT训练超节点核心,Q4 推出
960训练/推理2 PFLOPS(FP8)/ 4 PFLOPS
970下一代规划中

产业解读​

  1. 国产替代从推理迈向训练:950PR(推理)率先放量,950DT(训练)Q4 跟进,配合 Atlas 950 SuperPoD 万卡互联,国产算力首次具备"训练替代"完整拼图。
  2. 产能是最大变量:订单确定性极高,但中芯/华虹先进制程产能、HBM 供应、先进封装仍是放量瓶颈——这也是"现货稀缺"的根源。
  3. 出海打开第二曲线:韩国、马来西亚、俄罗斯、拉美的批量采购,标志国产算力从"内循环"走向"外循环"。

相关链接​

参考资料​


本文数据以官方与主流券商调研为准,产能/订单为动态数字,将持续更新。