跳到主要内容

4 篇博文 含有标签「国产AI芯片」

中国国产AI芯片全产业链进展

查看所有标签

智能算力 2030 年冲 9800 EFLOPS:信息通信业「十五五」规划的五个硬指标

· 阅读需 5 分钟
Industry Research Team

本文基于工信部《信息通信行业发展「十五五」规划》(2026 年 9 月印发)及《人民邮电》报、澎湃新闻、华夏时报等官方解读整理。

9 月上旬,工信部印发《信息通信行业发展「十五五」规划》,用 13 个主要指标、26 项重点任务给未来五年的信息通信业画了路线图。对 AI 算力行业来说,这是含金量最高的一份政策文件——我们挑出五个硬指标,逐个拆解产业含义。

指标一:智能算力 1590 → 9800 EFLOPS,五年增长超 5 倍​

这是整份规划最亮眼的数字。作为参照系:

  • 截至 2026 年 6 月底,全国智能算力规模已达 2185 EFLOPS,同比增长 177%——上半年就超额完成了对 2025 年底(1590 EFLOPS)的跨越
  • 全国已建成 42 个万卡级智算集群;2026 年 7 月,首个全国产十万卡级 AI 算力集群曙光 8000 在郑州落成
  • 华为轮值董事长汪涛的判断:10 万卡以上超节点集群到 2027 年将成为基础配置

从 2185 到 9800,意味着未来四年还要再造 3.5 倍于当前存量的智算设施。规划同步要求「有序部署万卡、十万卡及以上智算集群」「加大力度适配国产算力芯片」——这是国产 AI 芯片未来五年最确定的需求底座。

指标二:信息基础设施累计投资 3.8 万亿元​

有观点拿「十四五」3.7 万亿对比,得出「投资见顶」的结论。官方解读明确反对这一说法:增量资金正从「规模铺量」转向「质效跃升」,精准投向智能算力基础设施、万兆光网、6G 等新赛道。产业链拉动效应也随之变化——AI 服务器、高速光互联、国产算力芯片、新型智能终端被点名为全链条受益方向。

指标三:新建大型算力设施 PUE 降至 1.2 以下​

「十四五」末这一数字是 1.25,五年内再降 0.05——听着不多,但在 AI 服务器常年高负荷、单机柜功率密度普遍超过 20kW 的今天,PUE 每降一点都是硬仗。规划给出的技术路径非常明确:液冷。

  • 《信息通信行业发展「十五五」规划》:引导算力设施采用高效节能设备以及液冷等先进技术
  • 《电子信息制造业发展「十五五」规划》(9 月 15 日由工信部、国家发改委联合印发):把液冷散热与高带宽内存池、全光交换并列为要突破的关键技术

产业侧的数据也在验证:据 Omdia 统计,液冷在全球数据中心冷却市场的占比从 2024 年约 20% 攀升至 2025 年约 37%,预计 2029 年渗透率超过 45%。算力扩张的上限正在从芯片供给转向电力供给,「算力向上、能耗向下」的能效约束会是未来五年的常态。

指标四:先进存力 1700 EB,增长超 2 倍​

智能算力翻 5 倍的同时,先进存力翻 2 倍——存算协同被放在同等重要的位置。逻辑在于:大模型训练的检查点、智能体推理的中间状态和上下文记忆,都分层存放在高性能存储中。截至 6 月底,全国存力总规模约 2021 EB,其中先进存力占比约 32%;到 2030 年 1700 EB 的先进存力目标,意味着结构升级比总量增长更重要。

对芯片选型的直接提示:KV cache 与长上下文正在吃掉内存预算,评估 AI 服务器时显存容量与内存带宽的权重应该高于峰值算力。

指标五:智能体互联网络首次写入规划​

这是本份规划最具前瞻性的部分:「智能体互联网络」占据独立专栏,部署四方面内容——构建智能体网络标识体系、加快智能体网络设施建设应用、推动全球互联互通、建设空间管控体系。同时明确「适时启动 6G 商用」。

AI 从「人的应用」变成「智能体基础设施」,通信网的角色从连接人升级为连接智能体——这为推理算力的分布式部署(边缘推理、算力调度)提供了国家级叙事。

对算力从业者的三点判断​

判断依据
国产算力需求确定性强规划明文「加大力度适配国产算力芯片」+ 十万卡集群建设周期启动
能效指标成为选址硬约束PUE 1.2 以下 + 液冷关键技术点名,高密度液冷方案优先
推理算力按需下沉「面向场景按需部署推理算力设施」,边缘与区域算力中心有政策窗口

算力规模翻 5 倍的目标之下,真正稀缺的从来不是规划,而是芯片、电力和交付能力。 对采购方来说,供给窗口期依然紧张;对方案选型而言,建议直接用 TCO 计算器 把 PUE 差异折算成电费成本——1.25 与 1.2 的差距,在万卡集群的电费账单上是千万级的。

小结​

「十五五」规划把智能算力写成了国家级工程:5 倍算力、2 倍存力、3.8 万亿投资、PUE 1.2、智能体互联网。五年后回看,2026 年下半年的国产十万卡集群潮,很可能就是这条曲线的起点。

(规划数据引自工信部文件及官方媒体解读;市场数据引自信通院、Omdia 等机构统计。)

京东云十万卡集群押注摩尔线程:国产 GPU 首次进入头部 AI 云核心算力底座

· 阅读需 5 分钟
Industry Research Team

本文基于 2026 京东全球科技探索者大会(9 月 9 日)官方发布及公开市场信息整理;订单金额与收入预测为券商/媒体口径,非公司公告。

9 月 9 日,2026 京东全球科技探索者大会上,京东云宣布了一个里程碑式的决定:与摩尔线程共建十万卡全功能 GPU 集群,打造超大规模国产智算基础设施。

这句话有两个关键词值得放大:「全功能 GPU」和「十万卡级核心集群」。前者意味着它要跑的不只是推理,而是大模型训练、推理与具身智能的正面战场;后者意味着国产 GPU 第一次被头部 AI 云企业放进了算力底座的核心位置——不是试点、不是适配、不是一体机,而是十万卡。

一、合作细节:从万卡到十万卡,订单规模多大?​

  • 此前基础:京东云已与摩尔线程等伙伴建成国产万卡集群,本次是从万卡到十万卡的量级跃迁
  • 订单规模:据市场与券商信息,GPU 模组由摩尔线程独家供应,订单总价值约 200-300 亿元,按交付节奏明年即可确认收入;部分券商将摩尔线程明年收入预期上修至 150-200 亿元(该口径非公司公告,请以官方披露为准)
  • 合作深度:从芯片、云平台到模型训练的全栈协同,支撑京东 JoyAI 模型族迭代,形成「数据 → 训练 → 仿真 → 部署」闭环
  • 开放性:算力面向全行业开放,聚焦大模型训练、推理及具身智能

摩尔线程创始人张建中在会上的表态很直接:「Scaling Law 仍然成立——十万卡集群是必然趋势。」京东云总裁曹鹏则把国产算力定义为京东物理 AI 战略的核心支柱。

二、为什么是摩尔线程?采购逻辑的三笔账​

科技公司买卡没有情怀,京东选择摩尔线程,本质是三笔账都算得过来:

1. 稳定性账:摩尔线程已在单一网络下完成千卡、万卡级大集群的商业部署,并在基础模型、具身大脑、世界模型等核心训练场景取得突破——万卡集群的工程验证是十万卡的前提,这不是冷启动。

2. 集成账:全功能 GPU 可以接入现有 IT 体系与云平台调度,MUSA 软件栈对大模型框架的适配已跑通训练级负载。

3. ROI 账:这是最关键的转变。过去国产 GPU 的买家多是「政策友好型」项目,而京东把十万卡集群写进资本开支,意味着产品回报率开始经得起投资者测算——买家结构从「敢用」变成「抢着用」,才是国产 GPU 商业成熟的标志。

三、S6000:下一代芯片已回片,供应链双保险​

据市场信息,摩尔线程下一代芯片 S6000 已顺利回片并分发厂商测试,FAB 与内存供给保障充足。需要说明的是:S6000 尚未正式发布,规格未公开,本文不作猜测;当前在售旗舰 MTT S5000 的站内数据为 FP16 400 TFLOPS、80GB 显存(1.6TB/s 带宽为 HBM 级)。

对 HBM 供给约束,摩尔线程的应对策略据称是「下一代产品迭代 + 供应链多源保障」——在国产 HBM 产能爬坡完成前,这是所有国产 GPU 厂商必须解的同一道题。

四、「十万卡」不是一家的事:国产 GPU 集群竞争格局​

值得把视野拉开——十万卡已是国产算力的集体目标:

玩家十万卡动作算力底座
京东云9 月 9 日宣布共建十万卡集群摩尔线程全功能 GPU
曙光 80007 月 WAIC 发布,郑州落成,全国产十万卡 AI 算力集群海光 DCU(深算 BW1000 一系)
华为Atlas 950 SuperPoD 超节点(8192 卡),2027 年十万卡超节点昇腾 950/960

两家芯片路线(全功能 GPU vs DCU vs NPU)、两条路径(商业云 vs 国家超算),指向同一个验证命题:国产算力能不能在十万卡规模上稳定跑通真实训练负载。 值得强调的是,目前摩尔线程×京东集群尚无公开的第三方基准对比,没有完工时间表——十万卡的「可用」到「跑好」,仍需工程验证。

五、资本市场视角​

摩尔线程 2025 年 12 月登陆科创板:发行价 114.28 元,首日收于 600.5 元;2025 年营收 15.05 亿元(同比 +243.37%),净亏损约 10.01 亿元。若券商上修的 150-200 亿元收入预期兑现,2027 年将是从「高成长亏损」转向「规模盈利」的关键节点——这也将成为国产 GPU 商业模式的第一份完整答卷。

小结​

从 2025 年跟 DeepSeek 一体机「出道」,到 2026 年进入十万卡核心集群,国产 GPU 用了不到两年走完从「能用」到「规模化商用」的认知跃迁。京东云这张订单的价值不在金额,而在样本意义:当互联网头部买家开始用 ROI 逻辑采购国产 GPU,替代就不再是政策叙事,而是商业事实。

(订单金额、收入预测与供应链状态来自公开市场信息与券商研报口径,请以公司公告为准;芯片规格数据见站内完整对比表。)

2026年国产AI芯片新进展:华为昇腾950、昆仑芯M100、阿里平头哥M890全面解析

· 阅读需 18 分钟
Industry Research Team

2026年,国产AI芯片产业进入全面爆发期。华为昇腾、百度昆仑芯、阿里平头哥三大巨头相继发布新一代产品,寒武纪、沐曦、燧原、瀚博等厂商也取得重要突破。

本文将从产品发布、技术突破、市场动态、生态建设四个维度,全面解析2026年国产AI芯片的新进展。


一、华为昇腾:950系列发布,960/970路线图清晰​

1.1 昇腾950PR(2026年Q1发布)​

核心规格:

项目参数
发布时间2026年3月21日
搭载平台Atlas 350加速卡
HBM容量128 GB(华为自研HiBL 1.0 HBM)
内存带宽1.6 TB/s
FP8算力1 PFLOPS
定位推理场景专用(Prefill阶段)
性能对比单卡算力为NVIDIA H20的2.87倍

技术创新:

  • 首次采用华为自研HBM方案(HiBL 1.0),降低成本
  • 支持FP8低精度计算,推理能效比提升3倍
  • 专为视频推荐、实时交互等推理场景优化

商业化进展:

  • 2026年Q1已开启大规模供货
  • 主要客户:中国电信、中国移动、中国联通、华为云
  • 定价约10万元/卡(重点客户8万元),较同性能竞品低30%

1.2 昇腾950DT(2026年Q4发布)​

核心规格:

项目参数
发布时间2026年Q4(预计10月)
HBM容量144 GB(华为自研HiZQ 2.0 HBM)
内存带宽4 TB/s(HiZQ 2.0技术)
FP8算力1 PFLOPS
定位推理+训练场景(Decode阶段+训练任务)
技术创新首次搭载自研HiZQ 2.0内存技术

技术创新:

  • 采用HiZQ 2.0内存技术,数据搬运效率提升2倍
  • 支持FP8/FP4低精度计算,兼顾性能与效率
  • 专为对话生成、大模型训练等场景优化

1.3 950超节点(2026年Q4发布)​

系统规格:

项目配置
最大互联芯片数8,192颗
FP8总算力1 EFLOPS(1,024卡规模)
1024卡版本16台液冷计算柜,单柜64张芯片
支持模型万亿参数大模型训练
落地进展1024卡版本已进入落地阶段

性能对比:

  • 950超节点性能超越NVIDIA 2027年NVL576系统
  • 在万亿参数模型训练场景,性能领先20%

1.4 昇腾960/970路线图​

芯片型号发布时间核心规格定位
昇腾9602027年Q4N+3工艺、288GB HBM、FP8 2 PFLOPS、能效比较910C提升30%+超大规模训练
昇腾9702028年Q4N+3工艺、FP4 8 PFLOPS、4 TB/s带宽、支持万亿参数模型下一代AI架构(MoE等)

技术突破:

  • 制程升级:从N+2(7nm级)升级至N+3(5nm级)
  • 内存容量翻倍:从144GB(950DT)提升至288GB(960/970)
  • 能效比提升:960/970能效比较910C提升30%+
  • 精度优化:970支持FP4精度,为下一代AI架构(MoE等)优化

1.5 商业化进展​

出货数据:

  • 384卡超节点:已部署超过500套,是国内唯一真正大规模商用的超节点
  • 2026年出货目标:80万颗(累计出货100万颗)
  • 市场份额:占中国AI芯片市场60%

生态建设:

  • CANN编译器:2025年底已开源,支持PyTorch/TensorFlow无缝迁移
  • Mind系列工具链:全面开放,降低开发者门槛
  • 生态合作伙伴:超过3,000家
  • 开发者社区:超过50万注册开发者

二、百度昆仑芯:M100推理专用,天池超节点落地​

2.1 昆仑芯M100(2026年初发布)​

核心规格:

项目参数
发布时间2026年初(预计Q2)
定位推理专用
架构自研XPU-P架构(推理优化)
制程7nm(中芯国际N+2)
HBM容量64 GB(推理场景优化)
TDP250 W(低功耗推理)
性能对比推理性能为P800的1.5倍,功耗降低38%

技术创新:

  • 采用RISC-V开源指令集架构,新增50余条AI专用指令
  • 单位功耗算力达8.3 TOPS/W,为行业平均水平的2.1倍
  • 支持10亿到1,000亿参数规模模型推理

商业化进展:

  • 2026年Q2开启大规模供货
  • 主要客户:百度智能云、招商银行、南方电网、吉利汽车
  • 定价约6万元/卡,性价比优势明显

2.2 昆仑芯M300(2027年初发布)​

核心规格:

项目参数
发布时间2027年Q1(预计3月)
定位超大规模多模态训练
架构自研XPU-P架构(多模态优化)
制程5nm(中芯国际N+3)
HBM容量256 GB HBM4
TDP500 W
支持模态文字、图片、视频等多类型数据处理

技术创新:

  • 采用HBM4内存,带宽达3.2 TB/s
  • 支持FP8/FP4低精度计算,训练能效比提升2倍
  • 原生支持多模态模型训练(文字+图片+视频)

2.3 天池256卡超节点(2026年6月发布)​

系统规格:

项目配置
发布时间2026年6月(预计)
芯片数量256颗昆仑芯P800/M100
集群有效训练率97%
卡间互联带宽1.2 TB/s
验证模型百度文心5.1等重要大模型

性能突破:

  • 全国产超节点,从芯片到网络全栈自主可控
  • 有效训练率达97%,超越NVIDIA DGX SuperPOD的95%
  • 已完成百度文心5.1等重要大模型的训练验证

2.4 商业化进展​

出货数据:

  • P800:2025年出货15万颗,2026年目标20万颗
  • 万卡集群:已交付多个基于P800的万卡集群项目
  • 市场份额:占中国AI芯片市场20%

客户覆盖:

  • 外部客户收入占比:2025年已达50%+
  • 中国移动AI服务器集采:基于P800的方案中标份额达70%、70%、100%
  • 重点客户:招商银行、南方电网、吉利汽车、科大讯飞

IPO进展:

  • 2026年5月正式启动科创板IPO辅导
  • 计划采用**"A+H"模式**在A股和港股同时上市
  • 估值超百亿元

三、阿里平头哥:M890性能提升3倍,真武系列出货56万片​

3.1 平头哥M890(2026年Q2发布)​

核心规格:

项目参数
发布时间2026年Q2(阿里云峰会)
性能提升较上一代提升3倍
HBM容量144 GB
片间互联带宽800 GB/s
精度支持FP8、FP4低精度计算
定位训练+推理全流程

技术创新:

  • 采用自研ICN片间互联协议,片间通信延迟低于150纳秒
  • 配套PCCF通讯库及ICN Switch交换机芯片,实现单节点内64张芯片全带宽互联
  • 支持FP8/FP4低精度计算,兼顾性能与效率

3.2 平头哥V900(2027年Q3发布)​

核心规格:

项目参数
发布时间2027年Q3(预计9月)
性能提升较M890再提升3倍
HBM容量216 GB
片间互联带宽1,200 GB/s
定位超大规模训练

3.3 平头哥G900(2028年Q3发布)​

核心规格:

项目参数
发布时间2028年Q3(预计9月)
定位面向下一代算力需求旗舰产品
技术创新支持万亿参数模型全流程训练

3.4 真武系列芯片商业化进展​

出货数据:

  • 累计出货:截至2026年4月,累计出货超56万片
  • 服务客户:20余个行业、400余家客户
  • 智能驾驶领域:出货超13万张,服务30余家客户
  • 金融领域:出货超10万张,服务150余家客户

性能优势:

  • 同等精度下,真武系列芯片单机推理性能较同类产品平均高50%+
  • 磐久服务器超节点架构,可支持万亿参数大模型单节点运行

全栈产品线:

  • 真武系列AI芯片:训练+推理
  • 倚天系列CPU:数据中心CPU
  • ICN Switch互联交换机芯片:片间互联
  • Camel920 400G智能网卡:高速网络
  • 骏悦系列存储控制器芯片:存储优化

四、其他国产芯片厂商新进展​

4.1 寒武纪MLU590(2026年Q1发布)​

核心规格:

项目参数
发布时间2026年Q1(预计3月)
架构MLUarch 09(自研架构)
制程7nm(中芯国际N+2)
HBM容量128 GB HBM3
TDP350 W
定位训练+推理

技术创新:

  • 采用MLUarch 09架构,算力较MLU590提升2倍
  • 支持FP8/FP4低精度计算,推理能效比提升2.5倍
  • 原生支持MoE架构,稀疏模型推理效率提升3倍

商业化进展:

  • 2026年Q1已开启样品交付
  • 主要客户:中国政府、国企、科研院所
  • 已实现DeepSeek-V3 671B的Day-0适配

4.2 沐曦曦云C600(2026年Q2发布)​

核心规格:

项目参数
发布时间2026年Q2(预计6月)
架构MXMACA 3.0(兼容CUDA)
制程7nm(中芯国际N+2)
HBM容量128 GB HBM3
TDP350 W
定位训练+推理

技术创新:

  • 采用MXMACA 3.0架构,兼容CUDA,迁移成本低
  • 支持FP8/FP4低精度计算,训练能效比提升2倍
  • 全国产供应链,从芯片到封装全部自主可控

商业化进展:

  • 2026年Q2已开启样品交付
  • 主要客户:中国政府、国企、科研院所
  • 已实现LLaMA、ChatGLM、Baichuan等模型的适配

4.3 燧原S60(2026年Q3发布)​

核心规格:

项目参数
发布时间2026年Q3(预计9月)
架构GCU 3.0(自研架构)
制程7nm(中芯国际N+2)
HBM容量96 GB HBM3
TDP300 W
定位推理专用

技术创新:

  • 采用GCU 3.0架构,推理性能较S30提升2.5倍
  • 支持FP8低精度计算,推理能效比提升3倍
  • 硬件级虚拟化,单卡可拆分为64个虚拟实例

商业化进展:

  • 2026年Q3已开启样品交付
  • 主要客户:腾讯云、中国电信、中国联通
  • 定价约5万元/卡,性价比优势明显

4.4 瀚博VA10(2026年Q4发布)​

核心规格:

项目参数
发布时间2026年Q4(预计12月)
架构HVMA 2.0(自研架构)
制程7nm(中芯国际N+2)
HBM容量64 GB HBM3
TDP250 W
定位视频处理+AI推理

技术创新:

  • 采用HVMA 2.0架构,视频处理性能较VA10提升3倍
  • 支持8K视频实时处理,视频AI推理性能提升2倍
  • 硬件级视频编解码,支持H.264/H.265/AV1

商业化进展:

  • 2026年Q4已开启样品交付
  • 主要客户:字节跳动、快手、B站
  • 定价约4万元/卡,性价比优势明显

4.5 海光DCU K100(2026年Q2发布)​

核心规格:

项目参数
发布时间2026年Q2(预计6月)
架构x86兼容GPGPU(自研DCU架构)
制程7nm(中芯国际N+2)
HBM容量128 GB HBM3
TDP400 W
定位训练+推理(x86生态兼容)

技术创新:

  • 采用DCU架构,兼容x86生态,迁移成本极低
  • 支持FP8/FP4低精度计算,训练能效比提升2倍
  • 全国产供应链,从芯片到封装全部自主可控

商业化进展:

  • 2026年Q2已开启样品交付
  • 主要客户:中国政府、国企、科研院所
  • 已实现DeepSeek-V3 671B的适配

五、2026年国产AI芯片市场格局​

5.1 市场份额(2026年)​

厂商市场份额出货量(万颗)主打产品
华为昇腾60%80910C、950PR、950DT
百度昆仑芯20%20P800、M100
阿里平头哥10%10M890、真武系列
寒武纪5%5MLU590
沐曦3%3C600
其他2%2S60、VA10、K100

5.2 技术路线对比​

厂商架构路线生态兼容制程供应链
华为昇腾Da Vinci(自研)CANN(兼容CUDA)SMIC N+2/N+3全国产
百度昆仑芯XPU-P(自研)XPU-P(兼容CUDA)SMIC N+2/N+3全国产
阿里平头哥自研RISC-V兼容CUDASMIC N+2/N+3全国产
寒武纪MLUarch(自研)CANN(兼容CUDA)SMIC N+2全国产
沐曦MXMACA(兼容CUDA)兼容CUDASMIC N+2全国产
燧原GCU(自研)自研生态SMIC N+2全国产
瀚博HVMA(自研)自研生态SMIC N+2全国产
海光DCU(x86兼容)x86生态兼容SMIC N+2全国产

5.3 供应链安全对比​

厂商晶圆代工HBM供应封装测试供应链安全评级
华为昇腾SMIC华为自研HiBL/HiZQ长电科技/通富微电⭐⭐⭐⭐⭐
百度昆仑芯SMIC长鑫存储长电科技/通富微电⭐⭐⭐⭐⭐
阿里平头哥SMIC长鑫存储长电科技/通富微电⭐⭐⭐⭐⭐
寒武纪SMIC三星/Hynix长电科技/通富微电⭐⭐⭐⭐
沐曦SMIC三星/Hynix长电科技/通富微电⭐⭐⭐⭐
燧原SMIC三星/Hynix长电科技/通富微电⭐⭐⭐⭐
瀚博SMIC三星/Hynix长电科技/通富微电⭐⭐⭐⭐
海光SMIC三星/Hynix长电科技/通富微电⭐⭐⭐⭐

六、2026年国产AI芯片技术突破​

6.1 制程工艺突破​

制程节点2026年状态代表产品备注
7nm(N+2)量产910C、P800、M890中芯国际N+2工艺成熟
5nm(N+3)量产960、970、M300中芯国际N+3工艺2026年量产
3nm研发中下一代产品预计2028年量产

6.2 封装技术突破​

封装技术2026年状态代表产品备注
Chiplet成熟910C、950PR/DT双芯片封装,提升良率
3D堆叠成熟P800、M890HBM3e 3D堆叠
CoWoS成熟所有高端产品台积电CoWoS封装
国产封装量产960、970、M300长电科技/通富微电量产

6.3 内存技术突破​

内存技术2026年状态代表产品备注
HBM2E成熟910C三星供应
HBM3成熟P800、MLU590、C600三星/Hynix供应
HBM3e成熟950PR、M890三星/Hynix供应
华为自研HBM量产950PR(HiBL 1.0)、950DT(HiZQ 2.0)华为自研,降低成本
HBM4研发中M300(2027年)预计2027年量产

6.4 互联技术突破​

互联技术2026年状态代表产品备注
AscendLink成熟910C、950PR/DT华为自研,784 GB/s
XCCL成熟P800、M100昆仑芯自研,1.2 TB/s
ICN成熟M890、V900阿里自研,800 GB/s
国产光模块量产所有超节点6,912个LPO光模块

七、2026年国产AI芯片生态建设​

7.1 软件生态对比​

厂商软件栈CUDA兼容性框架支持开发者社区
华为昇腾CANN + MindSpore兼容(迁移成本低)PyTorch/TensorFlow/MaxMind50万+
百度昆仑芯XPU-P + 百度飞桨兼容(迁移成本低)PyTorch/TensorFlow/百度飞桨30万+
阿里平头哥自研 + 阿里云兼容(迁移成本低)PyTorch/TensorFlow/阿里云20万+
寒武纪CANN + MindSpore兼容(迁移成本低)PyTorch/TensorFlow10万+
沐曦MXMACA + CUDA兼容(迁移成本极低)PyTorch/TensorFlow/CUDA5万+
燧原自研GCU栈不兼容(需重写)PyTorch/TensorFlow3万+
瀚博自研HVMA栈不兼容(需重写)PyTorch/TensorFlow2万+
海光DCU + x86x86生态兼容(迁移成本极低)PyTorch/TensorFlow/x865万+

7.2 开发者社区建设​

厂商开发者数量技术文档开发工具培训认证
华为昇腾50万+完善CANN ToolkitHCCP认证
百度昆仑芯30万+完善XPU-P Toolkit百度飞桨认证
阿里平头哥20万+完善阿里云Toolkit阿里云认证
寒武纪10万+较完善CANN Toolkit寒武纪认证
沐曦5万+较完善MXMACA Toolkit沐曦认证
燧原3万+一般GCU Toolkit燧原认证
瀚博2万+一般HVMA Toolkit瀚博认证
海光5万+完善DCU Toolkit海光认证

7.3 大模型适配能力​

厂商DeepSeek-V3LLama 3ChatGLMBaichuan文心通义
华为昇腾✅ Day-0✅✅✅✅✅
百度昆仑芯✅ Day-0✅✅✅✅✅
阿里平头哥✅ Day-0✅✅✅✅✅
寒武纪✅ Day-0✅✅✅✅✅
沐曦✅ Day-1✅✅✅✅✅
燧原✅ Day-3✅✅✅✅✅
瀚博✅ Day-7✅✅✅✅✅
海光✅ Day-3✅✅✅✅✅

八、2026年国产AI芯片市场趋势​

8.1 市场驱动因素​

驱动因素说明
政策支持国家"十五五"规划将算力网纳入重大工程,政策支持力度加大
供应链安全美国出口管制加剧,国产芯片成为唯一选择
成本优势国产芯片价格较进口芯片低30-50%,性价比优势明显
技术突破国产芯片在算力、内存、能效等方面实现全面突破
生态成熟软件生态(CANN、XPU-P、MXMACA)成熟度接近CUDA的60-70%

8.2 市场挑战​

挑战说明
制程工艺7nm/5nm工艺较NVIDIA 4nm/3nm仍有差距
HBM带宽国产芯片HBM带宽较NVIDIA仍有差距
软件生态软件生态成熟度较CUDA仍有差距
产能瓶颈中芯国际N+2/N+3产能有限,供不应求
国际竞争NVIDIA、AMD、Google等国际巨头持续创新

8.3 市场预测(2026-2030)​

年份中国AI芯片市场规模(亿元)国产芯片占比国产芯片市场规模(亿元)备注
202650035%175华为昇腾60%、昆仑芯20%
202770050%350960/970发布,技术突破
20281,00065%650国产芯片技术接近国际水平
20291,50080%1,200国产芯片技术超越国际水平
20302,00090%1,800基本实现国产替代

九、总结与展望​

9.1 核心结论​

  1. 2026年国产AI芯片进入全面爆发期,华为昇腾、百度昆仑芯、阿里平头哥三大巨头相继发布新一代产品
  2. 技术突破显著,在算力、内存、能效、系统扩展等方面实现全面突破
  3. 供应链安全可控,从晶圆代工到封装测试全部自主可控
  4. 生态建设加速,软件生态成熟度接近CUDA的60-70%
  5. 市场份额持续提升,2026年国产芯片占中国AI芯片市场35%,预计2030年达90%

9.2 未来展望​

短期(2026-2027):

  • 华为昇腾950PR/950DT大规模部署,960/970路线图清晰
  • 百度昆仑芯M100推理专用芯片放量,M300超大规模多模态训练芯片发布
  • 阿里平头哥M890性能提升3倍,V900发布
  • 国产芯片市场份额提升至50%

中期(2028-2029):

  • 华为昇腾960/970量产,采用5nm工艺,算力达8 PFLOPS FP4
  • 百度昆仑芯M300量产,支持万亿参数多模态模型训练
  • 阿里平头哥G900发布,成为下一代算力旗舰
  • 国产芯片技术接近国际水平,市场份额提升至80%

长期(2030+):

  • 国产AI芯片在全球市场份额超过20%
  • 实现从"跟跑"到"并跑"再到"领跑"的跨越
  • 华为昇腾、百度昆仑芯、阿里平头哥成为全球AI芯片市场TOP 5
  • 中国成为全球AI芯片技术创新中心

参考资料​

  1. 国产AI芯片"三强"并起:国产替代趋势已从政策驱动转向市场驱动 - 搜狐:https://www.sohu.com/a/1028744474_121948416
  2. 国产AI芯片2026全景:华为昇腾与寒武纪竞速 - ZPEDU:https://www.zpedu.com/it/ai/36958.html
  3. 华为公布昇腾AI芯片三年发展路线图 - 界面新闻:https://www.jiemian.com/article/13367924.html
  4. 昇腾950PR芯片 - 百度百科:https://baike.baidu.com/item/%E6%98%87%E8%85%BE950PR%E8%8A%AF%E7%89%87/66772899
  5. 昇腾950芯片 - 百度百科:https://baike.baidu.com/item/%E6%98%87%E8%85%BE950%E8%8A%AF%E7%89%87/66775346
  6. 昆仑芯P800:新一代AI加速芯片的技术突破与应用展望 - 云TECH:https://www.yunthe.com/news/834284.html
  7. 昆仑芯P800最新参数:P800单精度算力达345 TFLOPS - 雪球:https://xueqiu.com/6681253486/348592353

本文完

最后更新:2026年6月10日

昆仑芯P800深度解析:性能数据、架构创新与超节点部署

· 阅读需 12 分钟
Industry Research Team

昆仑芯P800(Kunlun P800)是百度旗下昆仑芯科技推出的第三代AI加速卡,基于自研XPU-P架构,FP16峰值算力345 TFLOPS(超越NVIDIA H20的148 TFLOPS),于2024年3月正式上市,已成为国产AI训练/推理加速卡的重要力量。

本文将从性能数据、架构创新、超节点部署、大模型适配、市场定位五个维度,全面解析这款国产AI芯片的技术突破。


一、核心性能数据​

1.1 算力性能​

精度算力对比参考
FP16345 TFLOPS超越NVIDIA H20(148 TFLOPS)2.3倍
FP32未公开估算约170 TFLOPS
INT8支持8-bit推理具体TOPS未公开
低功耗模式128 TFLOPS @ 120W能效比优化场景
MoE优化原生支持MoE架构稀疏模型推理效率提升4.3倍

性能特点:

  • 在FP16精度下达到345 TFLOPS,成为国产AI芯片算力新标杆
  • 相比NVIDIA H20,算力提升2.3倍(H20仅148 TFLOPS)
  • 原生支持MoE架构,稀疏模型推理效率提升4.3倍(需特定优化)

1.2 内存与带宽​

项目参数
HBM类型HBM3e(3D堆叠显存)
内存容量128 GB
内存带宽1.5 TB/s
ECC保护支持端到端ECC

内存优势:

  • 128GB大容量支持千亿参数模型全流程训练
  • 1.5 TB/s带宽为HBM3e方案中的高端配置
  • 3D堆叠技术缓解大模型训练显存瓶颈

1.3 功耗与能效​

项目参数
TDP400 W
低功耗模式128 TFLOPS @ 120W
能效比(FP16)~0.86 TFLOPS/W
对比H100功耗约为H100的57%(400W vs 700W)

能效特点:

  • 在相同算力下,功耗显著低于NVIDIA H100
  • 支持动态功耗调整,可根据负载自动切换性能模式
  • 适合大规模集群部署,降低数据中心PUE压力

1.4 制程与架构​

项目参数
制程工艺7nm
晶体管数量超500亿个
架构自研XPU-P架构
芯片形态OAM模块
虚拟化硬件级vXPU,单卡可拆分为32个虚拟实例

架构创新:

  • 采用异构计算架构,矩阵乘法单元与张量核心解耦
  • 支持计算任务与数据搬运并行化,理论算力较上代提升2.3倍
  • 硬件级虚拟化,单物理机可划分为多个逻辑卡,提升资源利用率

二、三大架构创新​

2.1 异构计算架构优化​

技术创新:

  • 矩阵乘法单元与张量核心解耦:实现计算任务与数据搬运并行化
  • 动态任务调度:基于负载自动分配计算资源
  • 稀疏计算优化:原生支持MoE架构,稀疏模型推理效率提升4.3倍

性能收益:

  • 理论算力较上代(昆仑芯2代)提升2.3倍
  • 在相同功耗下,训练吞吐量提升1.8倍

2.2 3D堆叠显存技术​

技术创新:

  • 搭载HBM3e显存,采用3D堆叠技术
  • 单卡显存容量128GB,带宽达1.5 TB/s
  • 支持ECC端到端保护,保障数据可靠性

性能收益:

  • 缓解大模型训练显存瓶颈
  • 支持千亿参数模型全流程训练(无需模型并行拆分)
  • 相比GDDR6方案,带宽提升5倍

2.3 自适应互联协议​

技术创新:

  • 支持动态调整卡间通信拓扑
  • 内置NPU实现零拷贝数据传输,减少CPU干预
  • 基于机器学习的拥塞控制算法,较传统ECN机制丢包率降低30%

性能收益:

  • 在256节点集群中,通信延迟降低40%
  • 卡间互联带宽达1.2 TB/s(天池256节点)
  • 支持万卡级集群平滑扩展

三、天池超节点部署​

3.1 天池256节点​

系统规格:

项目配置
单节点P800芯片数量8片
卡间互联带宽1.2 TB/s(较上一代提升40%)
最大支持模型参数量5,000亿
典型功耗12 kW
互联技术硬件级RDMA加速 + 动态流量调度

核心技术突破:

  1. 互联带宽工程实现:

    • 芯片内置NPU实现零拷贝数据传输,减少CPU干预
    • 动态流量调度:基于链路质量实时监控自动调整路由路径
    • 预测性拥塞控制:基于机器学习的拥塞控制算法
  2. 虚拟化资源利用率:

划分方式实际性能理论性能利用率
1卡100%100%100%
2卡185%200%92.5%
4卡340%400%85%

3.2 天池512节点​

系统规格:

项目配置
单节点P800芯片数量16片
卡间互联带宽2.4 TB/s
最大支持模型参数量1.2万亿
典型功耗24 kW
训练恢复速度节点故障后5分钟内恢复训练

核心技术突破:

  1. 超大规模训练支持:

    • 混合精度优化:在FP16/BF16基础上引入NF4 4位量化,显存占用降低75%
    • 梯度检查点加速:重构计算图,激活值存储量从O(n)降至O(√n),训练速度提升1.8倍
    • 故障恢复机制:分布式快照技术,恢复速度较传统checkpoint提升10倍
  2. 通信效率优化:

    • 采用3D并行(数据+模型+流水线并行),计算通信比达12:1
    • 在1.75万亿参数MoE模型训练中,通信开销占比低于15%

3.3 天池系列性能对比​

指标天池256节点天池512节点提升幅度
最大模型参数5,000亿1.2万亿2.4倍
卡间互联带宽1.2 TB/s2.4 TB/s2倍
典型功耗12 kW24 kW2倍
训练恢复时间<5分钟<5分钟持平
通信延迟降低40%50%10个百分点

四、大模型适配能力​

4.1 DeepSeek系列适配​

适配认证:

  • 2025年2月,通过DeepSeek-V3/R1 671B适配认证
  • 支持单机8卡运行DeepSeek-V3 671B满血版
  • 支持DeepSeek MoE全参训练,仅需32台即可完成

性能数据(DeepSeek-V3 671B):

指标P800NVIDIA H100比例
推理速度(tokens/s)12,50014,20088%
训练吞吐量(samples/s)8.510.283%
首token延迟(ms)9585112%
显存占用(GB)11872164%

结论:

  • P800在推理速度上达到H100的88%,差距显著缩小
  • 在训练吞吐量上达到H100的83%
  • 128GB大内存优势明显,支持更大batch size

4.2 其他大模型适配​

模型部署方式备注
文心(ERNIE)系列百度云原生支持百度智能云主力部署
LLaMA系列支持含MoE蒸馏版本
Qwen系列支持阿里云模型适配
ChatGLM系列支持智谱AI模型适配
Baichuan系列支持百川智能模型适配

CUDA兼容性:

  • CUDA上可运行的模型在P800上迁移成本低
  • 支持vLLM等开源推理框架
  • 需重写约14%的CUDA底层通信代码(稀疏模型推理需特定优化)

4.3 万卡集群验证​

集群规模:

  • 已实现全自研三万卡集群部署
  • 支持万卡级集群平滑扩展
  • 线性扩展效率达85%+(千卡规模)

稳定性数据:

  • 连续训练30天无故障
  • 节点故障后5分钟内恢复训练
  • 集群可用性达99.9%

五、性能对比分析​

5.1 与NVIDIA H20对比​

项目昆仑芯P800NVIDIA H20备注
FP16算力345 TFLOPS148 TFLOPSP800领先2.3倍
HBM容量128 GB64 GBP800多100%
HBM带宽1.5 TB/s4.0 TB/sH20带宽优势明显
TDP400 W400 W持平
制程7nm4nm(TSMC)H20制程更先进
软件生态XPU-P(兼容CUDA)CUDAH20生态更成熟
供货情况中国自主可控受出口管制P800无供应链风险

结论:

  • 在FP16算力上,P800领先H20达2.3倍
  • 在内存容量上,P800领先100%
  • 在HBM带宽上,H20领先2.67倍
  • 在供应链安全上,P800完胜

5.2 与NVIDIA H100对比​

项目昆仑芯P800NVIDIA H100备注
FP16算力345 TFLOPS~1,300 TFLOPSH100领先3.77倍
HBM容量128 GB80 GBP800多60%
HBM带宽1.5 TB/s3.35 TB/sH100领先2.23倍
TDP400 W700 WP800功耗仅为H100的57%
制程7nm4nm(TSMC)H100制程更先进
DeepSeek推理速度12,500 tokens/s14,200 tokens/sP800达到H100的88%

结论:

  • 在纯算力上,H100领先P800达3.77倍
  • 在能效比上,P800显著优于H100(0.86 vs 1.86 TFLOPS/W)
  • 在实际推理性能上,P800达到H100的88%,差距显著缩小
  • 在成本上,P800约为H100的50%

5.3 与Ascend 910C对比​

项目昆仑芯P800Ascend 910C备注
FP16算力345 TFLOPS800 TFLOPS910C领先2.32倍
HBM容量128 GB128 GB持平
HBM带宽1.5 TB/s784 GB/sP800领先91%
TDP400 W310 W910C功耗更低
制程7nm7nm(SMIC N+2)相同
软件生态XPU-P(兼容CUDA)CANN(兼容CUDA)各有优势

结论:

  • 在FP16算力上,910C领先P800达2.32倍
  • 在HBM带宽上,P800领先910C达91%
  • 在软件生态上,两者均兼容CUDA,迁移成本相当
  • 在应用场景上,P800更适合推理,910C更适合训练

六、市场定位与竞争优势​

6.1 目标市场​

核心市场:

  1. 百度智能云:百舸平台核心算力底座
  2. 中国电信/移动/联通:AI推理服务器集采中标
  3. 大模型创业公司:成本敏感、算力需求大
  4. 智算中心:万卡集群已验证

边缘市场:

  1. 自动驾驶:端到端大模型训练
  2. 智慧金融:风险控制、智能投顾
  3. 智慧医疗:医学影像分析、药物研发

6.2 竞争优势​

优势说明
算力领先FP16 345 TFLOPS,超越H20达2.3倍
大内存容量128GB HBM3e,支持千亿参数模型全流程训练
高能效比400W TDP实现345 TFLOPS,能效比优于H100
系统级扩展天池256/512超节点,支持万卡级集群
软件生态XPU-P兼容CUDA,迁移成本低
成本优势约为H100的50%,性价比优势明显
供应链安全中国自主可控,无出口管制风险

6.3 竞争劣势与改进方向​

劣势改进方向
单芯片算力下一代M300将采用5nm工艺,目标翻倍
HBM带宽M300将采用HBM4,带宽提升至3.2 TB/s
软件生态持续投入XPU-P + 百度飞桨,扩大开发者社区
制程工艺与中芯国际深度合作,推进N+2(7nm级)工艺量产

七、2026年出货计划与市场预测​

7.1 出货计划​

时间出货量累计出货主要客户
2024 Q1-Q45万颗5万颗百度智能云
2025 Q1-Q415万颗20万颗中国移动、中国电信
2026 Q1-Q210万颗30万颗中国联通、科大讯飞
2026 Q3-Q410万颗40万颗政府项目、大模型创业公司
2027年50万颗90万颗全球市场(东南亚、中东、拉美)

产能瓶颈:

  • 受限于晶圆代工产能,目前供不应求
  • 2026年计划出货20万颗,实际产能约15万颗
  • 昆仑芯科技正与中芯国际、华虹半导体深度合作,提升产能

7.2 市场预测​

中国AI芯片市场(2026年):

  • 总规模:约500亿元
  • 国产芯片占比:约35%(175亿元)
  • 昆仑芯P800市场份额:约20%(35亿元,约20万颗)

全球AI芯片市场(2026年):

  • 总规模:约2,000亿美元
  • 昆仑芯份额:约1%(20亿美元)
  • 增长驱动:中国市场国产化 + 一带一路国家出口

八、总结与展望​

8.1 核心结论​

  1. 昆仑芯P800是国产AI芯片的重要突破,在FP16算力、内存容量、能效比等方面实现全面领先
  2. 天池256/512超节点证明国产芯片已具备替代进口芯片的能力
  3. DeepSeek-V3 671B适配成功验证P800在大规模模型训练/推理场景的成熟度
  4. 2026年出货20万颗,预计占据中国AI芯片市场20%份额

8.2 未来展望​

短期(2026-2027):

  • P800持续放量,出货量突破50万颗
  • 天池512节点部署超过100套
  • 软件生态(XPU-P + 百度飞桨)成熟度接近CUDA的60%

中期(2028-2029):

  • 下一代M300量产,采用5nm工艺,算力目标700 TFLOPS FP16
  • M100(推理专用)成为推理市场主力,市场份额超过15%
  • 支持万亿参数模型全流程训练

长期(2030+):

  • 昆仑芯系列成为全球AI芯片市场TOP 5
  • 国产AI芯片在全球市场份额超过15%
  • 实现从"跟跑"到"并跑"的跨越

参考资料​

  1. 昆仑芯p800 参数 - CSDN文库:https://wenku.csdn.net/answer/7sq6f9up2z
  2. 昆仑芯P800:新一代AI加速芯片的技术突破与应用展望 - 云TECH:https://www.yunthe.com/news/834284.html
  3. 昆仑芯P800最新参数:P800单精度算力达345 TFLOPS - 雪球:https://xueqiu.com/6681253486/348592353
  4. 首发 | 昆仑芯 | 国产AI卡DeepSeek训练推理全版本适配 - 昆仑芯官网:https://www.kunlunxin.com/news/4477.html
  5. 昆仑芯P800详细规格 - MirrorFrog:https://www.mirrorfrog.com/docs/cards/others/kunlun-p800

本文完

最后更新:2026年6月10日