跳到主要内容

昆仑芯P800深度解析:性能数据、架构创新与超节点部署

· 阅读需 12 分钟
Industry Research Team

昆仑芯P800(Kunlun P800)是百度旗下昆仑芯科技推出的第三代AI加速卡,基于自研XPU-P架构,FP16峰值算力345 TFLOPS(超越NVIDIA H20的148 TFLOPS),于2024年3月正式上市,已成为国产AI训练/推理加速卡的重要力量。

本文将从性能数据、架构创新、超节点部署、大模型适配、市场定位五个维度,全面解析这款国产AI芯片的技术突破。


一、核心性能数据​

1.1 算力性能​

精度算力对比参考
FP16345 TFLOPS超越NVIDIA H20(148 TFLOPS)2.3倍
FP32未公开估算约170 TFLOPS
INT8支持8-bit推理具体TOPS未公开
低功耗模式128 TFLOPS @ 120W能效比优化场景
MoE优化原生支持MoE架构稀疏模型推理效率提升4.3倍

性能特点:

  • 在FP16精度下达到345 TFLOPS,成为国产AI芯片算力新标杆
  • 相比NVIDIA H20,算力提升2.3倍(H20仅148 TFLOPS)
  • 原生支持MoE架构,稀疏模型推理效率提升4.3倍(需特定优化)

1.2 内存与带宽​

项目参数
HBM类型HBM3e(3D堆叠显存)
内存容量128 GB
内存带宽1.5 TB/s
ECC保护支持端到端ECC

内存优势:

  • 128GB大容量支持千亿参数模型全流程训练
  • 1.5 TB/s带宽为HBM3e方案中的高端配置
  • 3D堆叠技术缓解大模型训练显存瓶颈

1.3 功耗与能效​

项目参数
TDP400 W
低功耗模式128 TFLOPS @ 120W
能效比(FP16)~0.86 TFLOPS/W
对比H100功耗约为H100的57%(400W vs 700W)

能效特点:

  • 在相同算力下,功耗显著低于NVIDIA H100
  • 支持动态功耗调整,可根据负载自动切换性能模式
  • 适合大规模集群部署,降低数据中心PUE压力

1.4 制程与架构​

项目参数
制程工艺7nm
晶体管数量超500亿个
架构自研XPU-P架构
芯片形态OAM模块
虚拟化硬件级vXPU,单卡可拆分为32个虚拟实例

架构创新:

  • 采用异构计算架构,矩阵乘法单元与张量核心解耦
  • 支持计算任务与数据搬运并行化,理论算力较上代提升2.3倍
  • 硬件级虚拟化,单物理机可划分为多个逻辑卡,提升资源利用率

二、三大架构创新​

2.1 异构计算架构优化​

技术创新:

  • 矩阵乘法单元与张量核心解耦:实现计算任务与数据搬运并行化
  • 动态任务调度:基于负载自动分配计算资源
  • 稀疏计算优化:原生支持MoE架构,稀疏模型推理效率提升4.3倍

性能收益:

  • 理论算力较上代(昆仑芯2代)提升2.3倍
  • 在相同功耗下,训练吞吐量提升1.8倍

2.2 3D堆叠显存技术​

技术创新:

  • 搭载HBM3e显存,采用3D堆叠技术
  • 单卡显存容量128GB,带宽达1.5 TB/s
  • 支持ECC端到端保护,保障数据可靠性

性能收益:

  • 缓解大模型训练显存瓶颈
  • 支持千亿参数模型全流程训练(无需模型并行拆分)
  • 相比GDDR6方案,带宽提升5倍

2.3 自适应互联协议​

技术创新:

  • 支持动态调整卡间通信拓扑
  • 内置NPU实现零拷贝数据传输,减少CPU干预
  • 基于机器学习的拥塞控制算法,较传统ECN机制丢包率降低30%

性能收益:

  • 在256节点集群中,通信延迟降低40%
  • 卡间互联带宽达1.2 TB/s(天池256节点)
  • 支持万卡级集群平滑扩展

三、天池超节点部署​

3.1 天池256节点​

系统规格:

项目配置
单节点P800芯片数量8片
卡间互联带宽1.2 TB/s(较上一代提升40%)
最大支持模型参数量5,000亿
典型功耗12 kW
互联技术硬件级RDMA加速 + 动态流量调度

核心技术突破:

  1. 互联带宽工程实现:

    • 芯片内置NPU实现零拷贝数据传输,减少CPU干预
    • 动态流量调度:基于链路质量实时监控自动调整路由路径
    • 预测性拥塞控制:基于机器学习的拥塞控制算法
  2. 虚拟化资源利用率:

划分方式实际性能理论性能利用率
1卡100%100%100%
2卡185%200%92.5%
4卡340%400%85%

3.2 天池512节点​

系统规格:

项目配置
单节点P800芯片数量16片
卡间互联带宽2.4 TB/s
最大支持模型参数量1.2万亿
典型功耗24 kW
训练恢复速度节点故障后5分钟内恢复训练

核心技术突破:

  1. 超大规模训练支持:

    • 混合精度优化:在FP16/BF16基础上引入NF4 4位量化,显存占用降低75%
    • 梯度检查点加速:重构计算图,激活值存储量从O(n)降至O(√n),训练速度提升1.8倍
    • 故障恢复机制:分布式快照技术,恢复速度较传统checkpoint提升10倍
  2. 通信效率优化:

    • 采用3D并行(数据+模型+流水线并行),计算通信比达12:1
    • 在1.75万亿参数MoE模型训练中,通信开销占比低于15%

3.3 天池系列性能对比​

指标天池256节点天池512节点提升幅度
最大模型参数5,000亿1.2万亿2.4倍
卡间互联带宽1.2 TB/s2.4 TB/s2倍
典型功耗12 kW24 kW2倍
训练恢复时间<5分钟<5分钟持平
通信延迟降低40%50%10个百分点

四、大模型适配能力​

4.1 DeepSeek系列适配​

适配认证:

  • 2025年2月,通过DeepSeek-V3/R1 671B适配认证
  • 支持单机8卡运行DeepSeek-V3 671B满血版
  • 支持DeepSeek MoE全参训练,仅需32台即可完成

性能数据(DeepSeek-V3 671B):

指标P800NVIDIA H100比例
推理速度(tokens/s)12,50014,20088%
训练吞吐量(samples/s)8.510.283%
首token延迟(ms)9585112%
显存占用(GB)11872164%

结论:

  • P800在推理速度上达到H100的88%,差距显著缩小
  • 在训练吞吐量上达到H100的83%
  • 128GB大内存优势明显,支持更大batch size

4.2 其他大模型适配​

模型部署方式备注
文心(ERNIE)系列百度云原生支持百度智能云主力部署
LLaMA系列支持含MoE蒸馏版本
Qwen系列支持阿里云模型适配
ChatGLM系列支持智谱AI模型适配
Baichuan系列支持百川智能模型适配

CUDA兼容性:

  • CUDA上可运行的模型在P800上迁移成本低
  • 支持vLLM等开源推理框架
  • 需重写约14%的CUDA底层通信代码(稀疏模型推理需特定优化)

4.3 万卡集群验证​

集群规模:

  • 已实现全自研三万卡集群部署
  • 支持万卡级集群平滑扩展
  • 线性扩展效率达85%+(千卡规模)

稳定性数据:

  • 连续训练30天无故障
  • 节点故障后5分钟内恢复训练
  • 集群可用性达99.9%

五、性能对比分析​

5.1 与NVIDIA H20对比​

项目昆仑芯P800NVIDIA H20备注
FP16算力345 TFLOPS148 TFLOPSP800领先2.3倍
HBM容量128 GB64 GBP800多100%
HBM带宽1.5 TB/s4.0 TB/sH20带宽优势明显
TDP400 W400 W持平
制程7nm4nm(TSMC)H20制程更先进
软件生态XPU-P(兼容CUDA)CUDAH20生态更成熟
供货情况中国自主可控受出口管制P800无供应链风险

结论:

  • 在FP16算力上,P800领先H20达2.3倍
  • 在内存容量上,P800领先100%
  • 在HBM带宽上,H20领先2.67倍
  • 在供应链安全上,P800完胜

5.2 与NVIDIA H100对比​

项目昆仑芯P800NVIDIA H100备注
FP16算力345 TFLOPS~1,300 TFLOPSH100领先3.77倍
HBM容量128 GB80 GBP800多60%
HBM带宽1.5 TB/s3.35 TB/sH100领先2.23倍
TDP400 W700 WP800功耗仅为H100的57%
制程7nm4nm(TSMC)H100制程更先进
DeepSeek推理速度12,500 tokens/s14,200 tokens/sP800达到H100的88%

结论:

  • 在纯算力上,H100领先P800达3.77倍
  • 在能效比上,P800显著优于H100(0.86 vs 1.86 TFLOPS/W)
  • 在实际推理性能上,P800达到H100的88%,差距显著缩小
  • 在成本上,P800约为H100的50%

5.3 与Ascend 910C对比​

项目昆仑芯P800Ascend 910C备注
FP16算力345 TFLOPS800 TFLOPS910C领先2.32倍
HBM容量128 GB128 GB持平
HBM带宽1.5 TB/s784 GB/sP800领先91%
TDP400 W310 W910C功耗更低
制程7nm7nm(SMIC N+2)相同
软件生态XPU-P(兼容CUDA)CANN(兼容CUDA)各有优势

结论:

  • 在FP16算力上,910C领先P800达2.32倍
  • 在HBM带宽上,P800领先910C达91%
  • 在软件生态上,两者均兼容CUDA,迁移成本相当
  • 在应用场景上,P800更适合推理,910C更适合训练

六、市场定位与竞争优势​

6.1 目标市场​

核心市场:

  1. 百度智能云:百舸平台核心算力底座
  2. 中国电信/移动/联通:AI推理服务器集采中标
  3. 大模型创业公司:成本敏感、算力需求大
  4. 智算中心:万卡集群已验证

边缘市场:

  1. 自动驾驶:端到端大模型训练
  2. 智慧金融:风险控制、智能投顾
  3. 智慧医疗:医学影像分析、药物研发

6.2 竞争优势​

优势说明
算力领先FP16 345 TFLOPS,超越H20达2.3倍
大内存容量128GB HBM3e,支持千亿参数模型全流程训练
高能效比400W TDP实现345 TFLOPS,能效比优于H100
系统级扩展天池256/512超节点,支持万卡级集群
软件生态XPU-P兼容CUDA,迁移成本低
成本优势约为H100的50%,性价比优势明显
供应链安全中国自主可控,无出口管制风险

6.3 竞争劣势与改进方向​

劣势改进方向
单芯片算力下一代M300将采用5nm工艺,目标翻倍
HBM带宽M300将采用HBM4,带宽提升至3.2 TB/s
软件生态持续投入XPU-P + 百度飞桨,扩大开发者社区
制程工艺与中芯国际深度合作,推进N+2(7nm级)工艺量产

七、2026年出货计划与市场预测​

7.1 出货计划​

时间出货量累计出货主要客户
2024 Q1-Q45万颗5万颗百度智能云
2025 Q1-Q415万颗20万颗中国移动、中国电信
2026 Q1-Q210万颗30万颗中国联通、科大讯飞
2026 Q3-Q410万颗40万颗政府项目、大模型创业公司
2027年50万颗90万颗全球市场(东南亚、中东、拉美)

产能瓶颈:

  • 受限于晶圆代工产能,目前供不应求
  • 2026年计划出货20万颗,实际产能约15万颗
  • 昆仑芯科技正与中芯国际、华虹半导体深度合作,提升产能

7.2 市场预测​

中国AI芯片市场(2026年):

  • 总规模:约500亿元
  • 国产芯片占比:约35%(175亿元)
  • 昆仑芯P800市场份额:约20%(35亿元,约20万颗)

全球AI芯片市场(2026年):

  • 总规模:约2,000亿美元
  • 昆仑芯份额:约1%(20亿美元)
  • 增长驱动:中国市场国产化 + 一带一路国家出口

八、总结与展望​

8.1 核心结论​

  1. 昆仑芯P800是国产AI芯片的重要突破,在FP16算力、内存容量、能效比等方面实现全面领先
  2. 天池256/512超节点证明国产芯片已具备替代进口芯片的能力
  3. DeepSeek-V3 671B适配成功验证P800在大规模模型训练/推理场景的成熟度
  4. 2026年出货20万颗,预计占据中国AI芯片市场20%份额

8.2 未来展望​

短期(2026-2027):

  • P800持续放量,出货量突破50万颗
  • 天池512节点部署超过100套
  • 软件生态(XPU-P + 百度飞桨)成熟度接近CUDA的60%

中期(2028-2029):

  • 下一代M300量产,采用5nm工艺,算力目标700 TFLOPS FP16
  • M100(推理专用)成为推理市场主力,市场份额超过15%
  • 支持万亿参数模型全流程训练

长期(2030+):

  • 昆仑芯系列成为全球AI芯片市场TOP 5
  • 国产AI芯片在全球市场份额超过15%
  • 实现从"跟跑"到"并跑"的跨越

参考资料​

  1. 昆仑芯p800 参数 - CSDN文库:https://wenku.csdn.net/answer/7sq6f9up2z
  2. 昆仑芯P800:新一代AI加速芯片的技术突破与应用展望 - 云TECH:https://www.yunthe.com/news/834284.html
  3. 昆仑芯P800最新参数:P800单精度算力达345 TFLOPS - 雪球:https://xueqiu.com/6681253486/348592353
  4. 首发 | 昆仑芯 | 国产AI卡DeepSeek训练推理全版本适配 - 昆仑芯官网:https://www.kunlunxin.com/news/4477.html
  5. 昆仑芯P800详细规格 - MirrorFrog:https://www.mirrorfrog.com/docs/cards/others/kunlun-p800

本文完

最后更新:2026年6月10日

AI硬件进入"落地纪元"丨2026年五大变革与生存法则

· 阅读需 9 分钟
Industry Research Team

2026年,AI硬件市场正经历从"训练竞赛"到"落地为王"的根本性转变。随着大模型从技术演示走向规模化商业部署,硬件形态、技术路线和产业格局正在发生系统性变革。

出品方:中智盟咨询(CSHIA Research)
撰稿人:周军

五大核心趋势​

趋势1:算力需求结构转变,推理成为增长主引擎​

2026年AI硬件市场的最大变化是算力需求重心从训练转向推理。

根据市场数据:

  • 2026年全球AI推理算力需求预计同比增长超过60%
  • 推理算力占比将首次超过训练算力,成为AI基础设施的主要负载

这一转变源于AI应用从"模型开发"进入"规模化部署"阶段——企业不再频繁训练大模型,而是通过高频推理调用将AI能力转化为实际业务价值。

关键表现​

  1. 推理芯片市场爆发:专用推理芯片(ASIC)出货量预计增长129%,在AI服务器中的占比从2025年的不足20%提升至27.8%。

  2. 成本结构优化:英伟达Rubin平台将推理token成本降至前代的1/10,推动推理应用从"奢侈品"变为"日用品"。

  3. 工作负载特征变化:推理任务呈现"高频、长流程、低延迟"特征,对硬件实时响应能力要求更高。

GTC 2026 最新动态(6月1日台北)​

英伟达CEO黄仁勋在GTC 2026台北宣布多项推理算力重大进展:

  • Vera Rubin平台全面量产:NVL72机架系统智能体吞吐量比上一代Grace Blackwell提升10倍,专为Agentic AI设计
  • Vera CPU正式发布:88核Armv9.2自研Olympus架构,单线程IPC全球最高,LPDDR5X 1.5TB内存,1.2 TB/s带宽,原生支持FP8
  • RTX Spark AI PC芯片:与联发科联合研发(代号N1X),Blackwell架构GPU 1 PFLOP AI算力,128GB统一内存,台积电3nm,重构Windows PC生态
  • AI工厂平台DSX:包含DSX Sim(数字孪生仿真)、DSX OS(资源调配)、DSX MaxLPS(电力优化)、DSX Flex(电网协同)四大组件

该趋势意味着,硬件厂商的竞争焦点不再是"单卡算力峰值",而是"推理能效比"和"系统级优化能力"。


趋势2:边缘与端侧AI,算力下沉的规模化落地​

2026年是边缘AI硬件从概念验证走向规模化部署的关键年。

随着云端推理成本压力和隐私合规要求提升,算力正加速向数据源头迁移,催生边缘服务器、AI终端、智能设备等硬件形态的爆发式增长。

三大落地场景​

场景类别硬件形态核心特征2026年市场规模预测
边缘服务器小型化机柜、边缘计算节点功率密度40-80kW/柜,支持液冷全球出货量增长28%
AI终端设备AI手机、AI PC、智能眼镜端侧NPU算力60+TOPS,离线推理15亿台出货量
IoT设备智能摄像头、传感器、机器人低功耗芯片,实时响应市场规模突破1.5万亿美元

技术突破点​

  1. 端侧模型压缩:通过量化、蒸馏等技术,将百亿参数模型压缩至端侧可运行。

  2. 异构计算架构:CPU+NPU+GPU协同,在功耗约束下实现性能最大化。

  3. 内存带宽优化:HBM技术在边缘芯片的应用,缓解"内存墙"问题。

边缘AI的爆发意味着硬件设计必须兼顾"性能密度"与"功耗效率",传统通用芯片面临专用化挑战。


趋势3:专用芯片与异构计算,打破单一架构垄断​

2026年AI芯片市场将呈现"一超多强、百花齐放"的竞争格局。

英伟达虽在训练领域保持优势,但在推理、边缘、特定场景等细分市场,专用芯片(ASIC)和异构计算方案正快速崛起。

主要技术路线对比​

芯片类型代表厂商核心优势适用场景
通用GPU英伟达、AMD生态成熟,编程灵活云端训练、复杂推理
专用ASIC谷歌TPU、寒武纪能效比高,成本优势大规模推理、特定算法
存算一体多家初创公司突破"内存墙",低延迟边缘推理、实时处理
FPGA/DPU赛灵思、华为可重构,灵活性高网络加速、数据预处理

市场格局变化​

  1. 国产替代加速:中国AI芯片厂商在推理、边缘等场景市占率提升至30%以上。

  2. 开源生态崛起:ROCm、OpenML等开源框架降低专用芯片开发门槛。

  3. Chiplet技术普及:通过先进封装整合不同工艺节点芯片,实现性能与成本平衡。

  4. GTC 2026新品加速落地(2026年6月1日台北):

    • Vera Rubin平台:NVL72机架系统,智能体吞吐量比Grace Blackwell提升10倍
    • Vera CPU:88核Olympus自研架构,专为Agentic AI低延迟设计
    • RTX Spark:与联发科、微软合作,重构Windows PC生态,1 PFLOP AI算力
    • Nemotron 3 Ultra:SSM+MoE混合架构,推理速度提升5倍,成本降低30%

该趋势的核心逻辑是:没有一种芯片能通吃所有AI场景,场景碎片化催生技术路线多元化。


趋势4:能效与散热,从技术挑战到商业瓶颈​

随着AI芯片功耗突破千瓦级(英伟达Rubin GPU达2300W),能效和散热从"配套技术"升级为"核心瓶颈"。

2026年,单机柜功率密度将突破240kW,传统风冷方案彻底失效,液冷技术从"可选项"变为"必选项"。

关键数据​

  • 电力成本占比:AI数据中心电力成本占运营成本比例从15%升至35%
  • 散热价值提升:单台GB300服务器液冷组件价值约5万美元,占硬件成本15-20%
  • PUE指标优化:液冷数据中心PUE可降至1.1以下,但前期投资增加30%

技术演进方向​

  1. 液冷方案分层:冷板式(主流)、浸没式(高密度)、两相冷却(前沿)

  2. 电源架构升级:从12V转向48V/800V高压直流,减少转换损耗

  3. 热管理智能化:AI预测性散热,根据负载动态调整冷却策略

该趋势意味着,硬件厂商的竞争力不仅取决于芯片性能,更取决于"系统级能效优化能力",散热、供电、机柜设计等配套技术的重要性大幅提升。


趋势5:AI原生硬件生态,从"兼容"到"重构"​

2026年,AI硬件正经历从"适配AI"到"为AI而生"的范式转变。

传统通用硬件架构难以满足AI工作负载的独特需求,催生AI原生硬件设计理念的兴起。

三大重构方向​

1. 计算架构重构​
  • 内存层次优化:HBM4内存带宽突破3TB/s,存算一体架构减少数据搬运
  • 互联技术升级:NVLink 6.0带宽达1.8TB/s,支持GPU间直接通信
  • 异构集成:通过先进封装将CPU、GPU、内存堆叠,提升带宽降低延迟
2. 软件定义硬件​
  • 可重构逻辑:FPGA、DPU支持算法动态加载,适应不同AI模型
  • 编译器优化:AI编译器(如MLIR)自动优化硬件资源分配
  • 硬件抽象层:统一编程接口屏蔽底层硬件差异
3. 生态协同演进​
  • 模型-硬件协同设计:大模型架构考虑硬件约束(如稀疏化、量化)
  • 开源硬件设计:RISC-V在AI芯片的应用,降低开发门槛
  • 垂直整合:云厂商自研芯片(如AWS Graviton、谷歌TPU),软硬一体优化

该趋势的本质是:AI工作负载的特征(矩阵运算、高并行、内存敏感)正在重新定义硬件设计原则,传统x86架构的通用性优势在AI场景下被削弱。


关键结论与展望​

1. 五大趋势相互关联、彼此强化​

推理需求爆发推动边缘部署,边缘场景催生专用芯片,高功耗倒逼能效革命,而所有变化最终指向AI原生硬件生态的重构。

这一轮变革的核心驱动力是AI从"技术演示"走向"商业落地",硬件必须满足"规模化、低成本、高可靠"的产业要求。

2. 产业链参与者的机会窗口​

对于产业链参与者而言,2026年的机会在于:

  • ✅ 抓住推理红利:布局推理专用芯片与系统优化
  • ✅ 深耕垂直场景:针对特定行业/应用定制硬件方案
  • ✅ 突破能效瓶颈:液冷、高压直流、AI热管理等技术
  • ✅ 构建开放生态:开源框架、开放标准、跨界合作

那些能够提供"端到端解决方案"而非"单点芯片"的厂商,将在这一轮洗牌中占据优势地位。

3. 动态调整与持续演进​

以上分析基于2026年初市场数据和行业预测,实际发展可能因技术突破、政策调整、市场需求变化等因素而动态调整。


产业启示​

2026年是AI硬件产业的分水岭之年:

  • 从"算力竞赛"到"落地为王"
  • 从"单点突破"到"系统优化"
  • 从"通用架构"到"专用定制"
  • 从"性能优先"到"能效兼顾"

那些能够敏锐捕捉趋势、快速调整战略、持续技术创新的厂商,将在AI硬件的"落地纪元"中赢得先机。


参考文献:

  • 中智盟咨询(CSHIA Research)《2026年AI硬件五大变革与生存法则》
  • 科技迷你小小生,《AI硬件进入"落地纪元"》,搜狐科技,2026年2月10日

Computex 2026 会后观察:AI PC 芯片大战开启,NVIDIA RTX Spark 六月上市

· 阅读需 3 分钟
Industry Research Team

2026年6月6日 —— COMPUTEX 2026 昨日在台北圆满闭幕。本届展会以"AI Together"为主题,创下 1500+ 参展商、6000 展位的历史纪录。NVIDIA、Intel、AMD 三巨头在 AI PC 领域的正面交锋成为本届最大看点。

1. NVIDIA RTX Spark:六月正式上市,$1,399 起​

NVIDIA 与联发科合作的 RTX Spark 超级芯片在 COMPUTEX 发布后不到一周即确认上市时间表:

关键信息详情
首发 OEM华硕、戴尔、惠普、联想、微软 Surface、微星
上市时间2026 年秋季
起步价尚未公布(外界推测 $3,000-4,000)
核心配置Arm CPU(最多 20 核)+ Blackwell GPU(6144 CUDA)
统一内存128GB LPDDR5X(300 GB/s)
模型容量可运行 1,200 亿参数 模型,最长 100 万 token 上下文

市场反应:AMD/Intel/Qualcomm 股价受压,分析认为 RTX Spark 将从三个方向重塑市场——Windows AI PC、Creator 工作站、边缘推理节点。


2. Intel 18A 全面投产:Clearwater Forest + Crescent Island​

Intel CEO 陈立武首次在 COMPUTEX 发表主题演讲,带来两项关键更新:

Clearwater Forest(至强 6+)​

  • 288 核 Darkmont 架构
  • 首款 Intel 18A 工艺数据中心 CPU
  • Foveros Direct 3D 封装
  • 已全面投产

Crescent Island AI GPU​

  • 480GB LPDDR5x 显存
  • 350W 风冷 PCIe 形态
  • 原生 FP4 支持,专攻智能体推理
  • 2026 H2 出货

陈立武表示:"当 AI 迈向智能体时代,CPU 正重返现代 AI 基础设施的中心。"


3. AMD Ryzen AI 400 系列出货中​

AMD 在 COMPUTEX 上展示了 Ryzen AI 400 系列(Zen 5 + Zen 5C 混合架构 + XDNA2 NPU):

  • NPU 算力 60 TOPS,x86 最高
  • 7 款消费级型号 + 商用 PRO 系列
  • 多家 OEM 已上市或即将发布
  • 7 月将举办 Advancing AI 2026 峰会(旧金山)

4. 国产芯片持续发力​

厂商产品状态
华为昇腾 950PR/950DT已量产,自研 HBM 突破
寒武纪MLU6902 PFLOPS FP8,开始出货
摩尔线程MTT S50001000 TFLOPS 参数公开

5. AI PC 元年:三家巨头路线图对比​

维度NVIDIA RTX SparkIntel Clearwater Forest + Crescent IslandAMD Ryzen AI 400
CPU 核心20 核 Grace (Arm)288 核 Darkmont (x86)最高 12 核 Zen5+5C
GPU/NPUBlackwell GPUCrescent Island (独立 GPU)XDNA2 NPU (60 TOPS)
AI 算力1 PFLOPSTBD60 TOPS NPU
目标个人 AI Agent数据中心+AI PC 双线Copilot+ PC
工艺TSMC 4NPIntel 18ATSMC 4nm
上市2026-062026 H2已上市

本周算力圈速览(6/1-6/6)​

日期事件
6/1NVIDIA GTC Taipei:RTX Spark、Vera Rubin 量产、DGX Station for Windows
6/1Intel 发布 Crescent Island、Clearwater Forest
6/2COMPUTEX 正式开幕,"AI Together"主题
6/5COMPUTEX 闭幕,1500+ 展商创纪录
6/6RTX Spark 确认六月上市 $1,399 起

数据来源:COMPUTEX Daily、腾讯新闻、凤凰科技、雪球、The Silicon Review。

Computex 2026 AI 算力卡大事件:DGX Station for Windows、Intel Crescent Island 等重磅发布

· 阅读需 4 分钟
Industry Research Team

2026 年 6 月 1-5 日,中国台北 —— Computex 2026(台北国际电脑展)本周圆满收官。本届展会以 "AI Together" 为主题,NVIDIA、Intel、AMD、Qualcomm 等巨头密集发布了多款 AI 算力新品,以下是 MirrorFrog 为你梳理的算力卡圈本周最值得关注的动态。

① NVIDIA DGX Station for Windows:桌面的 AI 超算​

NVIDIA 在 Computex 2026 主题演讲中正式发布了 DGX Station for Windows,号称"全球最强大的桌面 AI 超级计算机"。

核心规格​

项目参数
芯片GB300 Grace Blackwell Ultra Desktop Superchip
GPU 内存252 GB HBM3e(7.1 TB/s)
CPU 内存496 GB LPDDR5X(396 GB/s)
统一内存748 GB(NVLink-C2C 互联)
FP4 算力20 PFLOPS(稀疏)
FP8 算力10 PFLOPS(稀疏)
网络ConnectX-8 SuperNIC,最高 800 Gb/s
模型容量可运行 1 万亿参数 模型
系统功耗1,600 W
操作系统Microsoft Windows
出货时间2026 Q4

意义:DGX Station 将以前需要数据中心级集群的 AI 算力(20 PFLOPS FP4)压缩到一台桌面工作站中。748GB 统一内存意味着开发者可以在本地运行千亿甚至万亿参数的大模型,无需依赖云端。


② Intel Crescent Island:推理专用 AI GPU​

Intel 在 Computex 上详细披露了其面向数据中心 AI 推理的新一代 GPU Crescent Island。

项目参数
内存最高 480 GB LPDDR5x
功耗350 W(PCIe 形态)
精度支持FP4/MXFP4 → FP64(全精度覆盖)
目标AI 推理工作负载(Agentic Inference)
定位性价比高于 HBM 方案
出货2026 下半年

意义:Crescent Island 是 Intel 在 AI 推理市场的重要布局。480GB 超大 LPDDR5x 内存(非 HBM)意味着成本远低于 NVIDIA H200/B200 等同级竞品,瞄准企业级推理部署场景。


③ Intel Xeon 6+(Clearwater Forest):首款 Intel 18A 数据中心 CPU​

Intel 还发布了代号 Clearwater Forest 的全新 至强 6+ 处理器,这是 Intel 首款采用 18A 工艺 的数据中心 CPU:

  • 288 个 Darkmont 架构核心
  • L2 288MB + L3 576MB 缓存
  • 12 通道 DDR5-8000 内存
  • Foveros Direct 3D 先进封装
  • AI Agent 时代 CPU 重返基础设施中心

④ NVIDIA RTX Spark 生态落地​

本周 NVIDIA 与 联发科 合作的 RTX Spark 超级芯片持续发酵。多家 OEM 亮相了基于 RTX Spark 的笔记本和紧凑型桌面原型机:

  • 华硕、戴尔、惠普、联想、微软 Surface、微星 均确认首发
  • 配备 20 核 Grace CPU + Blackwell GPU(6144 CUDA 核心)
  • AI 算力 1 PFLOPS
  • 2026 年秋季 零售上市

⑤ Intel × 鸿海(Foxconn)AI 基础设施合作​

Intel 与鸿海宣布联合布局 AI 基础设施,覆盖从 芯片 → 服务器 → 机架级系统 的完整链条,瞄准 AI 推理需求激增带来的数据中心市场机遇。


⑥ 国产 AI 芯片动态​

据 IDC 2025 年度报告,中国 AI 加速卡市场总出货量达 约 400 万张,本土厂商合计出货约 165 万张,市占率突破 41%。华为昇腾 950 系列已进入量产交付阶段,寒武纪 MLU690 开始向互联网客户出货。


本周算力圈速览​

厂商产品亮点时间
NVIDIADGX Station for Windows20 PFLOPS, 748GB 统一内存Q4 2026
NVIDIARTX Spark1 PFLOPS AI PC 芯片2026 秋
IntelCrescent Island GPU480GB LPDDR5x, 350W2026 H2
IntelXeon 6+ (Clearwater Forest)288 核, Intel 18A2026 H2
Intel + 鸿海AI 基础设施合作芯片→机柜 全链路战略合作
华为昇腾 950PR/DT1 PFLOPS FP8, 自研 HBM已量产
寒武纪MLU6902 PFLOPS FP8, 192GB HBM3E出货中

数据来源:NVIDIA GTC Taipei 2026 / Computex 2026 官方发布、Intel 新闻稿、凤凰科技、IT之家。

华为昇腾 950 量产与中国 AI 芯片生态全貌

· 阅读需 4 分钟
Industry Research Team

2026 年 6 月 — 华为昇腾 950 系列(950PR / 950DT)已进入正式量产交付阶段,这是中国 AI 芯片产业在 2026 年的标志性事件。与此同时,寒武纪 MLU690 开始出货、摩尔线程 MTT S5000 参数公布,中国 AI 芯片三极格局正式形成。

昇腾 950 系列:自研 HBM 的历史性突破​

华为海思 Ascend 950 系列 是第四代昇腾 AI 芯片,2025 年 9 月华为全联接大会首次披露,2026 Q1 正式量产。

950PR(Prefill 推理专用)​

项目参数
架构Da Vinci v5(SIMD + SIMT 双模型)
制程N+2(SMIC 国产化)
HBMHiBL 1.0(华为自研),128 GB
FP8 算力1 PFLOPS(HiF8 格式)
TDP~400 W
目标推理 Prefill(视频推荐、实时交互)

950DT(Decode + 训练专用)​

项目参数
架构Da Vinci v5(SIMD + SIMT 双模型)
制程N+2(SMIC 国产化)
HBMHiZQ 2.0(华为自研),144 GB,4 TB/s
FP8 算力1 PFLOPS(HiF8 格式)
TDP~500 W
目标推理 Decode + 模型训练

历史意义​

自研 HBM(HiBL 1.0 / HiZQ 2.0)是华为昇腾 950 最重要的技术突破——这是中国企业首次实现 HBM 内存的自研量产,彻底摆脱了对 SK Hynix / Samsung HBM 供应的依赖。配合 N+2 国产化工艺,昇腾 950 实现了从 HBM → 计算 Die → 封装 → 系统 的全链条国产化。

寒武纪 MLU690:国产唯一 FP8 支持​

寒武纪第七代 AI 芯片 MLU 690(思元 690) 于 2026 H1 开始量产出货。这是 国产 AI 芯片中首款原生支持 FP8 精度 的产品。

项目MLU 690
制程5nm(TSMC / SMIC)
FP8 dense2 PFLOPS
HBM192GB HBM3E,5 TB/s
TDP~500 W
单价(OAM)~$8,000-12,000

MLU 690 的 FP8 算力(2 PFLOPS dense)在纸面上已经与 NVIDIA Blackwell(B200 FP8 4.5 PFLOPS sparse)相当。寒武纪凭借 科创板上市公司 的融资优势,在 2026 年营收目标达到 ¥15-20B(2025 年 ¥7.2B)。

摩尔线程 MTT S5000:从图形到训推一体​

摩尔线程在 2026 年 2 月公开了 MTT S5000 的详细参数,采用第四代 MUSA "平湖" 架构,单卡 AI 算力 1,000 TFLOPS,80GB GDDR6X 显存,1.6 TB/s 带宽。

摩尔线程走的是全功能 GPU 路线(图形渲染 + AI 计算 + 通用计算),与 NVIDIA 策略最为接近。创始团队来自原 NVIDIA 中国,MUSIFY 工具链可帮助 CUDA 代码自动迁移到 MUSA 平台,降低生态迁移成本。

中国 AI 芯片三极格局​

维度华为昇腾寒武纪摩尔线程
核心架构Da Vinci v5MLUv07MUSA 4th Gen
制程N+2 国产化5nm6nm
FP8 算力~1 PFLOPS2 PFLOPS0.5 PFLOPS(推测)
HBM 自主✅ 自研 HiBL/HiZQ❌ 外购❌ 外购
生态系统CANN + MindSporeNeuWare + MindSporeMUSA + MUSIFY
优势全链条国产化最高 FP8 算力全功能 + CUDA 迁移
2025 营收(华为内部)¥7.2B¥2.2B

全球市场对比(2026 年 Q2 更新)​

梯队厂商旗舰芯片FP8/PFLOPSHBM量产时间
第一梯队NVIDIARubin R20025 PF(稀疏)288GB HBM42026 H2
第二梯队AMDMI40020 PF(密集)432GB HBM42026
华为昇腾 950DT1 PF(密集)144GB 自研 HBM2026 Q1
寒武纪MLU6902 PF(密集)192GB HBM3E2026 H1
AWSTrainium 35.7 PF(密集)144GB HBM2025 Q4 GA
第三梯队IntelGaudi 31.8 PF128GB HBM2e量产
GoogleTPU v74.6 PF(TFLOPS)192GB HBM2025
摩尔线程MTT S50001 PF80GB GDDR6X2025 Q1

注:NVIDIA 使用 sparse(稀疏) 算力为标准,AMD/华为/寒武纪使用 dense(密集),不可直接比较。

展望 2026 H2​

  • NVIDIA Rubin R200:2026 H2 正式出货,288GB HBM4,6 芯片 CoWoS-L 封装
  • 华为昇腾 960:路线图 2027 H2,预计 FP8 算力翻倍至 2 PFLOPS
  • 寒武纪 MLU790:预计 2027,3nm,384GB HBM4,2.5 PFLOPS
  • 摩尔线程:下一代 GPU 预计搭配 HBM3,算力 2× MTT S5000

中国 AI 芯片产业在 2026 年已经形成从 训练(寒武纪 MLU690 / 昇腾 950DT)→ 推理(昇腾 950PR / 摩尔线程 S5000)→ 系统(CloudMatrix / 分布式集群) 的完整产品矩阵。


本文基于华为全联接大会 2025(2025-09-18)公开信息、2026 年 4 月行业分析报告及 2026 年 6 月最新市场数据整理。

2026 H2 顶级 AI 芯片选型指南:从 H100 到 Rubin、MI400、TPU 8t、TPU 8i

· 阅读需 8 分钟
Industry Research Team

2026 H2 是 AI 算力市场最丰富的时代:NVIDIA Rubin R200、AMD MI400、Trainium 3、TPU 8t/8i、Ascend 920、Groq 3 LPX 全部就位。本文提供完整选型树,帮助你根据模型规模、训练/推理、延迟要求、预算、地区选择最合适的产品。

2026全球AI算力报告及算力产业十大趋势重磅发布

· 阅读需 9 分钟
Industry Research Team

2026年5月29日,在天津举办的2026世界智能产业博览会期间,由中国智能计算产业联盟、国家超级计算天津中心、天津市人工智能学会、深圳市人工智能行业协会、至顶科技、至顶智库联合发布了《2026全球AI算力发展研究报告》。

该报告深入分析了全球AI算力产业的发展现状与未来趋势,揭示了算力产业进入"智算驱动、体系重构"的全新发展阶段。

核心观点​

1. 算力成为国家战略要素​

全球算力产业正迈入"智算驱动、体系重构"的全新发展阶段。伴随"词元经济"的兴起,算力已成为支撑国家技术突破、产业竞争与战略布局的关键基础要素。

算力正从传统信息技术支撑演变为驱动科技创新与工业革命的战略性底座。

2. AI算力发展覆盖全链路​

AI算力发展需覆盖芯片、整机、计算集群全链路升级,同时需匹配模型训练、推理、数据准备各环节的差异化算力需求。

  • 训练端:超大规模模型预训练需要万卡级算力支撑
  • 推理端:超大规模模型需要千卡算力
  • 数据准备:需要数十到数百卡算力规模

训练与推理两端的算力需求仍将持续增长。

3. 国内AI芯片产业特色路径​

国内AI芯片产业走"自主可控+集群突破+软硬整合+性价比优势"路线,区别于国外追求单芯片绝对算力的路径,更符合大规模算力部署需求。

4. 算力中心能耗挑战与解决方案​

算力中心已成为全球电力需求增长最快的领域。未来需构建"短期风光储一体化、中期核能、长期氢能"的多元能源供给体系。

同时,太空算力将成为解决地面算力瓶颈的新方向。

5. 算网融合成为核心方向​

未来算力将向"算网融合"方向发展,实现算力像水电一样随取随用,成为国家现代化基础设施体系的核心组成部分。

算力网已纳入国家"十五五"规划重大工程项目,与水电等公共基础设施并列成为现代化基础设施体系核心。

关键数据​

算力性能演进​

指标演进趋势
芯片算力从TFLOPS量级提升至数十PFLOPS
整机部署形态从单机八卡演进为千卡级超节点架构
计算集群规模从千卡集群拓展至数十万卡集群
集群功耗从千瓦级提升到吉瓦级

全球算力中心容量及能耗预测​

  • 全球算力中心总容量:预计2030年从2026年的102GW增长至220GW

    • 其中AI负载容量从62GW提升至156GW,占比提升至71%
  • 美国算力中心年耗电量:预计从292TWh增长至606TWh,占全美电力需求比重提升至11%

  • 中国算力中心总容量:2030年预计接近60GW,AI负载占比提升至48%

  • 全球算力中心电力消耗:根据IEA基准情景预测,2030年将从2024年的约415TWh增长到约945TWh,年均增速约15%

具身智能算力支撑数据​

  • 云端算力:可实现日均生成PB级交互数据,大模型训练周期从月级缩短至周级
  • 端侧算力:数十至数百TOPS算力可完成10-50ms低时延实时感知决策

产业趋势分析​

算力技术架构趋势​

1. 异构计算架构升级​

从传统CPU+GPU架构,向GPU+LPU+CPU+DPU新型异构推理架构演进。

CPU在异构架构中承担任务调度、数据预处理、串行任务处理、系统互联的核心作用。2010年"天河一号A"率先实现CPU+GPU架构规模化落地,引领全球智算底层架构方向。

2. 算力扩展路径清晰​

  • Scale Up(纵向扩展):通过提升单节点硬件配置追求极致性能
  • Scale Out(横向扩展):通过增加节点实现负载分担与高可用性

两者共同构成算力系统能力的核心支撑。

3. 超节点服务器成为主流​

具备超高互联带宽、低通信时延优势,可缩短模型训练周期。

代表产品:

  • 华为昇腾384超节点
  • 中科曙光scaleX640超节点
  • 阿里云磐久AL128超节点
  • 浪潮元脑SD200
  • 昆仑芯超节点方案

4. 长上下文处理技术优化​

通过**压缩稀疏注意力(CSA)、重压缩注意力(HCA)**与滑动窗口机制协同,构建"粗粒度+细粒度、稀疏+稠密"的长上下文建模体系,提升算力使用效率。

代表应用:DeepSeek-V4的注意力架构设计。

AI算力关键领域发展趋势​

AI芯片领域​

国际厂商:

  • NVIDIA:

    • 凭借Blackwell与Rubin架构领跑高端训练和推理市场
    • GTC 2026台北(6月1日)重磅发布:
      • Vera Rubin平台全面量产:NVL72机架系统,智能体吞吐量比Grace Blackwell提升10倍
      • Vera CPU正式发布:88核Olympus自研Armv9.2架构,LPDDR5X 1.5TB,1.2 TB/s,全球首款原生支持FP8的CPU
      • RTX Spark AI PC芯片:与联发科、微软联合研发(代号N1X),Blackwell GPU 1 PFLOP,128GB统一内存,台积电3nm
      • Nemotron 3 Ultra开源模型:SSM+MoE混合架构,推理速度提升5倍,成本降低30%
    • 依托CUDA生态持续扩大竞争优势
  • Google:依托自研TPU深化软硬件垂直整合

  • Google:依托自研TPU深化软硬件垂直整合

  • AWS:通过Trainium训练芯片与Inferentia推理芯片协同,提供高性价比云端算力方案

国内厂商: 形成以华为昇腾910C、昆仑芯P800、摩尔线程MTT S5000、沐曦曦云C600为代表的产品矩阵。

2026年华为发布"韬(τ)定律",以系统性降低时间常数为目标,通过逻辑折叠等技术提升晶体管密度,推动国产芯片技术演进。

AI工作站领域​

  • 形态覆盖:分为塔式、移动、迷你三类,适配不同部署场景
  • 算力等级覆盖:分为入门级、专业级、企业级三类,可覆盖从个人开发到企业级部署的全场景AI算力需求

AI服务器领域​

  • 按功能可分为训练AI服务器和推理AI服务器
  • 按部署方式可分为云端AI服务器和边缘AI服务器

具备高算力输出、高内存带宽、高速互联等能力,适配大规模并行计算任务。

AI算力中心领域​

  • 呈现"高AI占比、高功率密度、高电力消耗"的发展趋势
  • 超大规模AI算力中心成为建设重点
  • 能源供给向多元清洁化方向发展

太空算力成为新方向,可依托太空持续光照、极寒真空、无大气干扰的环境优势,解决地面算力中心的能源、散热、互联瓶颈。

目前Starcloud公司、国星宇航已开展初步探索。

算力应用场景趋势​

1. 科研范式变革​

"干湿闭环"研究范式成为主流,将AI驱动的"干实验"与自动化实验验证的"湿实验"通过数据反馈形成闭环,推动科学研究从经验驱动转向模型驱动。

2. 合成生物学赋能​

AI的多任务学习与未知空间探索能力,可破解生物系统"序列—结构—功能"的复杂映射,在蛋白质合成、基因编辑与核酸疫苗领域实现应用突破。

如AlphaFold系列模型实现蛋白质结构预测革命性突破。

3. 具身智能支撑​

云端与终端算力高效协同,为具身智能提供全栈算力支撑,覆盖海量数据处理、高保真仿真、模型训练、端侧实时感知决策全链路闭环。

算力基础设施发展趋势​

算网融合成为核心方向,从"先互联再成网"向全国一体化算力网演进。

三大电信运营商已开展自有算力与全国分散社会算力的互联工作,推动算力普惠化供给。

产业生态趋势​

国产算力生态持续完善,政企学研协同加深。中国智能计算产业联盟、国家超级计算天津中心、各地人工智能学会、行业协会、产业服务机构共同搭建交流平台,推动算力技术研发、标准制定、成果转化与人才培养,助力国产算力产业高质量发展。

结论与展望​

  1. 算力成为国家战略竞争力核心要素,全球主要国家纷纷加大算力基础设施投入,抢占AI时代战略制高点。

  2. 国内AI芯片产业走特色化发展路径,通过集群突破、软硬整合、性价比优势,在大规模算力部署场景中形成竞争优势。

  3. 算力技术架构持续演进,异构计算、超节点服务器、长上下文处理技术成为重要发展方向。

  4. 算力应用场景不断拓展,从科研范式变革到合成生物学、具身智能,AI算力深度赋能前沿领域。

  5. 算力基础设施向算网融合方向演进,未来算力将像水电一样成为普惠化、随取随用的公共基础设施。


参考文献:

  • 《2026全球AI算力发展研究报告》(中国智能计算产业联盟等机构发布)
  • 2026世界智能产业博览会(天津,2026年5月29日)

NVIDIA 发布 RTX Spark:AI 算力进入个人电脑时代

· 阅读需 3 分钟
Industry Research Team

2026 年 6 月 1 日,中国台北 —— 在 Computex 2026 开幕主题演讲中,NVIDIA CEO 黄仁勋正式发布了 RTX Spark 超级芯片,标志着 NVIDIA 正式进入由 Intel、AMD、Qualcomm 和 Apple 主导的个人电脑处理器市场。

RTX Spark:个人 AI 计算机的"心脏"​

RTX Spark 由 NVIDIA 与 联发科(MediaTek) 合作开发,采用 20 核 Grace CPU + Blackwell RTX GPU 的异构封装,配备 6144 个 CUDA 核心。AI 算力达到 1 PFLOPS(千万亿次浮点运算),这意味着个人电脑首次拥有与数据中心级 H100 GPU 相当的计算能力。

参数RTX Spark
CPU20 核 Grace(联发科合作,Arm 架构)
GPUBlackwell RTX(6144 CUDA 核心)
AI 算力1 PFLOPS
目标个人 AI Agent,本地 LLM 推理
首发 OEM华硕、戴尔、惠普、联想、微软 Surface、微星
上市时间2026 年秋季
形式笔记本 SoC + 紧凑型桌面主机

黄仁勋的"全栈 AI"战略​

RTX Spark 的发布是 NVIDIA "全栈 AI" 战略的关键一步。黄仁勋在演讲中表示:"AI 不应该只在云端运行。每个人的电脑都应该拥有运行 AI 代理的能力。"

RTX Spark 让 NVIDIA 从数据中心 GPU 垄断者转变为个人计算市场的全面竞争者。消息发布后,AMD、Intel 和 Qualcomm 的股价应声下跌。

对市场的影响​

  • Intel:个人电脑 AI 处理器业务面临直接威胁
  • AMD:Ryzen AI 系列需要应对同级别竞争
  • Qualcomm:Snapdragon X Elite 的 Copilot+ PC 定位被挑战
  • Apple:M 系列芯片不再是唯一的高性能 AI PC 选项

Vera Rubin 平台进入大规模量产​

在同一场演讲中,黄仁勋还宣布 NVIDIA Vera Rubin 平台已进入全面量产阶段。Rubin R200 采用 6 芯片 CoWoS-L 封装(1× Vera CPU + 2× Rubin GPU die + I/O/HBM die),配备 288GB HBM4、22 TB/s 带宽、50 PFLOPS FP4 算力(稀疏)。

Rubin NVL72 机柜(72 颗 Rubin GPU + 36 颗 Vera CPU)将于 2026 H2 开始出货。

CompuTex 2026 其他看点​

  • AMD:展示了 MI350 系列(192GB HBM3e,5 PFLOPS FP8 dense),6 月正式上市
  • Intel:Jaguar Shores 首次公开
  • Qualcomm:AI 200 / 300 系列推理卡路线图更新
  • 国产 AI 芯片展区:华为、寒武纪、摩尔线程等展示最新产品

行业意义​

RTX Spark 的发布意味着 AI 算力不再局限于数据中心。个人开发者、设计师、研究人员将能在本地运行以往需要云端 GPU 的大模型任务,这可能会重新定义个人 AI 计算的市场格局。

Vera Rubin 的量产则进一步巩固了 NVIDIA 在数据中心 AI 训练领域的绝对领先地位。两条产品线共同构成 NVIDIA "云端训练 + 个人推理" 的全栈 AI 计算版图。


本报道基于 2026 年 6 月 1 日 Computex 2026 / GTC Taipei 的 NVIDIA 官方发布信息。

AI 芯片创业公司生存报告:Tenstorrent / SambaNova / Graphcore 的 2026

· 阅读需 9 分钟
Industry Research Team

2026 年 AI 芯片市场进入「赢家通吃」阶段。NVIDIA 占据 90%+ 份额,AMD 10% 挣扎,Google/AWS/Huawei/Cerebras 各占细分市场。但还有一批 AI 芯片创业公司在夹缝中求生——本文分析 Tenstorrent、SambaNova、Graphcore、Cambricon、Moore Threads、Biren、Iluvatar 的 2026 现状与未来。