跳到主要内容

7 篇博文 含有标签「AI Compute」

AI compute supply, demand and industry trends

查看所有标签

Groq 3 LPX 全面量产:三星 4nm 代工、单机架 315 PFLOPS FP8,英伟达把 LPU 变成 Vera Rubin 的第七颗芯片

· 阅读需 5 分钟
Industry Research Team

本文基于 NVIDIA 官方产品页、2026 年 3 月 GTC 架构博客及第三方基准数据整理;性能口径为厂商架构对比,实际收益需以自测为准。

英伟达确认,Groq 3 LPX——Vera Rubin 平台的「第七颗芯片」——已进入全面量产,由三星平泽园区代工。这是继 2025 年 12 月英伟达斥资约 200 亿美元获得 Groq 非独占 IP 授权与核心工程团队之后,这笔交易第一次以量产硅的形式落地。

对推理硬件格局而言,这是一次范式级事件:英伟达第一次把「别家定义的专用推理架构」纳入自家旗舰平台,且不是外挂销售,而是深度协同设计。

一、Groq 3 LPU 芯片与 LPX 机架:规格速览​

单颗 Groq 3 LPU(4nm,三星代工):

项目数值
编译器管理的片上 SRAM500 MB
SRAM 带宽150 TB/s
片间 scale-up 带宽2.5 TB/s(96 条 chip-to-chip 链路,每条 112 Gbps)

单个 LPX 机架(32 个 1U 液冷托盘,每托盘 8 颗 LPU):

项目数值
LPU 总数256 颗
FP8 算力315 PFLOPS
片上 SRAM 总量128 GB
SRAM 聚合带宽40 PB/s
机架内 scale-up 带宽640 TB/s
DDR5 内存12 TB(承载大模型权重)

每颗 LPU 500MB 的 SRAM 看起来不大,但乘上 256 颗、再叠加 40PB/s 的聚合带宽,构成了「确定性低延迟解码」的物理基础——LPU 的设计哲学正是用编译器静态调度片上 SRAM,彻底消除推理解码阶段的内存取数停顿,而这恰恰是 GPU 推理最典型的瓶颈。

二、AFD:注意力与 FFN 分家,GPU 和 LPU 各干各的​

LPX 不是替代 GPU,而是与 Vera Rubin NVL72 组成异构系统,核心是 AFD(Attention-FFN Disaggregation,注意力-前馈解耦):

  1. Rubin GPU 负责 prefill 与 attention——在大上下文上构建 KV cache、执行注意力层,吃 HBM 容量与高吞吐;
  2. Groq 3 LPU 负责 FFN / MoE 专家层解码——延迟敏感、模式可预测,恰好是 SRAM 确定性调度的主场;
  3. 中间激活在两个引擎间逐 token 交换,由 NVIDIA Dynamo 编排路由,GPU 算每一层注意力,LPU 算每一层前馈,协同完成每个输出 token。

这套分工的逻辑很清晰:智能体应用消耗的 token 量可达传统 AI 应用的 15 倍,瓶颈从「能不能算完」变成「能不能以稳定低延迟持续吐 token」。让 HBM 大容器去跑 attention、让 SRAM 确定性引擎去跑 decode,各取所长。

三、实测与官方口径​

  • 第三方实测(Artificial Analysis):Gemma 4 31B、100K token 上下文下,LPX 输出约 3400 tokens/s——单 token 间隔低于 1 毫秒,长上下文智能体场景的交互感质变
  • 官方架构对比:与 LPX 组合后,Vera Rubin NVL72 对万亿参数模型的每兆瓦吞吐最高提升 35 倍;「高价值 token」场景下每瓦收入机会最高 10 倍
  • 首发客户:Nebius 率先部署 LPX 机架扩展其 token 产能;CoreWeave 已在生产环境用 Spectrum-X Multiplane 连接 Vera Rubin 机架

需要强调:35 倍/10 倍是特定高交互工作点的架构对比数字,不是普适结论。训练、大吞吐批量推理、需要 CUDA 生态灵活性的负载,GPU 仍是正解;LPX 的主场是「单用户交互延迟即产品」的场景——智能体循环、实时编码助手、长上下文对话。

四、三个行业信号​

1. 专用推理芯片被收编,而非对抗。 过去 LPU 是「GPU 挑战者」的叙事,现在变成了 Vera Rubin 的组成部分。推理硬件的终局可能不是一种架构赢,而是「GPU + 专用解码引擎」的异构组合成为标配。对其他推理芯片创业公司(Cerebras、Etched 等),这既是天花板抬高的证明,也是「要么被集成、要么找差异化」的警示。

2. 三星代工拿到高端 AI 订单。 在台积电几乎垄断 AI 主芯片的背景下,三星 4nm 承接 LPX 量产意义重大——叠加此前特斯拉 AI6 的 2nm 订单,三星代工有望在 2027 年重回全年盈利。

3. 推理经济性进入「按 MW 定价」时代。 当厂商开始用 tokens/MW 和每瓦收入讲故事,算力选型的核心 KPI 已经从峰值算力(TFLOPS)彻底转向单位能耗的 token 产出。这与我们在 TCO 计算器 里内置的功耗-电费模型逻辑一致:峰值参数好看的芯片,未必是每 token 成本最低的芯片。

小结​

Groq 3 LPX 量产标志着推理硬件进入「GPU 管吞吐、LPU 管延迟」的异构时代。对于正在选型推理集群的团队,建议把工作负载拆开评估:批量离线推理留在 GPU,交互式长上下文智能体值得单独测算 LPX 类方案的单位成本。拿不准的话,先用 TCO 计算器 跑一遍两种架构的 3 年持有成本再拍板。

(本文性能数据来自 NVIDIA 官方架构对比与 Artificial Analysis 第三方实测,实际部署请以自测为准。)

GPU 租金又涨了:Nebius 10 月起 H100/B200 随需租金上调约 20%,自建 vs 租用的天平在移动

· 阅读需 5 分钟
Industry Research Team

据芯智讯 9 月下旬报道,Nebius 宣布10 月 1 日起 H100 / H200 / B200 随需(on-demand)租金平均上调约 20%。同月,财联社报道 CoreWeave 截至 8 月 11 日已签约电力增至 4.2 GW,并将"继续以更高价格签约新算力"。这是本轮 AI 周期里租赁市场连续第 N 次提价——对采购方来说,自建与租用的 TCO 天平正在移动。本文用站内 TCO 计算器的口径拆解这笔账。


1. 涨价的三个推手​

  • agentic 推理需求爆发:从 MLPerf v6.1 到 SemiAnalysis AgentX,agentic 负载成为推理增长主引擎——token 消耗量级远超聊天场景,推理算力从"够用"变成"永远不够";
  • 新一代平台的供给溢价:Vera Rubin NVL72 已在 CoreWeave 首发上线,新平台早期产能爬坡期定价天然偏高,同时抬高上一代卡(H100/H200/B200)的续租价格锚点;
  • 电力成为硬约束:CoreWeave 4.2GW 签约电力的表述说明——数据中心供给瓶颈已从 GPU 转向电力与机架,电力在手的企业没有理由降价。

2. 租金上涨 20% 对 TCO 意味着什么​

站内 TCO 计算器把总拥有成本拆成采购 + 能耗 + 运维 + 网络 + 折现五段。租金上涨不直接进入这个模型,但它改变了"租用基准线"——即自建方案要击败的机会成本:

场景租金涨 20% 前涨 20% 后
短期弹性负载(不足 1 年)租用占优租用仍占优(自建部署周期追不上)
稳定推理负载(2-3 年)临界区自建开始占优(机会成本抬高)
训练集群(3 年+)自建占优自建优势扩大

直觉化判断:

  • 24/7 满载跑 2 年以上的负载,租金上调 20% 通常足以让自建(哪怕按 1.5 倍采购溢价、含 PUE 1.3 能耗模型)在 30 个月内反超;
  • 潮汐型负载(白天高峰、夜间空闲)仍应租用——自建方案按 15% 空闲功耗持续付费的假设下,利用率低于约 50% 时自建几乎不可能回本;
  • 混合策略(自建基线 + 租用峰值)对租金上涨的敏感度最低,是当前利率与电价环境下的稳健解。

上述结论可在 TCO 计算器中自行复算:把"云租用单价"按 +20% 输入,对比采购价、电价与 PUE 两个情景。折现率默认 8%,采购成本不折现、逐年电费按 1.08^-y 折现。

3. 国产算力的定价含义​

租金上涨对国产 AI 芯片的采购决策有一层容易被忽略的影响:

  • 国产卡的租用市场尚未成熟:昇腾 / 寒武纪 / 摩尔线程的算力主要以一体机、整机柜和智算中心配额形式交付,公开随需租价稀缺——采购对比天然偏向"自建/整机"模型;
  • 相对 TCO 变化:NVIDIA 租金上涨 20% 等于抬高了所有国产替代方案的"相对吸引力",尤其是推理负载(910C / 950PR / P800 一级市场的实际成交价未公开,但整机报价对美元卡的价格差在扩大);
  • 供给节奏:DeepSeek 押注昇腾训练、16 万颗 950DT 采购传闻——头部需求先吃掉产能,后来者的排队周期在拉长,早决策本身有价值。

4. 小结​

  • Nebius 10 月起 H100/H200/B200 随需租金 +20%;CoreWeave 签约电力 4.2GW 且继续高价锁量——租赁市场供需仍紧;
  • agentic 推理 + Rubin 供给溢价 + 电力约束,三力推高租金,且短期难回头;
  • 决策口径:稳定负载 2 年+ → 自建窗口打开;潮汐负载 → 继续租用;混合策略最抗涨价;
  • 看什么:其他云厂商是否跟进调价、Rubin 租赁的正式定价、国产算力是否出现公开租用市场。

相关阅读​

参考资料​

  • 芯智讯:Nebius 上调 AI 芯片租用价格,10 月 1 日起 H100/H200/B200 随需租金平均上涨约 20%(2026-09-21)
  • 财联社 / 东方财富:CoreWeave 推出多机架 Vera Rubin NVL72 集群,已签约电力增至 4.2 吉瓦(2026-09)

本文基于公开报道整理;TCO 结论依赖利用率、电价、折现率等假设,请以 TCO 计算器按自身参数复算为准。

京东云十万卡集群押注摩尔线程:国产 GPU 首次进入头部 AI 云核心算力底座

· 阅读需 5 分钟
Industry Research Team

本文基于 2026 京东全球科技探索者大会(9 月 9 日)官方发布及公开市场信息整理;订单金额与收入预测为券商/媒体口径,非公司公告。

9 月 9 日,2026 京东全球科技探索者大会上,京东云宣布了一个里程碑式的决定:与摩尔线程共建十万卡全功能 GPU 集群,打造超大规模国产智算基础设施。

这句话有两个关键词值得放大:「全功能 GPU」和「十万卡级核心集群」。前者意味着它要跑的不只是推理,而是大模型训练、推理与具身智能的正面战场;后者意味着国产 GPU 第一次被头部 AI 云企业放进了算力底座的核心位置——不是试点、不是适配、不是一体机,而是十万卡。

一、合作细节:从万卡到十万卡,订单规模多大?​

  • 此前基础:京东云已与摩尔线程等伙伴建成国产万卡集群,本次是从万卡到十万卡的量级跃迁
  • 订单规模:据市场与券商信息,GPU 模组由摩尔线程独家供应,订单总价值约 200-300 亿元,按交付节奏明年即可确认收入;部分券商将摩尔线程明年收入预期上修至 150-200 亿元(该口径非公司公告,请以官方披露为准)
  • 合作深度:从芯片、云平台到模型训练的全栈协同,支撑京东 JoyAI 模型族迭代,形成「数据 → 训练 → 仿真 → 部署」闭环
  • 开放性:算力面向全行业开放,聚焦大模型训练、推理及具身智能

摩尔线程创始人张建中在会上的表态很直接:「Scaling Law 仍然成立——十万卡集群是必然趋势。」京东云总裁曹鹏则把国产算力定义为京东物理 AI 战略的核心支柱。

二、为什么是摩尔线程?采购逻辑的三笔账​

科技公司买卡没有情怀,京东选择摩尔线程,本质是三笔账都算得过来:

1. 稳定性账:摩尔线程已在单一网络下完成千卡、万卡级大集群的商业部署,并在基础模型、具身大脑、世界模型等核心训练场景取得突破——万卡集群的工程验证是十万卡的前提,这不是冷启动。

2. 集成账:全功能 GPU 可以接入现有 IT 体系与云平台调度,MUSA 软件栈对大模型框架的适配已跑通训练级负载。

3. ROI 账:这是最关键的转变。过去国产 GPU 的买家多是「政策友好型」项目,而京东把十万卡集群写进资本开支,意味着产品回报率开始经得起投资者测算——买家结构从「敢用」变成「抢着用」,才是国产 GPU 商业成熟的标志。

三、S6000:下一代芯片已回片,供应链双保险​

据市场信息,摩尔线程下一代芯片 S6000 已顺利回片并分发厂商测试,FAB 与内存供给保障充足。需要说明的是:S6000 尚未正式发布,规格未公开,本文不作猜测;当前在售旗舰 MTT S5000 的站内数据为 FP16 400 TFLOPS、80GB 显存(1.6TB/s 带宽为 HBM 级)。

对 HBM 供给约束,摩尔线程的应对策略据称是「下一代产品迭代 + 供应链多源保障」——在国产 HBM 产能爬坡完成前,这是所有国产 GPU 厂商必须解的同一道题。

四、「十万卡」不是一家的事:国产 GPU 集群竞争格局​

值得把视野拉开——十万卡已是国产算力的集体目标:

玩家十万卡动作算力底座
京东云9 月 9 日宣布共建十万卡集群摩尔线程全功能 GPU
曙光 80007 月 WAIC 发布,郑州落成,全国产十万卡 AI 算力集群海光 DCU(深算 BW1000 一系)
华为Atlas 950 SuperPoD 超节点(8192 卡),2027 年十万卡超节点昇腾 950/960

两家芯片路线(全功能 GPU vs DCU vs NPU)、两条路径(商业云 vs 国家超算),指向同一个验证命题:国产算力能不能在十万卡规模上稳定跑通真实训练负载。 值得强调的是,目前摩尔线程×京东集群尚无公开的第三方基准对比,没有完工时间表——十万卡的「可用」到「跑好」,仍需工程验证。

五、资本市场视角​

摩尔线程 2025 年 12 月登陆科创板:发行价 114.28 元,首日收于 600.5 元;2025 年营收 15.05 亿元(同比 +243.37%),净亏损约 10.01 亿元。若券商上修的 150-200 亿元收入预期兑现,2027 年将是从「高成长亏损」转向「规模盈利」的关键节点——这也将成为国产 GPU 商业模式的第一份完整答卷。

小结​

从 2025 年跟 DeepSeek 一体机「出道」,到 2026 年进入十万卡核心集群,国产 GPU 用了不到两年走完从「能用」到「规模化商用」的认知跃迁。京东云这张订单的价值不在金额,而在样本意义:当互联网头部买家开始用 ROI 逻辑采购国产 GPU,替代就不再是政策叙事,而是商业事实。

(订单金额、收入预测与供应链状态来自公开市场信息与券商研报口径,请以公司公告为准;芯片规格数据见站内完整对比表。)

Vera Rubin 全面量产:100% 全液冷 + 800V 直流供电,AI 数据中心基础设施范式重构

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月初,供应链信息确认:英伟达 Vera Rubin 平台已于 8 月正式量产、9 月启动批量出货,无延期、无卡顿。与 Blackwell 迭代初期的产能波折不同,这次量产节奏异常平稳——谷歌云、微软 Azure、CoreWeave、甲骨文云等头部云厂商已启动机架部署。但真正值得产业记住的,不是"又一代 GPU 量产了",而是 Rubin 把液冷从"可选配置"变成了"硬性前置条件"。


1. 量产节奏:史上最平稳的一次平台切换​

根据产业链调研与券商跟踪信息:

  • 2026 年 8 月:Vera Rubin 正式量产;
  • 2026 年 9 月:批量出货启动;
  • 2026 下半年:CoreWeave、谷歌云、微软 Azure、甲骨文云机架部署落地;
  • 2026 年:上代 GB 架构机柜出货量有望达 6 万台(同比翻倍);
  • 2027 年:GB 与 Rubin 两代平台合计出货体量有望接近 10 万台,Rubin 新机柜远期产能目标为每天 1000 个 NVL72 机柜。

需求侧同样在加码:华尔街报告披露,英伟达管理层表示 FY28 同比增长 70% 的目标并非需求上限——若供应不受限,增速可能超过 100%。当前主要约束已从需求端转向先进晶圆与 HBM 供应。

2. 单卡 2300W:风冷时代的终结​

Rubin 平台与前代最根本的差异不在算力,而在功耗密度:

指标H100GB300Rubin
单 GPU TDP700W~1400W2300W
机柜功耗~40kW~140kW190–230kW
散热方案风冷为主风液混合100% 全液冷
供电架构48V48V800V 高压直流

单芯片 TDP 从 700W 升至 2300W、单机柜功率密度突破风冷物理极限——这意味着 液冷不再是高端算力的选配升级,而是运行 Rubin 服务器的先决条件。英伟达官方将 Rubin 全液冷架构定义为"数据中心历史上最重要的能效突破之一",并已写入 DSX AI 工厂参考设计:所有跟随英伟达技术路线的云厂商和数据中心运营商,都必须采用全面液冷方案。

三个关键架构变化:

  1. 无风扇整机:GPU、CPU、交换机、DPU 全部器件强制采用直接冷板式液冷,45℃ 温水冷板成为出厂标配;
  2. 液冷边界延伸:散热覆盖范围从 GPU 冷板延伸至 CPU、DPU、交换机乃至光模块(液冷 Cage/鼠笼开始从"可选"变"刚需"),整套液冷系统价值量较 GB300 提升约 40%;
  3. 800VDC 供电:替代传统 48V 机架配电,整机电源 BOM 价值增长 30% 以上,PSU 电源模块从 5.5kW 向 18.3kW 迭代,固态变压器、高压直流 CDU 成为数据中心新增核心设备。

3. 对产业链的三重传导​

第一重:液冷从"配套"变"主角"。 2026 下半年以小规模部署验证为主,真正的放量窗口在 2027 年——Rubin 机架大规模铺货后,冷板、快速接头、CDU、液冷泵进入业绩兑现期。台系供应链 7 月数据已率先验证:AVC 奇鋐 7 月营收 185.9 亿新台币创历史新高(同比 +57.4%),双鸿、健策 7 月同比分别 +116.7%、+91.0%。

第二重:国产液冷供应链进入核心 BOM。 国内厂商由外围冷源和代工环节逐步进入芯片平台、服务器 ODM 和海外云厂商供应体系,替代路径从 Manifold、管路推进至高可靠快接头和冷板。英维克 26H1 海外收入占比 71.4%,飞龙股份液冷泵小功率平台订单超 5 万台——液冷全核心零部件自主可控正在成为现实。

第三重:供电与散热边界融合。 800VDC 架构下,电源模块、PDB 配电单元、高速交换芯片自身发热也达到很高水平,部分电源组件同样需要液冷辅助散热——电源与温控两条产业链正在合并成一条。

4. 需求矩阵扩容:云厂商之外,太空算力入场​

Rubin 的客户矩阵已从传统云厂商扩展至三个层次:

  • 全球云厂商:谷歌云、Azure、甲骨文云、CoreWeave;
  • AI 科技巨头:马斯克公开披露 2027 年 8GW 超大规模 IDC 建设规划;SpaceX 将 Vera Rubin 架构定义为"最优 AI 计算架构",计划地面与太空双向部署,支撑 "Starmind" 卫星算力项目;
  • 主权与边缘:远期 Rubin Ultra 及 2027 年后更高功耗机型单机柜有望冲击 600kW+。

普华永道预计全球数据中心累计投资到 2035 年将达 31.6 万亿美元。AI 基础设施建设的确定性,已经从"是否建设"变成"多快建设"。

5. 对采购方的启示​

  • 机房规划前置:2027 年起采购 Rubin 级算力,液冷改造(单千瓦改造成本较高)或按全液冷标准新建,必须在预算周期一开始就纳入;
  • 看 PUE 也看水温:45℃ 温水直冷允许更高进水温度,可利用自然冷源压低 PUE——选址时人工冷源依赖度成为新的评估维度;
  • 供应商组合即风险对冲:HBM 与先进封装供应是当前核心瓶颈(详见本站 HBM4 竞速分析),供应链多元化比单点性能更重要。

相关链接​

参考资料​


本文基于 2026 年 9 月初供应链调研、券商研报与英伟达官方披露整理。出货量与功耗数据为产业链预估口径,实际以英伟达及客户正式披露为准。

HBM4 量产元年:三星良率突破80%、三巨头齐过英伟达认证,AI 算力供给的最后一道瓶颈

· 阅读需 6 分钟
Industry Research Team

如果说 2025 年是 HBM3E 的产能爬坡年,那么 2026 年就是 HBM4 的量产元年。NVIDIA Vera Rubin 与 AMD MI400 两代旗舰同时押注 HBM4,让这块"AI 芯片上的内存"第一次成为决定整机柜交付节奏的战略物资。而 8 月密集披露的良率与认证数据,正在重写全球 HBM 供应版图。


1. 黄金良率突破:三星六个月从不足六成冲上 80%​

据韩国《首尔经济日报》8 月 9 日披露,三星电子 HBM4 良率已于 8 月初正式跨过 80% 的"黄金良率"门槛——较其原定年底达成的目标提前了四个多月。

时间节点三星 HBM4 良率备注
2026 年 2 月(量产启动)不足 60%产线爬坡期
2026 年 8 月初约 80%跨过规模量产 / 稳定盈利分水岭

半导体行业素有"80% 良率为黄金良率"之说——它既是晶圆厂竞争力的标尺,也被视为大规模商业化供给的财务转正点。推动这一跃迁的关键,是三星在 热压非导电薄膜(TC-NCF)键合工艺 上的突破,以及底层 1c DRAM 良率早已站上 80% 所提供的稳定基底。同期,三星 HBM4E 可靠性测试良率也已突破 70%。

业界评估,SK 海力士的 HBM4 良率同样迈入 80% 区间。两大巨头在量产品质上的差距正被快速抹平。


2. 供应版图:SK 海力士握有 Rubin 六至七成分配​

黄仁勋 6 月 5 日在首尔公开确认:三星、SK 海力士、美光三家均已通过 Vera Rubin 的 HBM4 认证——这是三大存储厂首次同时获得同一平台的公开认证。

但认证只是"进门券",分配份额才是话语权:

厂商2026 年 Rubin HBM4 分配(估算)备注
SK 海力士60%–70%凭借 HBM3/3E 世代积累的客户关系与 MR-MUF 封装工艺
三星25%–30%良率跃迁后份额快速提升
美光剩余部分HBM4 曝光有限,份额相对稳定

Counterpoint Research 预测 2026 年 HBM4 市场格局为 SK 海力士 54% / 三星 28% / 美光 18%。三星已设定阶梯式追赶目标:Q3 HBM4 营收环比三倍增长、下半年 HBM4 占 HBM 总营收超 60%、年底 HBM 整体市占率向 38% 靠拢。


3. 真正的瓶颈:从晶圆转向"后端堆叠"​

随着前端良率企稳,AI 加速器供应链的节奏,不再取决于"能产多少晶圆",而取决于后端堆叠、键合、测试、出货的速度。

  • 行业分析师将 HBM 堆叠列为 AI 芯片供应链第二严重的瓶颈,仅次于 TSMC 的 CoWoS 先进封装产能。
  • HBM 占 2026 年 DRAM 晶圆产量的约 25%;每片 HBM 晶圆消耗约 3–4 倍于普通 DRAM 晶圆的资源(额外 TSV 与堆叠步骤),每redirect一片晶圆就等于从现货市场抽走 3–4 单位商品内存。
  • 三星正考虑将部分传统内存后端产线(天安、温阳)迁往越南以释放 HBM 后端产能——侧面印证后端吞吐已是整条链最紧的环节。

4. HBM4 规格速览:带宽与能效的代际跃迁​

规格HBM4(12-Hi / 16-Hi)HBM4E
单栈容量36 GB / 48 GB—
引脚速率11.7–13.0 Gbps16 Gbps
单栈带宽最高 3.3 TB/s最高 3.6 TB/s
总线位宽2048-bit—
能效较 HBM3E 提升 40%—
热阻 / 散热改善 10% / 提升 30%—

三星 HBM4 于 2026 年 2 月量产,11.7 Gbps 的引脚速率已超出 Vera Rubin 兼容所需的 8 Gbps 行业基线;HBM4E 样品则于 5 月 29 日率先发往主要客户。


5. 价格权力延续至 2027:供给仍将是紧平衡​

TrendForce 判断,HBM 供应商的定价权将贯穿 2027 年,原因是供给持续受限:

  • 2027 年 HBM bit 出货量预计年增 50%–60%,但仍跟不上需求增速,市场维持紧缺;
  • 行业已预期显著涨价;
  • 对 NVIDIA 与 AMD 而言,一个更强的三星意味着更多供货选择与更从容的交期——在内存成为 AI 服务器最紧一环的市场里,第二、第三供应商的存在本身就是缓冲。

对整机柜而言,HBM 成本已是最大推手:Rubin Ultra 机柜预估售价高达 2100 万美元,HBM 占其中相当比重。


6. 对中国的启示:HBM 出口管制加速国产迭代​

HBM 是当前 AI 芯片管制的核心环节之一。在海外 HBM4 军备竞赛白热化的同时,国产 HBM 技术迭代被同步推快——华为昇腾路线图已明确将"推动国产 HBM 技术迭代"写入产品节奏(950 系列推进国产 HBM 配套,960/970 系列规划于 2027–2028 年陆续推出)。

短期看,HBM4 的紧缺会直接传导到 Rubin / MI400 的交付节奏;长期看,谁能锁定稳定的 HBM4 供给,谁就握住了 2027 年 AI 算力扩张的阀门。

相关链接​

参考资料​


本文基于 TrendForce、Seoul Economic Daily、TechTimes 等 2026 年 8 月公开报道整理。HBM 分配份额与市占率为第三方机构估算,非厂商官方确认数据。

推理加速卡市场 2026:占加速器市场60%-70%,GPU 与 ASIC 份额反转,五大流派混战

· 阅读需 5 分钟
Industry Research Team

过去三年,整个 AI 硬件故事都是"训练":谁有最多 H100、谁能把十万卡连成集群。这场竞赛基本尘埃落定——NVIDIA 赢了。但下一战场"推理"正在完全不同的规则下开打:衡量标准不是峰值 FLOPS,而是 cost-per-token(每 token 成本)、时延与功耗。2026 年,推理芯片第一次在规模上压倒训练,成为 AI 加速器的主战场。


1. 推理成为主战场:80%–90% 的算力花在推理上​

训练一个大模型要花数亿美元——一次。但模型上线后,它要日复一日回答数十亿次查询。一个热门消费级模型可能需要上万颗加速器 7×24 小时运行才能跟上需求。因此:

  • 推理约占一个模型生命周期算力的 80%–90%;
  • 推理芯片将占 2026 年约 $400B AI 加速器市场的 60%–70%,而 2023 年这一比例仅约 40%;
  • 推理芯片增速(预计年增 52.7%)显著高于训练芯片(28.4%),推理侧算力需求占比 2026 年首次超过训练侧,达 54%(约 $1010B)。

推理的经济学很直接:训练成本被摊销到微不足道,推理成本成为整张账单。每降低 1% 推理成本,都直接流向利润——对 OpenAI 这种推理流量达 hyperscale 体量的公司,Half 的账单是后面跟着一堆零的数字。


2. 市场规模:结构性增长拐点已至​

市场2026 规模增速备注
全球推理专用芯片$412.7B+38.4%较训练芯片增速高 14.2 pct
中国推理专用芯片$118.6B(占全球 28.7%)+44.1%亚太增速最强单一市场
全球 AI 训练/推理芯片(含 GPU/NPU)突破 $1850B+40.2%GPU 占约 62%

中国市场国产化替代加速,国产推理芯片出货占比达 34.6%,较 2025 年提升 9.8 pct。


3. 技术路线份额反转:GPU 放缓,ASIC 飙升​

路线2026 出货份额趋势
GPU52.6%仍居首,但增速放缓至 22.7%
ASIC 定制芯片41.3%从 2022 年 17.8% 大幅攀升
FPGA稳定特定低时延场景

GPU 凭借生态成熟度仍是主力,但 NPU/ASIC 在能效比上已实现对同代 GPU 1.8 倍的优势,推动其在边缘与端侧采用率快速攀升。专为推理优化的 ASIC 出货量预计达 1150 万颗,单位成本较 GPU 降低约 35%。


4. 五大流派混战​

流派代表产品核心优势适用场景
通用 GPUNVIDIA Rubin / B200 / H200生态成熟、训推一体前沿训练 + 高交互推理
LPU(语言处理单元)Groq LPU极低时延、确定性吞吐实时对话、高并发推理
TPU(推理专用)Google TPU 8i(Zebrafish)288GB HBM、384MB 片上 SRAM、ICI 19.2 Tb/sGoogle 规模化推理
自研 ASICOpenAI Jalapeño、微软 Maia 200、Meta MTIA针对自家模型剪掉通用性税,cost/token 降 ~50%hyperscaler 自有负载
风冷推理卡Intel Crescent Island350W 风冷、480GB LPDDR5X、tokens/watt成本敏感中长尾推理

OpenAI 与博通合作的 Jalapeño 目标将推理 token 成本较通用 GPU 栈降低约 50%——这是第五个加入"自研推理芯片俱乐部"的成员(前有 Google TPU、亚马逊 Inferentia/Trainium、微软 Maia、Meta MTIA)。


5. 核心指标转向:cost-per-token 与 tokens/watt​

推理竞赛与训练竞赛的根本不同在于切换成本低:

  • 训练需要 10 万卡集群 + NVLink + CUDA,迁移成本极高;
  • 推理在端点层面" embarrassingly parallel"——不需要百万卡集群,一个能快速便宜出 token 的节点即可,per-endpoint 可替换。

这意味着 NVIDIA 的三道护城河(最快硅、NVLink 扩展、CUDA)在推理侧都不再绝对。当最大的 AI 买家(OpenAI)开始把 GPU 当作"可选项之一",GPU 溢价就开始消蚀——定价权依赖稀缺性,而自研芯片从两个方向同时攻击稀缺性:既减少商户芯片需求,又给买家一个可信的谈判外部选项。


6. 边缘与端侧爆发:长尾化信号​

需求端呈现显著长尾化与碎片化:

场景2026 需求规模增速
云端推理$198.2B(占 48%)+24.5%(放缓)
边缘推理$126.5B(占 30.7%)+52.3%
端侧推理$88.0B(占 21.3%)+68.9%
智能驾驶推理$67.3B+58.2%
工业质检 / 机器人推理$42.1B+63.7%

推理负载的时延敏感性与功耗约束正在重塑芯片架构设计优先级——这也解释了为何 Crescent Island 这类"风冷大显存"方案能找到生存空间。

相关链接​

参考资料​


本文基于 2026 年公开市场研究、券商报告与行业分析整理。市场规模与份额为第三方机构测算,口径不一,仅供参考。

2026全球AI算力报告及算力产业十大趋势重磅发布

· 阅读需 9 分钟
Industry Research Team

2026年5月29日,在天津举办的2026世界智能产业博览会期间,由中国智能计算产业联盟、国家超级计算天津中心、天津市人工智能学会、深圳市人工智能行业协会、至顶科技、至顶智库联合发布了《2026全球AI算力发展研究报告》。

该报告深入分析了全球AI算力产业的发展现状与未来趋势,揭示了算力产业进入"智算驱动、体系重构"的全新发展阶段。

核心观点​

1. 算力成为国家战略要素​

全球算力产业正迈入"智算驱动、体系重构"的全新发展阶段。伴随"词元经济"的兴起,算力已成为支撑国家技术突破、产业竞争与战略布局的关键基础要素。

算力正从传统信息技术支撑演变为驱动科技创新与工业革命的战略性底座。

2. AI算力发展覆盖全链路​

AI算力发展需覆盖芯片、整机、计算集群全链路升级,同时需匹配模型训练、推理、数据准备各环节的差异化算力需求。

  • 训练端:超大规模模型预训练需要万卡级算力支撑
  • 推理端:超大规模模型需要千卡算力
  • 数据准备:需要数十到数百卡算力规模

训练与推理两端的算力需求仍将持续增长。

3. 国内AI芯片产业特色路径​

国内AI芯片产业走"自主可控+集群突破+软硬整合+性价比优势"路线,区别于国外追求单芯片绝对算力的路径,更符合大规模算力部署需求。

4. 算力中心能耗挑战与解决方案​

算力中心已成为全球电力需求增长最快的领域。未来需构建"短期风光储一体化、中期核能、长期氢能"的多元能源供给体系。

同时,太空算力将成为解决地面算力瓶颈的新方向。

5. 算网融合成为核心方向​

未来算力将向"算网融合"方向发展,实现算力像水电一样随取随用,成为国家现代化基础设施体系的核心组成部分。

算力网已纳入国家"十五五"规划重大工程项目,与水电等公共基础设施并列成为现代化基础设施体系核心。

关键数据​

算力性能演进​

指标演进趋势
芯片算力从TFLOPS量级提升至数十PFLOPS
整机部署形态从单机八卡演进为千卡级超节点架构
计算集群规模从千卡集群拓展至数十万卡集群
集群功耗从千瓦级提升到吉瓦级

全球算力中心容量及能耗预测​

  • 全球算力中心总容量:预计2030年从2026年的102GW增长至220GW

    • 其中AI负载容量从62GW提升至156GW,占比提升至71%
  • 美国算力中心年耗电量:预计从292TWh增长至606TWh,占全美电力需求比重提升至11%

  • 中国算力中心总容量:2030年预计接近60GW,AI负载占比提升至48%

  • 全球算力中心电力消耗:根据IEA基准情景预测,2030年将从2024年的约415TWh增长到约945TWh,年均增速约15%

具身智能算力支撑数据​

  • 云端算力:可实现日均生成PB级交互数据,大模型训练周期从月级缩短至周级
  • 端侧算力:数十至数百TOPS算力可完成10-50ms低时延实时感知决策

产业趋势分析​

算力技术架构趋势​

1. 异构计算架构升级​

从传统CPU+GPU架构,向GPU+LPU+CPU+DPU新型异构推理架构演进。

CPU在异构架构中承担任务调度、数据预处理、串行任务处理、系统互联的核心作用。2010年"天河一号A"率先实现CPU+GPU架构规模化落地,引领全球智算底层架构方向。

2. 算力扩展路径清晰​

  • Scale Up(纵向扩展):通过提升单节点硬件配置追求极致性能
  • Scale Out(横向扩展):通过增加节点实现负载分担与高可用性

两者共同构成算力系统能力的核心支撑。

3. 超节点服务器成为主流​

具备超高互联带宽、低通信时延优势,可缩短模型训练周期。

代表产品:

  • 华为昇腾384超节点
  • 中科曙光scaleX640超节点
  • 阿里云磐久AL128超节点
  • 浪潮元脑SD200
  • 昆仑芯超节点方案

4. 长上下文处理技术优化​

通过**压缩稀疏注意力(CSA)、重压缩注意力(HCA)**与滑动窗口机制协同,构建"粗粒度+细粒度、稀疏+稠密"的长上下文建模体系,提升算力使用效率。

代表应用:DeepSeek-V4的注意力架构设计。

AI算力关键领域发展趋势​

AI芯片领域​

国际厂商:

  • NVIDIA:

    • 凭借Blackwell与Rubin架构领跑高端训练和推理市场
    • GTC 2026台北(6月1日)重磅发布:
      • Vera Rubin平台全面量产:NVL72机架系统,智能体吞吐量比Grace Blackwell提升10倍
      • Vera CPU正式发布:88核Olympus自研Armv9.2架构,LPDDR5X 1.5TB,1.2 TB/s,全球首款原生支持FP8的CPU
      • RTX Spark AI PC芯片:与联发科、微软联合研发(代号N1X),Blackwell GPU 1 PFLOP,128GB统一内存,台积电3nm
      • Nemotron 3 Ultra开源模型:SSM+MoE混合架构,推理速度提升5倍,成本降低30%
    • 依托CUDA生态持续扩大竞争优势
  • Google:依托自研TPU深化软硬件垂直整合

  • Google:依托自研TPU深化软硬件垂直整合

  • AWS:通过Trainium训练芯片与Inferentia推理芯片协同,提供高性价比云端算力方案

国内厂商: 形成以华为昇腾910C、昆仑芯P800、摩尔线程MTT S5000、沐曦曦云C600为代表的产品矩阵。

2026年华为发布"韬(τ)定律",以系统性降低时间常数为目标,通过逻辑折叠等技术提升晶体管密度,推动国产芯片技术演进。

AI工作站领域​

  • 形态覆盖:分为塔式、移动、迷你三类,适配不同部署场景
  • 算力等级覆盖:分为入门级、专业级、企业级三类,可覆盖从个人开发到企业级部署的全场景AI算力需求

AI服务器领域​

  • 按功能可分为训练AI服务器和推理AI服务器
  • 按部署方式可分为云端AI服务器和边缘AI服务器

具备高算力输出、高内存带宽、高速互联等能力,适配大规模并行计算任务。

AI算力中心领域​

  • 呈现"高AI占比、高功率密度、高电力消耗"的发展趋势
  • 超大规模AI算力中心成为建设重点
  • 能源供给向多元清洁化方向发展

太空算力成为新方向,可依托太空持续光照、极寒真空、无大气干扰的环境优势,解决地面算力中心的能源、散热、互联瓶颈。

目前Starcloud公司、国星宇航已开展初步探索。

算力应用场景趋势​

1. 科研范式变革​

"干湿闭环"研究范式成为主流,将AI驱动的"干实验"与自动化实验验证的"湿实验"通过数据反馈形成闭环,推动科学研究从经验驱动转向模型驱动。

2. 合成生物学赋能​

AI的多任务学习与未知空间探索能力,可破解生物系统"序列—结构—功能"的复杂映射,在蛋白质合成、基因编辑与核酸疫苗领域实现应用突破。

如AlphaFold系列模型实现蛋白质结构预测革命性突破。

3. 具身智能支撑​

云端与终端算力高效协同,为具身智能提供全栈算力支撑,覆盖海量数据处理、高保真仿真、模型训练、端侧实时感知决策全链路闭环。

算力基础设施发展趋势​

算网融合成为核心方向,从"先互联再成网"向全国一体化算力网演进。

三大电信运营商已开展自有算力与全国分散社会算力的互联工作,推动算力普惠化供给。

产业生态趋势​

国产算力生态持续完善,政企学研协同加深。中国智能计算产业联盟、国家超级计算天津中心、各地人工智能学会、行业协会、产业服务机构共同搭建交流平台,推动算力技术研发、标准制定、成果转化与人才培养,助力国产算力产业高质量发展。

结论与展望​

  1. 算力成为国家战略竞争力核心要素,全球主要国家纷纷加大算力基础设施投入,抢占AI时代战略制高点。

  2. 国内AI芯片产业走特色化发展路径,通过集群突破、软硬整合、性价比优势,在大规模算力部署场景中形成竞争优势。

  3. 算力技术架构持续演进,异构计算、超节点服务器、长上下文处理技术成为重要发展方向。

  4. 算力应用场景不断拓展,从科研范式变革到合成生物学、具身智能,AI算力深度赋能前沿领域。

  5. 算力基础设施向算网融合方向演进,未来算力将像水电一样成为普惠化、随取随用的公共基础设施。


参考文献:

  • 《2026全球AI算力发展研究报告》(中国智能计算产业联盟等机构发布)
  • 2026世界智能产业博览会(天津,2026年5月29日)