跳到主要内容

英伟达中国份额崩至 8%,昇腾升至 50%:一份 9 月报告里的中国 AI 算力市场剧变

· 阅读需 5 分钟
Industry Research Team

本文基于 Bloomberg Intelligence 与 Bernstein 2026 年 9 月发布的市场分析及公开报道整理;市场份额与营收为分析师预测口径,非官方披露。

9 月 28 日,两份华尔街报告同时描摹出一个戏剧性的画面:中国 AI 算力市场的份额天平,在 12 个月内完成了几乎彻底的翻转。

一、份额翻转:40% → 8%,昇腾 → 50%​

Bernstein 最新预测:

  • 英伟达在中国 AI 芯片市场的份额,将从约 40% 跌至今年年底的约 8%
  • 华为昇腾升至接近 50%
  • 直接导火索:9 月中国对英伟达 H20 新订单的禁令,关上了英伟达重返中国市场的最后通道
  • 字节跳动、阿里、腾讯均已下出大额昇腾订单

时间线上看,这不是一次突变,而是出口管制三年收紧的累积结果:英伟达在中国 AI 芯片市场的份额一度高达 95%,随着高端芯片断供,中国超大规模云厂商整体转向华为与国产替代;即便 2026 年 1 月华盛顿放开 H200 对华销售,转向的齿轮已经咬合,回不去了。

二、昇腾 950PR:分析师眼里的「中国版 H200」​

支撑这份份额数据的,是产品力本身:

  • 昇腾 950PR 今年 3 月量产,FP4 算力最高 2 PFLOPS,搭载 128GB 国产 HBM
  • 分析师将其评为大致对标英伟达 H200
  • 华为 AI 芯片营收预计今年达 120 亿美元,较 2025 年的 75 亿美元增长 60%

950 系列的完整规格可参考我们此前的深度文章:昇腾 950PR/950DT 双配置解析 与 昇腾 960 官宣发布——960 已提前三个季度就绪,确认一年一代节奏。

三、模型侧:中国开源模型拿下 OpenRouter token 大盘​

芯片份额翻转的同时,模型使用侧的数据同样惊人(OpenRouter 平台统计):

指标数据
DeepSeek token 份额(6 月)16.3%,超过 Google、Anthropic、OpenAI 各自单独份额,居第一
中国开放权重模型合计 token 份额(5 月)约 61%(DeepSeek、Qwen、MiniMax、腾讯混元等)
中国模型周 token 消耗约 18 万亿,美国模型约 5.5 万亿,3 倍以上差距且一年内完成反超
中美前沿模型性能差距(6 月)收窄至 6%,创历史新低(5 月为 9%)

算力与模型形成正循环:买不到的卡倒逼国产算力放量,放量的国产算力养出便宜的 token,便宜的 token 让中国开源模型吃下全球推理流量的大头。

四、但股票市场没有买单​

Bloomberg Intelligence 同期指出一个矛盾:中国科技八巨头(China Tech 8)相对美股「七巨头」(Magnificent Seven)的估值折价达到年内最宽的 超过 50%,BI 认为只有「真正的 AI 突破」才能弥合。个股年内表现:阿里约 -7%、腾讯约 -23%,而美国 AI 基础设施龙头普涨 15% 以上。

这种背离有两种解读:要么市场低估了中国 AI 基本面,要么盈利执行(阿里上季 EPS 低于预期 17.3%、百度低 36%)拖累了 AI 叙事的兑现。对产业观察者而言,值得注意的是:算力侧的数据(份额、营收、出货)已经先行,应用侧的变现仍在路上。

五、对算力采购者的三点提示​

  1. 在华部署,昇腾生态已是默认选项。 从 CUDA 迁移到 CANN 的成本是一次性的,而供给不确定性是持续性的;9 月禁令后,新采购英伟达卡在中国市场已无合规路径。
  2. 国产算力「对标 H200」是分水岭。 过去国产替代的隐含假设是「性能打折、价格打折」;当单卡性能追平 H200 世代,采购决策就回归纯粹的 TCO 与供应安全计算——建议用 TCO 计算器 把电费、折旧、利用率放进同一张表里算。
  3. token 成本曲线决定应用格局。 中国模型 61% 的 OpenRouter token 份额说明:算力自主 → token 降价 → 应用繁荣的链条已经跑通第一段,接下来看推理成本能否继续下探。

小结​

40% 到 8%,不是一句口号,而是一个由禁令、产品力与模型生态共同驱动的市场重排。对中国市场而言,昇腾 950/960 的量产节奏与 CANN 生态成熟度,将决定这份份额能否守住;对全球市场而言,中国算力「内循环 + 开源模型出海」的组合,正在改写推理流量的地理分布。

(市场份额与营收预测来自 Bernstein / Bloomberg Intelligence 分析师报告,实际数字以各公司财报为准。)

智能算力 2030 年冲 9800 EFLOPS:信息通信业「十五五」规划的五个硬指标

· 阅读需 5 分钟
Industry Research Team

本文基于工信部《信息通信行业发展「十五五」规划》(2026 年 9 月印发)及《人民邮电》报、澎湃新闻、华夏时报等官方解读整理。

9 月上旬,工信部印发《信息通信行业发展「十五五」规划》,用 13 个主要指标、26 项重点任务给未来五年的信息通信业画了路线图。对 AI 算力行业来说,这是含金量最高的一份政策文件——我们挑出五个硬指标,逐个拆解产业含义。

指标一:智能算力 1590 → 9800 EFLOPS,五年增长超 5 倍​

这是整份规划最亮眼的数字。作为参照系:

  • 截至 2026 年 6 月底,全国智能算力规模已达 2185 EFLOPS,同比增长 177%——上半年就超额完成了对 2025 年底(1590 EFLOPS)的跨越
  • 全国已建成 42 个万卡级智算集群;2026 年 7 月,首个全国产十万卡级 AI 算力集群曙光 8000 在郑州落成
  • 华为轮值董事长汪涛的判断:10 万卡以上超节点集群到 2027 年将成为基础配置

从 2185 到 9800,意味着未来四年还要再造 3.5 倍于当前存量的智算设施。规划同步要求「有序部署万卡、十万卡及以上智算集群」「加大力度适配国产算力芯片」——这是国产 AI 芯片未来五年最确定的需求底座。

指标二:信息基础设施累计投资 3.8 万亿元​

有观点拿「十四五」3.7 万亿对比,得出「投资见顶」的结论。官方解读明确反对这一说法:增量资金正从「规模铺量」转向「质效跃升」,精准投向智能算力基础设施、万兆光网、6G 等新赛道。产业链拉动效应也随之变化——AI 服务器、高速光互联、国产算力芯片、新型智能终端被点名为全链条受益方向。

指标三:新建大型算力设施 PUE 降至 1.2 以下​

「十四五」末这一数字是 1.25,五年内再降 0.05——听着不多,但在 AI 服务器常年高负荷、单机柜功率密度普遍超过 20kW 的今天,PUE 每降一点都是硬仗。规划给出的技术路径非常明确:液冷。

  • 《信息通信行业发展「十五五」规划》:引导算力设施采用高效节能设备以及液冷等先进技术
  • 《电子信息制造业发展「十五五」规划》(9 月 15 日由工信部、国家发改委联合印发):把液冷散热与高带宽内存池、全光交换并列为要突破的关键技术

产业侧的数据也在验证:据 Omdia 统计,液冷在全球数据中心冷却市场的占比从 2024 年约 20% 攀升至 2025 年约 37%,预计 2029 年渗透率超过 45%。算力扩张的上限正在从芯片供给转向电力供给,「算力向上、能耗向下」的能效约束会是未来五年的常态。

指标四:先进存力 1700 EB,增长超 2 倍​

智能算力翻 5 倍的同时,先进存力翻 2 倍——存算协同被放在同等重要的位置。逻辑在于:大模型训练的检查点、智能体推理的中间状态和上下文记忆,都分层存放在高性能存储中。截至 6 月底,全国存力总规模约 2021 EB,其中先进存力占比约 32%;到 2030 年 1700 EB 的先进存力目标,意味着结构升级比总量增长更重要。

对芯片选型的直接提示:KV cache 与长上下文正在吃掉内存预算,评估 AI 服务器时显存容量与内存带宽的权重应该高于峰值算力。

指标五:智能体互联网络首次写入规划​

这是本份规划最具前瞻性的部分:「智能体互联网络」占据独立专栏,部署四方面内容——构建智能体网络标识体系、加快智能体网络设施建设应用、推动全球互联互通、建设空间管控体系。同时明确「适时启动 6G 商用」。

AI 从「人的应用」变成「智能体基础设施」,通信网的角色从连接人升级为连接智能体——这为推理算力的分布式部署(边缘推理、算力调度)提供了国家级叙事。

对算力从业者的三点判断​

判断依据
国产算力需求确定性强规划明文「加大力度适配国产算力芯片」+ 十万卡集群建设周期启动
能效指标成为选址硬约束PUE 1.2 以下 + 液冷关键技术点名,高密度液冷方案优先
推理算力按需下沉「面向场景按需部署推理算力设施」,边缘与区域算力中心有政策窗口

算力规模翻 5 倍的目标之下,真正稀缺的从来不是规划,而是芯片、电力和交付能力。 对采购方来说,供给窗口期依然紧张;对方案选型而言,建议直接用 TCO 计算器 把 PUE 差异折算成电费成本——1.25 与 1.2 的差距,在万卡集群的电费账单上是千万级的。

小结​

「十五五」规划把智能算力写成了国家级工程:5 倍算力、2 倍存力、3.8 万亿投资、PUE 1.2、智能体互联网。五年后回看,2026 年下半年的国产十万卡集群潮,很可能就是这条曲线的起点。

(规划数据引自工信部文件及官方媒体解读;市场数据引自信通院、Omdia 等机构统计。)

Groq 3 LPX 全面量产:三星 4nm 代工、单机架 315 PFLOPS FP8,英伟达把 LPU 变成 Vera Rubin 的第七颗芯片

· 阅读需 5 分钟
Industry Research Team

本文基于 NVIDIA 官方产品页、2026 年 3 月 GTC 架构博客及第三方基准数据整理;性能口径为厂商架构对比,实际收益需以自测为准。

英伟达确认,Groq 3 LPX——Vera Rubin 平台的「第七颗芯片」——已进入全面量产,由三星平泽园区代工。这是继 2025 年 12 月英伟达斥资约 200 亿美元获得 Groq 非独占 IP 授权与核心工程团队之后,这笔交易第一次以量产硅的形式落地。

对推理硬件格局而言,这是一次范式级事件:英伟达第一次把「别家定义的专用推理架构」纳入自家旗舰平台,且不是外挂销售,而是深度协同设计。

一、Groq 3 LPU 芯片与 LPX 机架:规格速览​

单颗 Groq 3 LPU(4nm,三星代工):

项目数值
编译器管理的片上 SRAM500 MB
SRAM 带宽150 TB/s
片间 scale-up 带宽2.5 TB/s(96 条 chip-to-chip 链路,每条 112 Gbps)

单个 LPX 机架(32 个 1U 液冷托盘,每托盘 8 颗 LPU):

项目数值
LPU 总数256 颗
FP8 算力315 PFLOPS
片上 SRAM 总量128 GB
SRAM 聚合带宽40 PB/s
机架内 scale-up 带宽640 TB/s
DDR5 内存12 TB(承载大模型权重)

每颗 LPU 500MB 的 SRAM 看起来不大,但乘上 256 颗、再叠加 40PB/s 的聚合带宽,构成了「确定性低延迟解码」的物理基础——LPU 的设计哲学正是用编译器静态调度片上 SRAM,彻底消除推理解码阶段的内存取数停顿,而这恰恰是 GPU 推理最典型的瓶颈。

二、AFD:注意力与 FFN 分家,GPU 和 LPU 各干各的​

LPX 不是替代 GPU,而是与 Vera Rubin NVL72 组成异构系统,核心是 AFD(Attention-FFN Disaggregation,注意力-前馈解耦):

  1. Rubin GPU 负责 prefill 与 attention——在大上下文上构建 KV cache、执行注意力层,吃 HBM 容量与高吞吐;
  2. Groq 3 LPU 负责 FFN / MoE 专家层解码——延迟敏感、模式可预测,恰好是 SRAM 确定性调度的主场;
  3. 中间激活在两个引擎间逐 token 交换,由 NVIDIA Dynamo 编排路由,GPU 算每一层注意力,LPU 算每一层前馈,协同完成每个输出 token。

这套分工的逻辑很清晰:智能体应用消耗的 token 量可达传统 AI 应用的 15 倍,瓶颈从「能不能算完」变成「能不能以稳定低延迟持续吐 token」。让 HBM 大容器去跑 attention、让 SRAM 确定性引擎去跑 decode,各取所长。

三、实测与官方口径​

  • 第三方实测(Artificial Analysis):Gemma 4 31B、100K token 上下文下,LPX 输出约 3400 tokens/s——单 token 间隔低于 1 毫秒,长上下文智能体场景的交互感质变
  • 官方架构对比:与 LPX 组合后,Vera Rubin NVL72 对万亿参数模型的每兆瓦吞吐最高提升 35 倍;「高价值 token」场景下每瓦收入机会最高 10 倍
  • 首发客户:Nebius 率先部署 LPX 机架扩展其 token 产能;CoreWeave 已在生产环境用 Spectrum-X Multiplane 连接 Vera Rubin 机架

需要强调:35 倍/10 倍是特定高交互工作点的架构对比数字,不是普适结论。训练、大吞吐批量推理、需要 CUDA 生态灵活性的负载,GPU 仍是正解;LPX 的主场是「单用户交互延迟即产品」的场景——智能体循环、实时编码助手、长上下文对话。

四、三个行业信号​

1. 专用推理芯片被收编,而非对抗。 过去 LPU 是「GPU 挑战者」的叙事,现在变成了 Vera Rubin 的组成部分。推理硬件的终局可能不是一种架构赢,而是「GPU + 专用解码引擎」的异构组合成为标配。对其他推理芯片创业公司(Cerebras、Etched 等),这既是天花板抬高的证明,也是「要么被集成、要么找差异化」的警示。

2. 三星代工拿到高端 AI 订单。 在台积电几乎垄断 AI 主芯片的背景下,三星 4nm 承接 LPX 量产意义重大——叠加此前特斯拉 AI6 的 2nm 订单,三星代工有望在 2027 年重回全年盈利。

3. 推理经济性进入「按 MW 定价」时代。 当厂商开始用 tokens/MW 和每瓦收入讲故事,算力选型的核心 KPI 已经从峰值算力(TFLOPS)彻底转向单位能耗的 token 产出。这与我们在 TCO 计算器 里内置的功耗-电费模型逻辑一致:峰值参数好看的芯片,未必是每 token 成本最低的芯片。

小结​

Groq 3 LPX 量产标志着推理硬件进入「GPU 管吞吐、LPU 管延迟」的异构时代。对于正在选型推理集群的团队,建议把工作负载拆开评估:批量离线推理留在 GPU,交互式长上下文智能体值得单独测算 LPX 类方案的单位成本。拿不准的话,先用 TCO 计算器 跑一遍两种架构的 3 年持有成本再拍板。

(本文性能数据来自 NVIDIA 官方架构对比与 Artificial Analysis 第三方实测,实际部署请以自测为准。)

GPU 租金又涨了:Nebius 10 月起 H100/B200 随需租金上调约 20%,自建 vs 租用的天平在移动

· 阅读需 5 分钟
Industry Research Team

据芯智讯 9 月下旬报道,Nebius 宣布10 月 1 日起 H100 / H200 / B200 随需(on-demand)租金平均上调约 20%。同月,财联社报道 CoreWeave 截至 8 月 11 日已签约电力增至 4.2 GW,并将"继续以更高价格签约新算力"。这是本轮 AI 周期里租赁市场连续第 N 次提价——对采购方来说,自建与租用的 TCO 天平正在移动。本文用站内 TCO 计算器的口径拆解这笔账。


1. 涨价的三个推手​

  • agentic 推理需求爆发:从 MLPerf v6.1 到 SemiAnalysis AgentX,agentic 负载成为推理增长主引擎——token 消耗量级远超聊天场景,推理算力从"够用"变成"永远不够";
  • 新一代平台的供给溢价:Vera Rubin NVL72 已在 CoreWeave 首发上线,新平台早期产能爬坡期定价天然偏高,同时抬高上一代卡(H100/H200/B200)的续租价格锚点;
  • 电力成为硬约束:CoreWeave 4.2GW 签约电力的表述说明——数据中心供给瓶颈已从 GPU 转向电力与机架,电力在手的企业没有理由降价。

2. 租金上涨 20% 对 TCO 意味着什么​

站内 TCO 计算器把总拥有成本拆成采购 + 能耗 + 运维 + 网络 + 折现五段。租金上涨不直接进入这个模型,但它改变了"租用基准线"——即自建方案要击败的机会成本:

场景租金涨 20% 前涨 20% 后
短期弹性负载(不足 1 年)租用占优租用仍占优(自建部署周期追不上)
稳定推理负载(2-3 年)临界区自建开始占优(机会成本抬高)
训练集群(3 年+)自建占优自建优势扩大

直觉化判断:

  • 24/7 满载跑 2 年以上的负载,租金上调 20% 通常足以让自建(哪怕按 1.5 倍采购溢价、含 PUE 1.3 能耗模型)在 30 个月内反超;
  • 潮汐型负载(白天高峰、夜间空闲)仍应租用——自建方案按 15% 空闲功耗持续付费的假设下,利用率低于约 50% 时自建几乎不可能回本;
  • 混合策略(自建基线 + 租用峰值)对租金上涨的敏感度最低,是当前利率与电价环境下的稳健解。

上述结论可在 TCO 计算器中自行复算:把"云租用单价"按 +20% 输入,对比采购价、电价与 PUE 两个情景。折现率默认 8%,采购成本不折现、逐年电费按 1.08^-y 折现。

3. 国产算力的定价含义​

租金上涨对国产 AI 芯片的采购决策有一层容易被忽略的影响:

  • 国产卡的租用市场尚未成熟:昇腾 / 寒武纪 / 摩尔线程的算力主要以一体机、整机柜和智算中心配额形式交付,公开随需租价稀缺——采购对比天然偏向"自建/整机"模型;
  • 相对 TCO 变化:NVIDIA 租金上涨 20% 等于抬高了所有国产替代方案的"相对吸引力",尤其是推理负载(910C / 950PR / P800 一级市场的实际成交价未公开,但整机报价对美元卡的价格差在扩大);
  • 供给节奏:DeepSeek 押注昇腾训练、16 万颗 950DT 采购传闻——头部需求先吃掉产能,后来者的排队周期在拉长,早决策本身有价值。

4. 小结​

  • Nebius 10 月起 H100/H200/B200 随需租金 +20%;CoreWeave 签约电力 4.2GW 且继续高价锁量——租赁市场供需仍紧;
  • agentic 推理 + Rubin 供给溢价 + 电力约束,三力推高租金,且短期难回头;
  • 决策口径:稳定负载 2 年+ → 自建窗口打开;潮汐负载 → 继续租用;混合策略最抗涨价;
  • 看什么:其他云厂商是否跟进调价、Rubin 租赁的正式定价、国产算力是否出现公开租用市场。

相关阅读​

参考资料​

  • 芯智讯:Nebius 上调 AI 芯片租用价格,10 月 1 日起 H100/H200/B200 随需租金平均上涨约 20%(2026-09-21)
  • 财联社 / 东方财富:CoreWeave 推出多机架 Vera Rubin NVL72 集群,已签约电力增至 4.2 吉瓦(2026-09)

本文基于公开报道整理;TCO 结论依赖利用率、电价、折现率等假设,请以 TCO 计算器按自身参数复算为准。

DeepSeek 确认押注华为芯片训练大模型:从 16 万颗 950DT 传闻到"必须成功"的站队

· 阅读需 5 分钟
Industry Research Team

2026 年 9 月 22 日,多家媒体报道:DeepSeek CEO 明确表示公司正大力押注华为芯片,预计将收到新一批华为芯片用于大模型训练,并强调"这一选择必须成功"。这是继此前"DeepSeek 拟采购 16 万颗昇腾 950DT 跑推理"报道之后,国产算力生态迄今最重要的站队信号——从推理采购升级为训练押注。


1. 信号链:四步走到"训练押注"​

把过去半年的公开信息串起来,DeepSeek 与昇腾的合作有一条清晰的升级路径:

时间信号性质
2026 年中DeepSeek V4 完成从 CUDA 到 CANN 的生态迁移软件适配
2026 年 8 月报道:DeepSeek 拟采购 16 万颗昇腾 950DT 部署推理推理采购意向
2026-09-17HC2026:960DT 提前三个季度就绪,950DT Q4 放量供给兑现
2026-09-22DeepSeek CEO:押注华为芯片训练大模型,"必须成功"训练押注

关键变化是负载等级:推理部署是"用现成算力降本",训练押注则是"把下一代模型的存在性押在国产芯片上"——训练集群对稳定性、互联效率、软件栈成熟度的要求高一个量级。

2. 华为侧的兑现能力​

DeepSeek 敢于站队,背后是华为供给侧一系列可核验的进展(均为官方口径):

  • 一年一代兑现:950PR 已量产、950DT 2026 Q4 放量、960DT 从原计划 2027 Q4 提前三个季度至 2027 Q1 就绪 / Q2 上市——路线图可信度连续两次验证;
  • 部署规模:昇腾超节点已规模商用超 1000 套,覆盖互联网、金融、医疗、制造;
  • 生态成熟:CANN 进入常态化开源运营,外部开发者占比首次超过 61%,月活开发者 5200 人;基于昇腾的原生训练模型超过 40 个,是国内唯一支持预训练的技术路线;
  • 训练证据链:中国电信 9 月开源的星(Xing)4.0-29B-A4B agentic MoE 模型宣布在昇腾上端到端训练(公司口径)——昇腾"能训大模型"不再只有华为自证。

规格详见昇腾 950DT 与昇腾 960 规格页;超节点分析见昇腾 960 官宣发布。

3. 为什么是 DeepSeek?​

DeepSeek 的选择有强结构性动因:

  1. 供给确定性:在出口管制约束下,NVIDIA 旗舰对华供给持续收紧;国产算力是唯一可规划的大规模训练供给;
  2. 成本结构:DeepSeek 一贯以极致工程效率著称(V3 训练成本即为业内标杆),国产算力叠加超节点系统效率符合其路线;
  3. 对赌生态红利:CANN 开源 + 头部模型厂商深度绑定,模型厂商可以参与定义工具链走向——这在 CUDA 封闭体系内不可能发生;
  4. 示范效应自我实现:头部实验室公开站队会反向拉动华为产能排期、上游 HBM 与整机的投入,"必须成功"因此是理性承诺而非口号。

4. 风险与待验证项​

冷静看,这条路线仍有三处需要时间验证:

  • 实际训练规模:新一批芯片的数量、型号(950DT 还是 960DT)、交付节奏均未披露;
  • MFU 口径:华为给出的 MFU / 时延收益均出自马尔科夫实验室仿真,尚无独立第三方实测;训练集群的真实有效算力要看大规模生产环境的长期数据;
  • 单卡代差:960DT FP4 4 PFLOPS 对比 Rubin R200 的 50 PFLOPS(FP4),单卡代差客观存在——训练效率取决于超节点规模与软件优化能否补足,这正是"系统级竞争"的胜负手。

5. 小结​

  • DeepSeek 确认押注华为芯片训练大模型——国产算力首个头部实验室训练级站队;
  • 信号链:CUDA→CANN 迁移 → 16 万颗 950DT 推理采购传闻 → 960 提前就绪 → 训练押注;
  • 支撑面:一年一代兑现、超节点 1000+ 套、CANN 开源生态外部开发者 61%;
  • 看什么:新一批芯片的实际到货与训练集群规模、第三方 MFU 数据、下一次 DeepSeek 发版的训练算力披露。

相关阅读​

参考资料​

  • 今日头条·今日科技早报:DeepSeek 确认押注华为芯片用于大模型训练(2026-09-22)
  • 华为全联接大会 2026 官方发布(2026-09-17)
  • 此前报道:DeepSeek 拟采购 16 万颗昇腾 950DT(2026-08)

本文基于公开报道与厂商官方口径整理。芯片数量、训练集群规模等细节以 DeepSeek 与华为后续披露为准。

国产算力生态一周三信号:中国电信开源昇腾训练模型、浪潮 128 卡推理一体机、奕行智能融资 20 亿

· 阅读需 5 分钟
Industry Research Team

昇腾 960 官宣、真武 V900 发布之外,9 月下旬还有三条容易被头条淹没、但结构性意义不输旗舰芯片的生态信号:运营商开源昇腾训练的模型、整机厂交付百卡级国产推理系统、初创公司拿到云端算力芯片的新一轮融资。本文逐条拆解。


1. 中国电信开源 Xing4.0:昇腾端到端训练的运营商级背书​

9 月 23 日(报道时间),中国电信开源 Xing4.0-29B-A4B——一个 agentic 混合专家(MoE)模型,公司口径宣布在华为昇腾加速器上端到端训练。

为什么重要:

  • "能训"的第三方证据:过去"昇腾能不能训大模型"主要靠华为自证(原生训练模型 40+);运营商以自己的数据、工程团队和集群跑通训练并开源,是第一个非华为体系的规模化训练案例;
  • agentic 定位:29B-A4B(29B 总参 / 4B 激活)的 MoE 形态直接面向 agent 工作负载——与 DeepSeek、Qwen 的开源节奏对齐,而非试验性小模型;
  • 开源外溢:模型权重 + 训练配方公开,意味着昇腾上的训练工程经验可以复用到其他机构——这正是生态扩散的标准动作。

配合华为侧披露的"CANN 进入常态化开源运营、外部开发者占比 61%",昇腾生态正从"厂商主导"转向"社区运营"。

2. 浪潮 MetaBrain SD200 Ultra:128 颗国产芯片的推理吞吐实测口径​

浪潮同期发布 MetaBrain SD200 Ultra 推理系统:

指标数值(公司口径)
国产 AI 芯片128 颗(厂商未披露具体型号)
服务模型Kimi K3
Token 吞吐2.8T tokens(该口径下的系统吞吐成绩)
时延5.85 ms

三个读数:

  • 百卡级系统集成:128 卡异构协同跑超大规模 MoE 推理,考验的是互联拓扑、调度与容错——整机厂把国产芯片"攒成大系统"的能力已经就位;
  • 面向头部开源模型:以 Kimi K3(已上线 AWS Bedrock)为目标负载,说明国产推理系统的验收标准是"跑通当下最受欢迎的模型",而非自说自话的 demo;
  • 注意口径:2.8T token 吞吐与 5.85ms 时延均为厂商宣称,测试模型版本、并发与批尺寸未披露,采购评估时需按实际负载复测。

3. 奕行智能 B+ 轮 20 亿元:云端算力芯片赛道仍在加注​

奕行智能(EVAS)完成 B+ 轮 20 亿元融资,投后估值近 150 亿元,和利资本追投;此前上半年已完成 15 亿元 B 轮并引入中国移动战略投资。公司主攻新一代云端算力芯片。

在旗舰芯片格局(昇腾 / 寒武纪 / 摩尔线程 / 海光 / 真武)看似已定的 2026 年,云端算力芯片新势力仍能拿到 20 亿级融资,说明:

  • 一级市场对"国产算力第二梯队"的需求判断:头部厂商产能排期到 2027 年,溢出需求给了新势力窗口;
  • 运营商战投的角色:中国移动既是采购方也是投资方,国产算力的需求侧在用资本锁定供给侧;
  • 云端推理 DSA 路线的差异化空间仍在(参考清微、后摩等路线的生态卡位)。

4. 一周信号拼图:闭环正在成形​

把三条信号与本月旗舰发布拼在一起,国产算力的产业闭环每一段都有人补位:

环节本月证据
旗舰芯片昇腾 960 提前官宣(9-17)、真武 V900 发布(9-22)
训练验证中国电信 Xing4.0 昇腾端到端训练并开源、DeepSeek 押注昇腾训练
推理系统浪潮 SD200 Ultra 128 卡跑 Kimi K3
软件生态CANN 常态化开源、外部开发者 61%
资本供给奕行智能 B+ 轮 20 亿(投后近 150 亿)
需求侧DeepSeek 站队、Kimi K3 上线海外云平台

"芯片—系统—模型—资本"四段都有独立玩家在投入,这是与 2024-2025 年"单点突破"最大的不同。

5. 小结​

  • 中国电信 Xing4.0-29B:首个非华为体系的昇腾端到端训练开源模型;
  • 浪潮 SD200 Ultra:128 颗国产芯片推理系统,2.8T token 吞吐 / 5.85ms(公司口径,待复测);
  • 奕行智能 20 亿 B+ 轮:云端算力芯片第二梯队仍在获得真金白银;
  • 看什么:Xing4.0 的训练集群规模与 MFU、SD200 Ultra 的第三方复测、奕行智能流片节奏。

相关阅读​

参考资料​

  • The GPU Daily(2026-09-24):China Telecom open-sources Xing4.0-29B;Inspur MetaBrain SD200 Ultra
  • 今日头条:奕行智能完成 B+ 轮 20 亿元融资,投后估值近 150 亿元(2026-09-21)
  • CSDN·AI 日报(2026-09-21):华为 CANN 常态化开源运营、OceanStor M900 发布

本文基于公开报道整理。Xing4.0 训练细节与 SD200 Ultra 性能数据均为公司口径,测试条件以后续披露为准。

阿里真武 V900 云栖大会发布:性能 3 倍于 M890、216GB 显存、50 万卡集群,2027 Q1 量产

· 阅读需 6 分钟
Industry Research Team

继华为 9 月 17 日全联接大会官宣昇腾 960 之后仅五天,9 月 22 日阿里巴巴在杭州云栖大会发布新一代训推一体 AI 芯片真武 V900——阿里称之为"目前算力性能最强的中国自研 AI 芯片"。本文基于阿里官方发布口径与新浪科技、C114、环球网等多方报道整理。


1. 单芯片:3 倍于 M890,216GB + 1200GB/s​

指标真武 V900(本次发布)真武 M890(上一代)
性能真武 M890 的 3 倍(官方口径,绝对值未公布)FP16 600 TFLOPS(本站收录)
显存216 GB144 GB(HBM3)
片间互联1200 GB/s—
精度原生 FP8 / FP4(含高精度训练)—
定位训推一体(万亿级参数训练 + 低精度推理)训推一体
量产2027 Q1,阿里云数据中心规模化部署已规模应用

三个读数:

  • 显存跨入 200GB+ 区间:216GB 与昇腾 960DT(288GB 自研 HBM)、NVIDIA Rubin(288GB HBM4)站上同一容量档位,长上下文与超大 MoE 模型的容量门槛被拉平;
  • 片间互联 1200GB/s:为超节点"内存语义互联"打底——这是与 ICN Switch 配套的芯片级前提;
  • 精度覆盖全场景:官方表述为"高精度训练、低精度和超低精度推理的全场景",FP8/FP4 原生支持与 2026 年新卡通用口径对齐。

单芯片绝对算力数值官方未公布,本站以"3 倍于 M890"的官方相对口径收录;M890 规格详见真武 M890 规格页。

2. 系统级:ICN Switch + 磐久超节点,单集群 50 万卡​

V900 的真正卖点不在单芯片,而在系统级协同:

  • ICN Switch 自研互联芯片:连接后的超节点具备原生内存语义与内存统一编址能力,千卡全带宽高速互联——上千颗 V900 可"像一颗超级芯片一样协同工作";
  • 磐久超节点服务器:集成 V900(算力)+ ICN Switch(互联)+ 磐脉智能网卡(网络)+ 镇岳 SSD 主控(存储),算、存、网全栈自研协同;
  • 50 万卡单集群:结合阿里云新一代智算中心网络架构,单一集群可扩展至 50 万卡规模。

这与华为"11 颗关键芯片"的思路如出一辙:竞争单位已经从单芯片转向整套系统的交付能力——真武管算力、倚天管通用计算、磐脉管网络、镇岳管存储、ICN Switch 管互联。

3. 商业与路线图​

  • 真武系列已服务超 650 家企业客户(截至 2026 年 6 月),覆盖智驾、金融、大模型、具身智能、能源、制造;
  • 基于 M890 的超节点已大规模应用,跑通 Qwen3.8、Kimi K3 等超 2 万亿参数模型;阿里云 Q4 新增服务节点扩大超节点供给;
  • 路线图:V900 于 2027 Q1 量产售卖;真武 J900 计划 2027 Q3 发布;
  • CPU 协同:2027 年推出倚天 720 / 730(730 首次采用平头哥全自研 CPU 微架构,单核 SPECint2017/GHz 最高达倚天 710 的 1.4 倍);2029 年的倚天 750 将通过 ICN 总线与真武 AI 芯片直接互联;
  • 阿里巴巴集团 CEO 吴泳铭表示,平头哥 AI 芯片年出货量将大幅提升。

4. 竞争坐标:同一周,两把剑​

把 9 月中旬的两次发布放在一起看,国产 AI 芯片的"系统级竞争"格局已经清晰:

维度华为昇腾 960(9-17)阿里真武 V900(9-22)
发布节点HC2026云栖大会 2026
单卡显存288GB(自研 HBM)216GB
访存带宽9.6 TB/s未披露
互联灵衢 UnifiedBus / NPO 光互联ICN Switch 内存语义互联
超节点昇腾 960 超节点(4096 卡,8 EFLOPS FP8)磐久超节点(单集群 50 万卡)
上市2027 Q22027 Q1

华为走"超节点 + 开源 CANN 生态"路线,阿里走"云上全栈 + 开源模型生态"路线;单卡规格都仍有代差,但交付的是可采购、可运维的超大规模集群。对英伟达 CUDA 生态的替代逻辑,正在从"性能对标"转向"供给确定性 + 系统效率"。

5. 小结​

  • V900:3×M890、216GB、1200GB/s 片间互联、原生 FP8/FP4,2027 Q1 量产;
  • 系统:ICN Switch 千卡全带宽、磐久超节点算存网全栈、单集群 50 万卡;
  • 节奏:J900 2027 Q3、倚天 730 2027、倚天 750 2029——平头哥首次给出三年代际路线;
  • 看什么:2027 Q1 实际量产与阿里云部署规模、V900 绝对算力披露、ICN Switch 对外供货的可能性。

相关阅读​

参考资料​

  • 环球网:平头哥发布新一代训推一体 AI 芯片真武 V900(2026-09-22)
  • 新浪科技 / TechWeb:阿里平头哥发布新一代 AI 芯片真武 V900,2027 年第一季度量产
  • C114:阿里发布新一代 AI 芯片真武 V900,2027Q1 量产

本文基于阿里巴巴官方发布与公开报道整理。V900 单芯片绝对算力官方未公布;超节点与集群规模为官方口径,以未来实际交付为准。

京东云十万卡集群押注摩尔线程:国产 GPU 首次进入头部 AI 云核心算力底座

· 阅读需 5 分钟
Industry Research Team

本文基于 2026 京东全球科技探索者大会(9 月 9 日)官方发布及公开市场信息整理;订单金额与收入预测为券商/媒体口径,非公司公告。

9 月 9 日,2026 京东全球科技探索者大会上,京东云宣布了一个里程碑式的决定:与摩尔线程共建十万卡全功能 GPU 集群,打造超大规模国产智算基础设施。

这句话有两个关键词值得放大:「全功能 GPU」和「十万卡级核心集群」。前者意味着它要跑的不只是推理,而是大模型训练、推理与具身智能的正面战场;后者意味着国产 GPU 第一次被头部 AI 云企业放进了算力底座的核心位置——不是试点、不是适配、不是一体机,而是十万卡。

一、合作细节:从万卡到十万卡,订单规模多大?​

  • 此前基础:京东云已与摩尔线程等伙伴建成国产万卡集群,本次是从万卡到十万卡的量级跃迁
  • 订单规模:据市场与券商信息,GPU 模组由摩尔线程独家供应,订单总价值约 200-300 亿元,按交付节奏明年即可确认收入;部分券商将摩尔线程明年收入预期上修至 150-200 亿元(该口径非公司公告,请以官方披露为准)
  • 合作深度:从芯片、云平台到模型训练的全栈协同,支撑京东 JoyAI 模型族迭代,形成「数据 → 训练 → 仿真 → 部署」闭环
  • 开放性:算力面向全行业开放,聚焦大模型训练、推理及具身智能

摩尔线程创始人张建中在会上的表态很直接:「Scaling Law 仍然成立——十万卡集群是必然趋势。」京东云总裁曹鹏则把国产算力定义为京东物理 AI 战略的核心支柱。

二、为什么是摩尔线程?采购逻辑的三笔账​

科技公司买卡没有情怀,京东选择摩尔线程,本质是三笔账都算得过来:

1. 稳定性账:摩尔线程已在单一网络下完成千卡、万卡级大集群的商业部署,并在基础模型、具身大脑、世界模型等核心训练场景取得突破——万卡集群的工程验证是十万卡的前提,这不是冷启动。

2. 集成账:全功能 GPU 可以接入现有 IT 体系与云平台调度,MUSA 软件栈对大模型框架的适配已跑通训练级负载。

3. ROI 账:这是最关键的转变。过去国产 GPU 的买家多是「政策友好型」项目,而京东把十万卡集群写进资本开支,意味着产品回报率开始经得起投资者测算——买家结构从「敢用」变成「抢着用」,才是国产 GPU 商业成熟的标志。

三、S6000:下一代芯片已回片,供应链双保险​

据市场信息,摩尔线程下一代芯片 S6000 已顺利回片并分发厂商测试,FAB 与内存供给保障充足。需要说明的是:S6000 尚未正式发布,规格未公开,本文不作猜测;当前在售旗舰 MTT S5000 的站内数据为 FP16 400 TFLOPS、80GB 显存(1.6TB/s 带宽为 HBM 级)。

对 HBM 供给约束,摩尔线程的应对策略据称是「下一代产品迭代 + 供应链多源保障」——在国产 HBM 产能爬坡完成前,这是所有国产 GPU 厂商必须解的同一道题。

四、「十万卡」不是一家的事:国产 GPU 集群竞争格局​

值得把视野拉开——十万卡已是国产算力的集体目标:

玩家十万卡动作算力底座
京东云9 月 9 日宣布共建十万卡集群摩尔线程全功能 GPU
曙光 80007 月 WAIC 发布,郑州落成,全国产十万卡 AI 算力集群海光 DCU(深算 BW1000 一系)
华为Atlas 950 SuperPoD 超节点(8192 卡),2027 年十万卡超节点昇腾 950/960

两家芯片路线(全功能 GPU vs DCU vs NPU)、两条路径(商业云 vs 国家超算),指向同一个验证命题:国产算力能不能在十万卡规模上稳定跑通真实训练负载。 值得强调的是,目前摩尔线程×京东集群尚无公开的第三方基准对比,没有完工时间表——十万卡的「可用」到「跑好」,仍需工程验证。

五、资本市场视角​

摩尔线程 2025 年 12 月登陆科创板:发行价 114.28 元,首日收于 600.5 元;2025 年营收 15.05 亿元(同比 +243.37%),净亏损约 10.01 亿元。若券商上修的 150-200 亿元收入预期兑现,2027 年将是从「高成长亏损」转向「规模盈利」的关键节点——这也将成为国产 GPU 商业模式的第一份完整答卷。

小结​

从 2025 年跟 DeepSeek 一体机「出道」,到 2026 年进入十万卡核心集群,国产 GPU 用了不到两年走完从「能用」到「规模化商用」的认知跃迁。京东云这张订单的价值不在金额,而在样本意义:当互联网头部买家开始用 ROI 逻辑采购国产 GPU,替代就不再是政策叙事,而是商业事实。

(订单金额、收入预测与供应链状态来自公开市场信息与券商研报口径,请以公司公告为准;芯片规格数据见站内完整对比表。)

昇腾 960 官宣发布:FP4 算力翻倍、全球首个 NPO 超节点,华为确认一年一代

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月 17 日,华为全联接大会(HC2026),华为常务董事、ICT 基础设施业务总裁汪涛正式发布昇腾 960。与 8 月数字中国峰会上的"路线图预告"不同,这次是完整的规格官宣——而且提前三个季度就绪。本文基于华为官网新闻稿及多方报道整理,逐项拆解 960 的规格、超节点与路线图含义。


1. 昇腾 960:双版本,训练先行​

昇腾 960 分为两个版本,节奏错开一个季度:

指标昇腾 960DT(训练版)昇腾 960PR(推理版)
FP8 算力2 PFLOPS(较 950 翻倍)待披露
FP4 算力4 PFLOPS待披露
显存288GB(自研 HBM)待披露
显存带宽9.6 TB/s待披露
配套超节点Atlas 860(风冷)Atlas 960(液冷)
就绪 / 上市2027 Q1 / 2027 Q22027 Q3

三个读数:

  • 提前三个季度就绪:960DT 原计划 2027 年 Q4,现在 2027 Q1 就绪、Q2 上市——与 950DT"提前上线华为云"一脉相承,路线图可信度在持续兑现;
  • 精度口径与英伟达对齐:FP8 / FP4 主口径(辅以自研 HiF8 / HiFP8),FP4 已是 2026 新卡的通用口径;
  • 288GB 自研 HBM + 9.6TB/s:显存容量与带宽同步翻倍,对训练长上下文大模型是实打实的容量红利。

单卡规格详见昇腾 960 规格页;上一代昇腾 950DT 规格页。

2. 昇腾 960 超节点:全球首个 NPO 超节点​

这是本场发布真正的"重器"——昇腾 960 超节点是全球第一个采用 NPO(近封装光学)的超节点:

指标昇腾 960 超节点
单节点规模4096 卡
系统算力8 EFLOPS FP8 / 16 EFLOPS FP4
HBM 总容量1 PB
互联 RTT低至 2μs
可用度99.8%

NPO 意味着什么:传统光模块挂在交换机面板上,信号要先出封装再转电—光;NPO 把光引擎挪到交换芯片封装近旁,大幅缩短 SerDes 距离、降低功耗与时延。华为的具体数字:

  • 5500 个自研 Hi-ONE 光引擎(业界首个量产 NPO,单引擎 7.2T);
  • 替代 4.8 万颗 800G 光模块;
  • 降低功耗 550kW 以上,同时支撑 2μs 级互联时延。

对比 8 月数字中国峰会的口径(Atlas 960 单超节点 15488 卡),官方最新口径为单超节点 4096 卡(1 个超集群可由多超节点组成)——以华为官网最新新闻稿为准。

⚠️ 华为还给出了"MFU 提升 2.75 倍""推理时延降低 70%"等收益数据,均出自华为马尔科夫实验室仿真,尚无独立第三方实测,阅读时注意口径。

3. 一年一代:970(2028)→ 980(2029)​

华为首次把"一年一代"从愿景变成官宣承诺:

年份产品状态
2026昇腾 950 系列950PR 已量产,950DT Q4 放量
2027昇腾 960本次官宣,提前就绪
2028昇腾 970HC2026 确认
2029昇腾 980HC2026 确认

支撑这一节奏的是华为提出的"韬定律":算力规格每代翻倍,访存带宽、访存容量、互联带宽同步大幅提升。

生态侧的同场数据也值得记录:CANN 外部开发者占比首次超过 61%、月活开发者 5200 人;910C 超节点部署已超 1000 套。

4. 竞争坐标:单卡有代差,系统级对打​

把 960DT 放到 2027 年的棋盘上看:

  • 对 NVIDIA Rubin(R200:288GB HBM4 / 50 PFLOPS FP4):单卡 FP4 算力约为 R200 的 8%(4 vs 50 PFLOPS),单卡代差客观存在;但 4096 卡超节点 + NPO 互联是系统级竞争——用"可交付的超大集群"对打单卡性能;
  • 对采购方:960 的价值主张是"在国产量产约束内拿到最大可用集群"。DeepSeek 拟采购 16 万颗 950DT 跑推理的订单已经证明:当供给与生态到位,头部实验室愿意主动选国产;
  • 对国产链条:950→960 的显存翻倍直接拉动国产 HBM 迭代,这是整条链的胜负手。

5. 小结​

  • 960DT:FP8 2P / FP4 4P、288GB HBM、9.6TB/s,2027 Q2 上市,提前三个季度;
  • 960 超节点:全球首个 NPO 超节点,4096 卡 / 8 EFLOPS FP8 / 1PB HBM / RTT 2μs;
  • 路线图:一年一代官宣至 2029,950、960 均提前兑现,规划可信度显著上升;
  • 看什么:2027 Q2 实际交付节奏、国产 HBM 产能、CANN 生态的第三方模型覆盖度。

相关阅读​

参考资料​

  • 华为官网:发布全球首个采用 NPO 的超节点(昇腾 960 超节点)(2026-09-17)
  • 电子工程专辑:国产 AI 芯片新突破!华为昇腾 960 芯片将提前发布
  • 环球网:华为全联接大会 2026 主题演讲报道

本文基于华为官网新闻稿与公开报道整理。MFU、时延等收益数据为华为实验室仿真口径;2028 / 2029 产品仅为路线图官宣,规格以未来发布为准。

Vera Rubin NVL72 MLPerf v6.1 首秀:Qwen3-VL 吞吐 3.7 倍于 GB300,CoreWeave 同日上线多机架集群

· 阅读需 5 分钟
Industry Research Team

9 月 16 日,MLCommons 公布 MLPerf Inference v6.1 Closed Division 结果,NVIDIA Vera Rubin NVL72 完成基准首秀。同一天,CoreWeave 宣布在自家云上上线多机架 Vera Rubin 集群——"新硬件首发即可租用"的节奏,正在把新一代算力从发布到可计费产出的周期压缩到季度级别。


1. 首秀成绩:3.7 倍与 2.5 倍​

NVIDIA 以预览提交(entries 6.1-0106 / 6.1-0074)给出两代旗舰的同口径对比:

基准模型Vera Rubin NVL72 vs GB300 NVL72软件栈
Qwen3-VL-235B-A22B(235B 多模态 MoE)吞吐最高 3.7 倍(离线 / 服务器 / 交互三场景)vLLM + NVIDIA Dynamo
DeepSeek-R1-671B(671B 推理模型)吞吐最高 2.5 倍TensorRT-LLM

支撑数字的三项技术:

  • NVFP4 精度:压缩模型权重、注意力张量与 KV Cache 的显存占用,等效批尺寸显著提升;
  • 分离式服务(Disaggregated Serving):prefill(算力密集)与 decode(带宽密集)拆到不同 GPU 池独立优化;
  • 专家并行:MoE 专家层跨卡分布式路由,配合第六代 NVLink / NVLink Switch(NVIDIA 宣称包速率较现成以太网高 10 倍、时延低 3 倍)。

2. 同场亮点:扩展效率与软件红利​

  • GB300 四机架 288 卡 99% 扩展效率:DeepSeek-R1 离线场景下,从单机架 72 卡扩展到 4 机架 288 卡几乎无折损(entries 6.1-0073 / 6.1-0074)——机架级互联的扩展效率第一次在 288 卡规模上得到验证;
  • 软件仍在释放红利:同一 GB300 硬件上,v6.1 软件优化较 v6.0 带来最高 1.6 倍 Qwen3-VL 提升;NVIDIA 还报告了 GPT-OSS-120B 与 DLRMv3 的提交后增益(未经 MLCommons 验证);
  • 19 家合作伙伴提交,其中 8 家采用多节点 Blackwell NVL72 配置(ASUS、Azure、Cisco、CoreWeave、Crusoe、Dell、Fujitsu、HPE、Lambda、Nebius、OCI、Supermicro 等);Nebius 也提交了 Vera Rubin 预览成绩。

3. CoreWeave 同日上线:首发即可租用​

CoreWeave 在 MLPerf 结果公布同日宣布其云上多机架 Vera Rubin NVL72 集群上线:

  • Spectrum-X 网络将数百颗 Rubin GPU 组成单一横向扩展集群,每颗 GPU 配 2 颗 ConnectX-9 SuperNIC(1.6Tb/s 横向扩展带宽);
  • AI 对象存储 LOTA 将读取时延降低 8 倍;
  • 运维侧:Valvey 软件定义液冷(NVIDIA 规格 45°C 液冷进液)、Racky 机架控制层与 Rack LifeCycle Controller 把整个 NVL72 机架当作单一可编程实体管理;
  • 此前 7 月,CoreWeave 自测 Vera Rubin 对 GB200 NVL72 在 DeepSeek R1 上达到 10 倍 tokens/s/MW(公司口径,非 MLCommons 验证)。

4. 竞争侧写​

  • AMD + Crusoe:以 512 卡创下 575 万 tokens/秒的 MLPerf 历史最高聚合吞吐(AMD 本轮提交覆盖面最广);
  • SemiAnalysis AgentX 预览:Vera Rubin 在 agentic 负载上较 GB300 最高 30 倍(预览口径);MLPerf Endpoints 基准 forthcoming,将把 agentic 推理纳入标准化测量;
  • 待验证项:Vera Rubin 成绩为预览提交、尚待独立复现;NVFP4"几乎无损"未给出量化质量指标;每 token 成本与功耗的规模化对比数据均未公布。Google TPU v7 与 AMD MI455X UALoE72 的对标提交预计 2026 年内出现。

站内规格对照:Rubin R200(288GB / 22TB/s)、B300 Ultra(GB300 核心)。

5. 小结​

  • Vera Rubin NVL72 首秀:Qwen3-VL 3.7 倍、DeepSeek-R1 2.5 倍于 GB300 NVL72(预览口径);
  • GB300 四机架 288 卡 99% 扩展效率,机架级互联进入可用区间;
  • CoreWeave 同日多机架上线——新一代算力从发布到可计费的周期进入季度级;
  • 看什么:独立复现与正式(非预览)提交、TPU v7 / MI455X 对标结果、每 MW 实测 token 产能。

相关阅读​

参考资料​

  • NVIDIA Blog:Vera Rubin NVL72 首度亮相 MLPerf Inference v6.1(2026-09-16)
  • MLCommons:MLPerf Inference v6.1 Closed Division 结果(entries 6.1-0073 / 6.1-0074 / 6.1-0106)
  • CoreWeave 投资者关系:多机架 Vera Rubin NVL72 上线公告(2026-09-16)
  • AMD Blogs:MLPerf Inference v6.1 提交结果

本文基于 MLCommons 公开结果与厂商官方口径整理。Vera Rubin 成绩为预览提交,部分增益数据未经 MLCommons 验证,已逐项标注。