跳到主要内容

11 篇博文 含有标签「Product Launch」

Official releases and first reviews of new AI chips / GPUs / ASICs

查看所有标签

Groq 3 LPX 全面量产:三星 4nm 代工、单机架 315 PFLOPS FP8,英伟达把 LPU 变成 Vera Rubin 的第七颗芯片

· 阅读需 5 分钟
Industry Research Team

本文基于 NVIDIA 官方产品页、2026 年 3 月 GTC 架构博客及第三方基准数据整理;性能口径为厂商架构对比,实际收益需以自测为准。

英伟达确认,Groq 3 LPX——Vera Rubin 平台的「第七颗芯片」——已进入全面量产,由三星平泽园区代工。这是继 2025 年 12 月英伟达斥资约 200 亿美元获得 Groq 非独占 IP 授权与核心工程团队之后,这笔交易第一次以量产硅的形式落地。

对推理硬件格局而言,这是一次范式级事件:英伟达第一次把「别家定义的专用推理架构」纳入自家旗舰平台,且不是外挂销售,而是深度协同设计。

一、Groq 3 LPU 芯片与 LPX 机架:规格速览​

单颗 Groq 3 LPU(4nm,三星代工):

项目数值
编译器管理的片上 SRAM500 MB
SRAM 带宽150 TB/s
片间 scale-up 带宽2.5 TB/s(96 条 chip-to-chip 链路,每条 112 Gbps)

单个 LPX 机架(32 个 1U 液冷托盘,每托盘 8 颗 LPU):

项目数值
LPU 总数256 颗
FP8 算力315 PFLOPS
片上 SRAM 总量128 GB
SRAM 聚合带宽40 PB/s
机架内 scale-up 带宽640 TB/s
DDR5 内存12 TB(承载大模型权重)

每颗 LPU 500MB 的 SRAM 看起来不大,但乘上 256 颗、再叠加 40PB/s 的聚合带宽,构成了「确定性低延迟解码」的物理基础——LPU 的设计哲学正是用编译器静态调度片上 SRAM,彻底消除推理解码阶段的内存取数停顿,而这恰恰是 GPU 推理最典型的瓶颈。

二、AFD:注意力与 FFN 分家,GPU 和 LPU 各干各的​

LPX 不是替代 GPU,而是与 Vera Rubin NVL72 组成异构系统,核心是 AFD(Attention-FFN Disaggregation,注意力-前馈解耦):

  1. Rubin GPU 负责 prefill 与 attention——在大上下文上构建 KV cache、执行注意力层,吃 HBM 容量与高吞吐;
  2. Groq 3 LPU 负责 FFN / MoE 专家层解码——延迟敏感、模式可预测,恰好是 SRAM 确定性调度的主场;
  3. 中间激活在两个引擎间逐 token 交换,由 NVIDIA Dynamo 编排路由,GPU 算每一层注意力,LPU 算每一层前馈,协同完成每个输出 token。

这套分工的逻辑很清晰:智能体应用消耗的 token 量可达传统 AI 应用的 15 倍,瓶颈从「能不能算完」变成「能不能以稳定低延迟持续吐 token」。让 HBM 大容器去跑 attention、让 SRAM 确定性引擎去跑 decode,各取所长。

三、实测与官方口径​

  • 第三方实测(Artificial Analysis):Gemma 4 31B、100K token 上下文下,LPX 输出约 3400 tokens/s——单 token 间隔低于 1 毫秒,长上下文智能体场景的交互感质变
  • 官方架构对比:与 LPX 组合后,Vera Rubin NVL72 对万亿参数模型的每兆瓦吞吐最高提升 35 倍;「高价值 token」场景下每瓦收入机会最高 10 倍
  • 首发客户:Nebius 率先部署 LPX 机架扩展其 token 产能;CoreWeave 已在生产环境用 Spectrum-X Multiplane 连接 Vera Rubin 机架

需要强调:35 倍/10 倍是特定高交互工作点的架构对比数字,不是普适结论。训练、大吞吐批量推理、需要 CUDA 生态灵活性的负载,GPU 仍是正解;LPX 的主场是「单用户交互延迟即产品」的场景——智能体循环、实时编码助手、长上下文对话。

四、三个行业信号​

1. 专用推理芯片被收编,而非对抗。 过去 LPU 是「GPU 挑战者」的叙事,现在变成了 Vera Rubin 的组成部分。推理硬件的终局可能不是一种架构赢,而是「GPU + 专用解码引擎」的异构组合成为标配。对其他推理芯片创业公司(Cerebras、Etched 等),这既是天花板抬高的证明,也是「要么被集成、要么找差异化」的警示。

2. 三星代工拿到高端 AI 订单。 在台积电几乎垄断 AI 主芯片的背景下,三星 4nm 承接 LPX 量产意义重大——叠加此前特斯拉 AI6 的 2nm 订单,三星代工有望在 2027 年重回全年盈利。

3. 推理经济性进入「按 MW 定价」时代。 当厂商开始用 tokens/MW 和每瓦收入讲故事,算力选型的核心 KPI 已经从峰值算力(TFLOPS)彻底转向单位能耗的 token 产出。这与我们在 TCO 计算器 里内置的功耗-电费模型逻辑一致:峰值参数好看的芯片,未必是每 token 成本最低的芯片。

小结​

Groq 3 LPX 量产标志着推理硬件进入「GPU 管吞吐、LPU 管延迟」的异构时代。对于正在选型推理集群的团队,建议把工作负载拆开评估:批量离线推理留在 GPU,交互式长上下文智能体值得单独测算 LPX 类方案的单位成本。拿不准的话,先用 TCO 计算器 跑一遍两种架构的 3 年持有成本再拍板。

(本文性能数据来自 NVIDIA 官方架构对比与 Artificial Analysis 第三方实测,实际部署请以自测为准。)

阿里真武 V900 云栖大会发布:性能 3 倍于 M890、216GB 显存、50 万卡集群,2027 Q1 量产

· 阅读需 6 分钟
Industry Research Team

继华为 9 月 17 日全联接大会官宣昇腾 960 之后仅五天,9 月 22 日阿里巴巴在杭州云栖大会发布新一代训推一体 AI 芯片真武 V900——阿里称之为"目前算力性能最强的中国自研 AI 芯片"。本文基于阿里官方发布口径与新浪科技、C114、环球网等多方报道整理。


1. 单芯片:3 倍于 M890,216GB + 1200GB/s​

指标真武 V900(本次发布)真武 M890(上一代)
性能真武 M890 的 3 倍(官方口径,绝对值未公布)FP16 600 TFLOPS(本站收录)
显存216 GB144 GB(HBM3)
片间互联1200 GB/s—
精度原生 FP8 / FP4(含高精度训练)—
定位训推一体(万亿级参数训练 + 低精度推理)训推一体
量产2027 Q1,阿里云数据中心规模化部署已规模应用

三个读数:

  • 显存跨入 200GB+ 区间:216GB 与昇腾 960DT(288GB 自研 HBM)、NVIDIA Rubin(288GB HBM4)站上同一容量档位,长上下文与超大 MoE 模型的容量门槛被拉平;
  • 片间互联 1200GB/s:为超节点"内存语义互联"打底——这是与 ICN Switch 配套的芯片级前提;
  • 精度覆盖全场景:官方表述为"高精度训练、低精度和超低精度推理的全场景",FP8/FP4 原生支持与 2026 年新卡通用口径对齐。

单芯片绝对算力数值官方未公布,本站以"3 倍于 M890"的官方相对口径收录;M890 规格详见真武 M890 规格页。

2. 系统级:ICN Switch + 磐久超节点,单集群 50 万卡​

V900 的真正卖点不在单芯片,而在系统级协同:

  • ICN Switch 自研互联芯片:连接后的超节点具备原生内存语义与内存统一编址能力,千卡全带宽高速互联——上千颗 V900 可"像一颗超级芯片一样协同工作";
  • 磐久超节点服务器:集成 V900(算力)+ ICN Switch(互联)+ 磐脉智能网卡(网络)+ 镇岳 SSD 主控(存储),算、存、网全栈自研协同;
  • 50 万卡单集群:结合阿里云新一代智算中心网络架构,单一集群可扩展至 50 万卡规模。

这与华为"11 颗关键芯片"的思路如出一辙:竞争单位已经从单芯片转向整套系统的交付能力——真武管算力、倚天管通用计算、磐脉管网络、镇岳管存储、ICN Switch 管互联。

3. 商业与路线图​

  • 真武系列已服务超 650 家企业客户(截至 2026 年 6 月),覆盖智驾、金融、大模型、具身智能、能源、制造;
  • 基于 M890 的超节点已大规模应用,跑通 Qwen3.8、Kimi K3 等超 2 万亿参数模型;阿里云 Q4 新增服务节点扩大超节点供给;
  • 路线图:V900 于 2027 Q1 量产售卖;真武 J900 计划 2027 Q3 发布;
  • CPU 协同:2027 年推出倚天 720 / 730(730 首次采用平头哥全自研 CPU 微架构,单核 SPECint2017/GHz 最高达倚天 710 的 1.4 倍);2029 年的倚天 750 将通过 ICN 总线与真武 AI 芯片直接互联;
  • 阿里巴巴集团 CEO 吴泳铭表示,平头哥 AI 芯片年出货量将大幅提升。

4. 竞争坐标:同一周,两把剑​

把 9 月中旬的两次发布放在一起看,国产 AI 芯片的"系统级竞争"格局已经清晰:

维度华为昇腾 960(9-17)阿里真武 V900(9-22)
发布节点HC2026云栖大会 2026
单卡显存288GB(自研 HBM)216GB
访存带宽9.6 TB/s未披露
互联灵衢 UnifiedBus / NPO 光互联ICN Switch 内存语义互联
超节点昇腾 960 超节点(4096 卡,8 EFLOPS FP8)磐久超节点(单集群 50 万卡)
上市2027 Q22027 Q1

华为走"超节点 + 开源 CANN 生态"路线,阿里走"云上全栈 + 开源模型生态"路线;单卡规格都仍有代差,但交付的是可采购、可运维的超大规模集群。对英伟达 CUDA 生态的替代逻辑,正在从"性能对标"转向"供给确定性 + 系统效率"。

5. 小结​

  • V900:3×M890、216GB、1200GB/s 片间互联、原生 FP8/FP4,2027 Q1 量产;
  • 系统:ICN Switch 千卡全带宽、磐久超节点算存网全栈、单集群 50 万卡;
  • 节奏:J900 2027 Q3、倚天 730 2027、倚天 750 2029——平头哥首次给出三年代际路线;
  • 看什么:2027 Q1 实际量产与阿里云部署规模、V900 绝对算力披露、ICN Switch 对外供货的可能性。

相关阅读​

参考资料​

  • 环球网:平头哥发布新一代训推一体 AI 芯片真武 V900(2026-09-22)
  • 新浪科技 / TechWeb:阿里平头哥发布新一代 AI 芯片真武 V900,2027 年第一季度量产
  • C114:阿里发布新一代 AI 芯片真武 V900,2027Q1 量产

本文基于阿里巴巴官方发布与公开报道整理。V900 单芯片绝对算力官方未公布;超节点与集群规模为官方口径,以未来实际交付为准。

昇腾 960 官宣发布:FP4 算力翻倍、全球首个 NPO 超节点,华为确认一年一代

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月 17 日,华为全联接大会(HC2026),华为常务董事、ICT 基础设施业务总裁汪涛正式发布昇腾 960。与 8 月数字中国峰会上的"路线图预告"不同,这次是完整的规格官宣——而且提前三个季度就绪。本文基于华为官网新闻稿及多方报道整理,逐项拆解 960 的规格、超节点与路线图含义。


1. 昇腾 960:双版本,训练先行​

昇腾 960 分为两个版本,节奏错开一个季度:

指标昇腾 960DT(训练版)昇腾 960PR(推理版)
FP8 算力2 PFLOPS(较 950 翻倍)待披露
FP4 算力4 PFLOPS待披露
显存288GB(自研 HBM)待披露
显存带宽9.6 TB/s待披露
配套超节点Atlas 860(风冷)Atlas 960(液冷)
就绪 / 上市2027 Q1 / 2027 Q22027 Q3

三个读数:

  • 提前三个季度就绪:960DT 原计划 2027 年 Q4,现在 2027 Q1 就绪、Q2 上市——与 950DT"提前上线华为云"一脉相承,路线图可信度在持续兑现;
  • 精度口径与英伟达对齐:FP8 / FP4 主口径(辅以自研 HiF8 / HiFP8),FP4 已是 2026 新卡的通用口径;
  • 288GB 自研 HBM + 9.6TB/s:显存容量与带宽同步翻倍,对训练长上下文大模型是实打实的容量红利。

单卡规格详见昇腾 960 规格页;上一代昇腾 950DT 规格页。

2. 昇腾 960 超节点:全球首个 NPO 超节点​

这是本场发布真正的"重器"——昇腾 960 超节点是全球第一个采用 NPO(近封装光学)的超节点:

指标昇腾 960 超节点
单节点规模4096 卡
系统算力8 EFLOPS FP8 / 16 EFLOPS FP4
HBM 总容量1 PB
互联 RTT低至 2μs
可用度99.8%

NPO 意味着什么:传统光模块挂在交换机面板上,信号要先出封装再转电—光;NPO 把光引擎挪到交换芯片封装近旁,大幅缩短 SerDes 距离、降低功耗与时延。华为的具体数字:

  • 5500 个自研 Hi-ONE 光引擎(业界首个量产 NPO,单引擎 7.2T);
  • 替代 4.8 万颗 800G 光模块;
  • 降低功耗 550kW 以上,同时支撑 2μs 级互联时延。

对比 8 月数字中国峰会的口径(Atlas 960 单超节点 15488 卡),官方最新口径为单超节点 4096 卡(1 个超集群可由多超节点组成)——以华为官网最新新闻稿为准。

⚠️ 华为还给出了"MFU 提升 2.75 倍""推理时延降低 70%"等收益数据,均出自华为马尔科夫实验室仿真,尚无独立第三方实测,阅读时注意口径。

3. 一年一代:970(2028)→ 980(2029)​

华为首次把"一年一代"从愿景变成官宣承诺:

年份产品状态
2026昇腾 950 系列950PR 已量产,950DT Q4 放量
2027昇腾 960本次官宣,提前就绪
2028昇腾 970HC2026 确认
2029昇腾 980HC2026 确认

支撑这一节奏的是华为提出的"韬定律":算力规格每代翻倍,访存带宽、访存容量、互联带宽同步大幅提升。

生态侧的同场数据也值得记录:CANN 外部开发者占比首次超过 61%、月活开发者 5200 人;910C 超节点部署已超 1000 套。

4. 竞争坐标:单卡有代差,系统级对打​

把 960DT 放到 2027 年的棋盘上看:

  • 对 NVIDIA Rubin(R200:288GB HBM4 / 50 PFLOPS FP4):单卡 FP4 算力约为 R200 的 8%(4 vs 50 PFLOPS),单卡代差客观存在;但 4096 卡超节点 + NPO 互联是系统级竞争——用"可交付的超大集群"对打单卡性能;
  • 对采购方:960 的价值主张是"在国产量产约束内拿到最大可用集群"。DeepSeek 拟采购 16 万颗 950DT 跑推理的订单已经证明:当供给与生态到位,头部实验室愿意主动选国产;
  • 对国产链条:950→960 的显存翻倍直接拉动国产 HBM 迭代,这是整条链的胜负手。

5. 小结​

  • 960DT:FP8 2P / FP4 4P、288GB HBM、9.6TB/s,2027 Q2 上市,提前三个季度;
  • 960 超节点:全球首个 NPO 超节点,4096 卡 / 8 EFLOPS FP8 / 1PB HBM / RTT 2μs;
  • 路线图:一年一代官宣至 2029,950、960 均提前兑现,规划可信度显著上升;
  • 看什么:2027 Q2 实际交付节奏、国产 HBM 产能、CANN 生态的第三方模型覆盖度。

相关阅读​

参考资料​

  • 华为官网:发布全球首个采用 NPO 的超节点(昇腾 960 超节点)(2026-09-17)
  • 电子工程专辑:国产 AI 芯片新突破!华为昇腾 960 芯片将提前发布
  • 环球网:华为全联接大会 2026 主题演讲报道

本文基于华为官网新闻稿与公开报道整理。MFU、时延等收益数据为华为实验室仿真口径;2028 / 2029 产品仅为路线图官宣,规格以未来发布为准。

Computex 2026 会后观察:AI PC 芯片大战开启,NVIDIA RTX Spark 六月上市

· 阅读需 3 分钟
Industry Research Team

2026年6月6日 —— COMPUTEX 2026 昨日在台北圆满闭幕。本届展会以"AI Together"为主题,创下 1500+ 参展商、6000 展位的历史纪录。NVIDIA、Intel、AMD 三巨头在 AI PC 领域的正面交锋成为本届最大看点。

1. NVIDIA RTX Spark:六月正式上市,$1,399 起​

NVIDIA 与联发科合作的 RTX Spark 超级芯片在 COMPUTEX 发布后不到一周即确认上市时间表:

关键信息详情
首发 OEM华硕、戴尔、惠普、联想、微软 Surface、微星
上市时间2026 年秋季
起步价尚未公布(外界推测 $3,000-4,000)
核心配置Arm CPU(最多 20 核)+ Blackwell GPU(6144 CUDA)
统一内存128GB LPDDR5X(300 GB/s)
模型容量可运行 1,200 亿参数 模型,最长 100 万 token 上下文

市场反应:AMD/Intel/Qualcomm 股价受压,分析认为 RTX Spark 将从三个方向重塑市场——Windows AI PC、Creator 工作站、边缘推理节点。


2. Intel 18A 全面投产:Clearwater Forest + Crescent Island​

Intel CEO 陈立武首次在 COMPUTEX 发表主题演讲,带来两项关键更新:

Clearwater Forest(至强 6+)​

  • 288 核 Darkmont 架构
  • 首款 Intel 18A 工艺数据中心 CPU
  • Foveros Direct 3D 封装
  • 已全面投产

Crescent Island AI GPU​

  • 480GB LPDDR5x 显存
  • 350W 风冷 PCIe 形态
  • 原生 FP4 支持,专攻智能体推理
  • 2026 H2 出货

陈立武表示:"当 AI 迈向智能体时代,CPU 正重返现代 AI 基础设施的中心。"


3. AMD Ryzen AI 400 系列出货中​

AMD 在 COMPUTEX 上展示了 Ryzen AI 400 系列(Zen 5 + Zen 5C 混合架构 + XDNA2 NPU):

  • NPU 算力 60 TOPS,x86 最高
  • 7 款消费级型号 + 商用 PRO 系列
  • 多家 OEM 已上市或即将发布
  • 7 月将举办 Advancing AI 2026 峰会(旧金山)

4. 国产芯片持续发力​

厂商产品状态
华为昇腾 950PR/950DT已量产,自研 HBM 突破
寒武纪MLU6902 PFLOPS FP8,开始出货
摩尔线程MTT S50001000 TFLOPS 参数公开

5. AI PC 元年:三家巨头路线图对比​

维度NVIDIA RTX SparkIntel Clearwater Forest + Crescent IslandAMD Ryzen AI 400
CPU 核心20 核 Grace (Arm)288 核 Darkmont (x86)最高 12 核 Zen5+5C
GPU/NPUBlackwell GPUCrescent Island (独立 GPU)XDNA2 NPU (60 TOPS)
AI 算力1 PFLOPSTBD60 TOPS NPU
目标个人 AI Agent数据中心+AI PC 双线Copilot+ PC
工艺TSMC 4NPIntel 18ATSMC 4nm
上市2026-062026 H2已上市

本周算力圈速览(6/1-6/6)​

日期事件
6/1NVIDIA GTC Taipei:RTX Spark、Vera Rubin 量产、DGX Station for Windows
6/1Intel 发布 Crescent Island、Clearwater Forest
6/2COMPUTEX 正式开幕,"AI Together"主题
6/5COMPUTEX 闭幕,1500+ 展商创纪录
6/6RTX Spark 确认六月上市 $1,399 起

数据来源:COMPUTEX Daily、腾讯新闻、凤凰科技、雪球、The Silicon Review。

Computex 2026 AI 算力卡大事件:DGX Station for Windows、Intel Crescent Island 等重磅发布

· 阅读需 4 分钟
Industry Research Team

2026 年 6 月 1-5 日,中国台北 —— Computex 2026(台北国际电脑展)本周圆满收官。本届展会以 "AI Together" 为主题,NVIDIA、Intel、AMD、Qualcomm 等巨头密集发布了多款 AI 算力新品,以下是 MirrorFrog 为你梳理的算力卡圈本周最值得关注的动态。

① NVIDIA DGX Station for Windows:桌面的 AI 超算​

NVIDIA 在 Computex 2026 主题演讲中正式发布了 DGX Station for Windows,号称"全球最强大的桌面 AI 超级计算机"。

核心规格​

项目参数
芯片GB300 Grace Blackwell Ultra Desktop Superchip
GPU 内存252 GB HBM3e(7.1 TB/s)
CPU 内存496 GB LPDDR5X(396 GB/s)
统一内存748 GB(NVLink-C2C 互联)
FP4 算力20 PFLOPS(稀疏)
FP8 算力10 PFLOPS(稀疏)
网络ConnectX-8 SuperNIC,最高 800 Gb/s
模型容量可运行 1 万亿参数 模型
系统功耗1,600 W
操作系统Microsoft Windows
出货时间2026 Q4

意义:DGX Station 将以前需要数据中心级集群的 AI 算力(20 PFLOPS FP4)压缩到一台桌面工作站中。748GB 统一内存意味着开发者可以在本地运行千亿甚至万亿参数的大模型,无需依赖云端。


② Intel Crescent Island:推理专用 AI GPU​

Intel 在 Computex 上详细披露了其面向数据中心 AI 推理的新一代 GPU Crescent Island。

项目参数
内存最高 480 GB LPDDR5x
功耗350 W(PCIe 形态)
精度支持FP4/MXFP4 → FP64(全精度覆盖)
目标AI 推理工作负载(Agentic Inference)
定位性价比高于 HBM 方案
出货2026 下半年

意义:Crescent Island 是 Intel 在 AI 推理市场的重要布局。480GB 超大 LPDDR5x 内存(非 HBM)意味着成本远低于 NVIDIA H200/B200 等同级竞品,瞄准企业级推理部署场景。


③ Intel Xeon 6+(Clearwater Forest):首款 Intel 18A 数据中心 CPU​

Intel 还发布了代号 Clearwater Forest 的全新 至强 6+ 处理器,这是 Intel 首款采用 18A 工艺 的数据中心 CPU:

  • 288 个 Darkmont 架构核心
  • L2 288MB + L3 576MB 缓存
  • 12 通道 DDR5-8000 内存
  • Foveros Direct 3D 先进封装
  • AI Agent 时代 CPU 重返基础设施中心

④ NVIDIA RTX Spark 生态落地​

本周 NVIDIA 与 联发科 合作的 RTX Spark 超级芯片持续发酵。多家 OEM 亮相了基于 RTX Spark 的笔记本和紧凑型桌面原型机:

  • 华硕、戴尔、惠普、联想、微软 Surface、微星 均确认首发
  • 配备 20 核 Grace CPU + Blackwell GPU(6144 CUDA 核心)
  • AI 算力 1 PFLOPS
  • 2026 年秋季 零售上市

⑤ Intel × 鸿海(Foxconn)AI 基础设施合作​

Intel 与鸿海宣布联合布局 AI 基础设施,覆盖从 芯片 → 服务器 → 机架级系统 的完整链条,瞄准 AI 推理需求激增带来的数据中心市场机遇。


⑥ 国产 AI 芯片动态​

据 IDC 2025 年度报告,中国 AI 加速卡市场总出货量达 约 400 万张,本土厂商合计出货约 165 万张,市占率突破 41%。华为昇腾 950 系列已进入量产交付阶段,寒武纪 MLU690 开始向互联网客户出货。


本周算力圈速览​

厂商产品亮点时间
NVIDIADGX Station for Windows20 PFLOPS, 748GB 统一内存Q4 2026
NVIDIARTX Spark1 PFLOPS AI PC 芯片2026 秋
IntelCrescent Island GPU480GB LPDDR5x, 350W2026 H2
IntelXeon 6+ (Clearwater Forest)288 核, Intel 18A2026 H2
Intel + 鸿海AI 基础设施合作芯片→机柜 全链路战略合作
华为昇腾 950PR/DT1 PFLOPS FP8, 自研 HBM已量产
寒武纪MLU6902 PFLOPS FP8, 192GB HBM3E出货中

数据来源:NVIDIA GTC Taipei 2026 / Computex 2026 官方发布、Intel 新闻稿、凤凰科技、IT之家。

NVIDIA 发布 RTX Spark:AI 算力进入个人电脑时代

· 阅读需 3 分钟
Industry Research Team

2026 年 6 月 1 日,中国台北 —— 在 Computex 2026 开幕主题演讲中,NVIDIA CEO 黄仁勋正式发布了 RTX Spark 超级芯片,标志着 NVIDIA 正式进入由 Intel、AMD、Qualcomm 和 Apple 主导的个人电脑处理器市场。

RTX Spark:个人 AI 计算机的"心脏"​

RTX Spark 由 NVIDIA 与 联发科(MediaTek) 合作开发,采用 20 核 Grace CPU + Blackwell RTX GPU 的异构封装,配备 6144 个 CUDA 核心。AI 算力达到 1 PFLOPS(千万亿次浮点运算),这意味着个人电脑首次拥有与数据中心级 H100 GPU 相当的计算能力。

参数RTX Spark
CPU20 核 Grace(联发科合作,Arm 架构)
GPUBlackwell RTX(6144 CUDA 核心)
AI 算力1 PFLOPS
目标个人 AI Agent,本地 LLM 推理
首发 OEM华硕、戴尔、惠普、联想、微软 Surface、微星
上市时间2026 年秋季
形式笔记本 SoC + 紧凑型桌面主机

黄仁勋的"全栈 AI"战略​

RTX Spark 的发布是 NVIDIA "全栈 AI" 战略的关键一步。黄仁勋在演讲中表示:"AI 不应该只在云端运行。每个人的电脑都应该拥有运行 AI 代理的能力。"

RTX Spark 让 NVIDIA 从数据中心 GPU 垄断者转变为个人计算市场的全面竞争者。消息发布后,AMD、Intel 和 Qualcomm 的股价应声下跌。

对市场的影响​

  • Intel:个人电脑 AI 处理器业务面临直接威胁
  • AMD:Ryzen AI 系列需要应对同级别竞争
  • Qualcomm:Snapdragon X Elite 的 Copilot+ PC 定位被挑战
  • Apple:M 系列芯片不再是唯一的高性能 AI PC 选项

Vera Rubin 平台进入大规模量产​

在同一场演讲中,黄仁勋还宣布 NVIDIA Vera Rubin 平台已进入全面量产阶段。Rubin R200 采用 6 芯片 CoWoS-L 封装(1× Vera CPU + 2× Rubin GPU die + I/O/HBM die),配备 288GB HBM4、22 TB/s 带宽、50 PFLOPS FP4 算力(稀疏)。

Rubin NVL72 机柜(72 颗 Rubin GPU + 36 颗 Vera CPU)将于 2026 H2 开始出货。

CompuTex 2026 其他看点​

  • AMD:展示了 MI350 系列(192GB HBM3e,5 PFLOPS FP8 dense),6 月正式上市
  • Intel:Jaguar Shores 首次公开
  • Qualcomm:AI 200 / 300 系列推理卡路线图更新
  • 国产 AI 芯片展区:华为、寒武纪、摩尔线程等展示最新产品

行业意义​

RTX Spark 的发布意味着 AI 算力不再局限于数据中心。个人开发者、设计师、研究人员将能在本地运行以往需要云端 GPU 的大模型任务,这可能会重新定义个人 AI 计算的市场格局。

Vera Rubin 的量产则进一步巩固了 NVIDIA 在数据中心 AI 训练领域的绝对领先地位。两条产品线共同构成 NVIDIA "云端训练 + 个人推理" 的全栈 AI 计算版图。


本报道基于 2026 年 6 月 1 日 Computex 2026 / GTC Taipei 的 NVIDIA 官方发布信息。