跳到主要内容

4 篇博文 含有标签「Inference Chip」

AI inference dedicated chips and accelerators

查看所有标签

云巨头自研芯片浪潮 2026:OpenAI Jalapeño、Maia 200、MTIA、TPU v8 集体"去英伟达化"

· 阅读需 6 分钟
Industry Research Team

2026 年 8 月 Hot Chips 的周二下午 AI 专场,是本届最有历史意义的一场——不是因为某颗芯片多强,而是因为登台的几乎全是"超算厂商去 NVIDIA 化"的自研 ASIC:Google 第八代 TPU、OpenAI 首颗自研芯片、微软 Maia、Meta MTIA、Cerebras 晶圆级机架同台。当全球最大的 AI 算力买家开始把 GPU 当作"可选项之一",AI 硬件的权力结构正在松动。


1. OpenAI Jalapeño:9 个月造出一颗芯片​

OpenAI 于 2026 年 6 月 24 日联合博通发布首款自研推理 ASIC Jalapeño,是"自研推理芯片俱乐部"的第五个成员。

维度Jalapeño
合作方博通(Broadcom)+ 台积电制造
定位推理专用 ASIC
设计周期端到端 9 个月(Greg Brockman 称借助 OpenAI 自有模型辅助设计)
成本目标较通用 GPU 栈 token 成本降约 50%
商用时间2026 年底首批部署,长期目标 10GW 自研芯片
合作规模与博通最高 100 亿美元战略合作(2029 年前部署加速器与网络)

演讲标题"You Can Just Build Things … Chips"本身就是信号:最大的 AI 算力买家不再默认 GPU 是唯一路径。


2. Google TPU v8:十年来最大架构转向——训练/推理分芯​

Google 拥有最悠久的自研芯片历史(2016 至今),第八代 TPU 首次将产品线一分为二:

型号代号合作方定位关键规格
TPU 8tSunfishBroadcom训练单 pod 9600 卡、121 FP4 ExaFLOPS、2PB 共享 HBM、ICI 带宽翻倍
TPU 8iZebrafishMediaTek推理288GB HBM、384MB 片上 SRAM(3× 上代)、ICI 19.2 Tb/s

产能方面,摩根士丹利基于供应链访谈估算 2026 年 Google TPU 产量可能超 300 万颗(券商预测,非官方目标)。Google 也是唯一实现自研芯片大规模部署并对外销售算力的厂商(Gemini 跑在 TPU 上)。


3. Meta MTIA:从推荐系统到 GenAI 双使命​

Meta 的自研之路起点最清晰——MTIA 最初为推荐排序硬件而生,正被生成式 AI 拉向双使命。

  • MTIA 300 已部署;400 / 450 / 500 计划在 2027 年前约每 6 个月推出一款;
  • 基于 RISC-V,Meta 称最高 25× 算力增益;
  • 节点沿行业节奏演进:100(7nm)→ 200(5nm)→ 300 系列(3nm + CoWoS);
  • 与 博通合作,据称另一颗代号 Iris 的芯片已于 2026 年 7 月通过测试;
  • Meta 计划 2026 年 9 月启动其中一款的量产,以将其整体算力翻倍。

4. 微软 Maia 200/300:部署最领先​

微软 Maia 200 于 2026 年 1 月 26 日发布,是四家中部署最先进的:

维度Maia 200
制程台积电 3nm,1400 亿+ 晶体管
算力10+ PFLOPS FP4 / 5 PFLOPS FP8
显存216GB HBM3E,7 TB/s
功耗750W
部署已在得梅因(Des Moines)数据中心运行,服务 OpenAI GPT-5.2 与 Microsoft 365 Copilot

微软称其在特定基准上约 3× 亚马逊 Trainium 性能。短期策略是"自研 Maia + 外购英伟达"双路线并行——自研芯片从设计到量产需要时间,英伟达成熟生态短期内无法替代。


5. 亚马逊 Trainium 3 与 Anthropic 自建团队​

  • 亚马逊:Trainium 系列已商用,累计部署 140 万颗(官方披露),是数十亿美元业务;优势在 AWS 客户基数——企业可在英伟达 GPU 与自研芯片间选择。Trainium 3 延续这一路线。
  • Anthropic:2026 年 8 月宣布组建自建芯片团队,尚无 tape-out 或量产时间表,初期定位为补充(而非取代)与 NVIDIA/AMD/AWS/Google Cloud 的现有合作,目标是为 Claude 架构量身打造、摆脱对单一 GPU 的依赖。

6. NVIDIA 的回应:不是更快的 GPU,而是全栈​

容易把叙事简化成"四家造芯片、英伟达防守 GPU"。但 NVIDIA 在 Hot Chips 拿了 6 个 slot:RISC-V 教程、Vera CPU、Rubin GPU、BlueField-4 DPU、Spectrum-X 多平面网络、以及 LPU 加速器。

一颗 hyperscaler ASIC 只替换了这五个支柱中的一个。如果 CPU、NIC、交换 fabric 与软件都来自同一家供应商,把加速器换掉省下的,比加速器那一行账单暗示的要少得多。Rubin 的打法是一个横跨七颗芯片、五种机柜的全栈 AI 工厂平台——竞争回应是"全栈位置",而非"更快的一颗芯"。


7. 趋势判断:推理去 GPU 化,训练仍 GPU 主导​

  • 推理侧:CUDA 护城河明显变浅。推理在端点层面可并行、可替换,自研 ASIC 通过剪掉通用性税(只实现 LLM 实际执行的操作)换取更低 cost/token。Groq LPU、Cerebras、各家 TPU/ASIC 都在同一指标上竞争。
  • 训练侧:Foundation model 仍用 GPU 训练,短期内无人认真挑战。NVIDIA 在训练的三道护城河(最快硅 + NVLink + CUDA)依旧牢固。
  • 结论:自研芯片不是"替代英伟达",而是在推理这一最大、增长最快的战场上,给买家一个可信的谈判外部选项——这本身就足以重塑 AI 基础设施的经济学。

相关链接​

参考资料​


本文基于 2026 年 8 月 Hot Chips 现场报道、企业公告与行业分析整理。部分产能与性能为券商估算或厂商公布口径,实际以量产产品为准。

推理加速卡市场 2026:占加速器市场60%-70%,GPU 与 ASIC 份额反转,五大流派混战

· 阅读需 5 分钟
Industry Research Team

过去三年,整个 AI 硬件故事都是"训练":谁有最多 H100、谁能把十万卡连成集群。这场竞赛基本尘埃落定——NVIDIA 赢了。但下一战场"推理"正在完全不同的规则下开打:衡量标准不是峰值 FLOPS,而是 cost-per-token(每 token 成本)、时延与功耗。2026 年,推理芯片第一次在规模上压倒训练,成为 AI 加速器的主战场。


1. 推理成为主战场:80%–90% 的算力花在推理上​

训练一个大模型要花数亿美元——一次。但模型上线后,它要日复一日回答数十亿次查询。一个热门消费级模型可能需要上万颗加速器 7×24 小时运行才能跟上需求。因此:

  • 推理约占一个模型生命周期算力的 80%–90%;
  • 推理芯片将占 2026 年约 $400B AI 加速器市场的 60%–70%,而 2023 年这一比例仅约 40%;
  • 推理芯片增速(预计年增 52.7%)显著高于训练芯片(28.4%),推理侧算力需求占比 2026 年首次超过训练侧,达 54%(约 $1010B)。

推理的经济学很直接:训练成本被摊销到微不足道,推理成本成为整张账单。每降低 1% 推理成本,都直接流向利润——对 OpenAI 这种推理流量达 hyperscale 体量的公司,Half 的账单是后面跟着一堆零的数字。


2. 市场规模:结构性增长拐点已至​

市场2026 规模增速备注
全球推理专用芯片$412.7B+38.4%较训练芯片增速高 14.2 pct
中国推理专用芯片$118.6B(占全球 28.7%)+44.1%亚太增速最强单一市场
全球 AI 训练/推理芯片(含 GPU/NPU)突破 $1850B+40.2%GPU 占约 62%

中国市场国产化替代加速,国产推理芯片出货占比达 34.6%,较 2025 年提升 9.8 pct。


3. 技术路线份额反转:GPU 放缓,ASIC 飙升​

路线2026 出货份额趋势
GPU52.6%仍居首,但增速放缓至 22.7%
ASIC 定制芯片41.3%从 2022 年 17.8% 大幅攀升
FPGA稳定特定低时延场景

GPU 凭借生态成熟度仍是主力,但 NPU/ASIC 在能效比上已实现对同代 GPU 1.8 倍的优势,推动其在边缘与端侧采用率快速攀升。专为推理优化的 ASIC 出货量预计达 1150 万颗,单位成本较 GPU 降低约 35%。


4. 五大流派混战​

流派代表产品核心优势适用场景
通用 GPUNVIDIA Rubin / B200 / H200生态成熟、训推一体前沿训练 + 高交互推理
LPU(语言处理单元)Groq LPU极低时延、确定性吞吐实时对话、高并发推理
TPU(推理专用)Google TPU 8i(Zebrafish)288GB HBM、384MB 片上 SRAM、ICI 19.2 Tb/sGoogle 规模化推理
自研 ASICOpenAI Jalapeño、微软 Maia 200、Meta MTIA针对自家模型剪掉通用性税,cost/token 降 ~50%hyperscaler 自有负载
风冷推理卡Intel Crescent Island350W 风冷、480GB LPDDR5X、tokens/watt成本敏感中长尾推理

OpenAI 与博通合作的 Jalapeño 目标将推理 token 成本较通用 GPU 栈降低约 50%——这是第五个加入"自研推理芯片俱乐部"的成员(前有 Google TPU、亚马逊 Inferentia/Trainium、微软 Maia、Meta MTIA)。


5. 核心指标转向:cost-per-token 与 tokens/watt​

推理竞赛与训练竞赛的根本不同在于切换成本低:

  • 训练需要 10 万卡集群 + NVLink + CUDA,迁移成本极高;
  • 推理在端点层面" embarrassingly parallel"——不需要百万卡集群,一个能快速便宜出 token 的节点即可,per-endpoint 可替换。

这意味着 NVIDIA 的三道护城河(最快硅、NVLink 扩展、CUDA)在推理侧都不再绝对。当最大的 AI 买家(OpenAI)开始把 GPU 当作"可选项之一",GPU 溢价就开始消蚀——定价权依赖稀缺性,而自研芯片从两个方向同时攻击稀缺性:既减少商户芯片需求,又给买家一个可信的谈判外部选项。


6. 边缘与端侧爆发:长尾化信号​

需求端呈现显著长尾化与碎片化:

场景2026 需求规模增速
云端推理$198.2B(占 48%)+24.5%(放缓)
边缘推理$126.5B(占 30.7%)+52.3%
端侧推理$88.0B(占 21.3%)+68.9%
智能驾驶推理$67.3B+58.2%
工业质检 / 机器人推理$42.1B+63.7%

推理负载的时延敏感性与功耗约束正在重塑芯片架构设计优先级——这也解释了为何 Crescent Island 这类"风冷大显存"方案能找到生存空间。

相关链接​

参考资料​


本文基于 2026 年公开市场研究、券商报告与行业分析整理。市场规模与份额为第三方机构测算,口径不一,仅供参考。

2026年H1 AI芯片行业复盘:Blackwell Ultra、国产三强与推理新时代

· 阅读需 12 分钟
Industry Research Team

2026年上半年,AI芯片产业发生了历史性转折——产业重心从"训练竞赛"转向"推理效率",国产芯片市场份额首次突破40%,NVIDIA以Blackwell Ultra筑高壁垒,推理专用芯片赛道百花齐放。


一、算力再翻番:NVIDIA Blackwell Ultra 发布(6月1日)​

2026年6月1日,NVIDIA CEO黄仁勋在**台北国际电脑展(Computex 2026)**上揭晓新一代AI芯片 Blackwell Ultra,为未来两年的AI基础设施竞赛划定新起跑线。

关键规格​

指标Blackwell UltraB200提升
FP8算力20 petaFLOPS~10 petaFLOPS100%
架构Blackwell UltraBlackwell升级
预计交付2027年Q12026年Q1—
定位超大规模训练+推理训练+推理旗舰

产业意义​

  1. 算力翻倍的直接影响:20 petaFLOPS FP8意味着千亿参数模型训练时间大幅缩短,万亿参数模型训练从"科学实验"走向"工程常态"
  2. 系统级平衡:Blackwell Ultra不仅是芯片,更是NVLink、HBM、散热、供电的系统级工程突破
  3. 路线图确定性:2027年Q1交付时间表,让云厂商和AI实验室可以提前18个月规划基础设施预算

挑战​

  • 能耗危机:性能翻倍伴随功耗大幅上升,数据中心供电和冷却设计面临极限挑战
  • 可及性问题:顶级算力优先供应顶级云厂商,中小开发者和研究机构如何通过云服务以合理成本触达算力
  • 软件栈适配:新硬件需要匹配的CUDA版本和框架支持,软件生态成熟度成为算力转化的关键瓶颈

二、国产AI芯片:从"可用"到"好用"的临界点​

2026年6月16日,信创世界发布**《2026中国国产AI芯片厂商能力象限》**,清晰勾勒出国产AI芯片的整体格局。

2.1 能力象限排名​

象限代表厂商
领导者象限华为昇腾、海光信息、寒武纪、阿里平头哥、摩尔线程
远见者象限百度昆仑芯、壁仞科技、燧原科技、沐曦股份、瀚博半导体
竞争者象限清微智能、黑芝麻智能、芯驰科技、砺算科技、后摩智能
挑战者象限登临科技、知存科技、芯原股份、瑞芯微、云天励飞

2.2 华为昇腾:国产算力的定海神针​

市场地位​

  • 2025年昇腾系列出货 81.2万张,占国产AI加速卡 49% 份额,稳居国产第一
  • 昇腾950PR单卡FP8算力达 1P(PetaFLOPS)、FP4算力达 2P
  • 推理性能约为NVIDIA H20的 2.87倍,定价仅 7.2-7.5万元,性价比优势显著

全栈优势​

华为"端管云芯"一体化战略是昇腾的核心壁垒:

  • 芯片设计:Da Vinci 3.0架构持续迭代
  • 操作系统:鸿蒙/欧拉OS深度优化
  • 网络通信:欧拉网络协议栈
  • 云服务:华为云ModelArts平台无缝集成

最新进展​

  • 2026年6月5日,深圳河套学院联合哈工大(深圳)、华为团队,依托昇腾910C集群完成 1.6万亿参数DeepSeek V4 Pro大模型全参数后训练
  • 这是国产AI芯片首次完成万亿参数级大模型训练,标志着"国产替代"从推理迈向训练

2.3 寒武纪:率先盈利的国产AI芯片标杆​

业绩爆发​

指标2025年全年2026年Q1同比增长
营收64.97亿元28.85亿元+453% / +160%
净利润20.59亿元(首次年度盈利)10.13亿元— / +185%

核心产品:思元590​

  • 在DeepSeek R1推理场景下,TPS可达 942,比H20高出约 50%
  • 与字节跳动多年联合优化,具备短期最强的云端推理部署能力
  • 2026年Q1营收28.85亿元中,思元590贡献超过70%

潜在风险​

在2026年第2号《安全可靠测评结果公告》中缺席,原因尚未明确,将对其国内政企市场表现产生影响。

2.4 清微智能:可重构芯片的"第三路线"​

技术路线​

清微智能采用与Groq LPU同源的可重构数据流架构,在GPU通用性与ASIC极致效率之间找到了平衡点。

指标清微智能 TX81传统GPU方案优势
推理成本基准+100%降低50%
能效比基准基准提升3倍
架构可重构数据流SIMT/SIMD更适合推理

落地进展​

  • 可重构芯片累计出货量已超 3000万颗
  • 在全国十余座千卡规模智算中心实现规模化落地
  • 已启动A股IPO辅导,有望成为"可重构芯片第一股"

三、推理芯片赛道:产业重心转移的核心信号​

2026年6月4日,TrendForce发布深度报告**《推理经济时代来临:AI芯片的规则正被重写》,指出AI产业的算力竞争重心正在从训练转向推理**。

3.1 为什么是现在?​

成本结构改变​

  • 训练是一次性成本:模型训练完成后,边际成本趋近于零
  • 推理是持续性成本:每一次API调用、每一个生成token,都代表算力消耗与毛利压力
  • 单位推理成本与能效表现将直接影响毛利率与规模扩张能力

模型精简技术成熟​

  • 1.58-bit量化技术与权重剪枝,使模型可在极低内存占用下维持推理准确度
  • MoE(混合专家)架构通过"部分唤醒"机制,每次推理仅激活少数专家子网络,大幅降低实际运算量
  • 精简模型的崛起,为硬式编码推理芯片提供了商业可行性

3.2 NVIDIA的百亿押注:收购Groq(2025年12月)​

2025年12月24日,NVIDIA以 200亿美元取得Groq的Inference技术授权与核心团队,这是NVIDIA历史上最大规模的并购/技术收购之一。

战略意图:

  1. 补全推理短板:NVIDIA GPU在训练领域无可撼动,但推理效率一直不是最强
  2. 对抗专用推理芯片:Cerebras、Taalas、SambaNova等初创公司正在蚕食推理市场
  3. 布局Agentic AI:Agentic AI需要极低延迟、极高吞吐的推理能力

3.3 Taalas HC1:硬式编码推理的概念验证​

2026年2月20日,加拿大AI芯片初创公司Taalas发布推理芯片 Taalas HC1,将Meta的开源AI模型Llama 3.1 8B直接刻印在芯片中。

关键指标​

指标Taalas HC1NVIDIA B200(throughput optimized)优势
推理速率16,960 tokens/s/user基准~4-5x
每百万tokens成本0.75 cents3.79 cents降低80%
功耗~250W~700W降低64%
制程TSMC N6TSMC 4nm更成熟
HBM❌ 不使用✅ HBM3e成本更低

技术原理​

Taalas HC1采用**存储内运算(Computing-in-Memory, CIM)**的激进实现:

  • 将模型权重直接固化于Mask ROM中(完全硬体定义)
  • 以片上SRAM处理动态资料(KV cache和LoRA微调权重)
  • 仅需修改2层光罩就能产出另一个AI模型的专用芯片,将一个AI模型转化为实体芯片仅需2个月

局限性​

  • 缺乏弹性:硬式编码无法应对快速迭代的模型更新
  • 生态壁垒:当前云端市场仍依赖通用平台,客户可能更偏好可随模型升级的弹性方案
  • NRE成本:一次性工程费用高,需要足够大规模的部署才能摊薄

3.4 Cerebras:晶圆级整合的上市之路​

2026年5月14日,Cerebras Systems正式在纳斯达克挂牌上市,成为首家上市的晶圆级AI芯片公司。

核心技术:Wafer-Scale Integration(WSI)​

  • WSE-3(第三代晶圆级引擎):整片12英寸晶圆做成单一芯片
  • 44GB片上SRAM:无需外部HBM,彻底消除内存带宽瓶颈
  • 21 PB/s带宽:片上通信带宽,是GPU的千倍级别
  • 与OpenAI合作:已签署逾200亿美元、规模750MW的三年算力合作协议

上市意义​

Cerebras的上市是推理专用芯片赛道成熟的标志:

  1. 资本市场开始为这类公司定价
  2. 证明"非GPU"技术路线具备商业可行性
  3. 为其他推理芯片初创公司(Groq、SambaNova、Taalas等)提供了估值参照

3.5 推理芯片格局:多元技术路线并存​

公司技术路线核心优势代表产品
Taalas硬式编码(Mask ROM)极致推理效率、低成本HC1
Cerebras晶圆级整合(WSI)超高带宽、大模型推理WSE-3
GroqSRAM-first架构确定性延迟、高吞吐LPU(已被NVIDIA收购)
d-Matrix数字存储内运算(DIMC)灵活性强于硬式编码Corsair
EtchedHard-wired Transformer所有Transformer模型适用Sohu
Axelera AI数字存储内运算(D-IMC)+ RISC-V高能效比Metis AIPU

TrendForce预测:

  • 通用GPU仍主导训练与多模型环境
  • 但在成熟、可预测场景中,通用GPU的利润空间将受到压缩
  • 产业格局从通用算力垄断,走向通用与专用并行的双轨结构

四、2026年H1国产AI芯片整体格局​

4.1 行业进入放量期​

指标2025年2026年Q1趋势
国产AI加速卡出货量165万张(占比41%)—持续上升
中国AI加速卡总出货量~400万张——
海光信息营收增速—翻倍增长↑
寒武纪营收增速—+160%↑
摩尔线程营收增速—翻倍增长↑

头部厂商集体进入业绩兑现通道,行业从"技术验证"迈向"规模商用"。

4.2 三大核心发展趋势​

趋势一:资本化浪潮重塑格局​

  • 2025年底至2026年初,摩尔线程、沐曦股份登陆科创板
  • 壁仞科技登陆港股
  • 燧原科技科创板IPO获受理
  • 昆仑芯、平头哥启动上市进程
  • 清微智能、瀚博半导体等推进IPO

资本化带来双重效应:

  • ✅ 正面:为研发和生态建设提供支撑
  • ⚠️ 负面:估值泡沫和业绩兑现压力

趋势二:产能成为最大制约变量​

国产AI芯片爆发式需求与有限先进制程产能的矛盾日益尖锐:

厂商先进制程产能需求实际获得
华为昇腾每月1.5万片(7nm级)优先保障
中芯国际总产能每月约2万片(7nm级)—
其他厂商合计约5000片/月极度紧张

能否拿到稳定晶圆产能直接决定厂商生死。寒武纪75.4%的营收占比存货,本质是对产能的锁定。

趋势三:竞争从"可用"转向"好用"​

早期竞争聚焦"能否跑通模型",当前升级为"运行效率、部署成本"的比拼:

竞争维度"可用"时代"好用"时代
硬件性能能否跑通模型运行效率、能效比
软件栈基本适配成熟度、框架广度
生态有无开发者社区活跃度
部署成本不敏感核心竞争要素

五、2026年H2展望​

5.1 即将到来的关键事件​

时间事件影响
2026年Q3NVIDIA Rubin架构详情公布下一代旗舰规格揭晓
2026年Q3华为昇腾950PR/950DT正式发布国产推理芯片新标杆
2026年Q4AMD MI350X规模化交付NVIDIA Blackwell竞品
2026年Q4寒武纪思元690发布(推测)新一代训练芯片
2027年Q1NVIDIA Blackwell Ultra交付算力新标杆落地

5.2 未来三年关键竞争要素​

  1. 晶圆产能获取能力:先进制程产能是稀缺资源,绑定中芯国际、TSMC的厂商具备先天优势
  2. 资本运作效率:IPO窗口期有限,能否在资本市场上融到足够资金决定研发持续性
  3. 软件生态建设深度:硬件性能只是入场券,软件栈成熟度、框架适配广度、开发者社区活跃度才是核心壁垒

六、结语:多元生态终将形成​

2026年H1,AI芯片产业正在经历从"一家独大"到"多元并存"的历史性转变。

  • NVIDIA以Blackwell Ultra筑高训练壁垒,同时以收购Groq布局推理效率
  • 华为昇腾以全栈能力守住国产算力的基本盘,950PR在推理性能上开始超越H20
  • 寒武纪以率先盈利证明国产AI芯片的商业化可行性,思元590在特定场景超越国际竞品
  • Cerebras、Taalas等推理专用芯片公司开辟了"非GPU"的第三路线
  • 清微智能的可重构架构为中国AI芯片提供了技术路线的多元化选择

未来三年,国产AI芯片终局将形成GPU、ASIC、可重构计算三大技术路线并存,云端与边缘协同发展的多元生态。"国产替代"不再是口号,而是正在发生的产业现实。


数据来源:

  • 信创世界《2026中国国产AI芯片厂商能力象限》(2026-06-16)
  • TrendForce《推理经济时代来临:AI芯片的规则正被重写》(2026-06-04)
  • RayByte《算力再翻番!英伟达Blackwell Ultra芯片发布》(2026-06-02)
  • 各公司官方财报和公告

相关阅读:


OpenAI 自研 AI 芯片 Jalapeño 深度解析:9 个月流片,推理成本降低 50%

· 阅读需 10 分钟
AI Hardware Analyst

2026 年 6 月 24 日,OpenAI 与博通(Broadcom)联合发布首款自研 AI 推理芯片 Jalapeño。这款专为大型语言模型推理设计的 ASIC,从设计到流片仅用 9 个月,推理成本降低约 50%,标志着 OpenAI 从纯模型公司转型为全栈 AI 基础设施提供商。


一、核心结论(先看这里)​

维度Jalapeño当前 GPU 方案优势
推理成本-50%基准✅ 成本减半
每瓦性能显著优于当前最先进加速器✅ 能效领先
设计周期9 个月~18 个月✅ 速度快 2x
定位推理 ASIC训练+推理 GPU专用优化
供货仅内部市场采购⚠️ 不对外销售

一句话总结:Jalapeño 是 OpenAI 全栈 AI 战略的关键一步,用自研芯片将推理成本降低 50%,同时开启"AI 辅助设计 AI 芯片"的新范式。


二、Jalapeño 是什么?​

2.1 基本信息​

项目内容
名称Jalapeño(哈拉贝诺辣椒)
类型专用集成电路(ASIC)
定位大型语言模型推理任务
发布时间2026-06-24
流片时间2025-09(推测,9 个月极速流片)
部署时间2026 年底(千兆瓦级数据中心)
合作方博通(Broadcom)、台积电(TSMC)、Celestica
制程TSMC 3nm
架构Systolic Array(脉动阵列)
HBM8 堆栈(推测 HBM3E 或 HBM4)

2.2 为什么叫"Jalapeño"?​

Jalapeño 是一种墨西哥辣椒,以"中等辣度、强烈风味"著称。OpenAI 以此命名,暗示这款芯片:

  • ✅ 辣度适中:不是最激进的架构(相比 Cerebras WSE),但足够有效
  • ✅ 风味强烈:在推理场景下有强烈的存在感(成本降低 50%)
  • ✅ 开胃前菜:这只是"多代路线图的第一步"(博通 CEO 陈福阳)

三、技术深度解析​

3.1 9 个月极速流片:AI 辅助设计芯片的新范式​

通常情况下,从零开始设计一块 ASIC 芯片需要 1.5 到 2 年。而 Jalapeño 从初始设计到制造流片仅用了 9 个月。

关键原因:深度软硬件协同开发

技术手段说明
AI 辅助架构探索OpenAI 用自家前沿模型(GPT-5.3-Codex-Spark)探索芯片架构设计空间
AI 功耗仿真用 AI 模型进行功耗仿真与优化
强化学习优化用 RL 优化芯片布局布线
博通硅实现能力博通提供业界顶尖的 ASIC 实现能力(网络芯片、交换芯片经验)

OpenAI 总裁 Greg Brockman 表示:

"我们利用服务于用户的前沿模型,来优化运行未来模型的基础设施。"

3.2 专为推理优化的架构​

与通用 GPU 不同,Jalapeño 是围绕 OpenAI 对 LLM 推理工作负载的深度理解从零构建的 ASIC:

架构特性说明
降低数据移动架构核心在于减少数据搬运(推理任务的主要瓶颈)
平衡计算-内存-网络资源分配针对推理优化,使实际利用率更接近理论峰值
结合高吞吐与低延迟目标是将当前领先加速器的吞吐能力与最快专用推理系统的低延迟结合起来
支持未来模型不仅支持现有模型(GPT-5、GPT-5.3),也适配未来新一代模型的推理需求

3.3 全栈平台:不只是芯片​

Jalapeño 是一个多代计算平台,而不仅仅是一颗芯片:

组件供应商说明
加速器芯片OpenAI 设计,台积电制造TSMC 3nm,8 堆栈 HBM
网络交换芯片博通 Tomahawk高速互联(与 NVIDIA NVLink 竞争)
电路板、机架、系统Celestica整机架解决方案
软件栈OpenAI深度适配 GPT、Codex、Agent 产品

部署目标:千兆瓦(Gigawatt)级数据中心

博通 CEO 陈福阳表示:

"Jalapeño 将于今年开始与微软和其他合作伙伴一起部署在千兆瓦级数据中心。"


四、性能与成本分析​

4.1 推理成本降低 50%​

虽然 OpenAI 官方新闻稿中针对 Jalapeño 带来的成本节约表述相当保守,仅透露其"每瓦性能大幅优于当前最先进水平",未给出具体百分比。

但据彭博社报道,博通 CEO 陈福阳透露:

早期内部测试显示,相较于当前主流 AI GPU,Jalapeño 可实现约 50% 的推理成本节省。

对于 OpenAI 的意义:

项目当前(GPU 方案)Jalapeño 方案节省
每天 API 调用数亿次数亿次—
推理成本占比~60-70% 运营成本~30-35%-50%
年算力支出数十亿美元数亿美元节省数十亿美元

4.2 每瓦性能显著优于当前最先进水平​

OpenAI 公告指出:

"Jalapeño 工程样品已以目标频率和功耗成功运行 GPT-5.3-Codex-Spark 等复杂强化学习任务,早期测试显示每瓦性能显著优于当前最先进的 AI 加速器。"

对比对象:NVIDIA Blackwell(当前最先进的 AI 加速器)

指标JalapeñoNVIDIA Blackwell说明
每瓦性能显著优于基准OpenAI 官方表述
推理延迟媲美最快专用推理系统基准目标
吞吐量媲美当前领先加速器基准目标
TDP未公开(推测 400-700W)700-1000WJalapeño 可能更低

五、对 AI 芯片市场的影响​

5.1 "去英伟达化"加速​

Jalapeño 的发布是科技巨头集体挑战英伟达市场主导地位的又一注脚:

厂商自研芯片类型状态与 OpenAI 的关系
GoogleTPU v6e / Ironwood训练+推理✅ 已商用Google Cloud 供应 OpenAI
AmazonTrainium 3训练✅ 已发布AWS 供应 OpenAI
MicrosoftMaia 100训练+推理✅ 已发布OpenAI 独家合作伙伴
MetaMTIA训练+推理✅ 已发布—
AppleNeural Engine端侧推理✅ 已商用—
OpenAIJalapeño推理🚧 2026 年底部署自用 + 可能出售给第三方

5.2 OpenAI 并非要完全"抛弃"英伟达​

Brockman 坦言:

"我们根本无法足够快地获得算力。"

目前,OpenAI 同时在向英伟达、AWS、AMD 和 Cerebras 等多方采购芯片,Jalapeño 是对其爆炸性算力需求的结构性补充,而非替代。

5.3 可能出售给第三方​

博通 CEO 陈福阳特别强调:

"这只是一个'多代路线图的起点',OpenAI 与博通的目标是共同建设千兆瓦(Gigawatt)级算力集群。"

这意味着,OpenAI 有可能将其硬件出售给第三方,前提是它能从博通和台积电获得足够的供货。


六、Jalapeño vs 其他自研芯片对比​

指标Jalapeño(OpenAI)TPU v6e(Google)Trainium 3(Amazon)Maia 100(Microsoft)
发布时间2026-06-2420242025 Q42023
类型推理 ASIC训练+推理 TPU训练 ASIC训练+推理
制程TSMC 3nmTSMC 4nmTSMC 5nm(推测)TSMC 5nm(推测)
是否对外销售❌ 仅内部(可能未来出售)✅ GCP✅ AWS❌ 仅内部
设计周期9 个月~18 个月~18 个月~18 个月
AI 辅助设计✅ 首款❌ 否❌ 否❌ 否
成本优势-50% 推理成本优化优化优化

关键差异:

  • ✅ Jalapeño 是首款由 AI 辅助设计的 AI 芯片
  • ✅ Jalapeño 设计周期仅 9 个月(行业平均 18 个月)
  • ⚠️ Jalapeño 不对外销售(至少目前如此)

七、未来路线图​

7.1 多代芯片平台​

Jalapeño 只是一个"多代路线图的起点":

时间事件
2026 年底Jalapeño 初始部署(千兆瓦级数据中心)
2027 年Jalapeño v2(推测,架构优化)
2027-2028 年Jalapeño 训练版本(推测,挑战 TPU/Trainium)
2028 年及以后千兆瓦级算力集群全面建成

7.2 OpenAI 全栈 AI 基础设施战略​

层次OpenAI 自研外包/采购
模型✅ GPT-5、GPT-5.3、Codex—
芯片✅ Jalapeño(推理)NVIDIA GPU、AWS Trainium、AMD GPU
系统✅ 与 Celestica 合作微软 Azure 数据中心
网络✅ 博通 Tomahawk微软 Azure 网络
云平台❌ 无微软 Azure(独家合作伙伴)

八、行业反响与专家观点​

8.1 支持观点​

专家观点
博通 CEO 陈福阳"Jalapeño 只是一个多代路线图的起点,目标是共同建设千兆瓦级算力集群。"
OpenAI 总裁 Greg Brockman"我们利用服务于用户的前沿模型,来优化运行未来模型的基础设施。"
业内人士"Jalapeño 的发布是科技巨头集体挑战英伟达市场主导地位的又一注脚。"

8.2 质疑观点​

质疑点说明
不对外销售目前仅内部使用,第三方无法采购,对英伟达市场份额影响有限
软件生态OpenAI 需要自建软件栈,与 CUDA 生态竞争难度大
供货能力台积电产能有限,能否满足 OpenAI + 博通 + 其他客户的需求?
性能数据不透明OpenAI 未公布具体规格(算力、显存、带宽、TDP),难以客观评估

九、对开发者的意义​

9.1 如果 OpenAI 未来出售 Jalapeño 给开发者...​

场景当前(NVIDIA GPU)未来(Jalapeño)
推理成本基准-50%
推理延迟基准可能更低
软件栈CUDA + TensorRTOpenAI API(可能开源软件栈)
采购难度高(出口管制、供不应求)低(OpenAI 直接供应)

9.2 即使不出售,也值得关注​

  • ✅ 推理成本降低 50% 会倒逼英伟达、AMD、英特尔降低 GPU 价格
  • ✅ AI 辅助设计芯片的新范式会被行业快速复制
  • ✅ 9 个月流片周期会成为行业新基准

十、总结​

维度评价
技术创新⭐⭐⭐⭐⭐ 首款 AI 辅助设计的 AI 芯片,9 个月流片
成本优势⭐⭐⭐⭐⭐ 推理成本降低 50%,年节省数十亿美元
战略意义⭐⭐⭐⭐⭐ OpenAI 从纯模型公司转型为全栈 AI 基础设施提供商
市场影响⭐⭐⭐⭐ "去英伟达化"加速,科技巨头自研芯片阵营壮大
开放性⭐⭐ 目前仅内部使用,未来可能出售给第三方

最终建议:

  • 🇨🇳 中国市场:继续关注华为昇腾、寒武纪 MLU、摩尔线程 MTT(Jalapeño 不对中国出售)
  • 🌍 国际市场:关注 Jalapeño 是否未来对外销售,以及其对英伟达市场份额的影响
  • 💡 开发者:关注 OpenAI API 降价可能性(推理成本降低 50% 可能部分让利给开发者)

参考资料​


声明:本文部分规格为推测值,以 OpenAI 官方技术白皮书为准。OpenAI 将在未来数月内发布详细性能技术白皮书。

最后更新:2026-06-26