跳到主要内容

3 篇博文 含有标签「Power & Cooling」

Power efficiency, thermal design and liquid cooling for AI systems

查看所有标签

智能算力 2030 年冲 9800 EFLOPS:信息通信业「十五五」规划的五个硬指标

· 阅读需 5 分钟
Industry Research Team

本文基于工信部《信息通信行业发展「十五五」规划》(2026 年 9 月印发)及《人民邮电》报、澎湃新闻、华夏时报等官方解读整理。

9 月上旬,工信部印发《信息通信行业发展「十五五」规划》,用 13 个主要指标、26 项重点任务给未来五年的信息通信业画了路线图。对 AI 算力行业来说,这是含金量最高的一份政策文件——我们挑出五个硬指标,逐个拆解产业含义。

指标一:智能算力 1590 → 9800 EFLOPS,五年增长超 5 倍​

这是整份规划最亮眼的数字。作为参照系:

  • 截至 2026 年 6 月底,全国智能算力规模已达 2185 EFLOPS,同比增长 177%——上半年就超额完成了对 2025 年底(1590 EFLOPS)的跨越
  • 全国已建成 42 个万卡级智算集群;2026 年 7 月,首个全国产十万卡级 AI 算力集群曙光 8000 在郑州落成
  • 华为轮值董事长汪涛的判断:10 万卡以上超节点集群到 2027 年将成为基础配置

从 2185 到 9800,意味着未来四年还要再造 3.5 倍于当前存量的智算设施。规划同步要求「有序部署万卡、十万卡及以上智算集群」「加大力度适配国产算力芯片」——这是国产 AI 芯片未来五年最确定的需求底座。

指标二:信息基础设施累计投资 3.8 万亿元​

有观点拿「十四五」3.7 万亿对比,得出「投资见顶」的结论。官方解读明确反对这一说法:增量资金正从「规模铺量」转向「质效跃升」,精准投向智能算力基础设施、万兆光网、6G 等新赛道。产业链拉动效应也随之变化——AI 服务器、高速光互联、国产算力芯片、新型智能终端被点名为全链条受益方向。

指标三:新建大型算力设施 PUE 降至 1.2 以下​

「十四五」末这一数字是 1.25,五年内再降 0.05——听着不多,但在 AI 服务器常年高负荷、单机柜功率密度普遍超过 20kW 的今天,PUE 每降一点都是硬仗。规划给出的技术路径非常明确:液冷。

  • 《信息通信行业发展「十五五」规划》:引导算力设施采用高效节能设备以及液冷等先进技术
  • 《电子信息制造业发展「十五五」规划》(9 月 15 日由工信部、国家发改委联合印发):把液冷散热与高带宽内存池、全光交换并列为要突破的关键技术

产业侧的数据也在验证:据 Omdia 统计,液冷在全球数据中心冷却市场的占比从 2024 年约 20% 攀升至 2025 年约 37%,预计 2029 年渗透率超过 45%。算力扩张的上限正在从芯片供给转向电力供给,「算力向上、能耗向下」的能效约束会是未来五年的常态。

指标四:先进存力 1700 EB,增长超 2 倍​

智能算力翻 5 倍的同时,先进存力翻 2 倍——存算协同被放在同等重要的位置。逻辑在于:大模型训练的检查点、智能体推理的中间状态和上下文记忆,都分层存放在高性能存储中。截至 6 月底,全国存力总规模约 2021 EB,其中先进存力占比约 32%;到 2030 年 1700 EB 的先进存力目标,意味着结构升级比总量增长更重要。

对芯片选型的直接提示:KV cache 与长上下文正在吃掉内存预算,评估 AI 服务器时显存容量与内存带宽的权重应该高于峰值算力。

指标五:智能体互联网络首次写入规划​

这是本份规划最具前瞻性的部分:「智能体互联网络」占据独立专栏,部署四方面内容——构建智能体网络标识体系、加快智能体网络设施建设应用、推动全球互联互通、建设空间管控体系。同时明确「适时启动 6G 商用」。

AI 从「人的应用」变成「智能体基础设施」,通信网的角色从连接人升级为连接智能体——这为推理算力的分布式部署(边缘推理、算力调度)提供了国家级叙事。

对算力从业者的三点判断​

判断依据
国产算力需求确定性强规划明文「加大力度适配国产算力芯片」+ 十万卡集群建设周期启动
能效指标成为选址硬约束PUE 1.2 以下 + 液冷关键技术点名,高密度液冷方案优先
推理算力按需下沉「面向场景按需部署推理算力设施」,边缘与区域算力中心有政策窗口

算力规模翻 5 倍的目标之下,真正稀缺的从来不是规划,而是芯片、电力和交付能力。 对采购方来说,供给窗口期依然紧张;对方案选型而言,建议直接用 TCO 计算器 把 PUE 差异折算成电费成本——1.25 与 1.2 的差距,在万卡集群的电费账单上是千万级的。

小结​

「十五五」规划把智能算力写成了国家级工程:5 倍算力、2 倍存力、3.8 万亿投资、PUE 1.2、智能体互联网。五年后回看,2026 年下半年的国产十万卡集群潮,很可能就是这条曲线的起点。

(规划数据引自工信部文件及官方媒体解读;市场数据引自信通院、Omdia 等机构统计。)

Vera Rubin 全面量产:100% 全液冷 + 800V 直流供电,AI 数据中心基础设施范式重构

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月初,供应链信息确认:英伟达 Vera Rubin 平台已于 8 月正式量产、9 月启动批量出货,无延期、无卡顿。与 Blackwell 迭代初期的产能波折不同,这次量产节奏异常平稳——谷歌云、微软 Azure、CoreWeave、甲骨文云等头部云厂商已启动机架部署。但真正值得产业记住的,不是"又一代 GPU 量产了",而是 Rubin 把液冷从"可选配置"变成了"硬性前置条件"。


1. 量产节奏:史上最平稳的一次平台切换​

根据产业链调研与券商跟踪信息:

  • 2026 年 8 月:Vera Rubin 正式量产;
  • 2026 年 9 月:批量出货启动;
  • 2026 下半年:CoreWeave、谷歌云、微软 Azure、甲骨文云机架部署落地;
  • 2026 年:上代 GB 架构机柜出货量有望达 6 万台(同比翻倍);
  • 2027 年:GB 与 Rubin 两代平台合计出货体量有望接近 10 万台,Rubin 新机柜远期产能目标为每天 1000 个 NVL72 机柜。

需求侧同样在加码:华尔街报告披露,英伟达管理层表示 FY28 同比增长 70% 的目标并非需求上限——若供应不受限,增速可能超过 100%。当前主要约束已从需求端转向先进晶圆与 HBM 供应。

2. 单卡 2300W:风冷时代的终结​

Rubin 平台与前代最根本的差异不在算力,而在功耗密度:

指标H100GB300Rubin
单 GPU TDP700W~1400W2300W
机柜功耗~40kW~140kW190–230kW
散热方案风冷为主风液混合100% 全液冷
供电架构48V48V800V 高压直流

单芯片 TDP 从 700W 升至 2300W、单机柜功率密度突破风冷物理极限——这意味着 液冷不再是高端算力的选配升级,而是运行 Rubin 服务器的先决条件。英伟达官方将 Rubin 全液冷架构定义为"数据中心历史上最重要的能效突破之一",并已写入 DSX AI 工厂参考设计:所有跟随英伟达技术路线的云厂商和数据中心运营商,都必须采用全面液冷方案。

三个关键架构变化:

  1. 无风扇整机:GPU、CPU、交换机、DPU 全部器件强制采用直接冷板式液冷,45℃ 温水冷板成为出厂标配;
  2. 液冷边界延伸:散热覆盖范围从 GPU 冷板延伸至 CPU、DPU、交换机乃至光模块(液冷 Cage/鼠笼开始从"可选"变"刚需"),整套液冷系统价值量较 GB300 提升约 40%;
  3. 800VDC 供电:替代传统 48V 机架配电,整机电源 BOM 价值增长 30% 以上,PSU 电源模块从 5.5kW 向 18.3kW 迭代,固态变压器、高压直流 CDU 成为数据中心新增核心设备。

3. 对产业链的三重传导​

第一重:液冷从"配套"变"主角"。 2026 下半年以小规模部署验证为主,真正的放量窗口在 2027 年——Rubin 机架大规模铺货后,冷板、快速接头、CDU、液冷泵进入业绩兑现期。台系供应链 7 月数据已率先验证:AVC 奇鋐 7 月营收 185.9 亿新台币创历史新高(同比 +57.4%),双鸿、健策 7 月同比分别 +116.7%、+91.0%。

第二重:国产液冷供应链进入核心 BOM。 国内厂商由外围冷源和代工环节逐步进入芯片平台、服务器 ODM 和海外云厂商供应体系,替代路径从 Manifold、管路推进至高可靠快接头和冷板。英维克 26H1 海外收入占比 71.4%,飞龙股份液冷泵小功率平台订单超 5 万台——液冷全核心零部件自主可控正在成为现实。

第三重:供电与散热边界融合。 800VDC 架构下,电源模块、PDB 配电单元、高速交换芯片自身发热也达到很高水平,部分电源组件同样需要液冷辅助散热——电源与温控两条产业链正在合并成一条。

4. 需求矩阵扩容:云厂商之外,太空算力入场​

Rubin 的客户矩阵已从传统云厂商扩展至三个层次:

  • 全球云厂商:谷歌云、Azure、甲骨文云、CoreWeave;
  • AI 科技巨头:马斯克公开披露 2027 年 8GW 超大规模 IDC 建设规划;SpaceX 将 Vera Rubin 架构定义为"最优 AI 计算架构",计划地面与太空双向部署,支撑 "Starmind" 卫星算力项目;
  • 主权与边缘:远期 Rubin Ultra 及 2027 年后更高功耗机型单机柜有望冲击 600kW+。

普华永道预计全球数据中心累计投资到 2035 年将达 31.6 万亿美元。AI 基础设施建设的确定性,已经从"是否建设"变成"多快建设"。

5. 对采购方的启示​

  • 机房规划前置:2027 年起采购 Rubin 级算力,液冷改造(单千瓦改造成本较高)或按全液冷标准新建,必须在预算周期一开始就纳入;
  • 看 PUE 也看水温:45℃ 温水直冷允许更高进水温度,可利用自然冷源压低 PUE——选址时人工冷源依赖度成为新的评估维度;
  • 供应商组合即风险对冲:HBM 与先进封装供应是当前核心瓶颈(详见本站 HBM4 竞速分析),供应链多元化比单点性能更重要。

相关链接​

参考资料​


本文基于 2026 年 9 月初供应链调研、券商研报与英伟达官方披露整理。出货量与功耗数据为产业链预估口径,实际以英伟达及客户正式披露为准。

AI硬件进入"落地纪元"丨2026年五大变革与生存法则

· 阅读需 9 分钟
Industry Research Team

2026年,AI硬件市场正经历从"训练竞赛"到"落地为王"的根本性转变。随着大模型从技术演示走向规模化商业部署,硬件形态、技术路线和产业格局正在发生系统性变革。

出品方:中智盟咨询(CSHIA Research)
撰稿人:周军

五大核心趋势​

趋势1:算力需求结构转变,推理成为增长主引擎​

2026年AI硬件市场的最大变化是算力需求重心从训练转向推理。

根据市场数据:

  • 2026年全球AI推理算力需求预计同比增长超过60%
  • 推理算力占比将首次超过训练算力,成为AI基础设施的主要负载

这一转变源于AI应用从"模型开发"进入"规模化部署"阶段——企业不再频繁训练大模型,而是通过高频推理调用将AI能力转化为实际业务价值。

关键表现​

  1. 推理芯片市场爆发:专用推理芯片(ASIC)出货量预计增长129%,在AI服务器中的占比从2025年的不足20%提升至27.8%。

  2. 成本结构优化:英伟达Rubin平台将推理token成本降至前代的1/10,推动推理应用从"奢侈品"变为"日用品"。

  3. 工作负载特征变化:推理任务呈现"高频、长流程、低延迟"特征,对硬件实时响应能力要求更高。

GTC 2026 最新动态(6月1日台北)​

英伟达CEO黄仁勋在GTC 2026台北宣布多项推理算力重大进展:

  • Vera Rubin平台全面量产:NVL72机架系统智能体吞吐量比上一代Grace Blackwell提升10倍,专为Agentic AI设计
  • Vera CPU正式发布:88核Armv9.2自研Olympus架构,单线程IPC全球最高,LPDDR5X 1.5TB内存,1.2 TB/s带宽,原生支持FP8
  • RTX Spark AI PC芯片:与联发科联合研发(代号N1X),Blackwell架构GPU 1 PFLOP AI算力,128GB统一内存,台积电3nm,重构Windows PC生态
  • AI工厂平台DSX:包含DSX Sim(数字孪生仿真)、DSX OS(资源调配)、DSX MaxLPS(电力优化)、DSX Flex(电网协同)四大组件

该趋势意味着,硬件厂商的竞争焦点不再是"单卡算力峰值",而是"推理能效比"和"系统级优化能力"。


趋势2:边缘与端侧AI,算力下沉的规模化落地​

2026年是边缘AI硬件从概念验证走向规模化部署的关键年。

随着云端推理成本压力和隐私合规要求提升,算力正加速向数据源头迁移,催生边缘服务器、AI终端、智能设备等硬件形态的爆发式增长。

三大落地场景​

场景类别硬件形态核心特征2026年市场规模预测
边缘服务器小型化机柜、边缘计算节点功率密度40-80kW/柜,支持液冷全球出货量增长28%
AI终端设备AI手机、AI PC、智能眼镜端侧NPU算力60+TOPS,离线推理15亿台出货量
IoT设备智能摄像头、传感器、机器人低功耗芯片,实时响应市场规模突破1.5万亿美元

技术突破点​

  1. 端侧模型压缩:通过量化、蒸馏等技术,将百亿参数模型压缩至端侧可运行。

  2. 异构计算架构:CPU+NPU+GPU协同,在功耗约束下实现性能最大化。

  3. 内存带宽优化:HBM技术在边缘芯片的应用,缓解"内存墙"问题。

边缘AI的爆发意味着硬件设计必须兼顾"性能密度"与"功耗效率",传统通用芯片面临专用化挑战。


趋势3:专用芯片与异构计算,打破单一架构垄断​

2026年AI芯片市场将呈现"一超多强、百花齐放"的竞争格局。

英伟达虽在训练领域保持优势,但在推理、边缘、特定场景等细分市场,专用芯片(ASIC)和异构计算方案正快速崛起。

主要技术路线对比​

芯片类型代表厂商核心优势适用场景
通用GPU英伟达、AMD生态成熟,编程灵活云端训练、复杂推理
专用ASIC谷歌TPU、寒武纪能效比高,成本优势大规模推理、特定算法
存算一体多家初创公司突破"内存墙",低延迟边缘推理、实时处理
FPGA/DPU赛灵思、华为可重构,灵活性高网络加速、数据预处理

市场格局变化​

  1. 国产替代加速:中国AI芯片厂商在推理、边缘等场景市占率提升至30%以上。

  2. 开源生态崛起:ROCm、OpenML等开源框架降低专用芯片开发门槛。

  3. Chiplet技术普及:通过先进封装整合不同工艺节点芯片,实现性能与成本平衡。

  4. GTC 2026新品加速落地(2026年6月1日台北):

    • Vera Rubin平台:NVL72机架系统,智能体吞吐量比Grace Blackwell提升10倍
    • Vera CPU:88核Olympus自研架构,专为Agentic AI低延迟设计
    • RTX Spark:与联发科、微软合作,重构Windows PC生态,1 PFLOP AI算力
    • Nemotron 3 Ultra:SSM+MoE混合架构,推理速度提升5倍,成本降低30%

该趋势的核心逻辑是:没有一种芯片能通吃所有AI场景,场景碎片化催生技术路线多元化。


趋势4:能效与散热,从技术挑战到商业瓶颈​

随着AI芯片功耗突破千瓦级(英伟达Rubin GPU达2300W),能效和散热从"配套技术"升级为"核心瓶颈"。

2026年,单机柜功率密度将突破240kW,传统风冷方案彻底失效,液冷技术从"可选项"变为"必选项"。

关键数据​

  • 电力成本占比:AI数据中心电力成本占运营成本比例从15%升至35%
  • 散热价值提升:单台GB300服务器液冷组件价值约5万美元,占硬件成本15-20%
  • PUE指标优化:液冷数据中心PUE可降至1.1以下,但前期投资增加30%

技术演进方向​

  1. 液冷方案分层:冷板式(主流)、浸没式(高密度)、两相冷却(前沿)

  2. 电源架构升级:从12V转向48V/800V高压直流,减少转换损耗

  3. 热管理智能化:AI预测性散热,根据负载动态调整冷却策略

该趋势意味着,硬件厂商的竞争力不仅取决于芯片性能,更取决于"系统级能效优化能力",散热、供电、机柜设计等配套技术的重要性大幅提升。


趋势5:AI原生硬件生态,从"兼容"到"重构"​

2026年,AI硬件正经历从"适配AI"到"为AI而生"的范式转变。

传统通用硬件架构难以满足AI工作负载的独特需求,催生AI原生硬件设计理念的兴起。

三大重构方向​

1. 计算架构重构​
  • 内存层次优化:HBM4内存带宽突破3TB/s,存算一体架构减少数据搬运
  • 互联技术升级:NVLink 6.0带宽达1.8TB/s,支持GPU间直接通信
  • 异构集成:通过先进封装将CPU、GPU、内存堆叠,提升带宽降低延迟
2. 软件定义硬件​
  • 可重构逻辑:FPGA、DPU支持算法动态加载,适应不同AI模型
  • 编译器优化:AI编译器(如MLIR)自动优化硬件资源分配
  • 硬件抽象层:统一编程接口屏蔽底层硬件差异
3. 生态协同演进​
  • 模型-硬件协同设计:大模型架构考虑硬件约束(如稀疏化、量化)
  • 开源硬件设计:RISC-V在AI芯片的应用,降低开发门槛
  • 垂直整合:云厂商自研芯片(如AWS Graviton、谷歌TPU),软硬一体优化

该趋势的本质是:AI工作负载的特征(矩阵运算、高并行、内存敏感)正在重新定义硬件设计原则,传统x86架构的通用性优势在AI场景下被削弱。


关键结论与展望​

1. 五大趋势相互关联、彼此强化​

推理需求爆发推动边缘部署,边缘场景催生专用芯片,高功耗倒逼能效革命,而所有变化最终指向AI原生硬件生态的重构。

这一轮变革的核心驱动力是AI从"技术演示"走向"商业落地",硬件必须满足"规模化、低成本、高可靠"的产业要求。

2. 产业链参与者的机会窗口​

对于产业链参与者而言,2026年的机会在于:

  • ✅ 抓住推理红利:布局推理专用芯片与系统优化
  • ✅ 深耕垂直场景:针对特定行业/应用定制硬件方案
  • ✅ 突破能效瓶颈:液冷、高压直流、AI热管理等技术
  • ✅ 构建开放生态:开源框架、开放标准、跨界合作

那些能够提供"端到端解决方案"而非"单点芯片"的厂商,将在这一轮洗牌中占据优势地位。

3. 动态调整与持续演进​

以上分析基于2026年初市场数据和行业预测,实际发展可能因技术突破、政策调整、市场需求变化等因素而动态调整。


产业启示​

2026年是AI硬件产业的分水岭之年:

  • 从"算力竞赛"到"落地为王"
  • 从"单点突破"到"系统优化"
  • 从"通用架构"到"专用定制"
  • 从"性能优先"到"能效兼顾"

那些能够敏锐捕捉趋势、快速调整战略、持续技术创新的厂商,将在AI硬件的"落地纪元"中赢得先机。


参考文献:

  • 中智盟咨询(CSHIA Research)《2026年AI硬件五大变革与生存法则》
  • 科技迷你小小生,《AI硬件进入"落地纪元"》,搜狐科技,2026年2月10日