跳到主要内容

中昊芯英 须臾 TPU (AI 训练/推理)

产品概述​

中昊芯英 是国内新兴的 TPU 架构 AI 芯片 创业公司,2026 年 6 月 30 日 正式发布 须臾 TPU(训推一体),成为继 Google 之后全球少数掌握 TPU 架构的企业。官方发布口径 混合精度浮点算力 896 TFLOPS、INT8 1792 TOPS、TDP 600W,单超节点最高 2048 片全光互联,官方称同算力功耗较传统芯片降低约 50%。天津移动 TPU 智算中心 已投入运行,是 国产 TPU 商业化的首个标杆案例。

核心设计理念:摒弃 GPU 的图形渲染模块,纯 ASIC 设计专注于 AI 计算(IP、指令集、算子库全自研),在相同工艺节点下能效显著优于传统 GPU。软件栈兼容 PyTorch / vLLM / SGLang / DeepSpeed / Megatron。

核心规格​

项目参数
发布2026-06-30(须臾正式发布)
架构自研 TPU(纯 ASIC,无图形渲染;IP/指令集/算子库自研)
制程未公开
FP16/BF16 算力896 TFLOPS(混合精度浮点,官方发布口径)
INT8 算力1792 TOPS
FP32 算力未公开
TDP600 W
互联全光互联,单超节点最高 2048 片
软件兼容PyTorch / vLLM / SGLang / DeepSpeed / Megatron
量产状态已量产交付
单价未公开

📌 数据订正(2026-09 交叉验证):本页此前记录「INT8 512 TOPS / FP16 256 TFLOPS(推测)/ TDP 400W / 2026-05 发布」为早期媒体口径;已按 2026-06-30 须臾发布会口径更新为 混合精度 896 TFLOPS、INT8 1792 TOPS、600W、单超节点最高 2048 片全光互联。

能效对比​

芯片功耗算力相对定位
中昊芯英 须臾 TPU600 W混合精度 896 TFLOPS / INT8 1792 TOPS官方称同算力功耗较传统芯片降约 50%
NVIDIA H100700 W3959 TOPS INT8基线
寒武纪 思元590350 W512 TOPS INT8国产对标

ℹ️ 能效优势来源:纯 ASIC 设计无图形冗余,专用矩阵乘法单元(MXU)架构类比 Google TPU,在推理场景功耗和散热成本显著低于 GPU。

商业化落地​

项目详情
首发客户天津移动
部署场景天津移动 TPU 智算中心
运行状态已投入运行
行业意义国产 TPU 商业化首批标杆

与 GPU 架构差异​

维度中昊芯英 TPU传统 GPU(如 H100)
设计理念纯 AI ASIC通用 GPU(图形+AI)
能效高(无图形冗余)较低
编程灵活度较低(固定数据流)高(CUDA 通用计算)
生态兼容自研(无 CUDA 兼容,兼容主流框架接口)CUDA 生态
适用场景AI 推理 + 训练通用计算

适用场景​

  • ✅ AI 推理(高能效场景)
  • ✅ 智算中心建设(国产化合规)
  • ✅ 千亿参数大模型训练(超节点规模全光互联)
  • ✅ 低功耗 / 低散热成本场景
  • ❌ 复杂数据流模型(灵活度低于 GPU)
  • ❌ 图形渲染 / 通用计算

厂商信息​

项目内容
公司中昊芯英(杭州)科技有限公司
定位国产 TPU 架构 AI 芯片新势力
核心产品须臾 TPU(2026-06-30 发布)
首发客户天津移动
首发时间2026 年 6 月 30 日
融资多轮融资

相关产品对比​