产品概述
中昊芯英 是国内新兴的 TPU 架构 AI 芯片 创业公司,2026 年 6 月 30 日 正式发布 须臾 TPU(训推一体),成为继 Google 之后全球少数掌握 TPU 架构的企业。官方发布口径 混合精度浮点算力 896 TFLOPS、INT8 1792 TOPS、TDP 600W,单超节点最高 2048 片全光互联,官方称同算力功耗较传统芯片降低约 50%。天津移动 TPU 智算中心 已投入运行,是 国产 TPU 商业化的首个标杆案例。
核心设计理念:摒弃 GPU 的图形渲染模块,纯 ASIC 设计专注于 AI 计算(IP、指令集、算子库全自研),在相同工艺节点下能效显著优于传统 GPU。软件栈兼容 PyTorch / vLLM / SGLang / DeepSpeed / Megatron。
核心规格
| 项目 | 参数 |
|---|
| 发布 | 2026-06-30(须臾正式发布) |
| 架构 | 自研 TPU(纯 ASIC,无图形渲染;IP/指令集/算子库自研) |
| 制程 | 未公开 |
| FP16/BF16 算力 | 896 TFLOPS(混合精度浮点,官方发布口径) |
| INT8 算力 | 1792 TOPS |
| FP32 算力 | 未公开 |
| TDP | 600 W |
| 互联 | 全光互联,单超节点最高 2048 片 |
| 软件兼容 | PyTorch / vLLM / SGLang / DeepSpeed / Megatron |
| 量产状态 | 已量产交付 |
| 单价 | 未公开 |
📌 数据订正(2026-09 交叉验证):本页此前记录「INT8 512 TOPS / FP16 256 TFLOPS(推测)/ TDP 400W / 2026-05 发布」为早期媒体口径;已按 2026-06-30 须臾发布会口径更新为 混合精度 896 TFLOPS、INT8 1792 TOPS、600W、单超节点最高 2048 片全光互联。
能效对比
| 芯片 | 功耗 | 算力 | 相对定位 |
|---|
| 中昊芯英 须臾 TPU | 600 W | 混合精度 896 TFLOPS / INT8 1792 TOPS | 官方称同算力功耗较传统芯片降约 50% |
| NVIDIA H100 | 700 W | 3959 TOPS INT8 | 基线 |
| 寒武纪 思元590 | 350 W | 512 TOPS INT8 | 国产对标 |
ℹ️ 能效优势来源:纯 ASIC 设计无图形冗余,专用矩阵乘法单元(MXU)架构类比 Google TPU,在推理场景功耗和散热成本显著低于 GPU。
商业化落地
| 项目 | 详情 |
|---|
| 首发客户 | 天津移动 |
| 部署场景 | 天津移动 TPU 智算中心 |
| 运行状态 | 已投入运行 |
| 行业意义 | 国产 TPU 商业化首批标杆 |
与 GPU 架构差异
| 维度 | 中昊芯英 TPU | 传统 GPU(如 H100) |
|---|
| 设计理念 | 纯 AI ASIC | 通用 GPU(图形+AI) |
| 能效 | 高(无图形冗余) | 较低 |
| 编程灵活度 | 较低(固定数据流) | 高(CUDA 通用计算) |
| 生态兼容 | 自研(无 CUDA 兼容,兼容主流框架接口) | CUDA 生态 |
| 适用场景 | AI 推理 + 训练 | 通用计算 |
适用场景
- ✅ AI 推理(高能效场景)
- ✅ 智算中心建设(国产化合规)
- ✅ 千亿参数大模型训练(超节点规模全光互联)
- ✅ 低功耗 / 低散热成本场景
- ❌ 复杂数据流模型(灵活度低于 GPU)
- ❌ 图形渲染 / 通用计算
厂商信息
| 项目 | 内容 |
|---|
| 公司 | 中昊芯英(杭州)科技有限公司 |
| 定位 | 国产 TPU 架构 AI 芯片新势力 |
| 核心产品 | 须臾 TPU(2026-06-30 发布) |
| 首发客户 | 天津移动 |
| 首发时间 | 2026 年 6 月 30 日 |
| 融资 | 多轮融资 |
相关产品对比