跳到主要内容

海光 DCU Z100

产品概述​

海光 DCU Z100 是海光信息深算系列 GPGPU 加速卡(属"深算一号"代际),基于 AMD CDNA 技术授权深度定制(架构代号 gfx906,CDNA 第一代),是海光"CPU + DCU"异构计算方案的核心。Z100 脱胎于 AMD 生态,可原生兼容 ROCm 开源计算平台,并通过海光自研 DTK(DCU Toolkit) 实现对 CUDA 应用低成本迁移,是国内"类 CUDA"生态成熟度最高的国产加速卡之一。

据北京大学高性能计算系统采购中标公告,Z100 拥有 8192 个通用计算核心、32GB HBM2 显存、FP64 算力 10.8 TFLOPS,硬件参数基本与 NVIDIA A100、AMD MI100 处于同代水平。Z100 与精简版 Z100L 同属深算一号产品家族,广泛部署于国家级超算中心(如昆山、成都、郑州超算)及运营商、银行智算中心。

核心规格​

项目参数
架构GPGPU,基于 AMD CDNA 授权深度定制(gfx906 / CDNA 第一代)
制程7nm(推测,基于同代 Z100L 公开信息)
计算核心8192 个通用计算核心(北京大学中标公告)
FP64 算力10.8 TFLOPS(北京大学高性能计算系统中标公告,权威来源)
FP32 算力未公开(推测 ~10.8 TFLOPS,与 FP64 持平,类 CDNA 架构特性)
FP16 / BF16 算力未公开(推测 ~21.6 TFLOPS)
INT8 算力未公开(推测 ~43.2 TOPS)
显存容量32 GB
显存类型HBM2
显存带宽未公开(Z100L 为 1024 GB/s,Z100 应更高,推测 ~1.2 TB/s)
TDP~250 W(未公开,按产品资料推测)
互联xHMI 互联(深算系列,带宽 ~184 GB/s);PCIe 4.0
接口PCIe 4.0 ×16
发布2022(深算一号)
量产/上市已量产

⚠️ 规格说明:FP64 10.8 TFLOPS / 8192 核心 / 32GB HBM2 来自北京大学高性能计算系统采购中标公告(HCZB-2021-ZB0364),为权威公开数据。FP32/FP16/INT8 算力及显存带宽、TDP 官方未单列,表中推测值来源于行业对比资料与 Z100L 同代参数,标注为推测,仅供参考。海光 DCU 全精度能力突出,双精度(FP64)性能对标 A100/MI100。

关键特性​

  • 类 CUDA 生态:基于 ROCm 开源生态,DTK 工具链支持 HIP/CUDA 自动迁移
  • 全精度计算:具备 FP64/FP32/FP16/INT8 全精度能力,双精度尤为突出
  • x86 协同:与海光 C86 系列 CPU 组成全国产"CPU+DCU"异构整机方案
  • 大模型适配:已适配 LLaMa、GLM、通义千问、DeepSeek 等主流大模型

厂商信息​

项目内容
公司海光信息技术股份有限公司
总部天津
成立2014 年
上市科创板 688041
技术来源AMD x86 / CDNA 授权 + 自研 DCU 架构

适用场景​

  • ✅ 高性能计算(HPC)/ 科学计算(FP64 双精度优势)
  • ✅ 大模型训练与推理(ROCm/CUDA 迁移成本低)
  • ✅ 国家级超算/智算中心(国产自主可控)
  • ✅ 金融/能源/运营商数据中心
  • ❌ 极致低功耗边缘场景(TDP 较高,数据中心定位)
  • ❌ CUDA 原生强依赖且不愿迁移的场景

相关卡​

参考资料​