买来一支装备不错的车队,不等于马上就能跑好比赛。车手还需要熟悉车辆,维修站要备齐工具,多辆车之间也得配合顺畅。AI芯片同样如此:纸面算力只是发动机,真正让模型跑起来,还要靠编译器、计算库和通信库。
9月30日,DeepSeek一次性开源了面向华为昇腾平台的一组基础设施组件。它不只移植某个模型,而是把编写算子、执行计算和连接多块芯片所需的几层工具一起补上。值得关注的也不只是“国产替代”四个字,而是昇腾生态开始触碰CUDA最坚固的部分:软件工具和开发习惯。
这里的性能数字主要来自DeepSeek或华为披露,部分实现细节经InfoQ查验公开仓库;它们能说明工程进展,但不能直接证明昇腾生态已经与CUDA等价。
不是一把工具,而是一整只工具箱
CUDA是Nvidia围绕自家GPU建立的编程平台和软件生态。开发者可以调用成熟工具,让芯片高效完成AI计算。它长期构成Nvidia的重要优势,因为团队一旦围绕这些工具写好代码、积累经验,换平台就不只是换一张芯片。
DeepSeek此次开放的核心是TileLang昇腾后端。TileLang是一种编写高性能“算子”的高级语言。算子可以理解为模型运行时反复调用的小型计算程序,例如矩阵乘法。编译器则像翻译员,把开发者写的高级代码变成芯片能够执行的指令。
这套昇腾后端封装了Ascend C底层指令,并提供原生代码生成、调度和同步能力。开发者仍要描述数据类型、分块大小和计算操作,但部分数据搬运、运行顺序及不同计算单元间的协调,可以交给编译器处理。DeepSeek称,TileLang已经承载V4系列模型训练中大部分算子的实现;其训练用到的每一个TileLang算子,也都有昇腾高性能版本。后两项目前都属于DeepSeek单方披露。
高级语言的价值,是让开发者少写底层代码,又尽量不牺牲性能。公开案例称,用TileLang实现FlashAttention——一种提高注意力计算效率的方法——可把代码从500多行压缩到80行,同时保持与官方版本相当的性能。不过,这个数字缺少统一测试条件,更适合用来理解开发方式的变化,不宜当作普遍结论。
编译工具之外,还有五项现成组件:DeepGEMM负责矩阵乘法;DeepEP负责多块设备之间交换数据;TileKernels封装向量计算和数据访存等常用操作;FlashMLA处理稀疏注意力,即只计算被选中的部分内容;DeepSelect负责从候选数据中筛出得分最高的项目。
这套组合的重要性在于覆盖完整链路。计算库把常用运算预先优化好,团队不必每次从底层重写;分布式通信库则负责多卡之间高速传递数据。单卡算得再快,如果下一张卡迟迟收不到数据,整个集群仍要等待。
128张卡,难点在于别互相等
DeepSeek还与华为共同推进了基于昇腾950的128卡超节点方案,并联合优化计算和通信。“超节点”可以理解为把许多加速卡组织成一台更大的计算机,让它们以较低延迟协同工作。
据华为提供的材料,SuperPoD Flex和UBL128方案可组成128卡、3.2 Tbps的单层交换Scale-up网络,也可扩展为256K卡的两层交换Scale-out网络。前者强调节点内部紧密连接,后者负责把规模向外扩展。
在相关测试中,DeepEP的数据分发带宽达到375 GB/s,结果汇总带宽达到347 GB/s。DeepSeek称,多项关键测试里的计算和通信性能已接近硬件上限。但这些仍是厂商披露的组件级测试,公开材料没有提供完整对照平台和独立复现实验,不能据此外推整套训练或线上服务的表现。
华为还披露了一组DeepSeek-V4.1-Flash离线推理数据:采用EP32部署时,TPOT为5毫秒,每卡吞吐为2469 tokens/s;TPOT放宽到10毫秒,吞吐为5102 tokens/s。TPOT是模型输出每个token——可理解为一个字词片段——所需的平均时间。
但这不是线上服务成绩。测试使用128K上下文,DSpark投机接受率为0.85,只统计不含Serving框架的纯模型性能,也没有计入请求调度和负载均衡。它适合观察特定配置下的执行能力,不适合直接估算真实产品能服务多少用户。
真正挑战的是开发者为何留下
据Reuters报道,这项合作意在降低对Nvidia及CUDA生态的依赖。这里的“降低”比“替代”更准确。
公开说法称,新组件与DeepSeek此前面向Nvidia平台的组件“一一对应”。这意味着组件类别或部分API能够对应,已有代码获得了复用和迁移的入口;它不意味着两边的功能、数据格式、硬件要求与性能已经完全相同。
这仍是一次值得重视的推进。过去,昇腾可以运行模型,不等于模型团队能方便地为它开发新算子,更不等于一套工具能覆盖编译、计算和多卡通信。此次开放把来自前沿模型实际需求的实现交给社区,也给开发者留下查看、修改和继续优化的入口。
CUDA的软件优势来自长期积累。挑战它,不能只证明一款芯片在某次测试中很快,还要让开发者愿意写代码、迁移代码,并在模型不断变化时继续使用。DeepSeek和华为这次做的,正是从“模型能不能跑”向“开发者能不能持续开发”迈了一步。
局限与未知
- 昇腾版尚未完全追平CUDA版:DeepGEMM的量化缩放因子布局不同;DeepEP部分通信能力仍在开发;FlashMLA部分内核仍只支持CUDA;DeepSelect昇腾实现目前只支持BF16数据格式。
- 已披露成绩主要是厂商测试或组件级微基准,缺少统一对照和独立复现,不能证明完整训练、线上Serving或不同负载下都能达到同样表现。
- 此次发布证明了一套工具链正在形成,但开发者规模、跨模型通用性、长期维护和社区成熟度仍未披露。它开始挑战CUDA的软件护城河,距离复制这条护城河还有多远,目前没有答案。