夜雨聆风学习资料网

ARTICLE · 1106099

国产算力苦「缺软件」久矣,DeepSeek 把英伟达那套开源组件全搬上了昇腾

国产算力苦「缺软件」久矣,DeepSeek 把英伟达那套开源组件全搬上了昇腾

DeepSeek 这次开源,瞄准的不是模型,是模型的地基。

今天上午,DeepSeek 通过官方公众号宣布,正式开源面向华为昇腾算力平台的基础设施组件。涵盖 TileLang 高级语言编译工具、计算库、分布式通信库,而且所有组件,跟它此前给英伟达平台写的开源版本一一对应。

说直白点,英伟达那边能跑的底层活,昇腾这边现在也能干了。

TileLang 是这批里最关键的那个。相对英伟达的 CUDA 语言,它写起来更简单,代码逻辑更短,但性能不打折,反而能把芯片特性发挥到上限。DeepSeek 自己说,TileLang 这条路先在英伟达成熟平台上验证过,目前已经扛起了 DeepSeek V4 系列模型训练里大部分算子的实现。

这次开源的昇腾版本,是把 Ascend C 的底层指令包了一层,用高级语言的方式写,还不损失硬件性能。DeepSeek 训练里用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。

光有 TileLang 还不够,这次一起放出来的还有几个核心组件。DeepGEMM 加速通用矩阵运算,DeepEP 负责大规模跨设备通信,TileKernels 管常规向量计算和访存,FlashMLA 是稀疏注意力算子、能提升长上下文处理效率,DeepSelect 做高效数据筛选。在多项关键测试用例里,这些组件的计算和通信性能,已经接近硬件上限。

我是真觉得,国产算力之前卡得最狠的,不是硬件,是上层软件。卡造出来了,可跑模型的工具链跟不上,开发者用着别扭,生态就起不来。DeepSeek 把这套地基补齐,意义比多训一个大模型还实在。

一手细节在官方那篇推送里。DeepSeek 提到,研发过程里华为团队给了毫无保留的大力支持,双方一起推进了基于昇腾 950 的 128 卡超节点方案,对计算和通信都做了深度优化。这不是 DeepSeek 一家闷头写出来的,是两边攒出来的。

这批组件的代码都挂在了 GitHub 上,TileLang、DeepGEMM-Ascend、DeepEP-Ascend、TileKernels、FlashMLA、DeepSelect,六个仓库对外敞开。

彩蛋放这儿。这次开源的每个组件,名字都对应着英伟达平台上的同名版本。等于 DeepSeek 在告诉外界,昇腾上能复现的那套能力,它已经一项项对上了。国产算力的软件短板,正在被一行行代码填平。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~

相关学习资料