夜雨聆风学习资料网

ARTICLE · 1110382

DeepSeek联手华为补国产AI软件短板:替代英伟达不能只靠芯片

DeepSeek联手华为补国产AI软件短板:替代英伟达不能只靠芯片
【一句话判断】DeepSeek一次开源了计算、通信和注意力等多套昇腾工具。国产AI竞争正在跨过“有没有芯片”,进入“能否让模型容易开发、稳定运行并把芯片性能真正用出来”的深水区。

一块性能不错的AI芯片摆在机房里,为什么模型还不一定愿意来?

因为芯片只是发动机。要让成千上万名开发者把模型搬过来,还要有编程语言、编译器、计算库、通信库、调试工具和大量已经优化好的代码。发动机造出来了,道路、加油站和维修体系没有跟上,整辆车照样跑不快。

9月30日,DeepSeek将一批面向华为昇腾950的AI基础设施开源。里面既有负责矩阵乘法的DeepGEMM-Ascend,也有让多块芯片交换数据的DeepEP-Ascend,还有处理注意力计算的FlashMLA相关组件。高性能编程语言TileLang也正式支持昇腾950。

这件事最值得注意的地方,不是两家中国科技公司又“宣布合作”,而是合作已经钻进AI计算最难、也最容易被忽视的一层:让模型真正读懂国产芯片,并把芯片的能力尽量榨出来。

英伟达卖的不只是一块GPU

很多人把国产算力替代理解为硬件问题:只要造出性能接近的芯片,就能少买英伟达。

现实远比这复杂。

英伟达真正难以替代的资产之一,是从2006年开始积累的CUDA。它不是一个孤零零的软件,而是一整套并行计算平台:开发者用它写程序,编译器把程序翻译给GPU,数学库和通信库完成常见运算,调试和性能分析工具再帮助工程师找到哪里跑得慢。

久而久之,大量AI框架、科研代码和企业系统都围绕CUDA生长。换一块芯片,不只是换硬件,还意味着迁移代码、重新调试、验证精度、解决兼容问题,并重新训练一批工程师。

因此,国产芯片真正要跨过的门槛从来不是“能不能点亮模型”,而是三步:能跑、跑稳、跑得足够快。许多替代方案卡在第二步和第三步。

DeepSeek开源的三件工具,分别在补什么

大模型每天都要重复海量计算。其中最基本的一类,是矩阵乘法。DeepGEMM-Ascend相当于把这类常用重活预先写成高性能程序,减少开发者从头优化的时间。

DeepEP-Ascend解决的是另一种拥堵。DeepSeek采用混合专家模型,一次任务只调用部分“专家”,但这些专家可能分散在不同芯片上。数据必须在芯片之间高速分发、再汇总,通信稍慢,昂贵的计算单元就会站着等。这个通信库的任务,就是让数据在昇腾芯片之间更高效地流动。

FlashMLA相关组件则瞄准大模型最吃算力和显存的注意力计算,覆盖输入阶段和逐字生成阶段。

把它们连起来看,DeepSeek不是为昇腾做一个展示程序,而是在拆解真实模型运行中的几处堵点:怎么算、怎么传、怎么处理长文本。

TileLang承担的角色更像翻译器。过去,追求极致性能往往需要工程师深入硬件底层,手工编写和优化算子。TileLang尝试用更接近Python的方式描述计算,再生成适配不同芯片的底层代码。它现在把昇腾950纳入正式支持范围,目标是让开发者少写一些晦涩代码,也能接近手工优化的性能。

国产AI软件生态要解决的核心问题,是让开发者不必每换一种芯片,就重新学一门“方言”。
为什么由一家模型公司来补芯片软件

过去,芯片厂商往往先造硬件、发布工具,再等待模型公司适配。现在,前沿模型的结构变化太快,芯片和软件很难各走各路。

DeepSeek知道自己的模型在哪些运算上最耗时,华为知道昇腾950的计算单元、内存和互联怎样工作。双方共同推进由128块昇腾950组成的超节点方案,计算库和通信库也针对这套硬件调优。

这种“模型—软件—芯片”共同设计,比简单移植更有价值。模型公司把最真实、最苛刻的工作负载带给芯片厂商;芯片厂商则把底层能力开放给模型团队。软件不再等硬件造完以后补课,而是在系统设计阶段就参与进来。

对中国AI产业而言,这也是一个重要变化:国产算力竞争正在从参数表上的单卡性能,转向整套系统能否完成训练和推理。

这还不是CUDA替代完成

这批开源工具很重要,但距离“替代CUDA”仍有很长一段路。

第一,目前公开组件主要围绕DeepSeek模型和昇腾950的特定工作负载优化。它们能否顺利服务更多模型、更多行业应用和更多代际的芯片,还要靠开发者实际使用。

第二,开源仓库公布的部分性能测试基于指定版本的CANN、PyTorch和概念验证硬件环境。实验中的高带宽,不等于不同数据中心部署以后都能复现。

第三,CUDA的优势不只在几个高性能算子。它还包括大量成熟的库、框架支持、错误诊断、性能分析、文档、培训和多年积累的开发者经验。这些无法靠一次开源补齐。

所以,判断这次合作有没有真正改变生态,不能只看代码仓库上线。接下来更值得看三件事:这些工具是否被DeepSeek之外的模型采用;昇腾集群能否在长期运行中保持稳定;开发者把CUDA程序迁移过来,需要付出多少时间和性能损失。

美国对高端AI芯片的出口限制,逼着中国企业从“买一块可以用的替代芯片”,走向“搭一套能够持续进化的国产计算体系”。DeepSeek与华为这次补上的,还只是其中几段道路。

但方向已经清楚:芯片决定算力的上限,软件决定这份算力有多少真正属于开发者。国产AI要减少对英伟达的依赖,最终必须同时拥有自己的发动机和交通系统。

资料来源与口径

- 路透社:DeepSeek与华为合作开发昇腾芯片编程工具

- DeepSeek开源项目:DeepGEMM-Ascend

- DeepSeek开源项目:DeepEP-Ascend

- DeepSeek开源项目:FlashMLA昇腾技术说明

- TileLang项目:昇腾950后端与多硬件支持范围

- 华为昇腾:CANN开发文档

- 英伟达:CUDA平台与开发工具说明

相关阅读
AI基建大战:中央再提算力网、DeepSeek造芯、美光加码建厂
DeepSeek招聘土木人才,被指转向自建算力
DeepSeek调价最高涨11倍:按模型能力分级收费,开发者重算成本

相关学习资料