ARTICLE · 1149304
DeepSeek开源昇腾基础设施组件:软件生态"卡脖子"破局,还是又一次自我感动?
2026年9月30日,国庆假期前一天,DeepSeek放出一则消息:正式开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang高级语言编译工具、高性能计算库与分布式通信库,并特别强调——"所有组件与此前面向英伟达平台的开源组件一一对应"。

这不是DeepSeek与华为的第一次握手,而是三年协同的第三次落子:
本次开源的核心是TileLang昇腾版——一个对标CUDA的算子编程语言,对昇腾Ascend C底层指令做封装,宣称"提供高级语言的编程方式、同时不损失硬件性能"。与之配套的DeepGEMM(矩阵运算)、DeepEP(分布式通信)、FlashMLA(稀疏注意力)等,分别在英伟达生态中找到对应物:cuBLAS、NCCL、FlashAttention。
消息一出,舆论一片沸腾:"正面硬刚英伟达CUDA""国产算力软件栈要翻身了""中国版CUDA时刻"。在一片欢呼声中,这篇文章想做的事情是:拆开看,这件事的真实成色到底如何。
二、深入剖析
1. 为什么是DeepSeek:它凭什么能"破局"
要理解这次开源的分量,先要理解DeepSeek的特殊位置。
第一,它是全球最强的开源模型厂商之一。DeepSeek V4.1 Flash在LiveBench位列全球第六,中美AI模型性能差距被压缩至3%左右。它不是"国产芯片的适配方",而是"定义模型前沿的玩家"——它选择适配昇腾,等于用自身实力为昇腾生态做了信用背书。
第二,它已经真刀真枪地跑通了。DeepSeek官方披露,其训练所用的全部TileLang算子,均已在昇腾平台完成高性能适配;双方还联合定义了基于昇腾950的128卡超节点方案。这跟过去常见的"国产芯片跑通大模型"的演示不同——那是"能在上面跑起来",这是"把家底整个搬上去"。
第三,它让对手感到了真实的恐惧。2026年4月,黄仁勋在访谈中直言,DeepSeek率先在华为芯片上发布模型的那一天,对美国将是"可怕的结果"。能让英伟达CEO公开表达焦虑的国产化事件,此前几乎没有。
2. 开源清单的技术含金量:对标CUDA的成色几何
但"对标CUDA"这句话,值得用放大镜看。
先看性能。第三方公开测试数据显示:在4096×4096×4096的GEMM算子中,手写AscendC耗时497.930微秒,TileLang耗时501.190微秒,比值0.993——即TileLang比手写底层指令慢约0.7%;整批cube类算子平均为0.98倍。
这个数据说明什么?它说明TileLang"不损失硬件性能"的宣称基本成立——但它只是"逼近",在已公开的测试数据中未见"超越"。官方口径"达到硬件性能上限"是一种修辞:硬件性能上限的定义权本身就在华为手里,而手写AscendC才是那个上限的近似真值。TileLang的价值在于"用接近手写的性能换取接近CUDA的易用性",这本身是了不起的工程成就——但请别把"接近"听成"突破"。
再看生态成熟度。一个常被忽略的细节是,昇腾社区自己的技术选型对比表里,对TileLang的定位写得非常诚实:
TileLang——优势:跨厂商可移植、国产化友好;局限:工业深度优化不足、开源生态建设中。
这是昇腾社区对TileLang的官方评估。翻译过来就是:语言框架有了,但距离"工业级、开箱即用"还有明显距离。
3. 战略动机的多层拆解:这不是慈善,是算账
任何一次成功的产业动作,背后都是精密的利益计算。DeepSeek这次开源,至少算清了四笔账。
第一笔账:算力去风险化。 把全部家当押在英伟达单一供应链上,对任何一家认真做AI的公司都是不可承受之重。据行业测算,昇腾950DT的硬件采购成本约为英伟达同级方案的三分之一,单位Token推理成本可降至GPT-4 Turbo的七十分之一。对以API服务为核心商业模式的DeepSeek而言,多一个成熟的国产算力平台,就是多一层议价筹码、多一条生存后路。
第二笔账:生态话语权。 整个行业被英伟达的编程语言绑定了几十年。如果TileLang能成为跨平台的行业通用语言,DeepSeek就从"模型公司"升维成"平台定义者"——它不再只是生态的参与者,而是规则的制定者。这笔账的远期回报,远超任何一次模型发布的收入。
第三笔账:政企市场。 信创政策持续推进,政企市场对国产化率有硬性要求。DeepSeek深度绑定昇腾,等于提前卡位了国内政企大模型采购的资格席位。
第四笔账:与华为的"芯模协同"。 据《科创板日报》披露,华为向DeepSeek团队提供了联合定义的昇腾超节点与大量技术支持,相关成果同步开源进CANN社区。这是一场双向奔赴:华为给算力与硬件know-how,DeepSeek给软件生态与全球影响力。
4. 批判一:开源不等于生态,"六件套"与"繁荣"之间隔着鸿沟
现在说最要紧的部分。
CUDA真正的护城河,从来不是那门语言本身,而是语言背后的整个体系:二十年的积累、数百万开发者的肌肉记忆、浩如烟海的库与工具链、完善的调试器、成熟的性能分析工具,以及"遇事不决搜CUDA"的社区惯性。徐直军自己都承认:"整个学术界都是伴随CUDA成长起来的,所有算法开发者都已习惯了PyTorch加CUDA的便利。"
一个编译工具加五个算子库,解决的是"能不能写"的问题;而"好不好写、出了bug怎么调、性能瓶颈怎么定位、版本更新会不会破坏兼容"——这些决定开发者愿不愿意长期留下的问题,开源公告里一个字都没有提。
"一一对应"这个表述本身也值得警惕。它意味着这次开源的性质是"移植"而非"原生":把英伟达平台上验证过的路径,复制到昇腾上。移植的优势是快,劣势是路径依赖——当英伟达升级架构、推出新的编程范式(如cuTile等新一代工具)时,昇腾生态的跟进永远慢半拍。你永远在追赶别人定义的赛道。
5. 批判二:生态的"单点依赖"是最大隐患
目前昇腾软件生态的建设,高度依赖DeepSeek这一家模型厂商。这带来一个结构性问题:
如果DeepSeek的商业发展受挫——无论是融资环境恶化、模型竞争力下滑,还是战略转向——整个昇腾生态的软件推进节奏都会被打断。FlagOS等第三方机构虽然也在做多芯片适配,但其深度、持续性与头部模型厂商不可同日而语。
更微妙的是,昇腾体系内部的软件层次已经不少:CANN是底层计算架构,MindSpore是AI框架,TileLang是编程语言,现在又多了一个DeepSeek带进来的整套组件。各层次各有归属,生态话语权分散。短期是百花齐放,长期可能演变为资源分散、标准内耗。
6. 批判三:利益格局里,谁在欢呼,谁在沉默
这场开源的真实受益者链条很清晰:
华为:获得全球顶级模型厂商的生态背书,弥补软件短板; DeepSeek:获得算力保障、成本优势与平台话语权; 开发者:多了一个可选项,理论上降低了被单一生态绑架的风险。
沉默者是谁?一线真正的昇腾开发者。他们知道,从"语言能跑"到"项目能迁、性能能调、线上能稳定"之间,还有漫长的文档、工具链、调试体验的欠账。舆论的欢呼声越大,这种真实差距越容易被掩盖。
还有一层更冷静的判断:这次开源是"产业政策+商业理性"的合谋,两者目标高度一致,所以推进得又快又顺。但恰恰因为太顺,我们更要警惕用叙事替代现实——把"重要进展"包装成"全面胜利",是国产科技叙事里最常见的自我伤害。
三、我的判断
第一,这是国产算力软件生态的重要里程碑,但请把"CUDA时刻"这个词收回去。 里程碑和颠覆之间,隔着一个"开发者用脚投票"的距离。CUDA的统治地位是二十年、数百万开发者、无数生产事故锤炼出来的,不是一套开源组件可以动摇的。这次开源解决的是"昇腾能不能用"的问题,而"好不好用、愿不愿意用",才刚刚开始。
第二,真正的胜负手不在编译器,而在正循环能否启动。 软件生态的繁荣公式从来都是:装机量×开发者×应用×时间。DeepSeek开源为这个公式提供了"应用"的种子,但种子需要土壤——足够的昇腾装机量、友好的开发体验、持续的资金投入——才能长成森林。未来12到24个月,最值得跟踪的指标不是又开源了几个组件,而是:非DeepSeek、非华为体系的第三方开发者,基于昇腾做出了多少原生创新。这个数字才是生态健康度的真实体温计。
第三,警惕"单点英雄"叙事。 一个健康的生态不该押注在单一厂商的善意和持续投入上。昇腾软件生态的长期出路,是把DeepSeek的开源从"一个人的贡献"变成"一群人的基础设施"——这需要华为拿出比开源组件更稀缺的东西:稳定的硬件路线图承诺、透明的架构文档、以及对待第三方开发者如对待自家团队的诚意。
第四,把这件事放回更大的坐标系看。 昇腾950的II级安全认证打开了关键行业市场,DeepSeek的开源补强了软件生态,但产能约束(麒麟与昇腾共享稀缺先进制程)始终是总闸门。这三件事拼在一起才是完整的图景:认证开了门,生态铺了路,但产能设了顶。软件层的进展再漂亮,也绕不开制造层的那道物理天花板。
最后说一句可能不中听但必须说的话:这次开源值得认真鼓掌,但拒绝自我感动。真正的国产算力崛起,不是看我们发布了多少对标声明,而是看十年后,有多少全球开发者——包括不关心地缘政治的开发者——在自由选择的前提下,主动写下昇腾的代码。那一天到来之前,所有"破局"都只是"破题"。
