夜雨聆风学习资料网

ARTICLE · 1123066

DeepSeek开源昇腾全栈组件:国产AI算力软件生态的关键一步

DeepSeek开源昇腾全栈组件:国产AI算力软件生态的关键一步

9月30日,DeepSeek正式开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang高级语言编译工具、计算库及分布式通信库,所有组件与英伟达平台版本一一对应。从TileLang到DeepGEMM、DeepEP,再到FlashMLA和DeepSelect,这套组件的意义不只是“支持昇腾”,而是把DeepSeek自用的核心研发工具完整搬到了另一条硬件路线上。

真正值得关注的,不是性能数字,而是开发者迁移成本能否降下来。

从模型适配到工具迁移,走了三个阶段

这次开源不是突然冒出来的。2025年9月,TileLang-Ascend首次开源,围绕昇腾建设高级语言开发能力的工作就已公开。2026年4月,DeepSeek V4发布并全面适配昇腾,国产大模型首次在国产芯片上完成从训练到推理的全栈部署。到了9月这次,适配范围直接对齐DeepSeek自家训练使用的全部TileLang算子,计算与通信组件成套开放。

这个递进路径说明一件事:DeepSeek对昇腾的支持,已经从“用起来”走到了“开发起来”。 以前是模型发布后做适配,现在是模型研发阶段的工具链本身就具备双平台能力。

那这一步到底改变了什么?

真正的门槛不是芯片,是工具链

CUDA生态的护城河从来不只是GPU本身。开发者写代码、调模型、搭框架都绑在CUDA上,换平台意味着整套技术栈重来。有报道显示,从CUDA迁移到华为CANN,需要重写并重新优化大量代码,部分项目时间和投入成本至少增加50%。

TileLang昇腾版本做的事情,就是让开发者不用直接面对Ascend C底层指令。它封装了底层编程方式,同时保留硬件性能不损失。更关键的是,TileKernels支持同一套Python接口在英伟达GPU和华为NPU上运行,底层根据硬件自动选择实现。

如果开发者能用一套代码跑两个平台,CUDA的锁定效应就会被削弱。 这比单纯跑分有意义得多。

但接口兼容只是第一步。性能能不能真正对齐硬件上限,还要看双方的合作深度。

昇腾950的128卡方案,才是真正的系统级交付

DeepSeek在公告中特别提到,与华为共同推进基于昇腾950的128卡超节点方案,对计算与通信做了深度优化。

这个超节点不是概念产品。满配状态下由128个计算柜和32个互联柜组成,共160个机柜,搭载8192颗昇腾950DT芯片,计划2026年第四季度上市。目前昇腾384超节点已商用落地750多套,覆盖互联网、运营商、金融、教育、医疗等行业。

算力竞争正在从单芯片性能比较,转向系统级有效算力的调度能力。 8192颗芯片能不能像一台计算机一样协同工作,比某一颗芯片跑多快更重要。

这意味着什么?对做推理服务的团队来说,超节点方案能降低部署复杂度;对做训练的团队来说,万卡级集群的可用性直接决定模型迭代速度。但问题也在这里——系统越大,软件生态的短板就越容易被放大。

市场数据已经在反映这个趋势

TrendForce最新报告预测,2026年中国高端AI芯片市场中,国产解决方案份额将接近90%,留给英伟达、AMD的空间可能只剩一成左右。投行Bernstein预测更激进:英伟达在中国AI半导体市场的份额可能从2025年的约40%下降到2026年的8%左右,华为可能超过50%。

对比去年12月的数据,当时TrendForce还预计国产份额约50%、进口产品约30%,短短8个月预期大幅上调。这种调整速度说明,产业界对国产算力的信心在快速积累。

英伟达真正的护城河从来不是GPU算力本身,而是CUDA让开发者“不想换”的惯性。 DeepSeek这次开源的组件,本质上是在给开发者修一条从CUDA迁移到昇腾的路。路修好了,换不换是时间问题。

但挑战同样真实。国产算力软件生态仍存在“生态碎片化”问题,多家芯片厂商各守一套软件栈,开发者需要在M种模型和N种芯片之间逐一适配。DeepSeek选择聚焦昇腾一家做深度适配,策略务实,但能否带动更多模型厂商跟进,还需要观察。


内容来源:网络

本期编辑:小艾 

论文投稿:作为领先的高科技先进制造技术产业服务平台,AMT接受学术论文投稿;稿件的发布完全是公益和免费的;论文投稿邮箱:info@amtbbs.org

版权声明:AMT尊重版权并感谢每一位作者的辛苦付出与创作;除无法溯源的作品,我们均在文末备注了来源;如文章、视频、图片、文字涉及版权,请原创作者第一时间联系我们,我们将根据您提供的证明材料确认版权后立即删除内容或按国家规定标准支付稿酬!

相关学习资料