夜雨聆风学习资料网

ARTICLE · 1065695

国产GPU软件栈:CUDA替代走到哪了

国产GPU软件栈:CUDA替代走到哪了
国产GPU硬件追得快,软件栈才是真坎。CUDA替代有三条路:兼容层、自研栈、开源生态,各家进度不同。
2025年到2026年,国产AI芯片从“能造”走向“能训能用”。但企业真正迁移时卡住的,往往不是单卡算力,而是CUDA替代——英伟达那套软件生态。CUDA替代不是换张卡,是换整套开发习惯。本文用公开数据说清:为什么软件比硬件难、三条路各到哪了、企业选型该问哪三个问题。

为什么CUDA替代,比造卡更难?

硬件可以堆面积、堆晶体管追性能;软件生态是另一回事。CUDA不只是个编程接口,是十几年攒下的算子库、工具链、开发者习惯。
公开数据能看出差距:以LLaMA-2 70B推理为例,昇腾910C真实推理性能约为英伟达 H100 的 60%。单卡算力逼近了(昇腾 910C 的 FP16 算力 800 TFLOPS,约 H100 的 80%),但软件栈效率把整体表现又拉下一截。这就是 CUDA替代难的缩影。

更深层的差距在算子库。CANN的算子库覆盖度约为CUDA的20%,也就是约2000个对10000个以上。迁移一个中等规模训练项目,估计需要6到18个月和50万到200万的额外工程投入。软件栈是最大的隐性成本,这句话不是修辞。


兼容 CUDA 的翻译层,到底卡在哪?

多数国产卡走"类 CUDA"路线:做一层翻译,把英伟达的函数调用转成自己的。技术上像查字典——代码调 CUDA_X,自动转成国产的 BR_X。
这条路快,但有硬伤:永远慢半拍。英伟达每次更新 CUDA、更新架构,国产厂商就得追新的翻译器,战略上被动。CUDA替代走翻译层,长期受制于人。
实测迁移效率因卡而异:海光 DCU 通过 ROCm 生态对 CUDA 做"软兼容",实测迁移效率可达 85%;华为 CANN 用"指令翻译+动态调度"实现对 CUDA API 约 80% 的覆盖。85% 和 80% 听着高,但剩下那 15%–20% 的算子,往往正好是你的关键业务。

海光在这条路上走得最远。DTK异构计算平台覆盖训练、推理及AI4S场景,DAS人工智能基础软件系统集成超2000个算子、支持100余种主流AI工具,已完成与DeepSeek、Qwen3、混元、智谱等400余款主流大模型的适配优化,覆盖全球99%非闭源大模型。光合组织已聚合6000余家合作伙伴。


华为 CANN 开源,为什么是另一条路?

华为没走纯翻译,而是把 CANN 做成全栈自研、再开源,绕开了 CUDA替代的翻译路线。公开信息显示,CANN 于 2025 年开源开放,兼容第三方编程框架,深度适配 PyTorch、TensorFlow。
开源的意义:不再"追英伟达的词",而是建自己的"第二语言",让开发者围绕 CANN 写原生代码。代价是前期迁移成本更高,但长期不被翻译层绑架。

CANN开源社区的数据能说明生态在动。月均活跃用户数超过5200人,自2026年6月起成为国内活跃度最高的开源社区。社区非华为开发者数量已经超过华为开发者数量,日均新增合入代码超过3万行,已上线67个社区项目,累计开源代码超1244万行。已有60多家客户和伙伴基于CANN自主打造420多个高性能算子,算子模板库CATLASS、通信库、领域加速库、图引擎、Ascend C等软件代码全面开源。

华为也用系统创新补单卡短板——CloudMatrix 384 超节点已累计部署 300 多套,用集群互联把多颗芯片池化成大算力。

海光、寒武纪、摩尔线程,软件栈各到哪了?

  • 海光:DCU 兼容 ROCm 生态,DTK 工具链集成超 2000 个算子,对 CUDA 算子覆盖度超 99%,迁移最省心,适合怕折腾的企业;2026年上半年研发投入26.52亿元,同比增长55.05%,研发人员占员工总数80.83%。
  • 寒武纪:NeuWare 全面兼容 PyTorch(2.1–2.8)、TensorFlow,云边端训推一体,自有 CNNL/CNCL 库,大模型适配速度快;大模型适配速度是它的杀手锏——DeepSeek-V4发布当日即完成Day 0适配,是第二次在DeepSeek系列模型发布当日完成适配,适配代码已开源至GitHub。截至目前已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产主流大模型的推理适配。背后靠的是NeuWare开源兼容性、Triton社区兼容性做算子开发,以及自研代码生成智能体CNAgent加速全流程。
  • 摩尔线程:MUSA 架构提供 Musify 迁移工具,主打"无缝替代 CUDA",并支持 Triton,全功能 GPU 路线覆盖云端到终端。(Musify支持CUDA C/C++语法转换、批量处理、原地转换、双向转换和自定义API映射,属于MUSA Toolkits的一部分。MTT S5000已实现对Triton计算语言的深度适配,开发者可用熟悉的Triton语法编写高性能算子,通过Triton-MUSA后端无缝运行。
三条线共通点:都在从"兼容适配"走向"自主标准",共同把 CUDA替代往前推了一步。2025 年国产厂商在约 400 万张 AI 加速卡年出货里合计约占165 万张,份额首破 40%。到2026年,国产卡整体出货占比已抬升至60%以上,华为昇腾单一品牌份额接近30%。TrendForce预测2026年中国国产AI芯片出货量预计达500万片,国产份额接近90%。硬件起来了,软件栈是下一关。——硬件起来了,软件栈是下一关。

新增关注:平头哥开源SAIL。 阿里旗下平头哥在2026世界人工智能大会上宣布正式开源AI软件栈SAIL,涵盖SDK、内核驱动、编译器、调试器、性能分析工具及高性能计算库等全套代码。平头哥表示现有AI应用可在约7天内迁移至SAIL平台。真武芯片截至2026年4月已累计出货56万颗,覆盖超400家企业客户。


企业选国产卡,软件栈要问哪三个问题?

别只看算力参数,问这三句:
  1. 你的算力覆盖多少?要对方给“你常用模型”的实测覆盖率,不是宣传册的覆盖;
  2. 迁移要改多少码?85%自动翻译的背后,那15%谁来改、改多久;(海光改代码少,昇腾要投入适配,寒武纪Day 0适配是加分项,但训练侧深度调优仍需时间。
  3. 生态往哪走?是长期跟CUDA翻译,还是有自己的开源栈——决定三年后你还绑不绑得住。CANN开源社区、平头哥SAIL开源、Triton跨架构工具的出现,说明行业在往“自主栈+开源协同”走,但各家的开放程度和社区活跃度差别很大。
这三个问题,比"FP16 多少 TFLOPS"更能决定 CUDA替代成败。

常见问题(FAQ)

Q1:推理场景能不能直接用国产卡?
能,而且最快。推理对生态要求比训练宽松,更看成本、供给和部署效率,国产卡渗透最快的就是推理。训练场景才真正吃完整软件栈。(DeepSeek V4完成从CUDA到CANN的全面迁移,是训练侧国产化的一个标志性节点,但大规模训练的稳定性和算子覆盖仍是各家需要持续打磨的地方。
Q2:海光和昇腾,软件栈怎么选?
怕迁移选海光(ROCm 兼容、改代码少);要长期自主、愿投入适配选昇腾(CANN 开源、超节点强)。看你团队能力和业务周期。
Q3:CUDA替代会不会半途而废?
趋势是"短期类 CUDA、长期建自主栈"。2026 年被视为国产 AI 芯片训练落地元年,生态投入只会加不会退,但翻译层路线仍存被动风险,选型时留出兼容冗余。

把你的国产算力选型和CUDA替代替代迁移需求发私信「亿人互联」——我们按你的模型和算子,免费帮你估:改多少代码、跑在哪张卡上最划算。

数据说明:

1. 昇腾910C单卡算力与推理性能对比(FP16 800 TFLOPS、端到端约为H100的60%–80%、CANN算子库覆盖度约为CUDA的20%、迁移中等规模训练项目6–18个月和50万–200万投入):来自腾讯云开发者社区2026年6月24日公开分析,综合公开数据手册与基准测试。

2. CANN开源社区数据(月活超5200人、非华为开发者数量超过华为开发者、日均新增合入代码超3万行、67个社区项目、累计开源代码超1244万行):来自华为2026年9月19日公开披露及2026世界人工智能大会华为官方信息。

3. CANN算子生态数据(60多家客户和伙伴、420多个高性能算子、CATLASS模板库):来自科技日报2026年2月13日报道。

4. 海光DCU软件栈数据(DTK覆盖训练推理AI4S、DAS集成超2000个算子、支持100余种AI工具、适配400余款大模型、覆盖99%非闭源大模型、光合组织6000余家合作伙伴、研发投入26.52亿元):来自海光信息2026年半年度报告及国联民生证券2026年8月26日点评。

5. 寒武纪NeuWare适配数据(DeepSeek-V4 Day 0适配、五大国产大模型推理适配、Triton社区兼容性、CNAgent代码生成智能体):来自新华财经2026年4月26日报道及寒武纪开发者社区2025年12月公开信息。

6. 摩尔线程MUSA/Musify数据(CUDA C/C++语法转换、批量处理、双向转换、Triton-MUSA适配):来自摩尔线程官方文档中心及京东云2026年9月开发者文档。

7. 平头哥SAIL开源数据(WAIC 2026开源、7天迁移、真武芯片出货56万颗、覆盖400家企业):来自WAIC 2026平头哥官方发布及快科技2026年7月20日报道。

8. 国产AI加速卡市场份额(2025年出货400万张、国产165万张占41%;2026年国产占比超60%、华为昇腾接近30%):来自IDC 2025年数据及TrendForce 2026年8月报告。

9. 全球市场份额预测(英伟达中国份额降至8%、华为超50%):来自Bernstein Research预测。

10. CloudMatrix 384超节点部署数、昇腾950超节点时间表:来自华为2026世界人工智能大会及全联接大会2026官方披露。

性能随型号、驱动、模型版本变化,以厂商最新披露为准,本文不构成实时报价或承诺。

相关学习资料