乐于分享
好东西不私藏

平头哥把AI软件栈全开源了:不跟英伟达比芯片,直接抄CUDA的老底

平头哥把AI软件栈全开源了:不跟英伟达比芯片,直接抄CUDA的老底

2026年7月18日,平头哥在WAIC上宣布开源T-Head SAIL软件栈,覆盖从驱动到推理引擎的完整链路,适配260+主流AI框架。这不是一个普通的开源公告——这是国产AI芯片阵营向英伟达CUDA生态发起的第一次系统性进攻。

关键词:平头哥、T-Head SAIL、真武芯片、AI软件栈、开源、CUDA


说实话,看到平头哥宣布开源T-Head SAIL的时候,我第一反应不是”又开源了个啥”,而是“终于走到这一步了”

过去两年,国产AI芯片的硬件进步肉眼可见——从几百TOPS到几千TOPS,从14nm到5nm,单卡参数一个比一个漂亮。但我一直在想一个问题:纸面算力那么强,为什么开发者还是不愿迁移?

答案很简单:软件跟不上。芯片再快,如果你的PyTorch代码跑上去要改一堆,框架适配遥遥无期,调试工具等于没有——那这颗芯片就是一台没有变速箱的跑车,引擎再猛也开不动。

平头哥这次开源SAIL,本质上就是在解决这个”最后一公里”问题。

SAIL是什么?一句话版本

T-Head SAIL(Seed of AI Library)是平头哥为真武系列AI芯片打造的全栈软件。从底层驱动到上层推理引擎,覆盖5层完整技术栈,开源后可供全球开发者下载、阅读源码、做定制优化。

社区地址:https://developer.t-head.cn/home

名字起得挺有意思——SAIL是”种子”的意思,平头哥说”每一行开源代码都是一颗种子”。能不能长成森林,得看社区买不买账。

5层架构到底覆盖了什么?

我帮大家把官方架构图翻译成人话:

层级 包含什么 解决什么问题
驱动与运行时
PPU Driver(KMD+UMD)+ Runtime
让操作系统认识芯片,统一设备和内存管理
编程语言层
C/C++ + Python
不用学新语言,现有代码直接迁移
编译器层
Compiler + Debugger
把PyTorch计算图翻译成芯片指令
高性能库层
acBLAS/acDNN/acFFT等6大数学库 + 编解码库 + 集合通信库
训练推理核心计算,全有高性能实现
开发者工具层
Asight Compute + Asight Systems + PPU-SMI + PPU-DCGM
单卡调试到千卡运维,全链路可观测

最值得说的是第4层和第5层。

高性能库层里,acBLAS对标cuBLAS,acDNN对标cuDNN——这两个是英伟达CUDA生态里开发者用得最多的库。平头哥做了完整对标,意味着开发者在PyTorch里调用的那些底层算子,在真武上都有对应的高性能实现。

开发者工具层更关键。Asight Compute做算子级性能分析,能帮你定位到底是哪个算子拖慢了整体性能——这个能力在CUDA里对应的是Nsight Profiler。PPU-DCGM做集群级资源调度,对应的是DCGM。

说白了,英伟达CUDA生态里有的东西,SAIL基本都做了对应版本。不是说性能一定追平了,但至少”该有的都有了”。

260+框架适配,7天迁移周期

SAIL已经适配了PyTorch、TensorFlow、vLLM、SGLang等260多个主流训练和推理框架。官方说“主流AI推理框架平均适配时间<7天”

7天这个数字很关键。

以前国产芯片最大的痛点是:官方说”支持PyTorch”,实际跑起来发现一堆算子没实现,改半天发现性能掉了30%,再调试发现内存管理有bug。所谓的”支持”,和”能用”之间差了十万八千里。

如果真武能把适配周期压到7天以内,意味着:

  • 上游框架发新版本,一周内就能在真武上跑

  • 开发者不用等芯片厂商适配,自己就能做少量代码修改完成迁移

  • 新模型发布后,不会卡在”等芯片适配”这个环节

当然,”7天”是官方数据,实际体验可能因模型复杂度有差异。但这个速度如果真的能稳定实现,已经接近CUDA生态的响应效率了。

56万片芯片都卖给谁了?

光有软件栈不够,还得有人用。截至2026年4月,真武AI芯片累计出货56万片,服务20多个行业400多家客户:

行业 部署规模 代表客户
金融
10万+卡
银行、证券、保险等150+机构
智能驾驶
13万+卡
长安、比亚迪、小鹏、蔚来、理想等30+车企
运营商/政府
规模化部署
中国电信、中国一汽、浦发银行、国家电网、中科院
阿里云内部
万卡级集群
通义千问训练推理

金融10万卡、智驾13万卡——这不是内部消化出来的数字,是真金白银的产业需求在驱动。

这一点很重要。很多国产芯片的问题是”芯片做出来了,没人用”。真武的56万片出货量说明它已经跨过了”能不能商用”的门槛,现在开源软件栈,是在解决”怎么让更多人用”的问题。

真武M890:下一代旗舰芯片

顺带提一下同日亮相的真武M890——平头哥新一代训推一体AI芯片,已入选WAIC 2026″镇馆之宝”。

参数 真武810E 真武M890
显存
96GB HBM2e
144GB
片间互联带宽
700GB/s
800GB/s
性能
对标H20
上一代的3倍
精度支持
FP16/BF16为主
FP32到FP4全精度

配合磐久AL128超节点服务器,单柜集成128颗M890芯片,通过自研ALink互连架构实现Pb/s级带宽和百纳秒级延迟。

单卡性能对比英伟达什么水平?业内评估:810E对标H20,M890在硬件参数上已经摸到了H200的门槛,但单卡实测仍有差距。不过阿里打的不是单卡战,是系统战——用128卡超节点的集群效率弥补单卡差距,同等AI算力下推理性能较传统架构提升50%。

国产AI芯片”软件开源潮”来了

平头哥不是第一个这么做的。

厂商 软件栈 开源时间 对标
华为
CANN(昇腾)
2025年
CUDA
平头哥
T-Head SAIL(真武)
2026.7.18
CUDA
摩尔线程
MUSA SDK 5.1.0
持续迭代
CUDA 12.8,兼容761接口
壁仞科技
BIRENSUPA
逐步开放
全栈工具链

为什么集体开源?因为英伟达最大的护城河不是芯片,是CUDA。十几年积累的开发者生态、算子库、调试工具、框架支持——这些东西让开发者”离不开”英伟达。

国产芯片在硬件上追赶的同时,如果软件生态跟不上,开发者永远没有动力迁移。开源是最快的补生态方式:让开发者看源码、改源码、贡献代码,把”芯片厂商单方面适配”变成”社区共建”。

这步棋走得对。但能不能走通,取决于三件事:

  1. 源码质量 — 开源的代码能不能直接编译跑起来,还是只是个”展示品”

  2. 社区响应 — 有没有人真的用、真的贡献、真的提issue

  3. 持续维护 — 开源不是一次性动作,需要长期投入

对开发者意味着什么?

说回跟我们最相关的事。如果你是一个日常用PyTorch/vLLM/SGLang做开发的程序员,T-Head SAIL的开源跟你有什么关系?

短期(3-6个月):

  • 如果你的公司在用阿里云百炼,可以直接用基于真武芯片的算力实例,软件栈已预装

  • 如果你的公司有国产算力替代需求,SAIL提供了可审计、可定制的完整方案

  • 如果你是做AI infra的,这份源码是学习”AI芯片软件栈怎么造”的绝佳教材

中长期:

  • 国产AI芯片的软件生态会逐步成熟,”迁移到国产芯片”的成本越来越低

  • 开发者多一个算力选择,不再被英伟达一家绑定

  • 开源社区如果活跃起来,框架适配、bug修复的速度会指数级提升

我怎么看这件事

平头哥开源SAIL,让我想到一句话:“开源不是终点,是生态共建的起点。”这句话是平头哥自己说的,但放在这里特别合适。

国产AI芯片走到今天,硬件已经不是最大的短板了。真正的壁垒是软件生态——英伟达用十几年建起来的CUDA生态,不是一颗两颗更强的芯片能打破的。

但开源是一种”弯道超车”的策略。华为开了CANN的头,平头哥跟进SAIL,摩尔线程在MUSA上持续迭代——当所有国产芯片厂商都在做同一件事(降低开发者迁移成本),整个生态的成熟速度会远超任何一家单干。

至于能不能真正挑战CUDA?我的判断是:短期内不会,但方向是对的。CUDA的优势不在于某一个库有多好,而在于”所有东西都在上面”。要打破这个飞轮效应,需要的不是一颗星,是一片森林。

SAIL的SAIL全称是”Seed of AI Library”——种子。种子能不能长成森林,时间会给答案。

但至少,播种的动作,国产AI芯片阵营已经做出来了。


你所在的团队有在用国产AI芯片吗?

迁移到国产算力最大的阻力是什么——软件适配、性能差距、还是习惯问题?

评论区聊聊,也想看看大家的真实体验。

觉得有用?建议收藏备用,国产算力这条线后续还会持续跟进 ⭐

星标⭐程序员之路,AI技术动态第一时间精选

信息来源:• 平头哥官方公告:真武 AI 芯片 T-Head SAIL 软件栈正式开源开放• 第一财经:《从秀单卡到建体系,WAIC见证国产算力系统性进化》• 太平洋科技:《平头哥真武M890入选WAIC镇馆之宝》• cnETA:《阿里巴巴开源AI软件技术栈 加速其自研芯片生态布局》