夜雨聆风学习资料网

ARTICLE · 1156365

国产软件栈横向对标(上)——华为昇腾 CAN

国产软件栈横向对标(上)——华为昇腾 CAN

国产软件栈横向对标(上)——华为昇腾 CAN

拿 CUDA 那把六层标尺去卡昇腾 CANN,发现它没照搬 NVIDIA 的架构。

昇腾把 Runtime 和 Driver 揉成了 AscendCL。多出一个叫 GE 的图引擎,默认先做整图优化再执行。编译也不走 PTX 中间指令,而是直接离线生成 .om 模型文件。PyTorch 靠 torch_npu 插件接管算子,让代码能跑在 NPU 上。

迁移时最容易踩坑的就是这套差异。API 看着像,底层完全是两码事。离线编译好的模型不能跨形态直接用。整图执行模式对动态 shape 不太友好。单算子裸调的灵活性也弱一些。

更扎心的是,服务能启动根本不代表迁移完成。港中大深圳有项实测,在 16 卡昇腾 910 上部署两个大模型。为了让负载跑到可用,硬生生打了 12 个源码补丁。还得关掉好几个吞吐量特性保数值正确。最后全靠外部看门狗吸收底层反复出现的设备故障。

启动成功只是第一步,持续负载下的稳定性才是真正的验收线。

原文国产软件栈横向对标(上)——华为昇腾 CANN 逐层拆解
上海,44分钟前,

相关学习资料