ARTICLE · 1089994
生成快 39%、读文档慢三成:本地模型部署AM
生成快 39%、读文档慢三成:本地模型部署AM
生成快 39%、读文档慢三成:本地模型部署AM
有读者私信问,7800XT能不能跑、W7900为啥掉速。其实同一张A卡换个后端,速度能差出四成。
拿9070XT跑Qwen3.8-27B实测,读长文档时ROCm比Vulkan快41%。但真到了逐字生成回复,Vulkan反而领先16%。
五个独立环境测下来全是这结果。日常聊天写代码直接选Vulkan,驱动即用免编译。要是处理长文档或者多卡部署,再切回ROCm。
R9700的部署更离谱。默认配置生成速度只有19.2 tok/s。加上定向构建和双卡拆分,直接飙到29.7。换成vLLM加量化补丁,直接冲到184.9。
同一块硬件没换,光靠软件配置就能拉开近十倍的差距。双卡64G的价值主要在容量,真要追单卡速度和成熟工具链,N卡还是绕不开的那个答案。
原文生成快 39%、读文档慢三成:本地模型部署AMD 显卡的 Vulkan 和 ROCm 到底怎么选
福建,1小时前,