乐于分享
好东西不私藏

我用一张 AMD 显卡,在自家电脑上跑出了一个会写歌的 AI

我用一张 AMD 显卡,在自家电脑上跑出了一个会写歌的 AI
上个月,一个做了十年唱片监制的朋友问我:"现在用 AI 写首歌,是不是比找工作室便宜?"我没直接回答,而是打开了自己那台装着 AMD 显卡的旧电脑,敲了一行字。七分钟后,一段带人声、带伴奏的完整歌曲就出来了。
他愣了一下:"这不需要云、不需要月费、歌还归我?"
我说:"对,全在本地。"
这不是炫技。过去一年,AI 写歌从实验室玩具变成订阅制 SaaS,但绝大多数方案的底层逻辑是一样的:你的歌词、你的旋律、你生成的作品,得先过别人的服务器。我们想做的,是另一条路——把写歌这件事,彻底搬回自己的电脑。

一、本地化不是情怀,是三笔账

很多人问,为什么不直接用现成的海外 SaaS?答案不在技术,在成本结构。
第一笔是版权账。主流 SaaS 生成的歌曲,商用权和所有权往往受平台条款限制,你付了钱,歌却不一定完全归你。我们用的是 Apache 2.0 协议的开源引擎,生成即归你,可商用、可分发,没有灰色地带。
第二笔是隐私账。把歌词和创作意图传到云端,等于把素材交给第三方保管。本地运行,数据不出机箱。
第三笔是成本账。我们用的显卡是 AMD RX 5500,8GB 显存,二手市场几百块。不升级硬件、不付月费,一首歌的电费可以忽略不计。三笔账加起来,本地化的理由足够硬。

二、硬件现实的打脸:AMD 不是不能跑

真相是,多数开源音乐模型官方只认 NVIDIA 的 CUDA。我们最早试的那版引擎,在 AMD 上能加载、能跑完流程,但出来的全是低频嗡鸣——数值精度在 AMD 的 DirectML 后端崩了。这不是 AMD 的锅,是"自回归 + fp16"这条路线对 AMD 不友好。
转机在于换架构。我们评估过 ACE-Step(质量好,但走 ROCm,只支持 RDNA3 新卡,而 RX 5500 是 RDNA1,跑不了),最终切到diffusion(扩散)架构的 DiffRhythm:它非自回归,对 AMD 的 DirectML fp16 鲁棒得多。实测在 RX 5500 上,真能稳定输出"人声 + 配乐"的完整歌曲,干净、无杂音。
结论很朴素:本地出歌在 AMD 上可行,关键不在堆显卡,在选对架构。

三、工程落地:从一句话到一首歌

光有引擎不够。我们做了个本地工作台 Carbon Studio,把流程跑通成闭环:你写一句话描述(主题、风格、想送给谁)→ AI 自动写歌词 → 引擎出歌 → 导出 mp3。全程离线,约七分钟一首。
这里有个真实踩过的坑:歌词太密会"吞字"。模型每个时间窗口能清晰唱出的音节数有上限,一行塞八个字,它就只吐几个。我们的解法是"稀疏歌词"——每行压到五字、句间隔拉到六秒,密度砍半,字字清楚。
另一个硬约束是显存墙。RX 5500 在 95 秒以内稳如老狗;超过这条线,模型切换到更大的版本,显存随时长平方级增长,必爆。所以当前我们锁 95 秒——够一首完整的副歌加主歌,不够长,但稳。风格方面,我们接了 MuQ 风格编码器,让"伤感 / 钢琴 / 中国风"这类标签真正引导伴奏,而不是摆设。
下面这首《晚风的话》,就是我们本地跑出来的真实样本(伤感流行,约 80 秒)。

四、给想入场的你

如果你也想搭一套本地写歌环境,三条建议:
  1. 硬件底线:一张能跑 DirectML 的 AMD 或核显卡即可起步;想写长歌(三分钟以上),再考虑 12GB 以上的卡。
  2. 引擎选型:优先 diffusion 架构,别在自回归模型上和 AMD 死磕。
  3. 歌词要稀疏:想听清词,就别贪多,短句慢唱。
我们给这个产品起了个名字:碳基圈 AI 写歌。它现在还没做成人人自助的网站,但地基已经通了——你描述,我们后台帮你生成,前 50 名粉丝免费定制一首。
AI 写歌,不该是云厂商的一张月费账单,而该是你电脑里的一个文件夹。这条路,我们走通了第一步。
#AI写歌

#免费生成歌曲# #本地AI# #碳基圈AI写歌# #AMD显卡写歌# #AI音乐生成#