夜雨聆风学习资料网

ARTICLE · 1050107

情绪可控性是AI音乐工具的核心卖点

情绪可控性是AI音乐工具的核心卖点

让 AI 按情绪写歌,作者拿三个开源模型跑了七百多次。想看看它是不是真听懂了“悲伤”和“欢快”。

结果文本提示全面压过参考音频。MusicGen-medium 在七项指标里赢了五项。可绝对误差还是不小。效价和唤醒度最低也有 0.744、0.953。满分区间是 1 到 9。说白了,最好的模型也会偏离目标一个小格以上。

最扎眼的是音频条件。InspireMusic 的相关性几乎崩了。唤醒度相关系数跌到负 0.017。这意味着参考曲越激动,生成结果反而越平静。音频模型被绑在原素材上,保住了音色节奏,却丢了情绪控制。

这套评测本身也有硬伤。情感标签靠 GPT-4 改写,评估又用 MER 模型回测。整条链全是模型判断模型。循环论证的风险根本绕不开。

所以做产品别指望一段参考曲就能精准传情。把情绪控制放进 prompt 更靠谱。但单次命中依然不稳,多给几个候选让用户挑才是正经事。

原文PAPER REVIEW · 第009期 跟 AI 说"来一首悲伤的歌",它真听懂了吗?"情绪可控性是 AI 音乐工具核心卖点,谁掌握了就掌控这个赛道的话语权
收录于Paper review 论文解读
北京,1小时前,

相关学习资料