ARTICLE · 1050107
情绪可控性是AI音乐工具的核心卖点
情绪可控性是AI音乐工具的核心卖点
让 AI 按情绪写歌,作者拿三个开源模型跑了七百多次。想看看它是不是真听懂了“悲伤”和“欢快”。
结果文本提示全面压过参考音频。MusicGen-medium 在七项指标里赢了五项。可绝对误差还是不小。效价和唤醒度最低也有 0.744、0.953。满分区间是 1 到 9。说白了,最好的模型也会偏离目标一个小格以上。
最扎眼的是音频条件。InspireMusic 的相关性几乎崩了。唤醒度相关系数跌到负 0.017。这意味着参考曲越激动,生成结果反而越平静。音频模型被绑在原素材上,保住了音色节奏,却丢了情绪控制。
这套评测本身也有硬伤。情感标签靠 GPT-4 改写,评估又用 MER 模型回测。整条链全是模型判断模型。循环论证的风险根本绕不开。
所以做产品别指望一段参考曲就能精准传情。把情绪控制放进 prompt 更靠谱。但单次命中依然不稳,多给几个候选让用户挑才是正经事。
原文PAPER REVIEW · 第009期 跟 AI 说"来一首悲伤的歌",它真听懂了吗?"情绪可控性是 AI 音乐工具核心卖点,谁掌握了就掌控这个赛道的话语权
收录于Paper review 论文解读
北京,1小时前,