一、模型不懂感觉,它只懂"可观察的音乐特征"
我想做一首失恋的歌。
给 Suno 的 prompt 是这样的: "我想要一首失恋的歌,要忧伤一点,要催泪一点"
抽了 20 次。没一首让我满意,都不是我想要的感觉。
有的太轻快,有的歌词直白得像朋友圈发泄,有的副歌飙上去了完全不是那种压着难受,反而给唱高兴了。
我一度觉得是 Suno 不行,或者我运气不好。
后来我才搞明白:不是运气问题,是"忧伤"这个词,模型翻译不出来。
回到上篇说过的模型工作原理:你写的文字,第一步是被翻译成标签。
"失恋""流行""女声""慢板",这些词才是模型能读懂的标签。
"忧伤"、"催泪"、"高级感"、"氛围感"这些词都是你的主观感受,模型是不会理解情绪的。
你说"忧伤",它只能往 sad、emotional、melancholy 这些通用词上靠,
最后生成的东西,当然跟你想要的感觉对不上。
解决方法也不是换个感觉词,而是把感觉词翻译成可观察的音乐特征。
比如你可以用:
这是AI音乐制作人的基本功:把脑子里的感觉拆解成模型能接受的特征。你可以说这是 prompt 技巧,但也是你对音乐语言的翻译能力。
再拿失恋的歌继续说。
原来的 prompt: "我想要一首失恋的歌,要忧伤一点,要催泪一点"
优化之后: "失恋题材,钢琴主奏,大提琴在副歌铺底,人声气声处理,副歌前留一拍停顿,BPM 68,不要失真,不要大鼓打满"
第二个不一定一次性就给你想要的,但方向是对的,你知道要怎么改。
第一个属于出什么算什么,你连反馈都不知道咋提,只能一遍一遍抽卡。
二、与其写 100 字 prompt,不如丢一首参考歌
上面那个对照表能解决"说不出感觉"的问题。
但还有一种更快的方式:直接给参考曲。
你丢进去一段音频,这首曲子里所有的音乐特征,Suno 都"听得见"。
它能直接提取节奏型、人声风格、乐器层次、情绪张力。
这些信息比你用文字描述更准确。
具体怎么用:
选参考曲的原则:不要找你"喜欢"的歌,要找你"想做成这个感觉"的歌。
我想做那首失恋歌的时候,参考曲选的不是我最爱的那首,而是一首人声处理和我想要的感觉最接近的歌。
相似度设多少:拿Suno的 Cover 功能举例,它有有相似度滑条,60%—70% 是我最常用的区间。
太高,出来的东西太像参考曲,会有抄袭感; 太低,参考曲的特征会被稀释掉。
还有一种方式更直接:哼旋律。
你脑子里有一条旋律线,哼进去,告诉 Suno 你要的旋律。
旋律本身就是音乐特征,不需要翻译。
三、不要"一句话写一首歌",要"分段控制歌"
我会经常遇到一个问题:整体 prompt 写得很好,但出来的歌还是平的。
其实是因为我在用一个笼统的指令控制歌。
我写"失恋+忧伤+钢琴+大提琴",这个指令贯穿整首歌——主歌忧伤、副歌忧伤、间奏忧伤、bridge 也忧伤。
但一首让人动的歌,恰恰是因为它有起伏。
真正能触动人的结构往往是这样的:
主歌压着,副歌稍微顶一下但没爆开,bridge 突然只剩人声和钢琴,然后 outro 慢慢散掉。
打动人的地方在于那个对比,不在于整首都维持一个情绪。
这就是结构标签的用处。
Suno 支持在 prompt 里用 [标签] 切割段落,给每一段单独下指令。用法很简单,直接在 prompt 里按结构顺序写:
[Intro: 钢琴单音,静][Verse: 气声人声,钢琴为主,大提琴轻轻铺底][Pre-Chorus: 弦乐渐渐进来,情绪稍微托起][Chorus: 大提琴加厚,人声稍微推一点,但不要失真鼓][Bridge: 去掉所有乐器,只剩人声和钢琴,一句话的长度][Outro: 钢琴渐弱,人声渐弱,不要硬结尾]
这个结构模板,你可以直接复制,改成你想要的感觉。
几个用法细节:
[Intro] 一定要写,因为很多 Suno 生成结果开头就进人声,没有铺垫空间,感觉很赶 [Bridge] 是整首歌最容易出惊喜的地方,在这里做减法,去掉所有乐器,情绪反而更浓 段落之间的过渡不用你写,模型会自己处理,你只需要控制每段的核心感觉 不要写太多字,每个标签里控制在 10—20 字以内,有关键词就够了
四、会写 prompt只是短期技能
我一直觉得,AI 音乐现在的状态,跟 2020 年的 GPT-3 非常像,那时候你也得背咒语、记 prompt 模板、群里互传"prompt 大全"。
厉害的人靠的是"会说话",说话方式对了,出来的东西就好。
到 2022 年底,ChatGPT(GPT-3.5)出来了,那套 prompt 技能就全过期了。因为它真正具备了理解自然语言的能力。
这个理解的过程就是靠人类一次又一次的标注累积和学习的。
AI 音乐现在就在这个节点之前。
你写完一首歌,觉得副歌不够炸,只能改 prompt 重抽。
没有办法跟它说"副歌再炸一点",因为现在模型听不懂这句话背后要改什么。
但现在做不到,不代表以后做不到。
有几个方向透露出了信息:
1、Suno 收购了 WavTool,一个核心卖点就是"用聊天操控编曲软件",说明 Suno 是有意向这样做的。Suno Studio 已经是第一步,虽然现在还很受限。
2、现在做不到更大的瓶颈是技术上:模型没法把"副歌再炸一点"映射到具体参数。但这个问题不是架构死结,是数据和能力积累的问题,会被解决的。
我猜它不会突然裸上一个自由对话框,更可能是渐进的:先出半结构化的受限指令("缩短前奏"、"换成男声"、"调高 BPM"),等积累的数据更多,再开放自然语言输入。
总有一天,Suno 会在你写"忧伤一点"的时候直接问你:"是那种压着的难受,还是快哭出来的那种?"
到那个时候,这篇文章里的写歌技巧都会过期。但有一件事不会过期:你把感觉翻译成音乐特征的能力。
这是制作人和普通玩家之间真正的差距。
制作人不靠 prompt,靠的是听得出哪里不对、说得出往哪个方向调。无论工具怎么迭代更新,这个能力是核心竞争力。
所以与其背 prompt 模板,不如做一个练习:每次出完一首歌,先说一句你为什么不满意。
把自己不满意的细节点抓住,慢慢地,你的乐感会越来越好,对 AI 音乐的掌控力也会越来越强。

夜雨聆风