乐于分享
好东西不私藏

AI写歌|怎么写好 prompt,控制歌曲按你的意愿生成

AI写歌|怎么写好 prompt,控制歌曲按你的意愿生成

一、模型不懂感觉,它只懂"可观察的音乐特征"

我想做一首失恋的歌。

给 Suno 的 prompt 是这样的: "我想要一首失恋的歌,要忧伤一点,要催泪一点"

抽了 20 次。没一首让我满意,都不是我想要的感觉。

有的太轻快,有的歌词直白得像朋友圈发泄,有的副歌飙上去了完全不是那种压着难受,反而给唱高兴了。

我一度觉得是 Suno 不行,或者我运气不好。

后来我才搞明白:不是运气问题,是"忧伤"这个词,模型翻译不出来。

回到上篇说过的模型工作原理:你写的文字,第一步是被翻译成标签。

"失恋""流行""女声""慢板",这些词才是模型能读懂的标签。

"忧伤"、"催泪"、"高级感"、"氛围感"这些词都是你的主观感受,模型是不会理解情绪的。

你说"忧伤",它只能往 sad、emotional、melancholy 这些通用词上靠,

最后生成的东西,当然跟你想要的感觉对不上。

解决方法也不是换个感觉词,而是把感觉词翻译成可观察的音乐特征

比如你可以用:

你想要的感觉
翻译成音乐特征
忧伤
钢琴主奏 + 人声少修饰 + 副歌不推高 + 70 BPM 以下
催泪
大提琴铺底 + 副歌前停顿一拍 + 气声人声
压抑中带希望
小调主歌 + 大调副歌 + 弦乐只在副歌进来
炸场
鼓打满 + 失真吉他 + 人声贴近话筒推满
高级冷感
低混响 + 人声干声 + 钢琴只弹几个音不铺满

这是AI音乐制作人的基本功:把脑子里的感觉拆解成模型能接受的特征。你可以说这是 prompt 技巧,但也是你对音乐语言的翻译能力。

再拿失恋的歌继续说。

原来的 prompt: "我想要一首失恋的歌,要忧伤一点,要催泪一点"

优化之后: "失恋题材,钢琴主奏,大提琴在副歌铺底,人声气声处理,副歌前留一拍停顿,BPM 68,不要失真,不要大鼓打满"

第二个不一定一次性就给你想要的,但方向是对的,你知道要怎么改

第一个属于出什么算什么,你连反馈都不知道咋提,只能一遍一遍抽卡。


二、与其写 100 字 prompt,不如丢一首参考歌

上面那个对照表能解决"说不出感觉"的问题。

但还有一种更快的方式:直接给参考曲。

你丢进去一段音频,这首曲子里所有的音乐特征,Suno 都"听得见"。

它能直接提取节奏型、人声风格、乐器层次、情绪张力。

这些信息比你用文字描述更准确。

具体怎么用:

选参考曲的原则:不要找你"喜欢"的歌,要找你"想做成这个感觉"的歌。

我想做那首失恋歌的时候,参考曲选的不是我最爱的那首,而是一首人声处理和我想要的感觉最接近的歌。

相似度设多少:拿Suno的 Cover 功能举例,它有有相似度滑条,60%—70% 是我最常用的区间。

太高,出来的东西太像参考曲,会有抄袭感; 太低,参考曲的特征会被稀释掉。

还有一种方式更直接:哼旋律

你脑子里有一条旋律线,哼进去,告诉 Suno 你要的旋律。

旋律本身就是音乐特征,不需要翻译。


三、不要"一句话写一首歌",要"分段控制歌"

我会经常遇到一个问题:整体 prompt 写得很好,但出来的歌还是平的。

其实是因为我在用一个笼统的指令控制歌。

我写"失恋+忧伤+钢琴+大提琴",这个指令贯穿整首歌——主歌忧伤、副歌忧伤、间奏忧伤、bridge 也忧伤。

但一首让人动的歌,恰恰是因为它有起伏。

真正能触动人的结构往往是这样的:

主歌压着,副歌稍微顶一下但没爆开,bridge 突然只剩人声和钢琴,然后 outro 慢慢散掉。

打动人的地方在于那个对比,不在于整首都维持一个情绪。

这就是结构标签的用处

Suno 支持在 prompt 里用 [标签] 切割段落,给每一段单独下指令。用法很简单,直接在 prompt 里按结构顺序写:

[Intro: 钢琴单音,静][Verse: 气声人声,钢琴为主,大提琴轻轻铺底][Pre-Chorus: 弦乐渐渐进来,情绪稍微托起][Chorus: 大提琴加厚,人声稍微推一点,但不要失真鼓][Bridge: 去掉所有乐器,只剩人声和钢琴,一句话的长度][Outro: 钢琴渐弱,人声渐弱,不要硬结尾]

这个结构模板,你可以直接复制,改成你想要的感觉。

几个用法细节:

  • [Intro] 一定要写,因为很多 Suno 生成结果开头就进人声,没有铺垫空间,感觉很赶
  • [Bridge] 是整首歌最容易出惊喜的地方,在这里做减法,去掉所有乐器,情绪反而更浓
  • 段落之间的过渡不用你写,模型会自己处理,你只需要控制每段的核心感觉
  • 不要写太多字,每个标签里控制在 10—20 字以内,有关键词就够了

四、会写 prompt只是短期技能

我一直觉得,AI 音乐现在的状态,跟 2020 年的 GPT-3 非常像,那时候你也得背咒语、记 prompt 模板、群里互传"prompt 大全"。

厉害的人靠的是"会说话",说话方式对了,出来的东西就好。

到 2022 年底,ChatGPT(GPT-3.5)出来了,那套 prompt 技能就全过期了。因为它真正具备了理解自然语言的能力。

这个理解的过程就是靠人类一次又一次的标注累积和学习的。

AI 音乐现在就在这个节点之前。

你写完一首歌,觉得副歌不够炸,只能改 prompt 重抽。

没有办法跟它说"副歌再炸一点",因为现在模型听不懂这句话背后要改什么。

但现在做不到,不代表以后做不到。

有几个方向透露出了信息:

1、Suno 收购了 WavTool,一个核心卖点就是"用聊天操控编曲软件",说明 Suno 是有意向这样做的。Suno Studio 已经是第一步,虽然现在还很受限。

2、现在做不到更大的瓶颈是技术上:模型没法把"副歌再炸一点"映射到具体参数。但这个问题不是架构死结,是数据和能力积累的问题,会被解决的。

我猜它不会突然裸上一个自由对话框,更可能是渐进的:先出半结构化的受限指令("缩短前奏"、"换成男声"、"调高 BPM"),等积累的数据更多,再开放自然语言输入。

总有一天,Suno 会在你写"忧伤一点"的时候直接问你:"是那种压着的难受,还是快哭出来的那种?"

到那个时候,这篇文章里的写歌技巧都会过期。但有一件事不会过期:你把感觉翻译成音乐特征的能力。

这是制作人和普通玩家之间真正的差距。

制作人不靠 prompt,靠的是听得出哪里不对、说得出往哪个方向调。无论工具怎么迭代更新,这个能力是核心竞争力。

所以与其背 prompt 模板,不如做一个练习:每次出完一首歌,先说一句你为什么不满意。

把自己不满意的细节点抓住,慢慢地,你的乐感会越来越好,对 AI 音乐的掌控力也会越来越强。