一个零预算、纯 AI 驱动的歌曲创作全流程拆解。
🎵 先听歌:
📹 先看 MV:
事情的起因是,我在某个加班的深夜,给领导发了一条消息,然后眼睁睁看着它变成了"已读"——但没有"回"。
第二天我发现,他根本不是忙。他在打排位。
于是我用 AI 花了 10 分钟,把这件事写成了一首 R&B 慢歌,叫《已读不回》,配上了完整的 MV。算上写这篇文章,全程 20 分钟。
总花费:0 元。(严格来说,AI 生图花了一些平台积分)
这篇文章,我拆解一下完整的制作流程(当然,如果有预算,也可以使用付费的MV生成服务)。如果你也想自己搞一首歌,照着来就行。
一、整体工作流
整个流程只有四步,三个工具:
WorkBuddy 写歌词 → Suno / 即梦 生成音频 → WorkBuddy 生成场景图 → 剪映 合成 MV 没有录音棚,没有拍摄团队,没有后期剪辑师。就你一个人 + 一台电脑。
二、第一步:让 WorkBuddy 写歌词
这是整个流程里最关键的一步。歌词不好,后面全白搭。
我当时给 WorkBuddy 的 prompt 大概是这样的:
"写一首职场主题的 R&B 慢歌歌词,主题是领导已读不回——我以为他很忙,结果发现他在打游戏,让我们加班自己却去健身,到九点才回来巡视。"
它给的初版歌词结构是这样的:
- Verse 1
:消息发出去等回复,路过发现领导在打排位 - Chorus
:反复质问"领导你为什么已读不回",对比峡谷厮杀和熬夜加班 - Verse 2
:咖啡凉了又热,朋友圈晒跑步机配文"自律" - Bridge
:转音段落,已读比沉默更锋利 - Outro
:九点推门巡视,低头假装在忙
R&B 情歌式的委屈腔调,套在职场吐槽上,反差感拉满。


一个细节:初版歌词太长了,3 分半的慢歌根本唱不完。我跟 WorkBuddy 来回沟通了两轮,把字数砍到约 37 行、预估 3 分 25 秒左右。AI 的核心价值不是一次性给完美答案,而是能快速迭代。
三、第二步:用 Suno / 即梦生成音频
歌词定稿后,我把它导入到 Suno(也可以用字节的即梦)。
Suno 支持输入自定义歌词 + 风格描述,我选了 R&B Slow Jam、男声、周杰伦式声线(男中音、慵懒咬字、鼻音共鸣)。
第一版就挺有感觉的——慢板 R&B,Verse 用诉说感强的吟唱,Chorus 用丝滑转音表达委屈。完全超出预期。
最后导出了一段约 3 分 37 秒的 WAV 音频文件,作为 MV 的声音轨道。
补充:Suno 和即梦都有免费额度,生成一两首歌基本不花钱。
四、第三步:让 WorkBuddy 生成 MV 场景图
这是整个工作流里"肉眼可见"的产出部分。我的思路是:不生成完整视频,只生成关键场景的静态图片,然后导入剪映合成。
原因很简单——目前 AI 视频生成的单段时长太短(几秒到十几秒),做一首 3 分半的完整 MV 成本高、效果也不可控。但 AI 生图已经很成熟了,用图片 + 剪映的 Ken Burns 缓推动画 + 转场 + 歌词字幕,效果完全可以媲美一支低成本 MV。
封面图
先看封面,荒诞讽刺风——西装革履的领导缩着身子、回头张望,偷摸打排位,桌下露出跑鞋,墙上时钟指向九点。

10 个场景设计
我按照歌词的叙事线,拆出了 10 个关键场景:
下面逐一看成品图👇










生成参数
所有图都是 1080×1920 的抖音竖版尺寸,Prompt 里统一加了 "cinematic, film grain, moody R&B music video aesthetic, 9:16 TikTok vertical style",确保色调和风格统一。
十个场景全部暗蓝紫电影感调色,跟 R&B 慢歌的气质一致。每张图大概消耗平台 5-10 个积分,折合人民币不到 5 毛钱。
五、第四步:剪映合成 MV
所有素材准备好了,进剪映。
具体操作:
- 导入音频:把 Suno 生成的 WAV 拖进去
- 导入 10 张场景图:按歌词顺序排列
- 添加 Ken Burns 效果
每张图加「关键帧缩放」——从 100% 缓推到 110%,模仿电影镜头的缓慢推进感。不同场景交替用推/拉/左移/右移,避免单调 - 添加转场:场景之间用「交叉溶解」过渡,时长约 1.5-2 秒
- 添加歌词字幕
在剪映里用「文本 → 识别歌词」功能,它会自动对时间轴。字体用粗黑体 + 白色描边,大字报荒诞搞笑风,呼应这首歌的讽刺气质 - 封面图放在第一帧:黑屏 + 歌名大字入场,给观众一个预期
- 导出:1080×1920、30fps、H.264
整个剪映操作大概花了 10 分钟。最耗时的是歌词字幕的样式和错别字调整
六、成本核算
| 合计 | 约 3.5 元 |
对比传统 MV 制作(拍摄团队 + 后期 + 场地,少说几千块起步),这个成本基本上可以忽略不计。
七、经验总结
1. AI 不是替代你,是放大你
歌词的核心洞察——"已读不回不是忙,是我没在你优先级"——来自真实的职场体验。AI 做的是把这种感受结构化、押韵化、节奏化。没有你的洞察,AI 写不出真东西。
2. 用讨巧的方式解决问题
一开始我想让 AI 直接生成完整 MV 视频,但发现成本巨高、可控性差。后来改用"静态图 + 剪映动画",效果完全不输。很多事情不是 AI 做不了,而是有更聪明的做法。
3. 风格统一比单张精美更重要
10 张图如果风格割裂,MV 看起来会很廉价。所有 Prompt 都加了统一的风格描述(暗蓝紫调、电影感颗粒、R&B MV 美学),确保画面之间有连续性。
4. 歌词字幕是 MV 的灵魂
竖版短视频里,字幕不仅传达信息,还是视觉设计的一部分。大字报式的歌词 + 关键词(已读不回)特殊高亮,让整支 MV 有了记忆点。
5. 迭代才是 AI 工具的正确用法
歌词改了 3 版,场景图生成了 2 轮(第一轮是横版,后来改成竖版),字幕样式调了好几遍。不要指望 AI 一次给完美答案,把它当成一个能快速出草稿的助手,你来做最终的判断和打磨。
写在最后
这首歌不是什么大作,但它证明了:一个人 + AI 工具链,10 分钟就能做出一首歌加 MV。再花 10 分钟写完文章,全程 20 分钟收工。
以前做一首歌需要词作者、编曲师、录音棚、MV 拍摄团队。现在只需要你有一个想法,和一个愿意陪你迭代的 AI。
如果你也想试试,打开 WorkBuddy,跟它说你想写一首什么样的歌。
它真的会帮你写。
本文中所有歌词、场景图、封面图均由 WorkBuddy AI 辅助生成,音频由 Suno 生成,MV 由剪映合成。完整成品见文首视频。
夜雨聆风