乐于分享
好东西不私藏

我用AI工具免费做了一首职场吐槽歌,歌词到MV只花10分钟

我用AI工具免费做了一首职场吐槽歌,歌词到MV只花10分钟

一个零预算、纯 AI 驱动的歌曲创作全流程拆解。

🎵 先听歌:

📹 先看 MV:

已关注
关注
重播 分享

事情的起因是,我在某个加班的深夜,给领导发了一条消息,然后眼睁睁看着它变成了"已读"——但没有"回"。

第二天我发现,他根本不是忙。他在打排位。

于是我用 AI 花了 10 分钟,把这件事写成了一首 R&B 慢歌,叫《已读不回》,配上了完整的 MV。算上写这篇文章,全程 20 分钟。

总花费:0 元。(严格来说,AI 生图花了一些平台积分)

这篇文章,我拆解一下完整的制作流程(当然,如果有预算,也可以使用付费的MV生成服务)。如果你也想自己搞一首歌,照着来就行。


一、整体工作流

整个流程只有四步,三个工具:

WorkBuddy 写歌词 → Suno / 即梦 生成音频 → WorkBuddy 生成场景图 → 剪映 合成 MV 

没有录音棚,没有拍摄团队,没有后期剪辑师。就你一个人 + 一台电脑。

二、第一步:让 WorkBuddy 写歌词

这是整个流程里最关键的一步。歌词不好,后面全白搭。

我当时给 WorkBuddy 的 prompt 大概是这样的:

 "写一首职场主题的 R&B 慢歌歌词,主题是领导已读不回——我以为他很忙,结果发现他在打游戏,让我们加班自己却去健身,到九点才回来巡视。" 

它给的初版歌词结构是这样的:

  • Verse 1
    :消息发出去等回复,路过发现领导在打排位
  • Chorus
    :反复质问"领导你为什么已读不回",对比峡谷厮杀和熬夜加班
  • Verse 2
    :咖啡凉了又热,朋友圈晒跑步机配文"自律"
  • Bridge
    :转音段落,已读比沉默更锋利
  • Outro
    :九点推门巡视,低头假装在忙

R&B 情歌式的委屈腔调,套在职场吐槽上,反差感拉满。

一个细节:初版歌词太长了,3 分半的慢歌根本唱不完。我跟 WorkBuddy 来回沟通了两轮,把字数砍到约 37 行、预估 3 分 25 秒左右。AI 的核心价值不是一次性给完美答案,而是能快速迭代。

三、第二步:用 Suno / 即梦生成音频

歌词定稿后,我把它导入到 Suno(也可以用字节的即梦)。

Suno 支持输入自定义歌词 + 风格描述,我选了 R&B Slow Jam、男声、周杰伦式声线(男中音、慵懒咬字、鼻音共鸣)。

第一版就挺有感觉的——慢板 R&B,Verse 用诉说感强的吟唱,Chorus 用丝滑转音表达委屈。完全超出预期。

最后导出了一段约 3 分 37 秒的 WAV 音频文件,作为 MV 的声音轨道。

 补充:Suno 和即梦都有免费额度,生成一两首歌基本不花钱。 

四、第三步:让 WorkBuddy 生成 MV 场景图

这是整个工作流里"肉眼可见"的产出部分。我的思路是:不生成完整视频,只生成关键场景的静态图片,然后导入剪映合成。

原因很简单——目前 AI 视频生成的单段时长太短(几秒到十几秒),做一首 3 分半的完整 MV 成本高、效果也不可控。但 AI 生图已经很成熟了,用图片 + 剪映的 Ken Burns 缓推动画 + 转场 + 歌词字幕,效果完全可以媲美一支低成本 MV。

封面图

先看封面,荒诞讽刺风——西装革履的领导缩着身子、回头张望,偷摸打排位,桌下露出跑鞋,墙上时钟指向九点。

10 个场景设计

我按照歌词的叙事线,拆出了 10 个关键场景:

序号
场景画面
对应歌词
1
深夜独坐工位,脸被手机屏幕照亮
"消息发出去,屏幕亮了一整夜"
2
「已读」绿字特写
"绿色的已读,像你留下的敷衍"
3
偷看领导工位
"路过你工位,余光扫过那瞬间"
4
领导在打排位
"屏幕上映着排位,嘴角带着甜"
5
空旷办公室独自加班
"咖啡凉了又热,电脑没关过机"
6
冷掉的咖啡、凌乱桌面
"配文「自律」,看得我好无力"
7
手机朋友圈晒跑步距离
"你的朋友圈,晒着跑步机距离"
8
健身房跑步机
"转头换好运动鞋,健身房起飞"
9
九点领导推门巡视
"九点才推门,巡视一圈 say OK"
10
「已读」终极特写
"已读两个字,比沉默更锋利"

下面逐一看成品图👇

生成参数

所有图都是 1080×1920 的抖音竖版尺寸,Prompt 里统一加了 "cinematic, film grain, moody R&B music video aesthetic, 9:16 TikTok vertical style",确保色调和风格统一。

十个场景全部暗蓝紫电影感调色,跟 R&B 慢歌的气质一致。每张图大概消耗平台 5-10 个积分,折合人民币不到 5 毛钱。

五、第四步:剪映合成 MV

所有素材准备好了,进剪映。

具体操作:

  1. 导入音频:把 Suno 生成的 WAV 拖进去
  2. 导入 10 张场景图:按歌词顺序排列
  3. 添加 Ken Burns 效果
    每张图加「关键帧缩放」——从 100% 缓推到 110%,模仿电影镜头的缓慢推进感。不同场景交替用推/拉/左移/右移,避免单调
  4. 添加转场:场景之间用「交叉溶解」过渡,时长约 1.5-2 秒
  5. 添加歌词字幕
    在剪映里用「文本 → 识别歌词」功能,它会自动对时间轴。字体用粗黑体 + 白色描边,大字报荒诞搞笑风,呼应这首歌的讽刺气质
  6. 封面图放在第一帧:黑屏 + 歌名大字入场,给观众一个预期
  7. 导出:1080×1920、30fps、H.264

整个剪映操作大概花了 10 分钟。最耗时的是歌词字幕的样式和错别字调整

六、成本核算

环节
工具
花费
歌词创作
WorkBuddy
0 元(订阅内)
音频生成
Suno / 即梦
0 元(免费额度内)
场景图 ×10
WorkBuddy ImageGen
30-50积分(积分免费)
封面图 ×1
WorkBuddy ImageGen
3-5积分(积分免费)
MV 合成
剪映
0 元(免费版)
合计约 3.5 元

对比传统 MV 制作(拍摄团队 + 后期 + 场地,少说几千块起步),这个成本基本上可以忽略不计。

七、经验总结

1. AI 不是替代你,是放大你

歌词的核心洞察——"已读不回不是忙,是我没在你优先级"——来自真实的职场体验。AI 做的是把这种感受结构化、押韵化、节奏化。没有你的洞察,AI 写不出真东西。

2. 用讨巧的方式解决问题

一开始我想让 AI 直接生成完整 MV 视频,但发现成本巨高、可控性差。后来改用"静态图 + 剪映动画",效果完全不输。很多事情不是 AI 做不了,而是有更聪明的做法。

3. 风格统一比单张精美更重要

10 张图如果风格割裂,MV 看起来会很廉价。所有 Prompt 都加了统一的风格描述(暗蓝紫调、电影感颗粒、R&B MV 美学),确保画面之间有连续性。

4. 歌词字幕是 MV 的灵魂

竖版短视频里,字幕不仅传达信息,还是视觉设计的一部分。大字报式的歌词 + 关键词(已读不回)特殊高亮,让整支 MV 有了记忆点。

5. 迭代才是 AI 工具的正确用法

歌词改了 3 版,场景图生成了 2 轮(第一轮是横版,后来改成竖版),字幕样式调了好几遍。不要指望 AI 一次给完美答案,把它当成一个能快速出草稿的助手,你来做最终的判断和打磨。


写在最后

这首歌不是什么大作,但它证明了:一个人 + AI 工具链,10 分钟就能做出一首歌加 MV。再花 10 分钟写完文章,全程 20 分钟收工。

以前做一首歌需要词作者、编曲师、录音棚、MV 拍摄团队。现在只需要你有一个想法,和一个愿意陪你迭代的 AI。

如果你也想试试,打开 WorkBuddy,跟它说你想写一首什么样的歌。

它真的会帮你写。


本文中所有歌词、场景图、封面图均由 WorkBuddy AI 辅助生成,音频由 Suno 生成,MV 由剪映合成。完整成品见文首视频。