AI实战 · 踩坑与顿悟
折腾到凌晨4点!
我用5款AI工具做《将进酒》MV,
踩坑与顿悟全记录
📅 2026年7月 📍 福AI夜校 🎯 AI实战分享
💡 先抛一个"顿悟"——
为什么现在网上那么多AI唱歌号,
都用古人的半身像对着麦克风静静唱?
因为用动态视频做AI对口型太容易翻车了!
这是前人踩了无数坑后总结出的最优解。
前两天我彻底掉进了AI音乐制作的"坑"里。昨晚折腾到半夜12点多,凌晨2点醒来脑子里还是这件事,躺在床上拿着手机又抠到了4点。真的是一件事挂在心上就放不下。
起因是我想用多款AI工具,将李白的《将进酒》制作成一首带有MV的歌曲。原本以为输入提示词就能坐等成片,结果从找工具、生歌曲、提人声到对口型,一路"过关斩将"踩了无数个坑。
今天做个全面的复盘与梳理,把经验、避雷指南以及那些"顿悟"分享给同样在探索AI音乐的你。
🎵 一、AI音乐生成:寻找Suno与麦浪、海绵的对比
在核心的音乐生成环节,我首先想试试业内大名鼎鼎的Suno。结果刚搜出来 suno.cn、sunoai.com 之类的网站就觉得不对劲——查了一下,全是国内的"李鬼"网站!真正的国外官网目前需要特殊网络技术才能访问,无奈只能放弃。
最终我主要对比测试了国内的两款工具:
🥇 麦浪(Melo)—— 专业度拉满,但门槛较高
✅ 优点:生成的歌曲复杂度、曲调及演唱水平都非常出色。使用类似Agent的交互方式,制作过程中会不断提问调整细节。对中国传统乐器和氛围感的拿捏很到位。给集美大学的音乐教授听后,评价"伴奏和音高已达到专业水平"。
❌ 缺点:音域偏高,普通人很难跟唱;歌曲动辄8分钟,不太懂得精简。
💰 省钱小妙招:买断版权下载需20元/首,但如果只为发抖音,可通过"分享视频卡片"巧妙拷贝。充值会员APP端59元,小程序端只要38元!

🥈 海绵音乐 —— 流行接地气,但音质受限
✅ 优点:流行歌曲味道足,对普通人更好唱、更容易上口。
❌ 缺点:导出后给教授听,反馈"音质太差",曲风偏"口水歌"。近期在做功能精简,以前可以加照片做MV的功能也被删掉了。

🗣️ 二、古诗词 + 方言的融合难点
我给AI布置的第一个任务是《将进酒》,原本希望用闽南语演唱。但在麦浪和海绵里都没找到闽南语的选项,最终AI生成的是"普通话夹杂着闽南语"的混合体——因为不是闽南语母语者,也无法判断发音准确度。
💡 重要经验
如果制作诗词类歌曲是为了辅助学习古诗词,千万不要把诗词拆散。歌词应该紧密围绕原诗,才能起到记忆辅助的作用。
🎬 三、AI对口型翻车 & 最大顿悟
音乐生成后,我尝试用照片/视频给歌曲做"对口型"MV。测试了"开拍"和"剪映"两款工具——结果翻车翻得彻彻底底:
🚫 开拍(照片对口型)
用照片生成的25秒短视频,嘴型对得还可以,但只有25秒,无法满足长歌。
🚫 开拍(视频对口型)
一旦加入带伴奏的视频,人物动作就会乱动,嘴巴连张都不张开。分析原因是视频原本的杂音干扰,导致AI强行根据视频的声音律动去改正,完全没匹配上歌曲。
🚫 剪映对口型
普通的对口型匹配度不高,且"灵动模式"只能支持25秒。
避坑尝试:为了解决视频对口型被伴奏干扰的问题,我用剪映尝试"人声分离"把伴奏去掉只留人声。结果发现提取后,前面好长一段居然没声音了,人声也被提走了一部分——再次失败。
💡 最大顿悟
经历了这些折腾,我突然明白了一个"行业真相"——为什么现在网上那么多AI唱歌号(比如"史隐孤声"),绝大多数都只用古人的半身像,静静地对着麦克风唱?
因为用动态视频做AI对口型太容易翻车了!静态的半身像+麦克风,既能掩盖肢体动作不协调的问题,又能最大程度集中AI的算力去匹配嘴型——这是前人踩坑后总结出的最优解啊!
🖼️ 四、MV配图与故事片生成:提示词与卡点是痛点
既然动态对口型走不通,我转向了"生成配图+故事片"的路线:
🔵 腾讯龙虾 WorkBuddy
✅ 生成的配图总体不错,一首歌能生成七八张图
❌ 图片与歌曲的时间轴对应不上,需手动拉卡点
❌ 生成的歌词字幕比较"土鳖",有时画面也比较乱

🟣 嘟嘟 Storybound
(福AI伙伴开发的视频号带货神器)
✅ 生成故事场景、配图总体不错
✅ 能自动根据歌词进行切分,一个场景20个字左右,歌词匹配较好。
✅ 给指定主题,自动生成歌曲和对应的场景效果好。(比如下面这首歌👇)
❌ 图片与歌曲的时间轴对应不上,需手动拉卡点
❌ "五花马,千金裘"这类古风提示词很难精准匹配画面
🟠 智谱清言 Agent
❌ 耗费了大几千的积分,生成的"李白"唱歌嘴型和动作依然与歌词对不上。伴奏刚起,李白已经嘴巴在念念有词了。
📝 五、总结与下一步计划
最大感受
目前想用AI"单线串联"完成一首高质量古诗词MV(先生成歌词→再生成歌曲→最后配图对口型)非常困难,各个环节的割裂感很强。
🔜 下一步优化思路
1️⃣ 化繁为简:不再拆解流程,直接把《将进酒》和要求一次性丢给Storybound等工具,让它直接生成,看看整体效果。
2️⃣ 人工干预与沉淀Skill:AI生成的图片风格和字幕卡点目前仍需人工介入调整。后续需要摸索并沉淀出更精准的风格提示词,再喂给WorkBuddy等工具。
🤝 一起交流,少走弯路!

看来我的AI音乐制作还要折腾一阵子,但只要掌握了各个工具的脾气,肯定能做出令人惊艳的作品。
如果你也有好用的AI音乐工具或避坑经验,
欢迎在评论区和我交流!👇
🤖 福AI夜校 · 让每个人都能玩转AI
科技有温度,陪伴有力量 💚
夜雨聆风