前一阵我发过一篇文章,叫《我让 Codex 替我参加了番茄音乐大赛,81 首歌全部成功上架!》。
当时的玩法很直接:让 Codex 帮我批量生成音乐,再按照番茄音乐的上传要求整理素材、打包、提交。那一批歌基本是全自动跑出来的,没有逐首做精修,也没有像传统音乐制作那样反复打磨。
这两天我重新登录番茄后台,发现事情开始变得有意思了。
后台里已经有几首歌产生了真实收益:当前收入累计 120.07 元。这个数字当然还谈不上改变生活,但它证明了一件事:AI 生成音乐不是只能停留在“好玩”,只要能完成创作、版权声明、平台格式和分发,它确实有机会形成一点点睡后收入。

更关键的是,这批作品还不是精细化创作的结果。它们更像一次“流水线能不能跑通”的验证。
既然粗放跑一遍都能有收益,那如果换成更垂直、更高频、更适合长期播放的内容,会不会更值得做?
我第一个想到的方向,就是儿歌。
为什么是儿歌
我查了一下公开资料,番茄音频创作平台的音乐人协议里明确提到,音乐人模块提供音乐物料上传、发布、管理等能力,账号信息里也包含用于后续收益对账、结算的内容。不过公开协议里没有披露“单次播放固定多少钱”的公式。所以这件事不能简单写成“播放一次就赚固定几分钱”,更稳妥的理解是:平台存在收益结算,播放规模是收益的重要变量,但最终收入还会受到合同、权利归属、平台规则、播放质量等因素影响。类似 Spotify 这类流媒体平台也公开解释过,主流分成逻辑更接近收入池和播放份额,而不是固定单次播放价格。
这个逻辑一放到儿歌上,就很有意思。

家里平时经常循环播放“太空小狮子”的歌给曹吉美听。小朋友喜欢一首歌,是真的会一遍、两遍、十遍地循环;睡前、起床、吃饭、刷牙、坐车、收玩具,每一个生活场景都可以有一首歌。既然都能用 AI 做歌,为什么不能给曹吉美定制一些属于她自己的儿歌?
但问题也来了。
我平时 KTV 能唱几首歌,不代表我会写歌。更不用说儿歌并不是“押韵 + 可爱词”这么简单。好的儿歌要朗朗上口,要有适合儿童的音域和节奏,要控制认知负荷,还要把知识、习惯、情绪、性格培养这些东西藏在很轻的旋律里。所以我没有一上来就让 AI 硬写,而是先研究真正已经被孩子反复听的儿歌。
先把对标素材库建起来
工欲善其事,必先利其器。
我先找了一个网易云音乐下载工具,把它集成到当前项目里。工具拉到 tools/MusicDownloader/ 目录后,我让 Agent 建好 Python 虚拟环境,装好依赖,并补齐使用文档和项目约定。这样后面不是临时跑一次,而是能持续复用。

真正开始下载时,我让 Agent 搜索“太空小狮子”的所有专辑,把专辑全部下载到本地参考目录,同时整理每张专辑和每首作品的信息。
第一步先抓专辑数据,albums.json 里已经有 25 张专辑的元数据。接下来再逐张专辑处理,不是只挑几首热门歌听听感觉。

这个过程里也踩了坑。
二维码登录失败,手机号登录也失败,最后我改成网页端 cookie 方案。搞定登录之后,下载结果就很完整了:24 张专辑、298 首歌、成功下载 293 首、失败 5 首,失败原因主要是版权限制;音频格式是 MP3 320kbps,封面和 LRC 歌词已嵌入,总大小约 2.0GB。

这里要强调一下:这些素材只用于个人学习和结构分析。我不复用原音频,不搬运歌词,不采样旋律,也不做“换皮改编”。真正要学的是它们背后的结构经验:什么主题适合孩子,什么节奏容易跟唱,什么词会被重复记住,什么编曲能让家长不至于听到崩溃。
用多模态模型逐首拆歌
素材有了,下一步不是“听感总结”,而是系统分析。
我让 Agent 调用多模态大模型,对近 300 首儿歌做逐首分析。这里有一个省钱的小技巧:魔搭平台提供 API-Inference,注册用户可以使用一定的免费 API 推理额度,而且覆盖大语言模型、多模态模型、文生图等多种方向。对这种批量分析任务来说,刚好可以把成本压下来。
我这次做的不是单模型拍脑袋,而是串了 Step、Qwen、MiniMax、DeepSeek、Kimi 等模型,对同一批儿歌进行结构化分析。
最终分析规模是:
• 总分析:282 首 • 覆盖专辑:22 张 • 报告总量:285 份 • 报告大小:4.4MB

每首歌的报告维度很细,不只是“这首歌很好听”,而是拆到元数据校验、歌词结构、旋律走向、节奏设计、和声推测、编曲乐器、人声特点、曲式结构、混音风格、儿童发展适配、功能分类、创作技法、爆款引擎、对比分析和创作启示。
这一步做完之后,我手里就不再是一堆 mp3,而是一套可以检索、可以复用、可以对比的儿歌知识库。

再用深度研究把经验蒸馏成技能
光有单曲分析还不够。
单曲报告解决的是“这一首歌为什么成立”,但我要的是“以后怎么稳定做出一批能成立的儿歌”。
所以我又用了彭超大佬的深度研究 skills,做了一份《AI x 中国儿歌创作:深度调研与技能蒸馏报告》。
这份报告综合了 20+ 份 Web 资料和 100+ 份本地分析文件,覆盖 17 个专辑、100+ 首儿歌、13 个分析维度。它不是单纯整理资料,而是把 AI 音乐生成技术、传统儿歌创作技巧、中国儿歌市场、对标账号样本分析放到一起,抽取出后面能真正执行的技能。

报告里最有价值的,不是“儿歌市场很有机会”这种大话,而是一些能落到生产流程里的规则:不同年龄段适合的音域、节奏和信息密度不一样;睡前歌、习惯养成歌、动物科普歌、情绪安抚歌,写法也应该不同;Hook 密度、重复策略、BPM 区间,会影响孩子能不能快速记住;儿歌还要在“熟悉”和“意外”之间找平衡,太复杂孩子跟不上,太单调家长听不下去。
这一步之后,我开始把研究报告继续蒸馏成 skills。
把方法论拆成一套儿歌工厂
我没有做一个“万能儿歌 prompt”。
万能 prompt 看起来省事,实际很容易失控:今天写成睡前歌,明天写成广告歌,后天又忘了儿童音域和认知负荷。
我把整个流程拆成了一套技能库:需求分析器先明确年龄、场景、功能和情绪目标;儿歌歌词生成器负责结构、重复、押韵和儿童表达;旋律与节奏设计师把歌词映射成适合儿童的旋律框架;Suno/Udio 提示词工程器把创作意图转成音乐生成平台能理解的 style prompt;爆款引擎评估器检查 Hook、重复、记忆点和传唱性;儿童发展适配审核器检查认知负荷、安全性和年龄匹配;分龄儿歌个性化适配器负责同题不同年龄版本;创作灵感与趋势发现器持续从知识库里找主题和风格机会。

到这里,整个系统已经从“让 AI 写首歌”变成了“让 AI 按一个儿歌生产流程工作”。前者看运气,后者看流程。
第一首测试作品:《猫头鹰的秘密》
流程搭好之后,我用它生成了第一首儿歌:《猫头鹰的秘密》。
这次我没有直接给模型一句“写一首猫头鹰儿歌”。我调用的是自己封装的 tomato-music-pipeline,再接上前面蒸馏出来的 skills/09-implementation-guide.md。
流程先根据主题,从知识库里找到适合参考的歌曲分析文件,例如《太空小狮子 - 五只小鸭-analysis.md》。它学习的是结构和方法,不是复制内容。
然后开始生成歌词:
天黑黑 月亮弯猫头鹰 站树尖大眼睛 圆又圆守护着 梦香甜
接着生成 Suno V5.5 的风格提示词。方向是 Chinese children's song、gentle lullaby style、warm and cozy night atmosphere、soft female vocal,整体定位很明确:睡前、温柔、夜晚、小动物、轻科普。

音乐生成完成后,tomato-music-pipeline 继续做后面的交付工作。
这也是我封装这个技能的原因:番茄音乐上传不是只要一个 mp3。真正能省时间的是把封面、歌词、时间轴、平台兼容音频、提交信息全部整理好。
最终目录里能看到几个关键文件:猫头鹰的秘密-cover.png、猫头鹰的秘密-lyrics.txt、猫头鹰的秘密.lrc、猫头鹰的秘密.srt、猫头鹰的秘密.mp3、manifest.txt,以及 release/、source/、upload/ 等目录。
其中 release 版本是封面歌词标签版,upload 版本是平台兼容版:44.1k、192k、元数据留空,并提升到主目录。音频时长 2 分 33 秒。

最后成品包括带时间轴的歌词、一张 1:1 封面和完整音频。封面是夜晚森林里的小猫头鹰,月亮、树枝、星星、松鼠这些元素都和睡前儿歌的氛围贴合。

到这里,一首儿歌就从选题、对标分析、创作、生成、封面、时间轴歌词,到平台上传包,完整跑通了。
这件事后面还能怎么做
这次只是第一首。真正值得继续做的,是把它 IP 化、系列化。
比如先固定一个世界观:曹吉美的睡前动物园、曹吉美的太空小课堂、猫头鹰老师的夜晚学校、小动物生活习惯歌、睡前十分钟自然百科。再固定一套声音和风格:温柔女声、慢速睡前节奏、轻木吉他或八音盒、每首歌 2 到 3 分钟、每首只讲一个知识点或一个习惯。
这样做的好处是,后面每首歌不再从零开始。主题可以批量规划,歌词可以批量生成,风格可以保持一致,封面也可以形成统一视觉。一个系列里可以有猫头鹰、月亮、小松鼠、云朵、星星、刷牙、收玩具、说晚安,每个角色都慢慢变成熟悉的陪伴对象。

AI 音乐创作最有意思的地方,可能不是“我能不能一键生成一首歌”,而是“我能不能把一套内容生产系统搭出来”。从这次实验看,答案是可以的。前面一批 AI 音乐已经在番茄后台产生收益,这次儿歌流程又把立项、调研、对标、技能蒸馏、音乐生成和上传交付打通。接下来要验证的,就是更细分的主题、更稳定的音色、更统一的 IP,以及批量创作后的长期播放表现。
如果你也在做 AI 音乐、儿歌、内容 IP 或者自动化投稿,欢迎留下你的经验和问题。这个方向还很早,很多坑值得一起踩,也值得一起总结。
如果这篇对你有启发,也欢迎关注「铁柱AGI」。后面我会继续把 AI 音乐创作、Agent 工作流、自动化投稿和内容 IP 这些真实实验拆开写:不只看一键生成有多热闹,也看它能不能真正变成可复用的生产系统。
夜雨聆风