夜雨聆风学习资料网

ARTICLE · 1160043

开源AI写歌一夜变天!华人团队祭出可编辑乐谱神作,连Suno都被逼入死角

开源AI写歌一夜变天!华人团队祭出可编辑乐谱神作,连Suno都被逼入死角

作者算法闲谈研究组

编辑算法闲谈编辑部

一个平常的周末深夜,开发者郭震(Michael Guo)坐在电脑前,戴上耳机,顺手点开了一段刚刚渲染出来的音频。

紧接着,清脆、微醺的 3/4 拍律动从耳膜蔓延开来。独奏小提琴在空气中拉出绵长而隐秘的渴望,复古低音大提琴沉稳地拨动心跳,层叠的弦乐如潮水般涌起,伴随着歌手微哑的吟唱,整首歌弥漫着经典老电影般的浪漫与心碎。

这首歌叫《不说出口的华尔兹》

郭震彻底听愣了他未曾雇佣昂贵的交响乐团,也不需要打开每月扣费数十美元的闭源商业音乐平台 Suno。这首完成度惊人的三分半钟华尔兹,来自一个完全开源的模型,YuE2。

▲ 开发者 Michael Guo 晒出用开源模型 YuE2 制作的《不说出口的华尔兹》,引发全网热议

“我差点错过了这份宝藏”郭震连夜将视频发到社交平台,直言被其听感彻底震撼,去健身房、晚上睡觉都在单曲循环。

此帖一出,社交媒体上的创作者与开发者圈子迅速掀起热烈讨论。开源音乐模型,是否已经进化到可以正面抗衡商业巨头的地步?

这场静悄悄的音乐革命,正在把原本高高在上的 AI 音乐圈,撕开一道巨大的裂口。

01杀疯了的战绩:开源黑马直插腹地,巨头神话现出裂纹

长期以来,AI 生成音乐几乎是闭源商业产品的天下。提起 AI 编曲写歌,大众脑海里跳出的名字几乎只有 Suno 或 Udio。开源模型往往被贴上“玩具”、“音质差”、“只能生成十几秒电音底噪”的标签。

但这一次,数字和战绩把固有的偏见砸得粉碎。

在权威横评与官方数据对比中,YuE2 在歌曲质量与文本对齐度等核心维度上紧咬商业对手,与 Suno 各版本不相上下。

▲ 郭震分享的官方评测散点图:YuE2 在歌曲质量与文本对齐维度紧咬 Suno 系列

在专业基准测试中,数据同样震撼包含 192 项严苛中英文双语评测的 WildSongBench 基准上,YuE2 的 best-of-8 评测直接飙到了 6.9632 的均分,一举跨越了 Suno v5 的 6.8721,登顶全行业最高得分!

▲ WildSongBench 官方评测榜,YuE2 在多项指标上展现出顶尖竞争力

“Suno killer is here!(Suno 杀手来了!)”

海外知名开发者 Ivan Fioravanti 在社交平台上高呼。他把重达 35 亿参数的 YuE2-3B 权重直接塞进了一台苹果 M5 Max 笔记本电脑里,不仅 100% 纯本地离线运行,而且无需量化,直接端出 48 kHz 高清立体声。还有开发者用 MLX 框架将其移植到 M2 Ultra 上,几分钟就能跑出一整首编曲完整的成熟歌曲。

▲ 开发者在苹果 Mac 设备上实现 100% 离线本地生成歌曲

不用联网,不用排队,不用按月掏订阅费。曾经昂贵奢华的 AI 录音棚,突然被压缩成了一个可以在个人电脑里自由调用的开源程序。

这匹突然杀出的超级黑马,究竟来自何方?

02撕开黑盒:AI 写歌为什么不能只是“赌大小”?

打造出 YuE2 的,是开源研究社区 M-A-P(Multimodal Art Projection) 与香港科技大学等机构组成的联合科研团队。

要看懂 YuE2 究竟革了谁的命,就必须先明白以往 AI 音乐模型最大的病根,黑盒抽卡。

在过去,无论你使用 Suno 还是体验早期的 AI 音乐生成器,流程大致都是一样的:你往输入框里扔进去一段歌词,外加几个风格词(比如“流行、民谣、木吉他”),点击生成。

接下来,就是长达一分钟的祈祷

模型内部就像一个密不透风的黑箱,直接从文本跨越到音频波形。这就带来了一个令所有严肃音乐人抓狂的死穴:极度不可控。

如果生成的歌曲前奏极其抓耳,但副歌的和弦走偏了怎么办?没法改如果第一句吉他扫弦很有味道,但第二句唱错了调怎么办?只能重来你唯一能做的,就是改改提示词,咬着牙一次又一次地按“重新生成”,像坐在老虎机前碰运气。

初代模型更是暴露出明显的工程短板。在 YuE 1.0 时代,团队曾试图用“大力出奇迹”的自回归路线暴力破局,把整首歌拆成数十万个音频 Token,让大语言模型逐帧硬猜。结果显而易见:生成一首 3 分钟的歌要跑上十几分钟乃至半小时,机器热得发烫;不仅如此,长距离累积误差还让歌手的音素错误率(PER)高达 36%,经常唱着唱着就开始含糊不清,咬字像是嘴里含了块热豆腐。

暴力硬堆算力的路,走不通了

03降维打击:人类写歌先写谱,凭什么 AI 就要硬猜声音?

面对这个死结,YuE2 展现出了极具原创性的解题思路:它彻底推翻了“文本直出音频”的蛮干路线,转而向人类音乐创作的历史经验致敬。

人类作曲家是怎么写歌的?没有哪个人会直接用意念把成品的声波凭空震荡出来。人类是先在纸上写谱的

旋律走向是什么?调性是什么?用了什么和弦进程?主歌几小节、副歌几小节?这套骨架在纸上立住了,乐手和歌手才会走进录音棚,根据乐谱注入音色、情感与细节。

YuE2 研发团队把这套哲学提炼成了一项核心技术:符号规划(Symbolic Planning)。

▲ 官方演示站明确标出核心理念:“Frontier quality. Music, with a plan.”

官方主页以此概括其技术灵魂:Music, with a plan. 通过符号规划先构筑可编辑乐谱,再赋予其丰富声音。

整个生成流程被精妙地解耦成了层层推进的“渐进式承诺”:

  1. 第一步(立骨架)
    :输入歌词和风格后,模型先不动声色,由自回归模块直接输出一份人类完全可读的 ABC 纯文本乐谱。在这个阶段,旋律走向、和弦进程、段落结构被白纸黑字地固定下来;
  2. 第二步(展血肉)
    :乐谱确定后,模型将其转化为音乐语义 Token,彻底锁死调性,告别长程跑调;
  3. 第三步(注灵魂)
    :通过先进的 Flow Matching(流匹配) 算法平滑补齐高频的声学细节,再经由 48 kHz 高保真立体声 VAE,直接渲染成最终成品的母带级波形!

▲ 郭震在长推文中深入剖析了“符号规划”带来的创作交互革命

这种由粗到细的分层控制,带来了近乎奇迹的飞跃。

根据技术论文(arXiv: 2609.33757)公布的严格对照实验,在完全相同的采样预算下,让音乐专家进行盲听盲测:有乐谱规划的版本,以 49.3% 的绝对优势碾压了直接生成的版本(34.6%)!

依靠乐谱这道物理层面的精准约束,YuE2 的音素咬字错误率直接从初代的约 36% 暴跌至 8%–9%!

▲ 论文详细记录了 AR-NAR 架构与符号规划对整曲生成的颠覆性提升

但技术指标的跃升还只是附赠品,符号规划给创作者带来的核心蜕变,在于掌控权的彻底回归。

在 YuE2 里,乐谱是一个可以随时截流、随时修改的白盒接口。如果 AI 生成的旋律极美,但你嫌流行和弦太俗气,你可以直接把 ABC 文本里的几个和弦改成爵士增减和弦,再丢给它重新渲染;你甚至可以让外部的大语言模型 Agent 充当你的副驾驶:“把副歌部分的情绪推高,和弦换成更有张力的走向。”

AI 音乐终于走出了黑盒抽卡的赌博时代,变成了有来有回、可以推敲、可以商量的深度创作。

04现实拷问:开源真的全面战胜商业帝国了吗?

看到这里,很多人难免产生疑问:既然开源模型已经如此强悍,Suno 这类商业巨头难道明天就会关门倒闭?

答案很干脆:远没有那么简单

如果你把情绪化的赞誉先放在一边,钻进第一线开发者的真实体验与第三方横评里,会发现现实依然骨感。

首先是关于那个惊艳四座的 6.9632 跑分。请注意后面的后缀,best-of-8该机制代表系统针对同一句提示词一口气生成 8 个候选版本,再用评测协议挑出最优版本去打榜。

一旦回到普通用户最常用的“单次生成(best-of-1 或 best-of-2)”场景,YuE2 的基准得分其实在 6.73 左右。它依然处于顶级专有模型的竞争区间内,但并未实现所谓的“秒杀一切”。

▲ 海外测评机构用相同的 5 首风格提示词横评 YuE2 与 Suno

海外评测机构 Earngenix 专门用 5 首一模一样的风格提示词,在英伟达 RTX 4090 环境下把 YuE2 与 Suno 进行了严苛的同台对战。实测结论非常毒辣:

在吉他、弦乐等物理乐器的编曲逻辑上,YuE2 表现得极其惊艳甚至更自然;但是在成品的人声质感、混音抛光度以及高潮段落的情感爆发力上,商业付费的 Suno 依然构筑着难以逾越的壁垒。

与此同时,中文社区的不少尝鲜者也指出了细节上的毛病:在遇到生僻词、难词或者复杂押韵时,YuE2 偶尔还是会出现把字音唱错、漏字,甚至唱着唱着突然拐到奇怪口音的尴尬场面。

▲ 尝鲜网友在推特下反馈歌词咬字与口音偶尔失控的现实短板

还有一道横亘在许多团队面前的红线,授权协议。YuE2 的代码虽然采用了宽松的 Apache 2.0,但权重却遵循 CC BY-NC 4.0(非商业许可)。虽然个人创作者被允许自行售卖生成的音乐作品,但企业如果想直接把模型封装成商业产品去收费,依然面临着严苛的商业授权门槛。

巨头依然手握重兵,开源也尚未天下无敌。

05终局推演:AI 创作的分水岭,敲响在华尔兹落幕时

然而,如果我们仅仅把目光停留在“谁的声音更抛光”、“谁的跑分高了 0.1”,就会完全忽视这场技术震荡所蕴含的深远历史意义。

ACE Studio 的研究者龚俊民(Gong Junmin)一语道破了行业深层的结构性变化:AI 音乐正在迎来关键的历史拐点。

▲ 行业研究者指出:闭源模型的边际效益正在递减,开源模型迎来历史拐点

在过去两年里,闭源商业公司凭借海量算力与私有数据集,跑马圈地般地建立起了声音保真度的高墙。但随着模型越做越大,纯音频端到端黑盒模型的边际收益递减已经肉眼可见。用户早已对“又一首好听但无法修改的流水线 MP3”感到审美疲劳。

YuE2 的爆发,本质上是一场创作权力的再分配。

它证明了一条完全不同的演进路线:把逻辑留给符号,把感性留给声音。通过引入人类文明沉淀了数百年的乐谱系统,它让机器第一次学会了“谋定而后动”。可控性、局部修改、工作流编排……这些闭源产品迟迟无法优雅解决的创作者刚需,反而在开源社区的白盒架构下找到了解药。

与此同时,随着 Mac 本地推理、24GB 显存单卡无量化运行的门槛被踏平,广大的独立音乐人、独立游戏开发者以及小型工作室,终于不再需要时刻把自己的命脉绑在巨头按月扣费的 API 之上。

回过头来,再去听一听郭震深夜跑出的那首《不说出口的华尔兹》。

三拍子的华尔兹依然在流淌,小提琴的尾音优雅地消散在空气里。但在优雅的乐声背后,整个数字音乐产业的旧秩序,已经听到了坚冰破裂的隆隆回响。

一个告别盲目抽卡、摆脱黑箱束缚、每一个音符都清晰可调的 AI 音乐新阶段,正在拉开序幕。

相关学习资料