我认为,AI生成的下一场风暴,不在图片,而在声音。
就在今天,Noiz AI联手港科大和清华,扔出了一颗重磅炸弹:一个叫CGM的音频生成大模型,号称“4步出声,单卡0.24秒”。你不需要理解背后是“扩散模型”还是“对抗网络”,你只需要知道一件事——AI生成高质量音频的门槛,正在被砸穿。
过去几个月,AI绘图卷得昏天暗地,Midjourney、Stable Diffusion你追我赶。但声音的世界呢?总觉得还差那么一口气。要么生成慢得像老牛拉车,要么效果假得让人出戏,要么就是操作复杂得让人头大。但现在,情况变了。
这个CGM模型,最狠的一点是“快”。0.24秒是什么概念?你眨一下眼的时间,它可能已经生成了好几段声音。而且它只需要“4步”迭代,这比动辄几十步、上百步的传统方法,效率提升了不止一个数量级。效率,往往是技术普及的生死线。
更绝的是,它还能“听懂”时间戳。这意味着什么?你可以精确地告诉AI:“从第5秒开始,来一段雨声,10秒后加入远处的雷声,再过5秒,让雷声变大。”这种控制粒度,以前几乎是专业音频工程师才能手动拼接的活儿。
我的判断是,这不仅仅是一次技术迭代,而是一次范式转移。音频生成的“ChatGPT时刻”,可能真的快来了。
快,是颠覆一切的前提
所有技术的普及,都有一个绕不开的坎:速度。
回想一下AI绘图,为什么Stable Diffusion能迅速崛起?开源是一方面,更重要的是,它让生成一张像样的图片,从几分钟缩短到了几秒钟。用户没有耐心等待。等待会打断创意,消磨热情。
音频生成此前最大的痛点之一,就是慢。你想生成一段30秒的环境音,可能需要在云端排队,等上几分钟,出来的效果还不一定满意。这种体验,注定只能是小众极客的玩具,无法成为大众的生产力工具。
CGM把速度拉到0.24秒,而且只用单张消费级显卡就能跑。这个信号极其强烈——技术正在从“云端神坛”走向“个人电脑”。当生成一段声音像在本地文档里敲几个字一样快时,应用的想象力就彻底打开了。
我认为,快,带来的不仅是体验提升,更是创作模式的改变。创作者可以实时地、反复地调整提示词,立刻听到效果,形成“提示-生成-反馈”的快速闭环。这种即时满足感,是创意工作流的催化剂。
听懂时间戳,AI声音有了“乐谱”
如果说“快”解决了效率问题,那么“基于时间戳的控制”,则是解决了音频生成的精准度问题。
过去的文本生成音频,更像是一种“模糊的描述”。你说“一段有鸟叫和溪流的声音”,AI给你一段,但你无法控制鸟什么时候叫,溪流声有多大。生成的是一整块“声音糊糊”。
现在,你可以像写分镜头脚本,或者像作曲一样,给AI一个“时间线乐谱”。“0-3秒,寂静;3-6秒,一只鸟叫一声;6秒后,持续不断的溪流声作为背景,音量中等。” AI能理解并执行这个精确的指令。
这个功能的含金量,被严重低估了。它让AI音频生成从一个“随机抽卡”游戏,变成了一个“可控的创作工具”。
对于影视、游戏、播客等行业的音频后期来说,这意味着巨大的效率提升。很多背景音效、环境声的制作,可以从繁琐的素材库搜索、剪辑、拼接中解放出来,直接用自然语言描述生成。而且可以无限调整,直到完美匹配画面节奏。
这才是真正的产品思维——不是炫技,而是解决真实、具体的生产痛点。
开源,是为了点燃更大的火
Noiz AI选择开源CGM模型,这个决定很有意思。
在AI绘图领域,Stable Diffusion的开源引爆了整个生态,催生了无数的应用、工具和商业模式。它证明了,在基础设施层面,开源往往比闭源能更快地催熟市场、建立生态。
现在的AI音频生成领域,有点像Stable Diffusion开源前的“荒原状态”。有技术,但不够好用;有产品,但不够普及。需要一个强大的、开源的“基座模型”来降低所有人的入场门槛。
我的判断是,Noiz AI和其研究伙伴深谙此道。他们开源CGM,看似放弃了短期内垄断技术的可能性,实则是在下一盘更大的棋。他们可能想成为“音频生成领域的Stability AI”。
当这个模型被开源,无数的开发者、创业者、创作者会涌入。有人会用它做视频配乐工具,有人会集成进游戏引擎,有人会做出新一代的播客制作软件……生态一旦建立,最大的受益者和定义者,往往是最早的奠基人。
这步棋,走得聪明。闭门造车,永远造不出一个繁荣的生态。用开源的技术火种,去点燃整个音频创作领域的草原,这才是格局。
音频的“App Store时刻”即将到来
那么,这件事对我们普通人,对创业者,意味着什么?
我认为,这意味着一个全新的、以音频生成为核心的“应用生态”即将爆发。我们可以类比移动互联网的“App Store时刻”——当iPhone和App Store提供了足够好用的基础能力,无数开发者创造了我们今天无法离开的应用。
CGM这样的模型,就是在提供音频领域的“基础能力”。快、可控、易得。
未来一年,我们可能会看到:
1. 全民UP主/播客主的时代:视频剪辑软件会内置智能音频生成,你描述场景,AI帮你配好全部背景音乐和音效。做视频的门槛再次降低。
2. 游戏开发革命:独立游戏开发者无需庞大的音效库,可以实时生成独一无二的游戏环境声音、技能音效,甚至根据玩家动作动态生成音频反馈。
3. 沉浸式内容新体验:结合VR/AR,你可以用语音实时构建一个完全定制化的声音环境。“给我一个星空下的篝火营地,有柴火噼啪声、远处的狼嚎和轻柔的风声。” 你的耳机里立刻就是一个世界。
4. 新的创意职业诞生:或许会出现“AI音频导演”,他们不擅长传统音频工程,但极其擅长用语言描述和引导AI,创作出震撼人心的声音艺术作品。
对于创业者,我的建议是:现在就要开始思考,如何将这种“瞬间生成可控音频”的能力,嵌入到一个具体的、用户愿意付费的场景中去。工具本身不是产品,解决特定场景下的用户问题才是。
写在最后:别只盯着ChatGPT说话了
AI的世界,声音比我们想象中更重要。
我们花了太多时间关注AI说了什么(ChatGPT),看了什么(绘图模型),却常常忽略了我们所处的世界,本身就是一个充满声音的世界。声音承载着信息,更承载着情绪、氛围和空间感。
Noiz AI这次联手顶尖学术机构放出的开源模型,是一个清晰的信号:技术奇点正在向多感官蔓延。当高质量的声音可以像自来水一样“即开即用”、随意塑形时,我们创作和消费数字内容的方式,将被再次重塑。
我敢断言,未来18个月内,基于此类技术的消费级音频生成应用会如雨后春笋般出现。它会先渗透进专业创作工具,然后进入大众娱乐和社交产品,最终变得像美颜滤镜一样无处不在。
这一次,你的耳朵,准备好了吗?
本文由 写作鹅 创作
夜雨聆风