夜雨聆风学习资料网

ARTICLE · 1120775

4年狂飙220亿美金!靠AI克隆声音,两个波兰年轻人血洗硅谷成亿万富翁

4年狂飙220亿美金!靠AI克隆声音,两个波兰年轻人血洗硅谷成亿万富翁

短短四年,估值翻了整整2444倍

2026年9月30日,欧美创投圈被一条重磅消息彻底震醒:AI语音独角兽 ElevenLabs 完成新一轮约3亿美元的员工股权转让(Tender Offer),公司估值正式飙升至 220 亿美元(约合 1560 亿人民币)。

距离他们今年2月估值110亿美元的 D 轮融资,仅仅过去了短短7个月。

这家诞生于2022年、首轮估值仅有900万美元的初创团队,仅用四年时间,就跃升为了全球估值最高的纯AI独角兽之一。而公司的两位联合创始人,来自波兰的“90后”高中死党马蒂(Mati Staniszewski)与皮奥特(Piotr Dabkowski),不仅双双蝉联福布斯欧洲“30位30岁以下精英”,更直接以数十亿美元的身家,强势迈入全球最年轻白手起家亿万富翁俱乐部。

▲ 联合创始人兼 CEO Mati 发布短视频,背景赫然印着巨大的“$22BN”

这场交易省去了漫长的PPT路演拉锯,团队也无需向公司账面注入救急资金。这一轮由国际资管巨头 Wellington 与 T. Rowe Price 领投的3亿美元交易,只有一个目的:让早期立下战功的工程师和老员工,直接带着真金白银套现离场。

在硅谷巨头挥舞着千万美元签字费满世界疯抢AI人才的当下,ElevenLabs 用最简单粗暴、也是最震撼的方式告诉世界:声音,这门一度被视作大模型“边缘配件”的生意,正在重构全球数十万亿美元的人机交互入口。

01.逼死全波兰观众的“单声优配音”,逼出了一家超级独角兽

很多改变世界的商业传奇,最初的起点都极其荒诞。ElevenLabs 也是如此

如果你在十几年前的波兰看电视,一定会遭遇一种极其精神污染的奇葩体验:波兰单男声解说(Lektor)。

在波兰传统的电视工业里,由于缺乏译制预算,所有引进的好莱坞大片、经典连续剧,从施瓦辛格的硬汉怒吼、玛丽莲·梦露的娇嗔喘息,到动画片里的小动物尖叫,全由同一个嗓音毫无波动的波兰大叔在原声之上低头念旁白。所有角色的喜怒哀乐,全被抹平成一种机械、困顿、宛如火车站列车晚点播报的死人嗓音。

生于华沙的马蒂和皮奥特,就是听着这种“折磨全波兰年轻人”的灾难配音长大的高中铁哥们。

▲ 福布斯封面长文:一家微小的波兰初创,如何成为价值数十亿美元的“AI之声”

高中毕业后,两人走上了典型的精英学霸路线。马蒂考入伦敦帝国理工学院,毕业后进入大数据狂人彼得·蒂尔创办的 Palantir;皮奥特则手握牛津与剑桥的双重学术背景,一头扎进谷歌担任机器学习工程师。

2022年,大语言模型初露峥嵘两人在下班后搞业余实验时,脑海中那个萦绕多年的执念突然被点燃:既然文字能够被机器理解,为什么不能让机器发出媲美人类、有灵魂、有情绪的声音,把那些被糟糕配音毁掉的影视和文字彻底解救出来?

2022年5月,两人掏空了全部积蓄,双双辞掉令常人艳羡的大厂光环,全职下场。

当年,他们拿到了首笔天使投资,投后估值仅为900万美元。伴随这轮融资落地的,是他们的开山之作,Eleven v1 模型。

那是AI历史上第一次,合成声音跨过了令人悚然的“恐怖谷”。

02.跨过“恐怖谷”:声音第一次有了呼吸、犹豫与笑意

在 ElevenLabs 出现之前,大部分人接触到的“语音合成(Text-to-Speech,简称 TTS)”,体验基本停留在高德地图的冰冷导航,或者短视频里千篇一律的“注意看,这个男人叫小帅”。

传统语音合成最大的痛点,就是机器味太冲。它懂得按音节发音,但它根本不懂“潜台词”。它不知道什么时候该倒吸一口凉气,不知道哪句话需要加重语调,更不知道如何在字里行间藏进一丝压抑的嘲讽或叹息。

而 ElevenLabs 带来的降维打击在于:它把语音生成当成了一种端到端的深度情感还原。

▲ 福布斯头条报道:两位“30岁以下精英”校友,将初创估值翻倍至220亿美元

你只要给它一段几秒钟的录音样本,它不仅能以99%以上的相似度瞬间克隆出一个人的音色,还能自动理解上下文。当文字写到悲伤时,生成的声音会自动带上沙哑与哽咽;当情节推进到高潮时,语速会不由自主地加快,甚至连换气时的轻微胸腔杂音、微不可察的吸气声,都被精准地渲染了出来。

全球的内容创作者瞬间陷入了狂欢:

  • 独立游戏开发者不再需要花数万美元雇佣配音演员,就能让几百个 NPC 操着不同地方的口音娓娓道来;
  • YouTube 头部博主只需一键,就能把自己的英文视频无缝翻译成地道的西语、德语或中文,口音依旧是他自己,口型与情绪完美贴合;
  • 企鹅兰登、哈珀·柯林斯等老牌出版巨头,用它在几天之内批量把成千上万本冷门出版物转化为高水准有声书。

甚至,连硅谷最老练的风险投资人在尽调时都被彻底震慑住了。

▲ 早期观察者 Linus Ekenstam 回忆:当时风投打电话做尽调,我直接吼道“立刻挂电话去开支票!ElevenLabs 是绝对的同类最佳,别浪费时间!”

估值火箭从此彻底失控

从最初的900万,到11亿、33亿、66亿、110亿,再到如今惊天动地的220亿美元。

圈内投资人甚至半开玩笑地造了一个梗:“创始人们记住了,给公司起名一定要带个数字(比如11),这样每次风投来谈估值,都只能按11的倍数往上翻,根本没有讨价还价的余地!”

▲ 投资圈推文调侃:1.1B -> 3.3B -> 6.6B -> 11B -> 22B,品牌里带个“11”直接剥夺了风投的议价权

但如果你以为,顶尖华尔街资本愿意为220亿美元买单,仅仅是因为它是个“更好玩的配音玩具”,那你就彻底低估了这场技术裂变。

03.7个月翻倍的深层秘密:它从发音工具蜕变为全球企业的“AI嘴替”

华尔街从不为单纯的“炫技”慷慨解囊

支撑这次估值翻倍的底气,是 ElevenLabs 商业模式的关键跃升:从面向C端内容创作者的“配音软件”,全面演变为跨国大企业的“对话式服务中枢”(ElevenAgents)。

大模型爆发两年来,全球企业级市场最大的痛点是什么?是文字客服的极度低效与冷血

无论大模型的后台多聪明,当一个愤怒的客户遇到飞机晚点、信用卡被盗刷或者保险理赔纠纷时,在App里和文字机器人来回拉扯几十分钟,只会让怒火成倍攀升。而传统的人工呼叫中心,更是一个人员流失率高达30%-40%、成本高昂、跨语种能力捉襟见肘的泥潭。

ElevenLabs 看准的正是这个数万亿美元规模的企业级死穴。

▲ 官方公告白纸黑字:企业对对话智能体的爆炸性需求,直接助推了220亿美元的全新估值

他们推出的 ElevenAgents 越过单纯朗读文本,直接接管了整个业务闭环:

  1. 能听、能思考、能办事:
     它原生接入企业内部的 CRM 数据库与业务 API。当用户拨通电话,它不仅能以绝对自然、极富同理心的声音对话,还能在通话的同时执行退款、更改机票舱位、完成医保续约等复杂后台操作;
  2. 极速响应与多渠道调度:
     用户可以先在 WhatsApp 上发送一段文字,随后直接转为跨国电话沟通,最后接收由 AI 整理好的确认邮件。整个过程,解决问题的平均速度比传统文字客服快了整整 31%;
  3. 恐怖的巨头渗透率:
     官方公布的数据令人咋舌,目前,全球排名前十的科技巨头中有5家、前十大保险公司中有5家、前十大电信运营商中有4家,都已将 ElevenAgents 嵌入了日常核心运营系统(包括 Stripe、德国电信 Deutsche Telekom 等知名大客户)。

结果就是爆炸性的商业反哺:企业客户的收入贡献,目前已经硬生生占到了 ElevenLabs 总营收的 55% 以上。 ElevenAgents 每周处理的自动化真实业务通话突破了 1500万次,短短7个月内直接翻了3倍,其对应的经常性收入(ARR)更是暴涨了三倍有余。

它告别了卖API点数的底层小作坊模式,正在成为全球企业级软件交互层那张无法被替代的“嘴”与“耳朵”。

04.凭什么比纯AI音乐贵出4倍?全能音频版图的降维布局

如果视野只停留在“人声”,你依然无法看全 ElevenLabs 筑起的壁垒全貌。

在音乐商业权威媒体 Music Business Worldwide(MBW) 的深度解构中,提到了一个悬殊的对比:ElevenLabs 目前 220 亿美元的估值,是全球最头部的纯 AI 音乐生成平台 Suno(估值约 54 亿美元)的整整 4 倍以上。

同样是生成声音,凭什么资本市场愿意给 ElevenLabs 如此恐怖的溢价?

第一,产品形态的“全栈性”完全不在一个维度。在创始团队的规划中,听觉世界由三大支柱构成:人声(Speech)、音效(Sound Effects)与音乐(Music)。

  • AI 音效生成系统(AI Sound Effects):
     ElevenLabs 直接与全球最大的创意素材库 Shutterstock 达成独家战略合作,用数百万条经过专业母带处理、版权毫无瑕疵的专业音轨,训练出扩散音效模型。影视创作者输入一句“赛博朋克雨夜远处汽车漂移与雷声”,数秒内就能拿到工业级且全球免版税(Royalty-Free)的立体声音效;
  • 移动听觉入口 ElevenReader:
     推出针对普通大众的独立阅读 App,无论是复杂的 PDF、EPUB 电子书,还是随手拍下的纸质书页面,都能转变为上千种高品质自然真人声朗读,死死锁定了数百万视障、阅读障碍及通勤用户的听觉时长;
  • 音乐矩阵:
     自研 Music v2 模型,不仅服务于 C 端的娱乐创作,更推出了直接对接商业广告与品牌配乐的商用授权中台。

第二,也是最致命的差异,对版权暴风雨的免疫力。像 Suno 这样的纯音乐初创,目前正深陷索尼、环球、华纳三大传统唱片巨头的侵权诉讼绞杀之中,商业化每走一步都如履薄冰。

而 ElevenLabs 这一轮引入的新股东,堪称一次教科书级的产业资本防御战:

  • 新入局的新加坡主权基金 GIC,本身就是全球最大唱片集团环球音乐(UMG)持有 4.7% 股份的重要股东,且与索尼音乐拥有版权合资公司;
  • 欧洲顶级 PE 巨头 EQT,则是欧洲最大独立数字音乐发行巨头 Believe 的控股方,而 Believe 早在数月前就已与 ElevenLabs 签署了正版授权协议。

左手用 Shutterstock 和顶级唱片资本构筑合规护城河,右手用企业级智能体(ElevenAgents)提供源源不断的高毛利现金流。面对这种“既有军火库、又有合规盾牌”的重装骑兵,单靠纯 C 端付费的单一赛道玩家,自然在估值量级上被甩开了整整一个时代。

05.3亿美金员工套现:硅谷最冷酷的留人暗战

回到这笔交易本身很多人不理解:为什么估值翻倍的节点,公司不融资扩充军备,反而是做一轮“老股套现”(Tender Offer)?

这恰恰暴露了当前全球顶级 AI 战场最残酷的一面:人才的极度饥渴与极度脆弱。

在过去一年里,OpenAI、微软、谷歌、Meta 为了争夺底层顶尖研究员,开出的薪酬待遇已经到了匪夷所思的地步,动辄数百万甚至上千万美元的即期签字费。

对于非上市初创公司的顶尖算法工程师来说,期权哪怕在纸面上价值千万,只要公司没有敲钟上市,就只是一纸无法消费的“纸面富贵”。如果一家独角兽继续画大饼,三年后才能 IPO,核心骨干随时可能在明天被竞对直接挖空。

▲ Mati 在长文中深情致谢:“这一轮,是给过去四年亲手打造这一切的团队的!”

ElevenLabs 极度清醒这是他们第二次进行类似操作(2025年9月就曾完成过一轮1亿美元的套现)。通过引入顶级长线基金,让员工将部分归属股权直接变成银行账户里冰冷落袋的现金豪宅。

把纸面财富在行进途中分阶段兑现给功臣,是当代顶级 AI 实验室维系军心、抵抗巨头挖角最硬核的战略手段。

正如 X 上一位资深投资人评价的那样:“在这个周期里,合理的股权流动性安排超越了单纯的融资文件,本身就是对抗巨头的终极防御武器。”

06.终局之问:当大模型都会说话,ElevenLabs 的护城河到底在哪?

狂欢之余,冷水也从未缺席

在社交媒体与产业分析圈,质疑的声音同样尖锐:OpenAI 的 GPT-4o 已经具备极速低延迟的原生语音能力;Google Astra 在多模态对话上步步紧逼;Meta 更是将多语言语音模型直接开源。

如果未来所有的前沿大语言模型,出厂时都自带了高保真、多情感的语音能力,那么仅仅靠“声音好听”起家的独立公司,会不会在一夜之间被巨头降维碾碎?

▲ 业内人士冷静指出:从66亿跳到220亿,关键在于“改一套通话脚本而不必招几百人”,核心要看企业客户是否在持续续约

面对这种终局追问,ElevenLabs 正在用行动给出答案:语音模型终将被商品化(Commoditized),但全栈的行业落地生态不会。

单纯的声音输出很难成为最终产品,落地解决实际业务问题才是立足之本。

巨头的大模型固然会说话,但它无法直接替一家德国电信运营商处理复杂的账单分期投诉,无法在一秒钟内自动识别某国地方口音并切换成符合当地金融合规要求的应答模板,更无法让一家跨国车企放心地把全球数百万车主的实时呼叫交由其无缝承接。

从研究底层的 Eleven v4/v4 Turbo 极致低延迟模型,到面向企业的 ElevenAgents 工作流编排,再到打通全版权生态的音效、音乐与无障碍阅读,他们正在努力让自己从一根“麦克风”,变成整座数字世界的“声带中枢”。

从华沙高中里抱怨破烂配音的两个毛头少年,到执掌220亿美元听觉帝国的科技巨擘,Mati 和 Piotr 用的不过是短短四年。

正如 Mati 在那篇引发业界轰动的宣告长文结尾写下的那样:“这只是献给过去四年拼搏团队的一个逗号。而属于声音的全新革命,我们才刚刚开始。”

相关学习资料