
七月的最后一周,AI视频生成赛道交出了一份滚烫的成绩单。
从7月3日到7月23日,短短20天,5家公司相继宣布大额融资。可灵AI拿了30亿美元,生数科技拿了5亿美元,爱诗科技C轮整体融资29.8亿元,智象未来C轮15亿元,就连成立不到一年的新公司FlovaAI都拿了8000万美元天使轮。前四家达到独角兽级别的公司融资加在一起,超过262亿人民币。
什么概念?2026年7月这一个月涌入的钱,比整个赛道在过去两年加起来的还要多。
这不是巧合。

01·
资本为何集中押注7月?
先看最重磅的那笔,可灵AI。
7月2日晚间,快手在港交所发布公告,旗下视频生成大模型可灵AI完成近30亿美元首轮独立融资,投后估值达180亿美元。这一规模仅次于DeepSeek首轮融资约70亿美元,超过Kimi单轮最大融资20亿美元,为近年国内AI领域第二大规模单轮融资,同时创下全球视频大模型公司最大额融资纪录。
投资方名单堪称豪华:CPE源峰、国方创投、BlueFive、腾讯、中关村科学城基金、中信证券联合领投,阿里云、百度等产业资本跟投,华策影视、芒果产业投资人也积极参与。腾讯、阿里、百度罕见同台出手。BlueFive Capital来自阿布扎比,这是中东资本首次投资中国AI视频模型。
资本敢给这个数字,底气来自可灵已经跑通的商业化。快手2026年Q1财报显示,可灵AI单季营收超6.5亿元,同比增长超300%。年化收入运行率(ARR)从2025年3月的1亿美元飙到2026年3月的近5亿美元,一年翻了4倍。截至2026年6月,可灵AI全球用户突破1亿,企业客户近5万家。
但更深层的原因藏在公告细节里,可灵在为独立上市铺路。
180亿美元的投后估值,已相当于快手当前总市值的75%-78%。快手成熟主业增长放缓,市销率仅1.5倍,而高增长的AI业务享有数十倍的成长溢价。两套估值体系天然割裂,分拆独立融资几乎是释放这块资产价值的唯一路径。
公告中还埋了一条对赌条款:如果北京可灵未能在2031年10月前完成IPO,投资者有权要求按本金加年化8%单利回购。分拆、融资、股权激励、回购条款,这套组合拳指向再明确不过。
再看生数科技。7月6日,生数科技宣布5亿美元B+轮融资。这家公司在5个月内拿了3轮:2月A+轮超6亿元,4月B轮20亿元(阿里云领投),加上7月这轮5亿美元,累计已超50亿元。今年3月底,生数科技已完成股份制改造,这是上市前的标准动作,市场消息称其最快上半年启动港股IPO。资本在抢IPO前夜的最后一张票。
智象未来7月23日完成15亿元C轮融资,近三个月累计融资超21亿元。爱诗科技7月14日宣布C轮整体融资29.8亿元,阿里领投C+轮。
资本在抢什么?抢的是视频大模型赛道最后的“上车”机会。 可灵要上市,生数要上市,窗口期不会永远敞开。

02·
从“抽卡”到“理解世界”:技术路线的关键分化
融资规模固然惊人,但比钱更值得关注的是钱去了哪里。
这轮融资潮背后,一个共同的叙事正在浮出水面:从视频生成模型向“世界模型”进化。
什么是世界模型?简单做个对比:以往的视频生成模型更像AI的“摄像机”,根据文字或图片生成看起来真实的视频;但世界模型像导演,理解故事和人物逻辑。视频生成模型是“像素概率拼接”,专业创作者使用主流视频生成模型时,为获得一个符合基本要求的镜头,平均需生成20至50次。而世界模型让AI真正理解物理规律、因果关系和物体运动。
各家公司的路径正在分化:
可灵AI走的是全模态平台化路线。今年2月上线可灵3.0系列模型,实现最长15秒视频生成、分镜控制、主体一致性、音画同出。4月又新增原生4K直出功能,成为业内首个实现该技术的AI视频大模型。可灵还与北京大学等机构联合推出了OpenWorldLib,一个统一的世界模型推理框架。
生数科技则向具身智能延伸。2026年4月,生数科技发布通用世界行动模型Motubrain,采用World Action Model技术路线,将感知、预测与行动统一建模。简单说,生数不满足于让AI“看懂”世界,还要让AI“行动”于世界。
爱诗科技押注实时交互。年初推出全球首个支持1080P分辨率的通用实时世界模型PixVerse R1,用户可以通过自然语言指令实时改变视频画面。从“视频观看”到“视频交互”,这是体验层面的质变。
智象未来则聚焦原生全模态世界模型。公司创始人梅涛提出,从多模态走向原生全模态世界模型是通往AGI的必经之路。
技术路线虽有分化,但方向一致,让AI真正理解世界,而不仅仅是拼接像素。

03·
对短剧的深远影响:谁掌握模型,谁掌握“印钞机”
资本和技术的变化,最终要落到产业上。
2026年的短剧市场已经给出了答案。今年一季度,全行业上线微短剧约12.8万部,其中AI短剧占比超95%。上半年国内AI短剧市场规模已突破110亿元,全年预计攀升至350亿元至400亿元。仅一年时间,AI短剧就从“概念”变成了“主流”。
底层模型能力,正在决定短剧制作的天花板。
以往的视频生成模型是“抽卡式”创作,创作者输入提示词,模型随机生成结果,不满意就重来。单镜头抽卡次数可能高达7次以上,有效生成成功率不足50%。这种模式下,AI短剧虽然数量爆炸,但爆款率极低——超过九成的AI短剧仍然难以出圈。DataEye数据显示,2026年上半年抖音端原生新增AI剧漫剧总计22.19万部,播放量破亿的仅1055部,占比不足0.5%。
但世界模型正在改变这一切。 当AI理解了物理规律、因果关系和叙事逻辑,它就不再是随机生成像素的“抽卡机”,而是一个可以精确控制、持续输出的创作引擎。正如上海交大发布的“世界叙事模型”所说,不是替代基模,而是为基模装上“专业方向盘”,使其从“概率采样器”升级为“受控绘图器”。
谁掌握了最强的视频大模型,谁就掌握了短剧生产的“印钞机”。成本优势已经显现,AI短剧对实拍真人短剧堪称降维打击。而当模型能力从“能生成”进化到“能理解”“能控制”,AI短剧将不仅解决数量问题,更有可能解决质量问题。
昆仑万维已经亮出了“4+3战略”:视频模型SkyReels、音乐模型Mureka、世界模型Matrix-Game、基座模型四条技术线,撑起AI短剧、AI音乐、AI游戏三个平台。这只是一个开始。
262亿,7月,5家公司。
这组数字背后,是一场关于“下一个视觉世界”控制权的争夺。可灵在为上市铺路,生数在抢IPO窗口,爱诗和智象在卡位世界模型的技术高地。资本押注的不是视频生成,而是“理解世界”的能力。
对短剧行业来说,这意味着一个根本性的变化正在发生:制作门槛从“技术”转向“模型”,核心竞争力从“人力”转向“算力+算法”。谁跑通了世界模型,谁就拿到了短剧工业化生产的钥匙。
2026年7月的这场资本狂飙,或许会被日后看作AI视频大模型“军备竞赛”的转折点。而短剧,只是这场竞赛最先被改写的战场之一。
END✦
推荐阅读





夜雨聆风