夜雨聆风学习资料网

ARTICLE · 1148548

AI 视频还在手动配音效?我给每张分镜卡加了这 4 行

AI 视频还在手动配音效?我给每张分镜卡加了这 4 行

别人转"京东开源世界模型",我盯着的是另外一件事:它生成的视频是带声音的。

这跟你现在做 AI 短剧卡住的地方,可能是同一个。

一、先说个真事:我的 AI 视频,一度是"哑巴"

上个月我给一集短剧做完 18 个镜头,画面都挺满意。导出一看——整轨静音。

不是我忘了开声音,是这一代的视频生成工具本来就不给你声音。你要么后期一段一段贴音效,要么整轨重配。

贴音效这件事恶心在哪?它跟画面不是同步生成的,所以你得看着画面倒推声音——这一步踩在哪块木地板上、这下水花该多大、这句台词的气口在哪。一个人做短剧,卡住你的往往不是画面,是这一层。

二、9 月 9 日,京东在 JDD 上开源了什么

2026 年 9 月 9 日,在 JDDiscovery-2026 京东全球科技探索者大会上,京东探索研究院发布 JoyAI-Echo 系列的两项进展,其中一项发布即开源(来源:央广财经 2026-09-09、21 世纪经济报道 9 月 9 日、北京商报 9 月 9 日、百度百科词条):

发布项
是什么
JoyAI-Echo 1.5
超长音视频生成模型升级版,支持 10 分钟以上音视频持续生成
JoyAI-EchoWM
可交互视听世界模型,已开源;可原生联合生成 720P 视频 + 环境音 + 音乐 + 语音

京东集团副总裁、京东探索研究院副院长段楠的介绍口径是:EchoWM 能根据用户移动和视角变化持续生成世界,同步生成 720P 视频、环境音、音乐和语音,支持第一人称、第三人称以及多轮连续交互(来源:北京商报、21 世纪经济报道,均 9 月 9 日)。

同一场大会上,京东还展示了新一代音视频基础模型 JoyAI-Video。央广财经报道其重点提升商业视频生成、物理规律呈现、第一人称视角和多镜头连续叙事能力,可应用于电商广告、短剧创作等场景,并将于 10 月正式发布。这条先记着,10 月再看。

三、它真正解决的,是"声音要不要后期贴"

行业里此前基本是两条路(央广财经报道中的表述):一类能根据操作持续生成画面,但没有自然声音;另一类能联合生成音视频,但用户难以持续进入并改变内容。

▲ 声音这一层,正在从后期工序变成生成的一部分

① 声音跟着画面走,不是独立配的。

机器之心在对该模型的长篇解读中写到:EchoWM 采用原生音视频联合生成,视频分支和音频分支在生成过程中交换信息;相机轨迹只直接输入视频分支,音频侧没有独立的轨迹条件,也没有额外训练一套"动作—声音控制器"。

翻译成人话:不是先出一段无声画面、再让另一个模型去配音,而是两个分支同时生成、互相通气。人物讲话时生成对应语音,风、脚步、碰撞这些事件伴随相应声响,音乐随场景延续。

这一步的意义在于——声音和画面的因果关系是模型自己学出来的,不是你手工对齐出来的。

② 一套"相机意图"统管第一人称和第三人称。

你按 WASD 是离散指令,但模型要处理的是连续的相机位置和朝向。EchoWM 用了统一的 camera intent(相机意图)表示,把键盘操作映射为相对初始位姿的连续 6-DoF 轨迹(3D 空间里的平移 + 旋转)。同一条轨迹:第一人称下描述观察者自身的运动;第三人称下规定相机变化,人物移动与镜头跟随的关系由模型从数据中学。

这点对做分镜的人其实很有启发:"镜头怎么动"正在变成一种可以被统一描述的输入,而不是每个工具一套写法。

③ 多轮探索:上一段的尾巴,是下一段的开头。

EchoWM 会提取上一段末尾的一段同步音视频,作为下一轮生成的上下文,用于维持场景布局、主体外观和声音的延续。

⚠️ 但边界也很明确:团队指出模型目前没有显式的持久三维记忆,多轮生成后,几何关系、主体身份和音频仍可能发生漂移。这跟你现在做 AI 短剧遇到的"角色脸型漂移",是同一类病——换了个技术路线,病没根治。

四、数据怎么看(团队自报口径,非第三方复现)

以下数字来自机器之心对团队论文的转述,以及百度百科词条收录,属团队自报口径,先看个量级就好:

评测
结果
WBench Navigation
(158 个多轮导航案例)
JoyAI-EchoWM 平均分 81.7,一致性 89.8、交互性 87.2;EchoWM-Flash 平均分 81.0、交互 87.9
SANA-WM-Bench 短时程
(前 241 帧)
VBench 得分 83.91 / 83.96,为测试模型中最高;简单轨迹下平移误差和相机运动一致性误差最低
SANA-WM-Bench 长时程
(961 帧)
困难轨迹下 SANA-WM 的相机控制误差更低,EchoWM 保持较高视觉质量;EchoWM-Flash VBench 80.13 / 81.06
自建 200 案例成对偏好研究
对比 LingBot-World-v2:选 EchoWM 46.50%、选对方 21.57%;对比 HappyOyster:选 EchoWM 63.13%、选对方 27.06%

💡 两点提醒:① 机器之心原文已注明,偏好比例统计的是评价选择,不能直接理解为任务成功率;② 长时程那一栏,相机控制精度它并不是第一。别看到"第一"就上头。

(开源仓库 github.com/jd-opensource/JoyAI-Echo,论文 arXiv 编号 2608.23189,均来自机器之心解读文章的公开链接)

五、另一半更值得注意:Echo 1.5 和它的 Director Agent

如果说 EchoWM 是"能进去探索的世界",那 JoyAI-Echo 1.5 对做短剧的人更贴脸。央广财经报道的参数:

1. 基于音视频 Memory Bank 架构,在多镜头、长时程生成中保持人物形象、声音和故事线索连贯;

2. 支持 10 分钟以上音视频持续生成;

3. 长视频后训练实现最高 7.5 倍推理加速;

4. 仅需 2 张 H200,即可在 480P 下平均每秒生成 24 帧,实现 1:1 等时生成;

5. Director Agent 可根据自然语言完成故事展开、分镜规划、生成审核与成片组装。

最后那条才是重点:"分镜规划"被写进了官方的能力描述里。从剧本到分镜这一段,正在被模型厂商当成标准件来做。

六、冷静一下:你现在用不上它

必须说清楚,不然这篇就变成吹稿了:

现实
说明
算力门槛
Echo 1.5 的等时生成指标建立在 2 张 H200 上,不是家用显卡
分辨率
EchoWM 联合生成为 720P,不是成片级别
会漂移
团队明确说没有持久 3D 记忆,多轮后几何 / 主体 / 音频都可能漂
定位不同
目标是"可进入的世界",不是"可控的短剧流水线"
短剧向的没发
JoyAI-Video 报道称 10 月才正式发布

所以这篇的价值不在于"快去用它",而在于它指出了一个方向:声音这一层,正在从后期工序变成生成的一部分。

七、★ 值得收藏:给分镜卡加一列「声音层」

既然趋势是"声音跟着画面事件走",那你现在就可以按这个逻辑改自己的分镜卡——不管你用哪个工具,这一列都用得上。我自己现在每张分镜卡固定写这四行:

声音层
写什么
举例
环境音
这个空间本来就有的底噪
老巷子:远处车流 + 屋檐滴水
动作音
画面里发生的物理事件
推门:木轴吱呀 + 门板闷响
人声
台词 / 气口 / 呼吸
只写单句,≤ 12 字
音乐
起落点写秒数
0:03 起,0:07 落

写这四行的三个好处:

1. 生成提示词更好写。你会发现自己开始自然地写"踩在湿木板上"而不是"走路"——画面提示词的质感会一起变好。

2. 后期配音效不用倒推。以前是看着画面猜声音,现在是照着卡片找素材。

3. 等哪天模型支持声音,这张卡直接能当输入。你提前把数据结构准备好了。

▲ 分镜卡上的「声音层」四行(图源:本文配图,需在后台重新上传)

🎧 附:一条"只听一遍"的自检法
成片导出后,把画面关掉,只听音轨从头播一遍。如果听的时候你脑补不出画面在干嘛,说明声音层没立住。这比反复看画面有效得多——看画面时你的眼睛会自动补信息,耳朵不会。

八、今天就能做的一个动作

打开你最近一集的分镜卡,给每个镜头补上「环境音 / 动作音 / 人声 / 音乐」四行。不用买任何工具,不用等任何模型发布。

补完你会发现两件事:一是你原来的分镜卡在声音上是空的;二是补完之后,画面提示词你想改的地方也变多了。

声音不是画面的装饰,它是画面的另一半信息。

📣 觉得有用?分享给也在做 AI 视频的朋友,点个「赞」和「在看」让更多人看到。

AI灵感反应堆 · 每天一个能抄的 AI 创作玩法

本文由 AI灵感反应堆 原创,转载请注明出处。
信息日期:2026-09-09(发布日)|核实于 2026-09-14
来源媒体:央广财经、21 世纪经济报道(南方财经)、北京商报、机器之心、百度百科词条、Pandaily
事实边界:文中评测分数与推理参数为京东团队论文 / 官方发布口径(经机器之心、百度百科转述),未经第三方独立复现;Echo 1.5 的算力指标为官方在特定硬件(2×H200、480P)下的口径;JoyAI-Video 发布时点为央广财经报道口径。以京东官方后续公开信息为准。

相关学习资料