ARTICLE · 1148548
AI 视频还在手动配音效?我给每张分镜卡加了这 4 行

别人转"京东开源世界模型",我盯着的是另外一件事:它生成的视频是带声音的。
这跟你现在做 AI 短剧卡住的地方,可能是同一个。
一、先说个真事:我的 AI 视频,一度是"哑巴"
上个月我给一集短剧做完 18 个镜头,画面都挺满意。导出一看——整轨静音。
不是我忘了开声音,是这一代的视频生成工具本来就不给你声音。你要么后期一段一段贴音效,要么整轨重配。
贴音效这件事恶心在哪?它跟画面不是同步生成的,所以你得看着画面倒推声音——这一步踩在哪块木地板上、这下水花该多大、这句台词的气口在哪。一个人做短剧,卡住你的往往不是画面,是这一层。
二、9 月 9 日,京东在 JDD 上开源了什么
2026 年 9 月 9 日,在 JDDiscovery-2026 京东全球科技探索者大会上,京东探索研究院发布 JoyAI-Echo 系列的两项进展,其中一项发布即开源(来源:央广财经 2026-09-09、21 世纪经济报道 9 月 9 日、北京商报 9 月 9 日、百度百科词条):
| JoyAI-Echo 1.5 | |
| JoyAI-EchoWM |
京东集团副总裁、京东探索研究院副院长段楠的介绍口径是:EchoWM 能根据用户移动和视角变化持续生成世界,同步生成 720P 视频、环境音、音乐和语音,支持第一人称、第三人称以及多轮连续交互(来源:北京商报、21 世纪经济报道,均 9 月 9 日)。
同一场大会上,京东还展示了新一代音视频基础模型 JoyAI-Video。央广财经报道其重点提升商业视频生成、物理规律呈现、第一人称视角和多镜头连续叙事能力,可应用于电商广告、短剧创作等场景,并将于 10 月正式发布。这条先记着,10 月再看。
三、它真正解决的,是"声音要不要后期贴"
行业里此前基本是两条路(央广财经报道中的表述):一类能根据操作持续生成画面,但没有自然声音;另一类能联合生成音视频,但用户难以持续进入并改变内容。

▲ 声音这一层,正在从后期工序变成生成的一部分
① 声音跟着画面走,不是独立配的。
机器之心在对该模型的长篇解读中写到:EchoWM 采用原生音视频联合生成,视频分支和音频分支在生成过程中交换信息;相机轨迹只直接输入视频分支,音频侧没有独立的轨迹条件,也没有额外训练一套"动作—声音控制器"。
翻译成人话:不是先出一段无声画面、再让另一个模型去配音,而是两个分支同时生成、互相通气。人物讲话时生成对应语音,风、脚步、碰撞这些事件伴随相应声响,音乐随场景延续。
这一步的意义在于——声音和画面的因果关系是模型自己学出来的,不是你手工对齐出来的。
② 一套"相机意图"统管第一人称和第三人称。
你按 WASD 是离散指令,但模型要处理的是连续的相机位置和朝向。EchoWM 用了统一的 camera intent(相机意图)表示,把键盘操作映射为相对初始位姿的连续 6-DoF 轨迹(3D 空间里的平移 + 旋转)。同一条轨迹:第一人称下描述观察者自身的运动;第三人称下规定相机变化,人物移动与镜头跟随的关系由模型从数据中学。
这点对做分镜的人其实很有启发:"镜头怎么动"正在变成一种可以被统一描述的输入,而不是每个工具一套写法。
③ 多轮探索:上一段的尾巴,是下一段的开头。
EchoWM 会提取上一段末尾的一段同步音视频,作为下一轮生成的上下文,用于维持场景布局、主体外观和声音的延续。
⚠️ 但边界也很明确:团队指出模型目前没有显式的持久三维记忆,多轮生成后,几何关系、主体身份和音频仍可能发生漂移。这跟你现在做 AI 短剧遇到的"角色脸型漂移",是同一类病——换了个技术路线,病没根治。
四、数据怎么看(团队自报口径,非第三方复现)
以下数字来自机器之心对团队论文的转述,以及百度百科词条收录,属团队自报口径,先看个量级就好:
(158 个多轮导航案例) | |
(前 241 帧) | |
(961 帧) | |
💡 两点提醒:① 机器之心原文已注明,偏好比例统计的是评价选择,不能直接理解为任务成功率;② 长时程那一栏,相机控制精度它并不是第一。别看到"第一"就上头。
(开源仓库 github.com/jd-opensource/JoyAI-Echo,论文 arXiv 编号 2608.23189,均来自机器之心解读文章的公开链接)
五、另一半更值得注意:Echo 1.5 和它的 Director Agent
如果说 EchoWM 是"能进去探索的世界",那 JoyAI-Echo 1.5 对做短剧的人更贴脸。央广财经报道的参数:
1. 基于音视频 Memory Bank 架构,在多镜头、长时程生成中保持人物形象、声音和故事线索连贯;
2. 支持 10 分钟以上音视频持续生成;
3. 长视频后训练实现最高 7.5 倍推理加速;
4. 仅需 2 张 H200,即可在 480P 下平均每秒生成 24 帧,实现 1:1 等时生成;
5. Director Agent 可根据自然语言完成故事展开、分镜规划、生成审核与成片组装。
最后那条才是重点:"分镜规划"被写进了官方的能力描述里。从剧本到分镜这一段,正在被模型厂商当成标准件来做。
六、冷静一下:你现在用不上它
必须说清楚,不然这篇就变成吹稿了:
所以这篇的价值不在于"快去用它",而在于它指出了一个方向:声音这一层,正在从后期工序变成生成的一部分。
七、★ 值得收藏:给分镜卡加一列「声音层」
既然趋势是"声音跟着画面事件走",那你现在就可以按这个逻辑改自己的分镜卡——不管你用哪个工具,这一列都用得上。我自己现在每张分镜卡固定写这四行:
| 环境音 | ||
| 动作音 | ||
| 人声 | ||
| 音乐 |
写这四行的三个好处:
1. 生成提示词更好写。你会发现自己开始自然地写"踩在湿木板上"而不是"走路"——画面提示词的质感会一起变好。
2. 后期配音效不用倒推。以前是看着画面猜声音,现在是照着卡片找素材。
3. 等哪天模型支持声音,这张卡直接能当输入。你提前把数据结构准备好了。

▲ 分镜卡上的「声音层」四行(图源:本文配图,需在后台重新上传)
🎧 附:一条"只听一遍"的自检法
成片导出后,把画面关掉,只听音轨从头播一遍。如果听的时候你脑补不出画面在干嘛,说明声音层没立住。这比反复看画面有效得多——看画面时你的眼睛会自动补信息,耳朵不会。
八、今天就能做的一个动作
打开你最近一集的分镜卡,给每个镜头补上「环境音 / 动作音 / 人声 / 音乐」四行。不用买任何工具,不用等任何模型发布。
补完你会发现两件事:一是你原来的分镜卡在声音上是空的;二是补完之后,画面提示词你想改的地方也变多了。
声音不是画面的装饰,它是画面的另一半信息。

📣 觉得有用?分享给也在做 AI 视频的朋友,点个「赞」和「在看」让更多人看到。
AI灵感反应堆 · 每天一个能抄的 AI 创作玩法
本文由 AI灵感反应堆 原创,转载请注明出处。
信息日期:2026-09-09(发布日)|核实于 2026-09-14
来源媒体:央广财经、21 世纪经济报道(南方财经)、北京商报、机器之心、百度百科词条、Pandaily
事实边界:文中评测分数与推理参数为京东团队论文 / 官方发布口径(经机器之心、百度百科转述),未经第三方独立复现;Echo 1.5 的算力指标为官方在特定硬件(2×H200、480P)下的口径;JoyAI-Video 发布时点为央广财经报道口径。以京东官方后续公开信息为准。