Vidu S1 实测:AI视频「从工具变成对话者」的第一步——但还没走稳
一、Vidu S1 是什么 但 Vidu S1 让我意识到一件事:过去所有的 AI 视频工具,本质上都是在帮你生产内容——你是创作者,视频是产品,观众是别人。 Vidu S1 换了一个问题:如果视频里的角色不是给别人看的,而是专门来跟你说话的呢? 它做的事叫实时交互视频生成(Real-time Interactive Video Generation)。你上传一张照片,它用十几秒把这张照片变成一个会动、会说话、能回应你的角色。你说话,它实时生成画面,生成速度要持续快过播放速度,否则就会卡顿。 这个技术挑战在哪?以前的 AI 视频是"想好了再画",现在是"你刚开口,它就要同步算出下一帧"——不只是快,还要在无限时长里保持角色不变形。 官方参数:540P 分辨率,25~42FPS,支持无限时长不断流。 二、实测步骤 我的测试目标不是"好不好看",而是找边界——它在哪里开始失控。 选了一个预设角色,先测最简单的单步指令:"你好"、"笑一下"、"点个头"。基线是:这些它能做到,响应延迟基本在1秒以内。 从单步升级到复合指令——"转个圈"、"做个连续的动作"。这里开始出问题,后面详细说。 让对话持续运行,不主动中断,观察角色形象、背景画面在时间推移中的变化。 刻意在对话里埋下几个细节,3分钟后换话题再绕回来,看它记不记得、记没记错。 专门留意角色说话时的口型同步、语速节奏和音量稳定性,这几项实际上是独立的系统,协调起来比看上去难得多。 三、发现的问题 问题一:连续动作做不了 专业描述:长程动作序列建模(Long-horizon Motion Sequence Modeling)能力不足,模型缺乏跨时间步的动作规划机制,只能响应单步动词指令,无法执行多步骤时序动作。 白话:你说"挥挥手",没问题。你说"转个圈",它要么无动于衷,要么扭一下就停了。它理解动词,但理解不了"动作的过程"。就像一个人能听懂每个单字,但听到一整句话就开始懵。 问题二:人物会消失,背景在漂移 专业描述:主体一致性(Subject Consistency)在短期内维持尚可,但存在主体消失(Subject Disappearance)和背景时序漂移(Background Temporal Drift)问题,场景锚定(Scene Anchoring)机制在长时间运行后失效。 白话:角色的脸没有变形,但整个人会突然消失几秒;背景像一张贴纸被人偷偷移动了位置,慢慢往不知道哪个方向游走。画面没有"崩",但里面的东西都没被钉稳。 问题三:语速忽快忽慢,音量忽大忽小 专业描述:TTS(文字转语音)推理延迟(Inference Latency)波动导致语音节奏失匀(Speech Rhythm Inconsistency),音量归一化(Volume Normalization)机制缺失,音视频同步(Audio-Visual Synchronization)稳定性不足。 白话:角色说话像网络不稳定时的语音消息——一句话有时飞速说完,有时拖得很慢;音量一会儿近一会儿远,像有人在随机调音量旋钮。不是角色在刻意控制语气,是系统本身没稳住。 问题四:3分钟前说的事,它记错了 专业描述:对话上下文窗口(Context Window)容量有限,缺乏显式长程记忆(Long-term Memory)机制,会话连贯性(Conversational Coherence)随对话轮次增加显著衰减,上下文截断(Context Truncation)后出现记忆错乱。 白话:AI 的"短期记忆"还凑合,"长期记忆"基本没有。你刚告诉它你在上海,聊了几分钟它可能就忘了,甚至接下来说出来的内容会和你之前说的矛盾。越聊越久,它对"你是谁、你们聊过什么"的认知就越模糊——不像在深入交流,更像每隔几分钟就在和一个对你毫无记忆的陌生人重新开始。 问题五:人物抖动,偶发延迟 专业描述:服务端推理延迟(Server-side Inference Latency)波动明显,生成帧率(Generation FPS)不稳定,帧间一致性(Inter-frame Consistency)下降时表现为画面抖动(Frame Jitter)和快速追帧(Frame Catch-up)现象。 白话:角色偶尔会"抽"一下——突然静止两三秒,然后快速补回来。就像视频通话信号卡了,卡完之后加速播放追上进度。大多数时候不影响体验,但一旦发生就会瞬间破坏那种"在和真人说话"的感觉。 四、如果有一天这些问题都解决了 我想了几个场景,不是产品路线图,是真实的人会需要的东西。 异地的家人 不是一个人在外地打工的孤独——而是更具体的:你妈妈不会用视频通话,但她有照片。上传一张,她的样子出现在屏幕里,会动,会开口,哪怕说的只是"吃饭了吗"。这件事对某些人来说不是娱乐,是刚需。 练一件你一直没勇气开口的事 不是背单词,是开口。很多人不是不会外语,是不敢说——怕说错、怕被笑。对着一个AI说,说错了没有任何代价,可以反复说,直到开口变成习惯。 让历史人物开口 课本上的人永远是黑白照片。如果鲁迅能回答你的问题,如果你能问李白为什么写那首诗——不是查资料,是对话。这件事对教育的意义,可能比任何课件都直接。 还有一个更难开口的场景 我知道有人,失去了一个很重要的人,手机里还存着照片,但再也听不到那个声音了。