点击关注 获取星威视最新动态
Chongqing Xingwei Vision Technology Co., Ltd.



前言
当我们现在习惯了和手机里的语音助手或者市面上的AI产品进行对话的时候,或许潜意识已经对那种“你说一句,它停一下,再回一句”的机械式交互习以为常。
但这种割裂感与延迟,本质就是传统AI系统的各模块(如语音识别、大语言模型、语音合成)之间串联处理导致的必然结果。
近期,阿里团队发布的Wan-Streamer v0.1,不仅将视音频交互的总延迟压缩至550毫秒,更重要的是,它抛弃了传统的模块拼接模式,采用了一种全新的原生流式架构。

图1:Wan-Streamer概述。它将语言、音频和视频作为输入和输出,通过单个Transformer进行建模,并采用块因果注意力机制实现增量流式生成。
01
交互的瓶颈
为什么AI总是“慢半拍”?
在探讨Wan-Streamer之前,我们需要先理解当前AI交互系统的底层逻辑及其局限性。
目前市面上绝大多数的语音或视音频交互系统,本质上是一个串行流水线。当用户发出语音指令时,信号需要依次经过语音识别(ASR)、大语言模型(LLM)、语音合成(TTS),最后再到视觉渲染模块。这种架构存在两个致命缺陷:

延迟叠加
每一个模块的处理时间都会累加。ASR识别需要时间,LLM推理需要时间,TTS生成音频又需要时间。这一连串的等待,导致用户往往需要忍受1秒甚至更长的延迟。

错误传导与割裂
由于各模块独立训练和运行,ASR识别错误会导致LLM理解偏差;而TTS生成的语音与视觉模块生成的口型往往无法完美对齐,导致机器人看起来像是在“对口型”,缺乏真实感。
这种接力棒式的处理方式,无法满足具身智能对实时性和环境感知的严苛要求。机器人必须像人类一样,在感知环境的同时就能规划行动,而不是先“听”完,再“想”完,再“动”。
02
技术破局
原生流式架构的三大支柱
Wan-Streamer的核心理念是端到端(End-to-End)与全双工(Full-Duplex)。它将语言、音频、视频统一在一个Transformer模型中进行处理,消除了模块间的壁垒。这一架构主要由以下三个关键技术支撑:
01
统一的Token序列
Wan-Streamer不区分输入和输出的模态界限。无论是用户的语音、视频,还是机器人生成的文字、语音、视频,都被编码为一种统一的Token序列。
◣ 技术逻辑:模型通过块因果注意力(Block-Causal Attention)机制,处理这个交错的序列。这意味着模型在处理当前时刻的信息时,仅依赖于过去的历史信息,从而保证了生成的实时性(因果性)。
◣ 实际效果:这种设计让唇语同步和表情生成成为了模型的“本能”。因为语音和画面是在同一个逻辑下生成的,无需后期通过算法强行对齐。
02
全双工的感知与表达
人类的交流是重叠的。我们在听别人说话时,会通过点头、眼神进行反馈;在自己说话时,也能感知对方的打断意图。Wan-Streamer通过因果编码器(Causal Encoders)和因果解码器(Causal Decoders),实现了这种能力。
◣ 倾听时的反馈:当用户在说话时,模型并非处于“待机”状态。它会持续生成非语言反馈,如眼神跟随、点头、微表情变化。这让交互对象感觉机器人是“活”的,是在认真倾听。
◣ 自然的打断机制:模型在生成回应的同时,依然在持续接收并分析用户的输入。一旦检测到用户有打断的意图(如突然插话),模型能立即停止生成,切换回感知模式。这种能力对于自然的人机协作至关重要。
03
“思考者-执行者”推理架构
这是Wan-Streamer在工程实现上最精彩的一笔。为了在保证生成质量的同时降低延迟,论文提出了分离“思考”与“执行”的架构。
◣ 思考者:负责处理高逻辑密度的任务,如理解用户意图、更新对话状态(KV-Cache)、预测语言逻辑。它运行在低延迟路径上。
◣ 执行者:负责处理高算力密度的任务,即运行流匹配(Flow-Matching)算法,生成音频和视频的潜在变量(Latents)。
这两个模块通过KV-Cache交换保持状态同步,思考与表达同步进行。这种设计实现了计算的流水线化(Pipelining):当执行者在生成下一帧画面时,思考者已经在处理用户的最新语音了。这种并行处理模式,是实现低延迟的关键。

图2:流式推理期间的思考者与执行者的重叠。在第k个单位,思考者对当前用户观测值uk进行编码,更新KV缓存,并解码前一个响应潜在变量yk−1以立即输出。执行者接收当前的KV切片,并仅运行流匹配求解器以生成下一个干净的音视频潜在变量yk,然后将其返回给下一单元中的思考者。为清晰起见,执行者窗口被绘制为一个完整的160毫秒流处理单元;实际上,实时吞吐量只需确保执行时间加上KV/潜在变量通信时间低于该单元时长即可。
03
数据实证
550ms的含金量
在AI领域,理论再完美也需要数据支撑。Wan-Streamer在延迟控制上交出了一份接近人类感知极限的答卷。我们整理了以下关键指标:
指标维度 | 数据表现 | 技术解读 |
模型侧延迟 | 约 200ms | 从接收信号到模型处理完准备发出信号的时间 |
网络往返延迟 | 约 35im | 模拟远程用户数据在网络上传输的时间 |
总交互延迟 | 约 550ms | 用户从开口到看到AI反应的总时间,接近人类对话水平 |
视频帧率 | 25FPS | 画面流畅无卡顿 |
横向对比分析:
相比于Doubao Realtime(约1秒)、Gemini Live(API首包延迟约234ms,但视音频生成未完全端到端)等产品,Wan-Streamer的优势在于“全链路统一”。它不依赖外部的ASR或TTS模块,所有处理都在一个模型内部完成,从而将延迟压缩到了极致。
客观指出:
目前该模型是在192p分辨率下验证的。虽然画质尚有提升空间,但这550ms的延迟成绩,是在保证“端到端一体化”前提下的成绩,含金量极高。
04
训练之道
如何培养一个“实时大脑”?
Wan-Streamer的强大并非一蹴而就,其训练策略非常值得我们关注,特别是对于我们在AI高质量数据集业务的启示。三个关键的训练阶段:
独立任务预训练
先让模型掌握基础的视觉理解、语音识别和文本对话能力。
端到端交互训练
引入全双工交互数据,让模型在交错的视音频流中学习“何时该听、何时该说、何时该点头”。
低延迟蒸馏
使用滚动蒸馏(Rolling Distillation)技术,用一个计算量大、效果好的“教师模型”来指导一个轻量级的“学生模型”。这让学生模型在减少计算步数(提高速度)的同时,依然能保持高质量的生成效果。
这种训练方式,未来的数据集不再是单一模态的堆砌,而是需要大量时空对齐的多模态交互数据。记录人类在对话时的眼神、手势、语气的微妙变化,将是训练顶级具身智能体的关键燃料。
05
产业启示
低延迟交互重构未来生态
重构人机关系,赋能千行百业
具身智能:打破延迟与模态壁垒,机器人实现“类人化”自然交互,加速服务、医疗、制造场景落地;
虚实融合:驱动元宇宙、AR/VR突破延迟瓶颈,重塑沉浸式体验与远程协作;
工业控制:毫秒级响应助力智能制造、能源等领域实时自主决策,提升安全与效率。
基础设施与数据范式变革
算力网络:倒逼边缘计算、5G/6G向“低延迟+确定性”进化,推动云边协同与硬件架构创新;
数据战略:时空对齐的多模态交互数据成为新基建,驱动行业构建更智能的训练集与标注体系。
AI成为实时智能伙伴
从家庭服务到太空探索,低延迟交互将打破物理与虚拟边界,让人工智能真正融入人类工作与生活,重构生产力与创造力范式。
参考资料:https://arxiv.org/abs/2605.15153
- END -
往期推荐 ·
编辑 | 星威视市场运营中心
免责声明:本文部分资料来源于网络,仅供交流,版权归原作者所有。本平台不对引用部分的文章信息或资料的真实性、有效性、准确性及完整性承担责任,内容观点不代表星威视立场。如有侵权请联系我们第一时间删除。


星威视
XINWAYS
专注 AI算力建设运营、AI高质量数据集、商业航天、低空经济、具身智能 五大核心赛道,以 “算力驱动智能、智能赋能社会” 为理念,为产业数字化、智能化升级提供全链条解决方案。
我们的业务范围
✔ 星算云管理平台:
算力中心建设、算力统一纳管、异构协同、弹性调度、智训智推一体化。
✔ AI高质量数据集:
从数据采集→清洗→标注→质检→入库全流程解决方案。
✔ 商业航天与低空经济:
打造空天地一体化平台,天基卫星+空基无人机/浮空平台+地基5G/物联网/雷达三层立体组网,融合通、感、导、算、智一体化能力,实现全域无盲区通信、全天候立体感知、全周期智能研判、全场景应急调度。
✔ 具身智能仿真训练场:
基于三维卫星、无人机、室内采集数据,提供城市级孪生环境,齐全研发工具链与主流算力支持的一站式具身智能训练服务,打造低成本、高效率、安全可靠的具身智能研发与训练AI云。
► 技术赋能千行百业,标杆项目覆盖全国!
► 公众号留言私信,量身定制行业解决方案。

夜雨聆风