端到端实时音视频交互模型开源
推荐指数 82.0 NO. 023 · 2026.06.26
upvotes39comments2
为什么值得看
Wan-Streamer v0.1 是一个原生流式架构的多模态基础模型,用单个 Transformer 同时处理视觉、音频、文本的输入输出,通过块因果注意力机制实现增量式流式推理。对做实时 AI 助手、直播交互、硬件端侧设备的团队来说,这可能是替代级联pipeline(如ASR+LLM+TTS+视频生成拼接)的关键方案。
媒体预览
编辑判断
目前市面上的实时交互方案大多是级联架构,比如 GPT-4o 的语音模式背后其实是 ASR→LLM→TTS 的管道,延迟和语义损失难以避免。Wan-Streamer 的激进之处在于把音视频 token 和文本 token 混排在同一个序列里,用块因果注意力做增量解码,这跟 Moshi、GLM-4-Voice 的路线类似,但开源且强调端到端训练。
从工程落地看,真正的考验是音视频 token 的压缩率和实时解码的算力需求,论文里没给具体数字。如果延迟能压到 200ms 以内,对 AI 眼镜、车载助手、直播数字人这些场景会是颠覆性的。建议先跑 demo 测实际流式延迟,别只看架构图。
相关内容