开放域主体驱动视频生成新方案
推荐指数 60.0 NO. 025 · 2026.06.26
upvotes55comments1
为什么值得看
DomainShuttle 提出域感知建模和双 RoPE 机制,实现开放域主体驱动视频生成,同时支持保真还原(in-domain)和灵活变形(cross-domain)两种场景。解决了现有方法只擅长单一域、跨域生成时主体特征丢失或过度约束的痛点。
媒体预览
编辑判断
现有主体驱动视频方案如 DreamPose、AnimateAnyone 基本卡在单一域,跨域生成时要么主体走样、要么文本指令被压制。这篇的核心 trick 是把域信息显式编码进时空建模,配合两套 RoPE 分别管主体一致性和运动自由度,相当于给模型发了两张权限不同的通行证。
从实验看跨域场景的 FVD 和主体相似度指标都有明显提升,但论文没提推理速度和显存占用,55 票热度也说明社区还在观望。如果开源代码和模型权重能跟上,做短视频工具、广告素材生成的团队可以重点跟进;否则停留在学术 demo 层面的概率不低。
相关内容