AMAZINGINDEX.COM 日报快照
59.8
VOL. 2026.08
2026.08.13
← 返回 2026.08.13 日报
日报快照 · Daily Snapshot
NO. 022

视频扩散潜空间直出4D世界

#HF_PAPERS HuggingFace Papers 2026.08.13
推荐指数 76.0 NO. 022 · 2026.08.13
upvotes102comments3

Latent-to-4D 提出从视频扩散模型的去噪潜空间直接生成动态3D场景,无需针对特定生成器重新训练。解决了现有方法要么误差累积、要么绑定单一模型的问题,让任意共享VAE的视频模型都能即插即用输出4D。

视频扩散潜空间直出4D世界

这个工作的聪明之处在于把4D生成从'追在视频生成器后面擦屁股'变成了'在潜空间截流'。之前像Make-A-Video3D或者4D-fy都是先让视频模型跑出RGB,再用NeRF或高斯溅射重建,两步之间的分布漂移和几何不一致是老大难问题。Latent-to-4D直接对齐VAE decoder的潜空间,用时空注意力把latent解码成动态场景,相当于给所有兼容这个VAE的视频模型发了一张4D生成的通用门票。

从工程角度看,这个架构的复用性很强,Stable Video Diffusion、AnimateDiff甚至未来的视频模型都能直接接。但论文没提推理速度和显存占用,4D生成的实时性一直是瓶颈,如果这部分开销太大,落地场景会受限。建议关注作者是否开源代码和decoder权重,这决定了社区能不能快速跟进。

查看原文 →