多模态智能体训练:环境不是越多越好
推荐指数 70.0 NO. 024 · 2026.08.11
upvotes28comments1
为什么值得看
研究发现单纯堆量多模态训练环境反而有害,提出从「多样性」和「难度结构」两个维度优化环境分布的方法:AES 智能选择环境,HDC 构建分层课程。对正在训练视觉-语言-动作模型的团队有直接参考价值,能省下大量无效算力。
媒体预览
编辑判断
当前主流做法是用 VLN-CE、ALFRED、WebShop 等环境拼一个大池子直接训,这篇论文戳破了「规模即正义」的幻觉。AES 本质上是用能力覆盖度代替随机采样,HDC 则是把环境按技能树分层而非简单按成功率排序,这跟传统课程学习的区别在于它显式建模了能力之间的依赖关系。
实验显示在相同环境数量下,他们的分布设计把多任务成功率提升了 12-18%。不过论文没开源完整的环境划分工具,复现需要自己啃附录里的难度标注逻辑。如果你在用 MineDojo 或 Habitat 做训练,建议先拿现有的环境池跑一遍他们的诊断指标(环境冗余度、能力覆盖 gap),大概率能砍掉 30% 以上的无效环境。
相关内容