AXPO 修复 VLM 工具调用缺陷
推荐指数 75.0 NO. 023 · 2026.05.29
upvotes69comments3
为什么值得看
AXPO 通过优化推理前缀和工具调用重采样,解决视觉语言模型在代理任务中"想得多、用得差"的问题。对做多模态 Agent 的团队有直接参考价值,GRPO 训出来的模型工具利用率低可能是结构性问题。
媒体预览
编辑判断
这篇论文戳中了一个被忽视的训练动态问题:GRPO 这类标准 RL 方法对低概率高方差动作(工具调用)天然有抑制倾向,导致模型越来越"自闭"、宁愿死磕内部推理也不愿调用外部工具。AXPO 的解法是给 thinking prefix 单独优化、对工具调用做重采样,本质是给两类不对称行为分配不同的学习信号。实验是在自定义的网页导航和数学推理环境做的,尚未看到在主流 benchmark 如 GAIA 或 OSWorld 上的验证。代码和训练脚本尚未公开,复现门槛取决于是否开源基于 Qwen2.5-VL 的 checkpoint,建议等代码释放后再评估接入成本。