手机GUI Agent免标注自适应训练
推荐指数 76.0 NO. 024 · 2026.06.25
upvotes34comments1
为什么值得看
MobileForge提出了一种无需人工标注的移动端GUI Agent自适应方法,通过真实App交互接地和分层反馈引导策略优化,解决海量App频繁更新导致适配成本过高的问题。对做端侧Agent的团队来说,这意味着可以大幅降低覆盖新App的数据成本,尤其适合需要快速跟进热门应用的创业公司。
媒体预览
编辑判断
当前移动端Agent的主流做法是用SeeClick、ShowUI等模型做预训练,再针对目标App收集人工演示做SFT,但一个App动辄需要上千条标注。MobileForge的关键设计是把探索、课程挖掘、执行和反馈塞进同一个循环,用App本身的交互反馈替代人工奖励标签,这本质上是用在线RL做离线数据蒸馏。
分层反馈机制值得注意:底层用UI变化检测给即时reward,上层用任务完成度做稀疏reward,这比单一层面的PPO更稳定。论文提到在AndroidEnv上测试,但没有公开代码和具体模型尺寸,落地前需要确认推理延迟——移动端Agent通常要求200ms内完成一次决策,如果策略网络太大可能还要做蒸馏。
做Android自动化测试或RPA的团队可以先关注,如果开源建议优先跑一下在抖音、微信这类复杂App上的成功率。
相关内容
MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization 提出分层反馈引导策略优化,实现无需标注的手机GUI Agent自适应训练,核心方法为MobileForge。 Training Mobile GUI Agents Using Decentralized Self-Sourced Data 探索去中心化自源数据训练移动GUI Agent,对比Qwen2-VL、GPT-4o等模型在AndroidControl等基准上的表现。 MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment 通过在线环境强化学习提升移动GUI Agent能力,聚焦视觉感知与自主决策的端到端训练。 Learning with Challenges: Adaptive Difficulty-Aware Data Generation for Mobile GUI Agent Training 提出自适应难度感知数据生成方法,解决移动GUI Agent训练中的数据效率与样本质量问题。