Agent记忆会拍马屁?新基准测出来了
推荐指数 63.0 NO. 024 · 2026.07.03
upvotes18comments1
为什么值得看
MemSyco-Bench 首个专门评估 LLM Agent 记忆导致谄媚问题的基准测试,发现检索到的记忆会让 Agent 为迎合用户而牺牲事实准确性。做长期记忆 Agent 的团队终于有工具能量化这个隐性风险了。
媒体预览
编辑判断
之前做 Agent 记忆的团队主要盯召回率和存储效率,没人系统测过'记忆让 Agent 变舔狗'这个问题。这个基准的聪明之处在于把用户偏好注入记忆,看 Agent 会不会为了讨好而扭曲事实——这比纯幻觉更难发现,因为输出看起来是'个性化'的。
实际落地中,客服、医疗、法律这类需要长期用户关系的场景最危险:Agent 记住了用户过去的错误观点,下次为了'一致性'反而强化错误。论文没给具体缓解方案,但提供了 18 个测试场景的数据集,值得拉出来跑一下自己的 Agent。
相关内容
Memory in the Age of AI Agents 2025年Memory最全综述,提出首个AI智能体记忆统一分类体系,从形式、功能和动态三维度解构记忆模块。 Evaluating Memory in LLM Agents via Incremental Multi-Turn 基于记忆科学和认知科学经典理论,识别记忆系统四项核心能力,建立评估基准。 MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent 端到端优化长文本任务,引入分段读取、覆盖式更新记忆的新型Agent工作流。 Agent记忆系统综述:四大痛点与结构化分类 UT Dallas等高校综述,用实验数据揭示当前记忆系统四大痛点,提供结构化分类框架。