Meta 记忆 Agent 封面
3

8 月

Meta 给 AI Agent 装了「记忆教练」:第二个 AI 决定什么时候该提醒、什么时候闭嘴

Meta 给 AI Agent 装了「记忆教练」:第二个 AI 决定什么时候该提醒、什么时候闭嘴

AI Agent 做长任务时最大的毛病不是「不会做」,是「忘了做到哪了」。Meta AI 发表的新论文提出一个简单的方案:给 Agent 配一个专属记忆教练——另一个 AI,只在最关键的时机插入最关键的提醒。结果:Terminal-Bench 2.0 从 37.6% 提升到 45.9%,τ²-Bench 提升 6.8 个百分点。

问题比想象中更普遍

Meta AI 的论文给出了几个典型的长任务失败模式:

  1. 约束遗忘:Agent 前几步识别了一个重要约束(「这个文件只能读不能写」),但后来修复一个无关 bug 时违反了它
  2. 重复失败:一个命令失败了,Agent 试了几乎完全一样的另一个命令
  3. 诊断遗忘:Agent 花了几步诊断出一个错误的根因,后来把同样的根因当成新的发现重新诊断了一遍

这些不是你调一下 prompt 就能修好的问题。根本原因是:长任务的上下文窗口在膨胀,真正关键的决策信息被淹没在海量的中间步骤里。Meta 把这叫做行为状态衰减(behavioral state decay)

解法:双 Agent 架构

主 Agent(Action Agent)n  ├── 接收用户指令n  ├── 调用工具、执行任务n  └── 每 N 步接收「记忆 Agent」的提醒nn记忆 Agent(Memory Agent)  n  ├── 定期扫描最近几步的轨迹n  ├── 更新结构化记忆库n  └── 决定:插一句提醒,还是保持沉默

关键设计:记忆 Agent 不是每步都说话。它有一个选择性介入(selective intervention)机制——只在判断需要的时候插入提醒。消融实验证明这比「时刻在线」和「完全不提醒」都好。

数据说话

基准基线加记忆 Agent提升
Terminal-Bench 2.0 (pass@1)37.6%45.9%+8.3 pp
τ²-Bench (task-weighted avg)55.0%61.8%+6.8 pp

更有趣的是:强模型也能受益。用 Claude Opus 4.6 当主 Agent 时,记忆 Agent 仍然带来 +2.4 pp 的提升。不是只有弱模型需要记忆辅助——所有做长时任务的 Agent 都可能需要。

开源化路径

Meta 团队进一步尝试了把记忆 Agent 的能力蒸馏到开源模型:

  • 使用 Claude Opus 4.6 作为记忆 Agent 生成训练数据
  • 用 SFT + GRPO(强化学习)训练 Qwen 3.5-27 B 做记忆 Agent
  • 初步结果:部分转移到 Terminal-Bench,验证奖励有提升

方向明确:未来开源模型也能扮演「记忆教练」的角色

为什么现在关注这个

有三个趋势交叉:

  1. Agent 任务在变长——从「帮我改这个函数」到「帮我维护这个项目一周」
  2. 上下文窗口在变长,但注意力效率并没有——前面的内容确实还在窗口里,但模型已经「忘记」它了
  3. 多 Agent 协作架构正在成为主流——与其让一个 Agent 又干活又记账,不如分工

Meta 的这篇论文不只是提了一个方案,而是把「记忆管理」正式定义为一个独立的研究问题。行为状态衰减(behavioral state decay)这个概念可能会成为 Agent 评估的标准维度。

局限

  • 实验只在 Claude Opus 4.6 作为记忆 Agent 上跑,Opus 5 的表现未知
  • Terminal-Bench 和 τ²-Bench 是固定任务集,真实长时任务的退化模式可能更多样
  • 记忆 Agent 本身也要消耗 token 和推理时间,论文没有详细分析性价比曲线

相关阅读

FAQ

这和 RAG 有什么区别?

RAG 是外部知识检索(「我需要知道什么事实」),记忆 Agent 是内部状态管理(「我已经做了什么、发现了什么、要注意什么」)。两者互补,不互相替代。

为什么不直接给主 Agent 更大的上下文窗口?

论文的核心发现是:信息在上下文窗口里 ≠ 模型会正确使用它。更大的窗口只是把问题放大,不是解决它。选择性提醒比被动暴露更有效。


相关阅读

评论 (2)

评论被关闭。

RELATED

Posts