
8 月
Meta 给 AI Agent 装了「记忆教练」:第二个 AI 决定什么时候该提醒、什么时候闭嘴
Meta 给 AI Agent 装了「记忆教练」:第二个 AI 决定什么时候该提醒、什么时候闭嘴
AI Agent 做长任务时最大的毛病不是「不会做」,是「忘了做到哪了」。Meta AI 发表的新论文提出一个简单的方案:给 Agent 配一个专属记忆教练——另一个 AI,只在最关键的时机插入最关键的提醒。结果:Terminal-Bench 2.0 从 37.6% 提升到 45.9%,τ²-Bench 提升 6.8 个百分点。
问题比想象中更普遍
Meta AI 的论文给出了几个典型的长任务失败模式:
- 约束遗忘:Agent 前几步识别了一个重要约束(「这个文件只能读不能写」),但后来修复一个无关 bug 时违反了它
- 重复失败:一个命令失败了,Agent 试了几乎完全一样的另一个命令
- 诊断遗忘:Agent 花了几步诊断出一个错误的根因,后来把同样的根因当成新的发现重新诊断了一遍
这些不是你调一下 prompt 就能修好的问题。根本原因是:长任务的上下文窗口在膨胀,真正关键的决策信息被淹没在海量的中间步骤里。Meta 把这叫做行为状态衰减(behavioral state decay)。
解法:双 Agent 架构
主 Agent(Action Agent)n ├── 接收用户指令n ├── 调用工具、执行任务n └── 每 N 步接收「记忆 Agent」的提醒nn记忆 Agent(Memory Agent) n ├── 定期扫描最近几步的轨迹n ├── 更新结构化记忆库n └── 决定:插一句提醒,还是保持沉默关键设计:记忆 Agent 不是每步都说话。它有一个选择性介入(selective intervention)机制——只在判断需要的时候插入提醒。消融实验证明这比「时刻在线」和「完全不提醒」都好。
数据说话
| 基准 | 基线 | 加记忆 Agent | 提升 |
|---|---|---|---|
| Terminal-Bench 2.0 (pass@1) | 37.6% | 45.9% | +8.3 pp |
| τ²-Bench (task-weighted avg) | 55.0% | 61.8% | +6.8 pp |
更有趣的是:强模型也能受益。用 Claude Opus 4.6 当主 Agent 时,记忆 Agent 仍然带来 +2.4 pp 的提升。不是只有弱模型需要记忆辅助——所有做长时任务的 Agent 都可能需要。
开源化路径
Meta 团队进一步尝试了把记忆 Agent 的能力蒸馏到开源模型:
- 使用 Claude Opus 4.6 作为记忆 Agent 生成训练数据
- 用 SFT + GRPO(强化学习)训练 Qwen 3.5-27 B 做记忆 Agent
- 初步结果:部分转移到 Terminal-Bench,验证奖励有提升
方向明确:未来开源模型也能扮演「记忆教练」的角色。
为什么现在关注这个
有三个趋势交叉:
- Agent 任务在变长——从「帮我改这个函数」到「帮我维护这个项目一周」
- 上下文窗口在变长,但注意力效率并没有——前面的内容确实还在窗口里,但模型已经「忘记」它了
- 多 Agent 协作架构正在成为主流——与其让一个 Agent 又干活又记账,不如分工
Meta 的这篇论文不只是提了一个方案,而是把「记忆管理」正式定义为一个独立的研究问题。行为状态衰减(behavioral state decay)这个概念可能会成为 Agent 评估的标准维度。
局限
- 实验只在 Claude Opus 4.6 作为记忆 Agent 上跑,Opus 5 的表现未知
- Terminal-Bench 和 τ²-Bench 是固定任务集,真实长时任务的退化模式可能更多样
- 记忆 Agent 本身也要消耗 token 和推理时间,论文没有详细分析性价比曲线
相关阅读
FAQ
这和 RAG 有什么区别?
RAG 是外部知识检索(「我需要知道什么事实」),记忆 Agent 是内部状态管理(「我已经做了什么、发现了什么、要注意什么」)。两者互补,不互相替代。
为什么不直接给主 Agent 更大的上下文窗口?
论文的核心发现是:信息在上下文窗口里 ≠ 模型会正确使用它。更大的窗口只是把问题放大,不是解决它。选择性提醒比被动暴露更有效。











评论 (2)
[…] Meta 给 AI Agent 装了记忆教练 […]
[…] Meta 记忆 Agent 教练 […]
评论被关闭。