Agent Lightning 封面
4

9 月

微软开源 Agent Lightning:用 6000 条样本让 9 B 模型追平 GPT-5.5,Agent 开始训练 Agent

Agent Lightning 封面

核心结论:微软 8 月 25 日开源的 Agent Lightning,做了一件「反直觉」的事——用真实部署环境里的 Agent Harness 做强化学习训练,只用了 6000 条样本,就把 Qwen 3.5-9 B 的 SWE-bench 从 41.8% 拉到 56.4%,追平 GPT-5.5。它证明了一个被忽视的道理:决定 Agent 能力的不是模型多大,而是「在真实环境里训练」。

AI 摘要

  • 微软开源 Agent Lightning,上线即 1.76 万 Star,v 1.0 代码精简到约 3500 行
  • 用真实 Agent Harness 做强化学习训练,无需模拟环境、无需改业务代码
  • 仅 6000 条样本,把 Qwen 3.5-9 B 的 SWE-bench Verified 从 41.8% 提升到 56.4%(+14.6 个百分点)
  • 追平 GPT-5.5,而基座只是 90 亿参数的国产模型
  • 附带 Agent Lightning Skill,让 Claude Code 等智能体系统性优化其他 Agent

它解决了一个什么根本矛盾?

Agent 训练的现状,有个很别扭的地方。

训练一个能写代码的 AI,通常是在「模拟环境」里练的——一堆精心构造的 benchmark 数据集,模型在里面刷题、刷分。但等模型真正部署上线,面对的是真实世界的混乱:工具调用的各种边界情况、上下文管理的坑、失败重试的细节。

训练环境 ≠ 部署环境。 这就是为什么很多模型在 benchmark 上刷得很高,一到真实 Agent 工作流里就拉胯。

微软的 Agent Lightning 干的事,就是把这个「割裂」消掉。它的核心思路一句话:用部署时的真实 Agent Harness 来做强化学习训练

三个设计如何直击痛点?

Harness 代理层

Agent Lightning 的结构不复杂,但每一层都踩在真问题上:

Harness 代理层:在 Agent 和模型之间插一个代理层。Agent 的每一次工具调用、每一次上下文交互,都经过这个代理层。训练时,代理层静默收集这些真实交互数据,用于强化学习。

无侵入设计:开发者不需要改任何业务代码。你的 Agent 该怎么跑还怎么跑,代理层在后台工作。这是它能落地的关键——如果要求开发者为了训练重构代码,没人会用。这种「分层解耦」的思路,和智盒整理的 AI Agent 落地三大范式 里强调的「编排层与基础模型解耦」如出一辙。

PPO 训练管线:用近端策略优化(PPO)在真实交互数据上训练,配套数据清洗、防 reward hacking 机制和完整训练脚本,全部开源。

6000 条样本凭什么这么「魔法」?

SWE-bench 提升对比

最让人震惊的是数据效率。

传统大模型训练动辄百万、千万条数据。Agent Lightning 只用了 6000 条训练样本:

  • 基座模型:Qwen 3.5-9 B(通义千问 3.5,90 亿参数)
  • 训练前:SWE-bench Verified 41.8%
  • 训练后:SWE-bench Verified 56.4%
  • 提升幅度:+14.6 个百分点(相对提升 35%)

56.4% 是什么概念?GPT-5.5 在这个基准上的成绩大约是 56.0%。也就是说,一个 90 亿参数的国产模型,用 6000 条真实交互数据微调后,追平了 OpenAI 的旗舰。

这背后的道理,和今年 7 月 DeepSeek V 4 Flash 0731 的爆发如出一辙——那个模型靠「完全重新后训练」,把 DeepSWE 从 7.3 拉到 54.4(详见 DeepSeek V 4 Flash 0731 升级分析)。两者的共同结论是一致的:决定 Agent 性能的是后训练质量,不是原始规模。

Agent 训练 Agent 意味着什么?

v 1.0.1 版本还推出了一个「套娃」功能:Agent Lightning Skill。

它的作用是让 Claude Code、Codex、GitHub Copilot 这些编程智能体,系统性地优化其他 AI Agent 的提示词、工具和工作流

换句话说,这已经不只是「用 AI 训练模型」,而是「用 AI 优化 AI」。微软把这个叫「Agent 训练 Agent 时代的正式开始」。

这个 skill 本身是可复用的 Claude Code skill,你可以直接装进自己的编程智能体里,让它去审计和优化你手上的其他 Agent。

门槛、替代方案和风险

门槛:中等偏低。代码只有约 3500 行、MIT 开源、训练脚本齐全,对有一定 RL 基础的团队来说「今晚就能跑」。但需要理解 PPO 和强化学习的基本概念,不适合完全零基础的用户。

替代方案:如果你的目标是「低成本训练编码 Agent」,市面上还有几条路——用现成的 benchmark 刷分(快,但和真实环境脱节)、用 DeepSeek 这类已经很强又便宜的模型直接上(零训练成本)、或者等 Agent Lightning 生态成熟后跟进。

风险:项目刚 v 1.0,生态还在早期。6000 条样本的惊人效果目前是微软自报的,第三方复现结果还没出来。而且「用真实 Harness 训练」意味着训练数据的质量取决于你的 Agent 真实工作流——如果你的 Agent 本身用法就有问题,训练可能会固化这些坏习惯。这正是项目自己强调要「防 reward hacking」的原因。

FAQ

Agent Lightning 和传统的 RLHF 有什么区别?

传统 RLHF 用的是「人类反馈」构造的偏好数据,Agent Lightning 用的是「真实 Harness 交互」数据。前者是「人觉得好不好」,后者是「Agent 真实跑起来效果如何」。后者更贴近部署时的真实表现。

6000 条样本真的够吗?

微软的实验表明,对 SWE-bench 这个特定基准,6000 条真实交互数据足够带来 14.6 个百分点的提升。但这不等于「所有任务都只要 6000 条」——它的数据效率来自「真实环境 + 高质量交互」,而不是样本量本身。样本的质量比数量重要。

我能用在自己的 Agent 上吗?

能。它无侵入设计,你的 Agent 不用改代码就能接入。但要跑训练,还是需要准备 RL 环境、理解 PPO 管线。更适合有一定工程能力的团队,而不是零基础个人。

这和 DeepSeek V 4 Flash 0731 的爆发是什么关系?

两者是同一个趋势的两面。DeepSeek 0731 靠「完全重新后训练」把 DeepSWE 从 7.3 拉到 54.4,Agent Lightning 靠「真实 Harness 训练」把 SWE-bench 拉高 14.6 个百分点。共同指向一个结论:2026 年 Agent 能力的提升,越来越不靠堆模型规模,而是靠后训练和真实环境训练。

参考来源

  • 博客园:《Agent Lightning:微软开源 Agent 训练 Agent 框架,6000 条样本涨 14.6 个百分点》(2026-08-25)
  • GitHub:microsoft/agent-lightning

RELATED

Posts