
9 月
微软开源 Agent Lightning:用 6000 条样本让 9 B 模型追平 GPT-5.5,Agent 开始训练 Agent

核心结论:微软 8 月 25 日开源的 Agent Lightning,做了一件「反直觉」的事——用真实部署环境里的 Agent Harness 做强化学习训练,只用了 6000 条样本,就把 Qwen 3.5-9 B 的 SWE-bench 从 41.8% 拉到 56.4%,追平 GPT-5.5。它证明了一个被忽视的道理:决定 Agent 能力的不是模型多大,而是「在真实环境里训练」。
AI 摘要
- 微软开源 Agent Lightning,上线即 1.76 万 Star,v 1.0 代码精简到约 3500 行
- 用真实 Agent Harness 做强化学习训练,无需模拟环境、无需改业务代码
- 仅 6000 条样本,把 Qwen 3.5-9 B 的 SWE-bench Verified 从 41.8% 提升到 56.4%(+14.6 个百分点)
- 追平 GPT-5.5,而基座只是 90 亿参数的国产模型
- 附带 Agent Lightning Skill,让 Claude Code 等智能体系统性优化其他 Agent
它解决了一个什么根本矛盾?
Agent 训练的现状,有个很别扭的地方。
训练一个能写代码的 AI,通常是在「模拟环境」里练的——一堆精心构造的 benchmark 数据集,模型在里面刷题、刷分。但等模型真正部署上线,面对的是真实世界的混乱:工具调用的各种边界情况、上下文管理的坑、失败重试的细节。
训练环境 ≠ 部署环境。 这就是为什么很多模型在 benchmark 上刷得很高,一到真实 Agent 工作流里就拉胯。
微软的 Agent Lightning 干的事,就是把这个「割裂」消掉。它的核心思路一句话:用部署时的真实 Agent Harness 来做强化学习训练。
三个设计如何直击痛点?

Agent Lightning 的结构不复杂,但每一层都踩在真问题上:
Harness 代理层:在 Agent 和模型之间插一个代理层。Agent 的每一次工具调用、每一次上下文交互,都经过这个代理层。训练时,代理层静默收集这些真实交互数据,用于强化学习。
无侵入设计:开发者不需要改任何业务代码。你的 Agent 该怎么跑还怎么跑,代理层在后台工作。这是它能落地的关键——如果要求开发者为了训练重构代码,没人会用。这种「分层解耦」的思路,和智盒整理的 AI Agent 落地三大范式 里强调的「编排层与基础模型解耦」如出一辙。
PPO 训练管线:用近端策略优化(PPO)在真实交互数据上训练,配套数据清洗、防 reward hacking 机制和完整训练脚本,全部开源。
6000 条样本凭什么这么「魔法」?

最让人震惊的是数据效率。
传统大模型训练动辄百万、千万条数据。Agent Lightning 只用了 6000 条训练样本:
- 基座模型:Qwen 3.5-9 B(通义千问 3.5,90 亿参数)
- 训练前:SWE-bench Verified 41.8%
- 训练后:SWE-bench Verified 56.4%
- 提升幅度:+14.6 个百分点(相对提升 35%)
56.4% 是什么概念?GPT-5.5 在这个基准上的成绩大约是 56.0%。也就是说,一个 90 亿参数的国产模型,用 6000 条真实交互数据微调后,追平了 OpenAI 的旗舰。
这背后的道理,和今年 7 月 DeepSeek V 4 Flash 0731 的爆发如出一辙——那个模型靠「完全重新后训练」,把 DeepSWE 从 7.3 拉到 54.4(详见 DeepSeek V 4 Flash 0731 升级分析)。两者的共同结论是一致的:决定 Agent 性能的是后训练质量,不是原始规模。
Agent 训练 Agent 意味着什么?
v 1.0.1 版本还推出了一个「套娃」功能:Agent Lightning Skill。
它的作用是让 Claude Code、Codex、GitHub Copilot 这些编程智能体,系统性地优化其他 AI Agent 的提示词、工具和工作流。
换句话说,这已经不只是「用 AI 训练模型」,而是「用 AI 优化 AI」。微软把这个叫「Agent 训练 Agent 时代的正式开始」。
这个 skill 本身是可复用的 Claude Code skill,你可以直接装进自己的编程智能体里,让它去审计和优化你手上的其他 Agent。
门槛、替代方案和风险
门槛:中等偏低。代码只有约 3500 行、MIT 开源、训练脚本齐全,对有一定 RL 基础的团队来说「今晚就能跑」。但需要理解 PPO 和强化学习的基本概念,不适合完全零基础的用户。
替代方案:如果你的目标是「低成本训练编码 Agent」,市面上还有几条路——用现成的 benchmark 刷分(快,但和真实环境脱节)、用 DeepSeek 这类已经很强又便宜的模型直接上(零训练成本)、或者等 Agent Lightning 生态成熟后跟进。
风险:项目刚 v 1.0,生态还在早期。6000 条样本的惊人效果目前是微软自报的,第三方复现结果还没出来。而且「用真实 Harness 训练」意味着训练数据的质量取决于你的 Agent 真实工作流——如果你的 Agent 本身用法就有问题,训练可能会固化这些坏习惯。这正是项目自己强调要「防 reward hacking」的原因。
FAQ
Agent Lightning 和传统的 RLHF 有什么区别?
传统 RLHF 用的是「人类反馈」构造的偏好数据,Agent Lightning 用的是「真实 Harness 交互」数据。前者是「人觉得好不好」,后者是「Agent 真实跑起来效果如何」。后者更贴近部署时的真实表现。
6000 条样本真的够吗?
微软的实验表明,对 SWE-bench 这个特定基准,6000 条真实交互数据足够带来 14.6 个百分点的提升。但这不等于「所有任务都只要 6000 条」——它的数据效率来自「真实环境 + 高质量交互」,而不是样本量本身。样本的质量比数量重要。
我能用在自己的 Agent 上吗?
能。它无侵入设计,你的 Agent 不用改代码就能接入。但要跑训练,还是需要准备 RL 环境、理解 PPO 管线。更适合有一定工程能力的团队,而不是零基础个人。
这和 DeepSeek V 4 Flash 0731 的爆发是什么关系?
两者是同一个趋势的两面。DeepSeek 0731 靠「完全重新后训练」把 DeepSWE 从 7.3 拉到 54.4,Agent Lightning 靠「真实 Harness 训练」把 SWE-bench 拉高 14.6 个百分点。共同指向一个结论:2026 年 Agent 能力的提升,越来越不靠堆模型规模,而是靠后训练和真实环境训练。
参考来源
- 博客园:《Agent Lightning:微软开源 Agent 训练 Agent 框架,6000 条样本涨 14.6 个百分点》(2026-08-25)
- GitHub:microsoft/agent-lightning










