AB
AiBoss
ニュース

微软开源 Agent Lightning v1.0:约 3500 行代码的轻量级智能体强化学习框架

微软研究院开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 训练范式,让部署所用的智能体框架直接参与强化学习,无需在训练框架内重写智能体。整个框架约 3500 行代码,原生支持 Kubernetes,官方称在 SWE-bench Verified 上以约 6000 条训练样本将 Qwen3.5-9B 的 Pass@1 从 41.8% 提升至 56.4%。

微软开源 Agent Lightning v1.0

微软研究院(Microsoft Research)在其官方博客发布 Agent Lightning v1.0,并已开源。该版本围绕其提出的 Harnessed Agentic RL 训练范式重建:部署时使用的智能体框架(harness)直接参与强化学习,开发者无需在训练框架内重新实现智能体。据官方介绍,整个框架约 3500 行代码,由 API Gateway、Rollout Controller 和基于 verl 构建的 Customized Trainer 三个核心组件组成。

背景与影响

传统智能体强化学习假设训练框架掌握与环境的交互循环,因此训练一个智能体往往需要把它的循环在 RL 框架里重建一遍,成本高,且被训练的智能体与最终部署的智能体可能并不一致。Agent Lightning 的做法是在智能体与模型之间放置一个兼容 OpenAI 接口的 LLM 代理,只需把原先调用模型 API 的端点指向该代理,训练框架即可观测并记录模型调用。v1.0 还引入 Collocated Async RL,让 rollout 与模型更新共用同一组 GPU;官方称实验中相较同步 RL 取得约 2 倍端到端加速,且占用 GPU 少于常规异步方案。智能体以标准 Kubernetes Job 形式运行,可复用自管集群、云上 Kubernetes 或本地基础设施,不依赖付费商业沙箱服务。官方给出的端到端编码智能体示例基于 SWE-smith、mini-SWE-agent 与 Qwen3.5-9B,使用约 6000 条训练样本,称在 SWE-bench Verified 上 Pass@1 由 41.8% 升至 56.4%,提升 14.6 个百分点。

限制与来源

上述代码规模、加速比与基准成绩均来自微软研究院官方博客的自我描述,本站未做独立验证;基准结果依赖特定数据集、模型版本与训练配置,其他环境下未必可复现。框架的许可证、依赖版本、支持的模型与部署环境、以及各地区的可用情况,请以项目官方仓库与官网当前信息为准。本文信息源自微软研究院博客文章《Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses》。