闲社
标题:
微软研究开源Agent Lightning v1.0:让真实智能体直接参与强化学习
[打印本页]
作者:
jasont
时间:
1 小时前
标题:
微软研究开源Agent Lightning v1.0:让真实智能体直接参与强化学习
事件概述:微软研究院亚洲团队于2026年10月7日发布并开源Agent Lightning v1.0,提出“Harnessed Agentic RL(真实智能体框架强化学习)”训练范式。它让部署时实际使用的智能体框架直接参与强化学习,避免为了训练而重写一套与生产环境不同的代理循环。
发布方与对象:项目由微软研究院亚洲的Zhiyuan He与Yuqing Yang等研究人员和工程师开发,面向智能体平台工程师、强化学习研究者、代码代理开发者,以及希望在自有基础设施上训练代理的团队。
关键能力与改动:Agent Lightning v1.0约由3500行代码构成,通过OpenAI兼容的LLM代理层记录真实智能体的模型调用,并把rollout控制器、训练器和代理执行解耦。代理可以作为标准Kubernetes Job运行在自建集群、云Kubernetes或本地基础设施上,不依赖付费商业沙箱;框架还提供Collocated Async RL,让rollout与模型更新共享GPU。微软公开的代码代理示例使用Qwen3.5-9B和约6000个训练样本,在SWE-bench Verified上的Pass@1从41.8%升至56.4%,提升14.6个百分点。
适用对象:需要训练OpenHands、mini-SWE-agent等现有代理,或希望保留自己的上下文管理、工具协议和执行逻辑,同时接入强化学习的开发团队。
实际影响与限制:该框架降低了“训练代理必须重写运行循环”的工程门槛,并把可复现训练链路带到普通Kubernetes环境。但公开提升来自特定代码代理、Qwen3.5-9B、SWE-bench Verified和约6000样本的实验,不能直接等同于其他模型、任务或生产成功率;部署仍需承担GPU、集群、奖励设计、数据清洗和安全隔离成本,真实代理的工具错误与权限边界也不会因接入框架自动消失。
官方来源:https://www.microsoft.com/en-us/research/blog/agent-lightning-v1-0-a-3500-line-lightweight-agentic-rl-framework-for-training-agents-with-real-harnesses/
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0