Microsoft Research· Zhiyuan He, Yuqing Yang·· 5 小时前精选AI 评分71
微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架
Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses
AI 导读
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与 RL 训练,无需在训练框架内重新实现 agent。
推荐理由
微软研究院开源 Agent Lightning v1.0,读者可了解让部署用 harness 直接参与 RL 训练的轻量框架设计。
深读指南
适合谁读:对智能体强化学习、LLM 训练框架与工程实现感兴趣的研究者、工程师和技术决策者。
提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,避免在训练框架内重写 agent。
whichever agent harness is used in deployment is the harness that takes part directly in reinforcement learning during training
通过 LLM 代理层连接现有 harness,通常只需把模型端点指向 Agent Lightning 代理即可接入 RL 训练。
simply pointing the model endpoint at the Agent Lightning proxy is usually enough to connect quickly to RL training
采用 Collocated Async RL,让 rollout 与模型更新共享同一组 GPU,实验报告约 2 倍端到端加速。
this approach achieved about a 2x end-to-end speedup over synchronous RL while using fewer GPUs than conventional asynchronous RL
局限与前提:性能提升数据(41.8% 到 56.4%、14.6 个百分点、约 6000 样本、约 2 倍加速)均来自作者自述实验,未提供独立复现或第三方评测;框架约 3500 行代码、Kubernetes 原生支持等属于设计描述,未给出与其他框架的完整对比;文中未说明失败案例、超参敏感性或跨任务泛化边界。
对照原文阅读来源:Microsoft Research · microsoft.com