微软亚研院开源Agent Lightning v1.0智能体RL训练框架

工具AI 评分 78/100Microsoft Research 博客(RSS)待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

本条选题由第三方线索发现;线索方提供的摘要未被采用,本页内容依据下方信源整理。线索来源:AIHOT

微软亚研院推出Agent Lightning v1.0,以约3500行代码提供完整智能体强化学习控制面。该框架让部署与训练共用同一harness,免去在训练框架内重写智能体。原生支持K8s运行且不依赖付费沙箱。其数据高效训练流程仅用约6000个开源样本,便将Qwen3.5-9B在SWE-bench Verified的Pass@1从41.8%提升至56.4%,增长14.6个百分点。

为什么值得看

用极简代码实现部署训练一体化智能体RL,且仅凭少量样本即大幅提升模型代码修复能力。

Qwen智能体强化学习

信源1 家

  1. [1]Microsoft Research 博客(RSS)线索来自 AIHOTMicrosoft Research Asia 开源 Agent Lightning v1.0:3,500 行代码的真实 harness 智能体 RL 训练框架

关键事实

  • Agent Lightning v1.0以约3500行代码提供完整智能体RL控制面[1]

  • 框架让部署用的agent harness直接参与强化学习,无需在训练框架内重写[1]

  • 原生支持K8s,不依赖付费商业沙箱服务[1]

  • 使用约6000个开源训练样本,将Qwen3.5-9B在SWE-bench Verified的Pass@1提升14.6个百分点[1]

相关 · 工具

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。