研究提出Harness-Zero方法,将智能体线束增益蒸馏进模型权重
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
智能体线束能提升模型表现,但部署时依赖特定线束,通用性受限。研究提出线束蒸馏,将特定线束的引导行为转移至模型权重,使部署时无需保留该线束。方法Harness-Zero利用“智能体即线束”机制,由线束智能体在目标线束动作空间中纠正学生回复,生成训练示范。微调后模型内化了线束行为。实验表明,移除专用线束后,基础模型宏平均任务成功率从23.3%升至44.3%,甚至超过保留线束时的41.7%;对28种模式的线束行为平均恢复率达82.3%。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载线束依赖问题与蒸馏思路
智能体线束作为调节模型与环境交互的外部系统,能显著提升智能体表现,但性能增益与部署时使用的线束强绑定。由于最优线束因领域、实例和模型而异,通用智能体只能妥协于次优的共享线束,或在不断增多的专用线束间路由。为解决此问题,研究探索线束蒸馏:将领域或实例优化的线束作为训练期引导,将其诱导的行为转移至模型权重,使增益在单一固定目标线束下依然保留。然而,优化线束与目标线束在动作空间和可用信息上存在差异,优化线束的指导无法直接用作目标线束的监督信号。
Harness-Zero机制与实验表现
研究提出Harness-Zero方法,借助“智能体即线束”实现蒸馏。在优化线束引导下,线束智能体在目标线束动作空间执行前纠正学生回复,将线束指导转化为训练示范。对生成轨迹微调可将线束诱导行为内化至模型,部署时即可移除专用线束。跨知识工作、工具使用和科学领域的实验显示:前沿大语言模型使用相同演化线束时,智能体即线束优于代码即线束;移除专用线束部署时,基础模型宏平均任务成功率从23.3%升至44.3%,超越保留该线束的41.7%;且对三领域28种模式中缺失的线束诱导行为,实现了82.3%的平均恢复。
为什么值得看
该方法使模型在部署时摆脱对外部专用线束的依赖,实现性能反超,对构建通用智能体具重要价值。
智能体微调蒸馏
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
