HMED机制让自改进智能体从修订后果中学习元技能
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
自改进智能体在优化任务技能时,需依靠元技能控制发现与改进过程。现有方法依据原始搜索轨迹的分支结果更新元技能,但初始状态与修订效果相互纠缠,导致更新偏向占据初始优势的修订而非真正改善过程的修订。提出的HMED机制通过回溯已完成事件,在共享的恢复状态下重新执行原版与修订后的元技能,从而剥离初始状态影响,精准观测修订带来的变化。每次对比被蒸馏为可复用的元经验,使未被保留的修订也能提供学习信号。在三个交互式基准及开源闭源模型上,HMED均显著提升技能发现性能。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载元技能更新的状态纠缠难题
智能体通过生成和修订任务技能来持续改进,而控制该发现与改进过程的元技能本身也需学习。现有方法基于原始技能搜索轨迹及分支结果来优化元技能。然而,分支表现实际上混合了初始发现状态的影响与元技能修订所产生的作用。这种纠缠导致难以刻画特定修订的真实效果,使得更新方向偏离真正优化过程的修订,转而偏向那些恰好受益于有利初始状态的修订。
HMED机制的后见与重执行策略
为解决上述问题,HMED(后见元经验蒸馏)机制被提出。其核心在于回溯产生修订的已完成事件,并将发现状态恢复至修订前的共享条件。在此相同状态下,重新执行原任元技能与修订后的元技能。通过这种受控对比,能够清晰剥离初始状态干扰,直接观测修订本身带来的变化。此外,每次对比结果被蒸馏为结构化的元经验记录供未来复用,这确保了即便修订最终未被保留,依然能为后续更新贡献有效的学习信号。
跨基准与模型的性能提升
该研究在三个交互式智能体基准上进行了实验验证,涵盖了开源与闭源两类模型。实验结果表明,相较于强基线方法,HMED一致地提升了技能发现性能。这证实了将元技能学习从单纯依赖分支结果,转向关注改变改进过程所带来的后果,能够有效增强智能体的自改进能力与技能发现效率。
为什么值得看
解决智能体元技能更新中状态与效果纠缠的难题,让失败的修订也产生学习信号,提升自改进效率。
智能体蒸馏
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
