Rep2Skill框架利用模型内部表征引导智能体技能自进化

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

当前LLM智能体技能自进化局限于文本空间,仅靠长轨迹与稀疏结果修改技能,忽略了包含执行状态记录的内部表征。Rep2Skill框架将内部表征引入优化循环,对收集的轨迹建模以定位偏离成功动态的步骤,结合执行上下文转化为文本反馈来定向修订技能。在两个环境及两个开源LLM上的实验表明,在无更强外部模型、同LLM兼任执行与优化器的设定下,该框架持续优于纯文本方法,为智能体自改进提供新方向。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

纯文本技能优化的局限

基于大语言模型的智能体通过文本技能积累可复用的过程知识,无需更新模型参数。然而,现有的技能进化机制完全在文本空间内进行。优化器必须仅从冗长的执行轨迹和稀疏的任务结果中诊断成功与失败的模式,并据此修改技能。这种纯文本范式将智能体内部表征排除在技能优化循环之外,而内部表征其实包含了其执行状态演变的丰富记录。

表征引导的技能修订机制

Rep2Skill提出一种表征引导的技能自进化框架,核心在于让智能体通过反思自身内部表征来改进外部文本技能。具体而言,在收集到的智能体运行轨迹上,该框架对这些轨迹的内部模型表征进行建模,从而定位出偏离成功执行动态的步骤。随后,它将这些信号与执行上下文一起解释为可操作的文本反馈,用于对技能进行有针对性的修订。

实验验证与自进化设定

研究在两个智能体环境及两个开源大语言模型上开展了实验。实验设定处于自进化场景,即同一个LLM同时充当执行器与优化器,且不依赖更强的外部模型。结果显示,Rep2Skill在此设定下持续优于纯文本方法。这证实了利用内部表征指导技能修订的有效性,为超越纯文本反思的智能体自改进确立了方向。

为什么值得看

突破智能体仅靠文本反思自改进的局限,利用模型内部表征定位执行偏差,为无强模型辅助的技能自进化提供新路径。

智能体

信源1 家

  1. [1]arXiv cs.AI一手信源Rep2Skill: Representation-Guided Skill Self-Evolution for LLM Agents

关键事实

  • Rep2Skill框架将LLM内部表征引入智能体技能自进化优化循环[1]

  • 该框架通过建模内部表征轨迹定位偏离成功动态的步骤,并转化为文本反馈修订技能[1]

  • 在同LLM兼任执行与优化器且无更强外部模型的设定下,Rep2Skill持续优于纯文本方法[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。