AI 圈大事记

RRSI方法解决智能体框架递归自改进过拟合问题

论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

针对大模型智能体框架在递归自改进中易对训练任务过拟合、导致分布外性能下降的问题,RRSI方法将正则化引入该过程。其提议者采用随时间退火的预算限制编辑数量并鼓励探索未知轨迹;选择者通过评估器筛选特定基准提议,用修剪器移除微小、昂贵或失效的变更。这些约束促使框架演化出可复用机制而非特定技巧。在八项涵盖编码与工程设计的基准测试中,该方法在演化分布上最高提升14.1分,在五项分布外基准上最高提升4.7分,且生成的框架策略令牌消耗减少30%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

框架自改进的过拟合困境

大语言模型智能体的能力很大程度上由其框架(即围绕固定骨干模型的提示、控制流、工具、内存及上下文管理)放大。近期方法通过迭代提议和选择框架的组件编辑来实现自动化,实质上在智能体系统层面建立了递归自改进。然而,这种递归演化容易因记忆训练任务而过拟合,在分布内基准上取得大幅增益,但在分布外基准上增益缩小甚至消失。

正则化约束的提议与选择

RRSI通过约束演化的候选提议与选择,将正则化原则融入框架自改进。在提议阶段,提议者采用随时间退火的预算,限制候选能捆绑的编辑数量,并基于演化历史鼓励探索未涉足的轨迹。在选择阶段,选择器配备评估器和修剪器:评估器审查针对特定基准的提议,修剪器则移除幅度过小、代价过高或不再有用的变更。这些约束共同作用,使演化倾向于可复用的智能体机制,而非特定基准技巧或噪声。

跨基准测试的性能与效率

在横跨编码、智能体工作空间和工程设计任务的八项基准测试中,RRSI展现出兼顾性能与泛化的效果。在演化的分布上,其最高提升达14.1分;在五项分布外基准上,最高提升4.7分。同时,相较于未正则化的演化方式,RRSI生成的框架在运行时所需的策略令牌数量减少了30%,实现了效率优化。

为什么值得看

解决智能体框架自改进时泛化能力下降的痛点,在提升分布外性能的同时显著降低运行成本。

大模型智能体基准测试

信源1

  1. [1]arXiv cs.AI一手信源RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

关键事实

  • RRSI方法将正则化原则引入智能体框架的递归自改进过程,以解决过拟合问题。[1]

  • 提议者通过时间退火预算限制编辑捆绑数量并鼓励未探索轨迹,选择者通过评估器和修剪器移除无用变更。[1]

  • 在八项基准测试中,RRSI在演化分布上最高提升14.1分,在五项分布外基准上最高提升4.7分。[1]

  • RRSI生成的框架相比未正则化演化,策略令牌消耗减少30%。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。