RRSI方法解决智能体框架递归自改进过拟合问题
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对大模型智能体框架在递归自改进中易对训练任务过拟合、导致分布外性能下降的问题,RRSI方法将正则化引入该过程。其提议者采用随时间退火的预算限制编辑数量并鼓励探索未知轨迹;选择者通过评估器筛选特定基准提议,用修剪器移除微小、昂贵或失效的变更。这些约束促使框架演化出可复用机制而非特定技巧。在八项涵盖编码与工程设计的基准测试中,该方法在演化分布上最高提升14.1分,在五项分布外基准上最高提升4.7分,且生成的框架策略令牌消耗减少30%。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载框架自改进的过拟合困境
大语言模型智能体的能力很大程度上由其框架(即围绕固定骨干模型的提示、控制流、工具、内存及上下文管理)放大。近期方法通过迭代提议和选择框架的组件编辑来实现自动化,实质上在智能体系统层面建立了递归自改进。然而,这种递归演化容易因记忆训练任务而过拟合,在分布内基准上取得大幅增益,但在分布外基准上增益缩小甚至消失。
正则化约束的提议与选择
RRSI通过约束演化的候选提议与选择,将正则化原则融入框架自改进。在提议阶段,提议者采用随时间退火的预算,限制候选能捆绑的编辑数量,并基于演化历史鼓励探索未涉足的轨迹。在选择阶段,选择器配备评估器和修剪器:评估器审查针对特定基准的提议,修剪器则移除幅度过小、代价过高或不再有用的变更。这些约束共同作用,使演化倾向于可复用的智能体机制,而非特定基准技巧或噪声。
跨基准测试的性能与效率
在横跨编码、智能体工作空间和工程设计任务的八项基准测试中,RRSI展现出兼顾性能与泛化的效果。在演化的分布上,其最高提升达14.1分;在五项分布外基准上,最高提升4.7分。同时,相较于未正则化的演化方式,RRSI生成的框架在运行时所需的策略令牌数量减少了30%,实现了效率优化。
为什么值得看
解决智能体框架自改进时泛化能力下降的痛点,在提升分布外性能的同时显著降低运行成本。
大模型智能体基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
