MemPilot框架实现LLM代理按需多模态记忆编排
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有LLM代理记忆系统多采用查询无关方式构建,易产生无效开销并丢失关键细节。MemPilot框架通过强化学习优化多步LLM策略,在查询无关检索与委派异构模型处理原始多模态历史间迭代选择,按需编排记忆。该策略联合控制证据量、指令、模型选择与视觉访问,实现计算细粒度分配。配合目标优势解耦与基于前缀的边际效用估计,在五个多模态基准上取得优于基线的性能-成本-延迟权衡前沿。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载记忆构建痛点与按需编排
当前大语言模型代理的记忆系统通常以查询无关的方式构建,这会导致两方面问题:一是产生不必要的预处理开销,二是可能丢弃后续被证明至关重要的细节。尽管近期研究开始将记忆处理转向运行时适应,但往往局限于特定操作或固定处理方案,在性能、成本和延迟的灵活控制上存在不足。MemPilot框架旨在应对该挑战,通过按需记忆编排,在不同偏好下灵活协调性能、成本与延迟。
强化学习策略与细粒度控制
MemPilot的核心是利用强化学习优化一个多步LLM策略。该策略在每一步迭代中做出决策:是从查询无关的记忆中检索,还是将原始多模态历史的查询特定处理委派给异构的LLM和VLM。通过这种方式,策略能够联合控制四个维度:证据数量、处理指令、模型选择以及视觉访问权限,从而实现对运行时计算资源的细粒度分配。
多目标优化与实验验证
针对竞争性目标下的策略优化,MemPilot采用了目标优势解耦方法,在聚合前分别估计每个目标的优势。同时,引入基于前缀的边际效用估计,以在多步推演中实现细粒度的信用分配。在五个多模态代理记忆基准上的实验表明,该框架在不同优化偏好下均实现了有利的性能、成本与延迟权衡,偏好扫描产生了比现有权衡感知基线更广阔的前沿。
为什么值得看
解决LLM代理记忆构建的查询无关痛点,提供按需编排方案,实现性能与开销的细粒度灵活权衡。
多模态强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
