MemPilot框架实现LLM代理按需多模态记忆编排

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

现有LLM代理记忆系统多采用查询无关方式构建,易产生无效开销并丢失关键细节。MemPilot框架通过强化学习优化多步LLM策略,在查询无关检索与委派异构模型处理原始多模态历史间迭代选择,按需编排记忆。该策略联合控制证据量、指令、模型选择与视觉访问,实现计算细粒度分配。配合目标优势解耦与基于前缀的边际效用估计,在五个多模态基准上取得优于基线的性能-成本-延迟权衡前沿。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

记忆构建痛点与按需编排

当前大语言模型代理的记忆系统通常以查询无关的方式构建,这会导致两方面问题:一是产生不必要的预处理开销,二是可能丢弃后续被证明至关重要的细节。尽管近期研究开始将记忆处理转向运行时适应,但往往局限于特定操作或固定处理方案,在性能、成本和延迟的灵活控制上存在不足。MemPilot框架旨在应对该挑战,通过按需记忆编排,在不同偏好下灵活协调性能、成本与延迟。

强化学习策略与细粒度控制

MemPilot的核心是利用强化学习优化一个多步LLM策略。该策略在每一步迭代中做出决策:是从查询无关的记忆中检索,还是将原始多模态历史的查询特定处理委派给异构的LLM和VLM。通过这种方式,策略能够联合控制四个维度:证据数量、处理指令、模型选择以及视觉访问权限,从而实现对运行时计算资源的细粒度分配。

多目标优化与实验验证

针对竞争性目标下的策略优化,MemPilot采用了目标优势解耦方法,在聚合前分别估计每个目标的优势。同时,引入基于前缀的边际效用估计,以在多步推演中实现细粒度的信用分配。在五个多模态代理记忆基准上的实验表明,该框架在不同优化偏好下均实现了有利的性能、成本与延迟权衡,偏好扫描产生了比现有权衡感知基线更广阔的前沿。

为什么值得看

解决LLM代理记忆构建的查询无关痛点,提供按需编排方案,实现性能与开销的细粒度灵活权衡。

多模态强化学习

信源1 家

  1. [1]arXiv cs.AI一手信源MemPilot: Orchestrating On-Demand Multimodal Memory Curation for LLM Agents

关键事实

  • MemPilot通过强化学习优化多步LLM策略,在查询无关记忆检索与查询特定多模态历史处理间迭代选择。[1]

  • 该策略联合控制证据量、处理指令、模型选择及视觉访问,实现运行时计算的细粒度分配。[1]

  • 采用目标优势解耦分别估计各目标优势,并引入基于前缀的边际效用估计进行细粒度信用分配。[1]

  • 在五个多模态代理记忆基准上,展现出优于现有基线的性能-成本-延迟权衡前沿。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。