AI 圈大事记

MemBodied为视觉语言动作模型引入固定大小情景记忆

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

针对视觉语言动作模型在依赖历史的操作任务中无法有效利用过往观测且上下文膨胀的问题,研究提出MemBodied机制。该机制包含记录交互的关联状态与保留初始场景的情节锚点,以固定大小记忆替代直接使用历史观测。在RMBench的五项任务中,其平均成功率是无状态策略的7.81倍、普通循环记忆的2.98倍,且以十分之一的新增参数量超越最强记忆基线1.3倍。在LIBERO-Long测试集上达到90.6%成功率,较无状态π0策略提升5.4%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

VLA模型记忆瓶颈

视觉语言动作模型虽为通用机器人控制提供了坚实基础,但多数策略无法在当前观测之外保留并利用情节级信息。在依赖历史的操控任务中,关键信息往往仅存在于过往观测中。若直接在上下文中保留历史观测以恢复信息,会导致上下文持续膨胀并增加推理延迟,严重影响模型实际部署效率。

双组件固定大小记忆

为解决上述问题,研究提出MemBodied机制,构建固定大小的情景记忆。该记忆包含两个互补组件:关联状态负责记录跨策略调用的交互信息,情节锚点则保留初始场景的紧凑表征作为参考。每次策略调用时,模型依据当前输入与这两个记忆组件生成动作,从而避免直接处理不断增长的历史观测序列。

评测表现与参数效率

在需记忆的RMBench五项任务评测中,MemBodied平均成功率分别达到无状态策略的7.81倍与普通循环记忆的2.98倍。对比最强记忆增强基线,其性能领先1.3倍,且新增参数量仅为后者的十分之一。在全观测LIBERO-Long套件上,该方法取得90.6%的成功率,较无状态π0策略提升5.4%,证实了其作为扩展策略上下文实用替代方案的价值。

为什么值得看

以极低参数开销解决VLA模型历史信息利用难题,为依赖历史的机器人操控提供高效记忆替代方案。

信源1

  1. [1]arXiv cs.AI一手信源MemBodied: Recurrent Associative Memory for Vision-Language-Action Models

关键事实

  • MemBodied包含关联状态与情节锚点两个互补组件,以固定大小情景记忆替代直接使用过往观测[1]

  • 在RMBench五项任务中,平均成功率是无状态策略的7.81倍、普通循环记忆的2.98倍[1]

  • 以十分之一的新增参数量超越最强记忆增强基线1.3倍[1]

  • 在LIBERO-Long测试集上达到90.6%成功率,较无状态π0策略提升5.4%[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。