新方法RV-ICL让机器人从视频递归学习,无需训练即提升成功率

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对大模型智能体调度冻结VLA策略时,文本记忆缺失操作细节、完整视频拖慢推理、固定关键帧丢失抓取细节的痛点,提出免训练的递归视频上下文学习方法(RV-ICL)。该方法将演示视频按抓取等子事件构建为层级结构供智能体导航,规划前读粗粒度层级,执行遇细节需求时重入并仅加载当前子目标片段。每任务仅需一条演示。在RPent基础上,LIBERO-PRO成功率从92.6%升至96.5%,LIBERO-Plus从86.7%升至95.8%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

视频上下文痛点与方案

大语言模型智能体在调度冻结的视觉-语言-动作策略时,常通过文本记忆跨回合改进,但文本仅记录做过什么,缺失任务具体操作方式。直接用演示视频作上下文存在三大缺陷:完整视频每轮拖慢推理速度;固定关键帧会丢失决定抓取成败的接触细节;且智能体在规划阶段需要任务结构,执行时又转为关注接触点附近帧,需求随阶段变动。为此,研究者提出免训练的递归视频上下文学习方法,将演示转为智能体可导航的层级结构,而非直接接收的提示。

层级构建与按需加载

该方法基于演示的子事件(如抓取与释放)构建层级,层级从整个任务的关键帧逐步细化至阶段、时刻和极短片,并通过只读工具对外暴露。智能体在规划前读取粗粒度层级以把握全局结构;在执行过程中,一旦某步骤需要更多细节,便重新进入该层级,且仅加载当前子目标对应的极短片。这种方式使每项任务仅需一条演示即可完成指导,兼顾了全局结构与局部接触细节的获取,同时避免了完整视频输入带来的推理延迟。

基准测试表现

基于RPent基准,RV-ICL在两个测试集上取得了显著提升。在LIBERO-PRO上,成功率由原先的92.6%提升至96.5%;在LIBERO-Plus上,成功率由86.7%大幅跃升至95.8%。这表明该递归视频导航机制有效弥补了纯文本记忆的细节缺失与固定关键帧的信息丢失,在无需额外训练的条件下显著增强了智能体处理复杂操作任务的能力。

为什么值得看

免训练即可利用视频细节指导机器人执行,显著提升长程任务成功率,对具身智能体记忆与规划机制有直接参考价值。

大模型智能体

信源1 家

  1. [1]arXiv cs.AI一手信源Recursive Video In-Context Learning for Agentic Robot

关键事实

  • RV-ICL是一种免训练方法,将演示视频转化为智能体可导航的层级结构而非直接输入的提示[1]

  • 该层级按子事件构建,从任务关键帧到阶段、时刻和短片逐层细化,通过只读工具暴露[1]

  • 智能体规划前读取粗层级,执行中按需重入层级并仅加载当前子目标的短片[1]

  • 在LIBERO-PRO上成功率从92.6%升至96.5%,在LIBERO-Plus上从86.7%升至95.8%[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。