AI 圈大事记

研究指VLMs处理机器人故障易受提示干扰,应依准确率求助人类

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

Eshika Pathak等人构建模拟基准测试,探究机器人任务失败时的纠错决策。测试发现,六款开源视觉语言模型(VLM)的行为高度受提示词表面形式影响,仅调整选项顺序便使拒绝率从78-100%骤降至0-6%。基于图像的诊断准确率未超多数类基线,模型自信度与正确性无关。将力传感数据以文本输入后,四个模型首超基线,表明瓶颈在缺传感器数据而非能力。模型未遵循最优策略且忽视四倍提问成本变化,但单次人类求助可将准确率提至0.70-0.81。结论指出,求助决策应基于实测准确率与成本,非模型自信度。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

机器人纠错决策基准构建

机器人在任务失败时面临三种纠错路径:依自身诊断行动、查询其他机载传感器或向人类求助。为评估何种路径最优,Eshika Pathak与Leela Krishna构建了模拟基准测试。该测试通过注入已知真实故障原因,并防范数据泄漏,来衡量各传感器对故障原因的揭示程度。结果显示,部分故障可由相机图像诊断,而另一些仅能从力传感数据诊断(力数据诊断得分达0.99,图像方法最高仅0.55)。

VLM表现受提示严重干扰

对六款开源视觉语言模型的测试揭示了其行为缺陷。模型行为高度追踪提示词表面而非证据本身:仅将拒绝选项从末位移至首位,就使三组模型及家族对的拒绝率从78-100%暴跌至0-6%。无论是否提供示例,基于图像帧的诊断准确率始终低于或等于多数类基线,且模型声明的自信度与正确性毫无关联。然而,当把力传感数据转化为十行文本提供给同一批模型时,六个模型中有四个首次实现了超越基线的诊断,这表明模型诊断失败主要归因于缺失传感器数据,而非缺乏推理能力。

求助决策应基于实测准确率

研究将纠错选择建模为三动作决策问题,其最优策略取决于测量的准确率。测试表明,模型并未遵循该最优策略,且其求助率完全无视提问成本四倍变化的影响。尽管如此,向人类提出一次问题即可将模型从基线水平提升至近似回答者自身的可靠度(求助时达0.70-0.81)。因此,研究结论强调,机器人决定是否向人类求助的判断依据,必须绑定实测准确率与既定成本,绝不能依赖模型自身输出的置信度。该研究已被IROS 2026人机对话机器人研讨会接收。

为什么值得看

揭示VLMs在机器人纠错中严重依赖提示且自信度失效,为构建基于实测准确率的人机交互决策提供实证。

基准测试

信源1

  1. [1]arXiv cs.AI一手信源When Should a Failing Robot Ask? Initiating Corrective Human-Robot Dialogue from Audited Sensor Evidence

关键事实

  • 六款开源VLM的拒绝率因选项顺序调整,从78-100%骤降至0-6%[1]

  • VLM基于图像的诊断准确率未超多数类基线,其自信度不包含正确性信息[1]

  • 将力传感数据以十行文本输入,四个VLM首次实现超基线诊断[1]

  • 单次人类求助可将模型诊断准确率提升至0.70-0.81[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。