研究指VLMs处理机器人故障易受提示干扰,应依准确率求助人类
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载机器人纠错决策基准构建
机器人在任务失败时面临三种纠错路径:依自身诊断行动、查询其他机载传感器或向人类求助。为评估何种路径最优,Eshika Pathak与Leela Krishna构建了模拟基准测试。该测试通过注入已知真实故障原因,并防范数据泄漏,来衡量各传感器对故障原因的揭示程度。结果显示,部分故障可由相机图像诊断,而另一些仅能从力传感数据诊断(力数据诊断得分达0.99,图像方法最高仅0.55)。
VLM表现受提示严重干扰
对六款开源视觉语言模型的测试揭示了其行为缺陷。模型行为高度追踪提示词表面而非证据本身:仅将拒绝选项从末位移至首位,就使三组模型及家族对的拒绝率从78-100%暴跌至0-6%。无论是否提供示例,基于图像帧的诊断准确率始终低于或等于多数类基线,且模型声明的自信度与正确性毫无关联。然而,当把力传感数据转化为十行文本提供给同一批模型时,六个模型中有四个首次实现了超越基线的诊断,这表明模型诊断失败主要归因于缺失传感器数据,而非缺乏推理能力。
求助决策应基于实测准确率
研究将纠错选择建模为三动作决策问题,其最优策略取决于测量的准确率。测试表明,模型并未遵循该最优策略,且其求助率完全无视提问成本四倍变化的影响。尽管如此,向人类提出一次问题即可将模型从基线水平提升至近似回答者自身的可靠度(求助时达0.70-0.81)。因此,研究结论强调,机器人决定是否向人类求助的判断依据,必须绑定实测准确率与既定成本,绝不能依赖模型自身输出的置信度。该研究已被IROS 2026人机对话机器人研讨会接收。
为什么值得看
揭示VLMs在机器人纠错中严重依赖提示且自信度失效,为构建基于实测准确率的人机交互决策提供实证。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
