研究提出RePAIR方法提升移动GUI智能体跨用户可靠性

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

移动GUI智能体在个性化界面下可靠性不足。研究提出PAIR管线构建用户条件化应用状态以供评估,并引入RePAIR训练法,利用跨用户子目标差异进行学习。测试6个智能体发现,用户条件化UI下子目标达成率下降6.98至15.4个百分点,涉及用户自身内容时降幅扩至8.77至22.0个百分点,常误选非目标项。RePAIR在未见用户上较SFT基线提升用户条件化SAR 5.87pp、全成功指标7.50pp、整体任务SR 9.42pp。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

个性化UI致智能体性能下降

移动图形用户界面智能体常在受用户历史与偏好影响的界面上运作,但其跨用户可靠性缺乏探究。研究对六种智能体开展评估,发现当处于用户条件化的界面上下文时,子目标达成率出现显著下滑,降幅介于6.98至15.4个百分点之间。若任务目标源自用户自身内容,该性能落差进一步扩大至8.77至22.0个百分点。失败情形多表现为在目标曝光前误选其他项目。

PAIR管线与RePAIR训练法

为开展可控评估,研究提出PAIR管线,用于构建用户条件化的应用状态,使同一任务能在不同用户条件下进行测试。为解决上述性能衰减,又引入RePAIR训练机制。该方法基于强化学习,通过感知个性化的交互奖励,从跨用户的子目标结果差异中学习,旨在增强智能体在用户条件化移动环境中的可靠性。

RePAIR跨用户泛化效果

在未见过的用户测试集上,RePAIR相较于其监督微调母模型取得了全面提升。具体而言,用户条件化步动作成功率提高5.87个百分点,全成功指标上升7.50个百分点,整体任务成功率增加9.42个百分点。这初步证实了显式学习跨用户变异能够有效改善图形界面智能体面对个性化界面时的可靠性。

为什么值得看

揭示个性化UI对GUI智能体成功率的具体影响幅度,并提供有效提升跨用户鲁棒性的训练方案。

智能体

信源1 家

  1. [1]arXiv cs.AI一手信源Can Agents Work for Everyone? Cross-User Reliability for Mobile GUI Agents in Personalized User Interfaces

关键事实

  • 提出PAIR管线构建用户条件化应用状态,以及RePAIR训练方法学习跨用户差异[1]

  • 6个智能体在用户条件化UI下子目标达成率下降6.98至15.4pp,涉及个人内容时降8.77至22.0pp[1]

  • RePAIR较SFT基线在未见用户上提升条件化SAR 5.87pp、全成功7.50pp、任务SR 9.42pp[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。