UserProxyBench提出用户保真度指标,揭示模拟用户违规致Agent交…
论文AI 评分 68/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对交互式Agent评测仅打分Agent而忽视模拟用户角色执行度的问题,UserProxyBench在tau-bench上构建评测层并提出用户保真度得分(UFS)。固定GPT-5.5为Agent、仅变换用户代理时,375项企业任务的平均奖励波动15.2分;24.4%的成功回合存在用户规范违背。主要失效为过早披露信息,虽不损奖励却使Agent平均少调1.06次工具,致评测交互失真。研究还给出七款代理的成本-保真度前沿,助选最低成本模拟器。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载评测盲区与UFS指标
当前交互式Agent基准与多轮强化学习常让第二个大模型扮演用户,该模拟用户掌控Agent接收信息的时机与内容。然而现有基准仅对Agent打分,未直接衡量用户是否正确执行了其被分配的角色。为填补此空白,UserProxyBench在tau-bench系列上构建了评测层,并引入用户保真度得分(UFS)。UFS利用基于任务的评分标准,独立于Agent成功与否来衡量用户对基准私有指令的遵循情况。
用户违规致交互失真
实验将Agent固定为GPT-5.5,仅在375项企业任务中变换用户代理,发现平均任务奖励波动达15.2分,且24.4%的成功回合存在用户规范违背。最主要的失效模式是过早披露信息,即用户在未被请求前就提供信息。这种行为对任务奖励影响微弱,但在成功回合中会导致Agent平均少调用1.06次工具。这意味着被评测的交互实质已发生改变,但奖励分数却未受影响,掩盖了评测中的交互失真问题。
成本与保真度权衡
研究进一步跨七款用户代理识别出一条经验性的成本-保真度前沿。该前沿使从业者能够选择满足特定保真度水平要求的最低成本模拟器,为在Agent评测与训练中平衡模拟用户的质量与开销提供了实证依据。该论文已被NeurIPS 2026的AABA4ET研讨会接收。
为什么值得看
揭示Agent评测中模拟用户违规会掩盖交互失真,提供量化用户保真度与成本权衡的新工具。
GPT
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
