CLIFT方法通过保形自验证实现Web智能体训练与测试时扩展
论文AI 评分 78/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
开源Web智能体用强化学习训练时,常面临二元成功信号稀疏或调用前沿模型评判代价高昂的困境。CLIFT引入保形自验证机制解决此问题。训练阶段,智能体回答关于自身轨迹的自然语言验证问题,组合保形认证器保留与训练评判一致的信号,赋予带符号信任权重并融入步级奖励且不削弱基线。测试阶段,冻结已认证问题库作为结构化证据用于保形轨迹选择,智能体采样贪心及多样重试轨迹,自验证器总结后由保守多数投票决定是否替换当前轨迹,全程无需外部评判。在WebArena Infinity上达到开源最优;VisualWebArena上开源训练的库零样本迁移至GPT-5.5亦达最优;Online Mind2Web上零样本评测提升实网智能体表现。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载训练阶段保形自验证
开源Web智能体强化学习训练常受限于二元任务成功信号过于稀疏,而调用前沿语言模型作为评判又成本过高且部署时不可用。CLIFT在训练时让智能体对自身执行轨迹回答自然语言验证问题。组合保形认证器仅保留那些URL条件证据与训练时评判相一致的信号,通过极性感知提升分配带符号的信任权重,并将所得验证分数融入每步奖励中,该融合方式确保不会削减评判基线。
测试阶段免评判扩展
在测试阶段,训练所得的认证问题库被冻结,作为结构化证据供保形轨迹选择使用。智能体采样一条贪心轨迹与多条多样重试轨迹,自验证器对每条URL轨迹进行总结,随后保守多数投票规则决定是否用重试轨迹替换当前保留轨迹,整个过程无需调用任何外部评判模型,实现了测试时的扩展。
三基准评测表现
该单一机制支持三种设定并取得显著效果。在WebArena Infinity上,CLIFT达成开源Web智能体最优性能。在VisualWebArena上,使用开源模型训练的验证库在测试时迁移至GPT-5.5,在标准测试框架下同样达到最优。在Online Mind2Web上,无需专门针对该基准训练智能体,仅通过翻译认证问题库即可在零样本评测中提升实网智能体表现。
为什么值得看
将昂贵的外部评判反馈转化为可复用的训练信号与免评判的测试扩展信号,显著降低Web智能体强化学习成本。
GPT智能体强化学习开源模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
