EviRover:首个通过交互强化学习解决视觉感知的智能体
论文AI 评分 75/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
传统视觉感知常假设单次浏览即可解答查询,但在需细粒度细节或最新知识时易失效。研究提出“证据不足下的感知”概念,将其转化为可交互获取信息的智能体过程。为此构建两条数据生成管线产出EviRover-SFT-5K与EviRover-RL-12K,并建立含5类688实例的人工验证基准EviLens。基于此训练的EviRover是首个经监督微调与智能体强化学习显式训练的感知智能体。其4B版本在EviLens上较骨干模型平均提升30分,媲美先进专有模型,且增益泛化至WebEyes及BrowseComp-VL(提升15分)等常规与通用多模态基准。代码、模型与数据均已开源。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载感知范式转换与数据构建
传统视觉感知多基于单次浏览进行一次性预测,前提是图像内容与模型参数化知识足以解答查询。然而在依赖细粒度视觉细节或需密集及最新知识的真实场景中,该前提常不成立。研究将此类情况定义为“证据不足下的感知”,并把感知重构为可超越单次浏览获取信息的智能体过程。为填补该设定下的数据空白,研究设计了两条专属数据生成管线,分别产出用于训练的EviRover-SFT-5K与EviRover-RL-12K数据集,同时构建了涵盖五类感知场景、包含688个实例的人工验证基准EviLens。
模型训练与实验表现
基于上述数据,研究提出EviRover,据称是首个显式训练以通过交互解决感知查询的智能体。其训练流程为先进行监督微调,随后执行智能体强化学习。实验表明,参数量为4B的EviRover在EviLens基准上较其骨干模型平均提升30分,性能可比肩先进的专有模型。不仅如此,这种性能增益还能迁移至EviLens之外的场景,在WebEyes、常规感知基准及通用多模态基准上均展现效果,其中在BrowseComp-VL上取得了15分的提升。所有代码、模型及数据均已开源。
为什么值得看
突破单次预测局限,用交互与强化学习让小参数模型比肩专有模型,为复杂视觉感知提供新解法。
多模态智能体微调强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
