Jev-Mobile解耦VLM规划与执行,降低手机GUI代理成本
论文AI 评分 72/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对现有手机GUI代理因视觉语言模型(VLM)同时负责规划与动作落地导致的高延迟与高成本问题,Jev-Mobile提出低频VLM规划与高频轻量执行的新范式。VLM设定局部目标,结合无障碍树构建可执行动作空间,由快速决策模型Jev反复选择动作。单次VLM决策可执行多步GUI操作。在AndroidWorld测试中,其任务成功率达79%(SeeAct-V为78%,逐步VLM基线为84%),但成功轨迹的平均端到端执行时间缩短32.7%,模型API成本降低73.4%。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载解耦规划与执行范式
当前基于视觉语言模型(VLM)的自主手机GUI代理,通常在几乎每步交互中都依赖VLM进行规划与动作落地,引发显著延迟及模型服务开销。Jev-Mobile改变了这一机制,转向低频VLM规划搭配高频轻量执行。具体而言,VLM仅负责设定局部目标,无障碍树提供结构化可执行动作空间,随后由快速类型化决策模型Jev在该空间内反复挑选动作。此设计允许单次VLM决策下执行多步GUI操作,从而减少昂贵的VLM推理频次,同时保留自适应交互能力。
性能与效率对比数据
在完整的AndroidWorld任务套件评测中,Jev-Mobile取得了79%的任务成功率。作为对比,SeeAct-V的成功率为78%,逐步VLM基线为84%。尽管任务成功率略低于逐步VLM基线,但在成功轨迹中,Jev-Mobile的平均端到端执行时间缩减了32.7%,平均模型API成本大幅下降73.4%。这表明将高层VLM推理与低层动作执行分离,能在维持具备竞争力的任务表现的同时,实质性提升手机GUI代理的运行效率。
为什么值得看
大幅削减手机GUI代理的执行耗时与API开销,同时保持任务成功率基本不降,对移动端自动化降本增效极具参考价值。
API
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
