PhoneCLI将应用界面编译为可调用命令,提升移动智能体效率
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对移动GUI智能体依赖视觉语言模型(VLM)逐步截图操作导致的缓慢、高成本与脆弱性问题,PhoneCLI提出将应用界面导航离线编译为可调用命令的方案。该方案无需应用内部API、运行时插桩或模型训练,离线探索并提取目标应用的屏幕、交互元素及导航边构建语义地图,每个屏幕生成一条确定性重放命令。在线执行时,智能体选择命令并在亚秒级时间内零VLM成本确定执行;遇到开放交互或编译路径失败则回退至VLM解释器。在AndroidLab上,该方案提升了任务成功率并减少步骤与token消耗,迁移至AndroidWorld的M3A智能体也获得一致效率提升。其编译对象为应用导航而非单次运行,因此可服务于新任务。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载离线编译与命令生成
当前移动GUI智能体依赖感知-动作循环,每步需截图并调用视觉语言模型(VLM)生成动作,过程缓慢、昂贵且脆弱,而日常导航通常是静态、有序且重复的。PhoneCLI在离线阶段从外部探索目标应用,提取其屏幕、交互元素及导航边,将其蒸馏为语义标注的地图。基于此地图,每个屏幕生成一条确定性命令,即到达该屏幕的重放序列。此过程完全不需要应用内部API、运行时插桩或模型训练。
在线执行与VLM回退
在线阶段,智能体选择对应的编译命令,在执行前进行验证,随后以亚秒级时间确定执行,且VLM成本为零。对于开放性交互或编译路径失效的情况,系统会回退到内嵌的VLM解释器,此时等同于纯VLM智能体,因此编译机制只会带来帮助而不会产生负面影响。
评测表现与泛化能力
在AndroidLab评测中,PhoneCLI提升了任务成功率,同时减少了执行步骤与token消耗。将其迁移至AndroidWorld的官方M3A智能体时,也展现出一致的效率提升。关键在于,PhoneCLI编译的是应用本身的导航结构而非单次运行记录,这使得编译结果能够服务于新任务,而不仅限于重复执行的历史任务。
为什么值得看
将移动智能体高频导航离线编译为确定性命令,实现亚秒级零成本执行,显著降本增效。
智能体API
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
