VLM-in-Sandbox框架实现无训练视觉推理与状态管理
论文AI 评分 68/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
Hexiong Yang等人提出VLM-in-Sandbox,一种无需训练的智能体多模态推理框架。该框架通过视觉工作区将视觉证据生成与管理分离,利用图像账本记录中间产物,维持有界的活跃视觉上下文,并允许模型显式提升选定证据供后续检查。在7个基准与4个基础VLM上,其样本加权平均准确率最高。1260例编译匹配研究显示,该方法达66.27%准确率,且比全保留对照组少用18.6%的token。在6350个GPT-4.1-mini提交例中,相对追加模式产生302次挽救与142次退化。本地vLLM研究证实其减少了未缓存token、首token时间及端到端延迟。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载视觉证据状态管理机制
沙盒计算机环境支持语言模型使用工具与持久文件进行多步推理,但扩展至视觉语言模型时面临状态管理难题。视觉推理会产生裁剪、掩码、叠加、缩放区域及分析渲染等中间图像证据,这些证据需保持可寻址且不能在多模态上下文中无限累积。VLM-in-Sandbox框架通过视觉工作区解决此问题,将图像产物注册至图像账本,维持有界的活跃视觉上下文,并允许模型显式提升选定证据供后续检查,从而分离沙盒工具执行的视觉证据生成与视觉证据管理。
准确率与Token消耗对比
在7个基准测试与4个基础VLM上,VLM-in-Sandbox在原始VLM、追加沙盒及该方法三者中取得最高样本加权平均准确率。一项包含1260例的编译匹配研究进一步区分了模型导向可见性与有界保留:VLM-in-Sandbox达到66.27%准确率,同时比自动全保留对照组减少18.6%的总token消耗。在全部6350个提交的GPT-4.1-mini示例中,相较于原始追加模式,该方法产生302次挽救与142次退化。
推理延迟与负载优化
本地vLLM研究与前缀缓存实验确认,由于VLM-in-Sandbox产生了更小的请求工作负载,其有效减少了未缓存token数量、首token时间以及端到端延迟。这些结果表明,显式视觉证据状态是沙盒VLM智能体的核心抽象,能够在不进行额外训练的前提下,通过有效管理视觉上下文边界,兼顾推理准确率与计算资源消耗。
为什么值得看
解决沙盒VLM视觉证据无限累积问题,以更少token实现更高准确率与更低延迟。
GPT多模态智能体
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
