AI 圈大事记

VLM-in-Sandbox框架实现无训练视觉推理与状态管理

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

Hexiong Yang等人提出VLM-in-Sandbox,一种无需训练的智能体多模态推理框架。该框架通过视觉工作区将视觉证据生成与管理分离,利用图像账本记录中间产物,维持有界的活跃视觉上下文,并允许模型显式提升选定证据供后续检查。在7个基准与4个基础VLM上,其样本加权平均准确率最高。1260例编译匹配研究显示,该方法达66.27%准确率,且比全保留对照组少用18.6%的token。在6350个GPT-4.1-mini提交例中,相对追加模式产生302次挽救与142次退化。本地vLLM研究证实其减少了未缓存token、首token时间及端到端延迟。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

视觉证据状态管理机制

沙盒计算机环境支持语言模型使用工具与持久文件进行多步推理,但扩展至视觉语言模型时面临状态管理难题。视觉推理会产生裁剪、掩码、叠加、缩放区域及分析渲染等中间图像证据,这些证据需保持可寻址且不能在多模态上下文中无限累积。VLM-in-Sandbox框架通过视觉工作区解决此问题,将图像产物注册至图像账本,维持有界的活跃视觉上下文,并允许模型显式提升选定证据供后续检查,从而分离沙盒工具执行的视觉证据生成与视觉证据管理。

准确率与Token消耗对比

在7个基准测试与4个基础VLM上,VLM-in-Sandbox在原始VLM、追加沙盒及该方法三者中取得最高样本加权平均准确率。一项包含1260例的编译匹配研究进一步区分了模型导向可见性与有界保留:VLM-in-Sandbox达到66.27%准确率,同时比自动全保留对照组减少18.6%的总token消耗。在全部6350个提交的GPT-4.1-mini示例中,相较于原始追加模式,该方法产生302次挽救与142次退化。

推理延迟与负载优化

本地vLLM研究与前缀缓存实验确认,由于VLM-in-Sandbox产生了更小的请求工作负载,其有效减少了未缓存token数量、首token时间以及端到端延迟。这些结果表明,显式视觉证据状态是沙盒VLM智能体的核心抽象,能够在不进行额外训练的前提下,通过有效管理视觉上下文边界,兼顾推理准确率与计算资源消耗。

为什么值得看

解决沙盒VLM视觉证据无限累积问题,以更少token实现更高准确率与更低延迟。

GPT多模态智能体

信源1

  1. [1]arXiv cs.AI一手信源VLM-in-Sandbox: Visual Workspaces for Agentic Visual Reasoning

关键事实

  • VLM-in-Sandbox是一种无需训练的智能体多模态推理框架,引入视觉工作区分离视觉证据生成与管理。[1]

  • 在1260例编译匹配研究中,该方法达66.27%准确率,比全保留对照组少用18.6%的token。[1]

  • 在6350个GPT-4.1-mini提交例中,相对追加模式产生302次挽救与142次退化。[1]

  • 本地vLLM研究证实,较小的请求工作负载减少了未缓存token、首token时间及端到端延迟。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。