FORESIGHT架构让流式VLM免重训规划未来感知

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

现有流式视觉语言模型推理计算路径固定,无法随场景动态调整。FORESIGHT提出免重训的双流架构,利用孪生LLM共享权重与KV缓存,一者处理输入,另一者超前运行以预测未来上下文并规划计算,决定何时推理、检查什么及采样密度。在线执行通过轻量差分更新实现低开销动态适配。基于冻结的Qwen3-VL-8B,在OmniPro Online上达23.0均F1,超最强训练基线9.5%;在StreamingBench与OVO-Bench分别提升6.7与15.4,视频流中证据晚到时增益最大达18.7。代码将开源。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

流式VLM计算路径固定的局限

当前流式视觉语言模型在推理期间计算路径保持固定,无法适应不断演变的场景动态。不同未来事件需要不同级别与形式的感知,固定计算导致模型难以灵活应对变化。该研究揭示流式VLM本身具备预测近未来的能力,并利用此能力以免训练方式动态配置未来计算。实现该目标需克服三大挑战:未来预测须足够可靠以指导计算、规划须与流式推理并发运行、在线重配置开销须极低。

双流架构与在线重配置机制

为解决上述挑战,FORESIGHT采用双流架构,包含两个共享权重、输入编码器与KV缓存的孪生LLM。首个LLM持续处理输入词元,第二个则在流前运行,负责预测未来上下文、规划未来计算并生成任务响应,不中断流式推理。每个规划决定下次推理时机、检查内容与采样密度,将瞬态证据与持久控制分离。计算规划通过高效重配置协议在线执行,结合模式引导解码与轻量差分更新,实现低开销动态适配。

冻结骨干模型的评测表现

实验采用冻结的Qwen3-VL-8B作为骨干模型。在OmniPro Online评估中,取得23.0的平均联合F1,击败最强训练基线9.5%。在StreamingBench上提升6.7分,OVO-Bench提升15.4分。当视频流中证据较晚到达时,获得最大增益18.7分。该研究源代码将公开发布。

为什么值得看

免重训即让流式VLM动态规划计算,在晚到证据场景增益近19分,大幅提升在线推理效率与效果。

Qwen

信源1 家

  1. [1]arXiv cs.AI一手信源Foresight: planning future perception in streaming VLMs without retraining

关键事实

  • FORESIGHT是针对流式VLM的双流架构,无需重训即可动态规划未来计算。[1]

  • 架构包含两个共享权重、输入编码器与KV缓存的孪生LLM,分别处理输入流与超前预测规划。[1]

  • 基于冻结的Qwen3-VL-8B,在OmniPro Online评估达23.0均F1,超最强训练基线9.5%。[1]

  • 在StreamingBench提升6.7,OVO-Bench提升15.4,晚到证据场景增益最大为18.7。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。