AI 圈大事记

SCoRE提出显式视觉证据选择与整合方法

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

SCoRE 是一个统一的智能体循环框架,旨在解决视觉检索增强生成中证据稀疏分散及现有方法依赖原始轨迹导致噪声的问题。该框架在探索阶段仅保留查询相关的观测记录与来源指针,维持视觉上下文边界;终止时重新加载原始图像并将视觉证据整合为逻辑序列。训练范式结合了冷启动轨迹蒸馏与证据感知强化学习,以优化证据覆盖、整合紧凑性及答案正确性。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

解决视觉证据利用难题

视觉检索增强生成(VRAG)通过检索相关页面图像作为视觉证据来回答关于视觉丰富文档的查询。然而,这一过程面临两大挑战:一是与答案相关的证据通常较为稀疏,可能集中在某一页的小区域或分散在多个页面;二是现有的智能体方法往往基于原始探索轨迹或压缩的文本记忆生成答案,而非基于显式组织的支持图像集。这使得答案容易受到探索噪声的影响,并掩盖了基于证据的推理痕迹。

SCoRE 框架机制

研究提出的 SCoRE 框架是一个统一的智能体循环,专注于显式的证据选择与整合。在探索过程中,SCoRE 仅在维护的文本账本中保留与查询相关的观测结果及其来源指针,既保留了早期证据,又保持了视觉上下文的边界。当探索终止时,系统会重新加载引用的原始图像,并对用于回答的视觉证据进行整合,将其排列成逻辑序列。这种机制将最终推理与探索性的试错解耦,并通过索引化的主张与图像链接确保了严格的视觉基础。

训练范式与优化目标

为了实现这种统一流程的端到端优化,研究采用了结合过滤后的冷启动轨迹蒸馏与证据感知强化学习的训练范式。强化学习的奖励机制旨在促进证据的覆盖范围、整合的紧凑性以及答案的正确性。这种方法旨在解决证据发现、保存和组织方面的瓶颈,确保模型在处理复杂视觉文档时能够更准确地定位和利用关键信息。

为什么值得看

解决了视觉文档问答中证据利用效率低与推理噪声问题,提升了答案的可信度。

智能体强化学习蒸馏

信源1

  1. [1]arXiv cs.AI一手信源Navigating Sparse Evidence: Agentic Visual RAG via Explicit Context Selection and Consolidation

关键事实

  • SCoRE 通过显式证据选择与整合,解决视觉文档中答案相关证据稀疏及分散的挑战。[1]

  • 探索阶段保留查询相关观测与来源指针,终止时重载图像并整合为逻辑序列。[1]

  • 训练结合冷启动轨迹蒸馏与证据感知强化学习,奖励覆盖、紧凑性与正确性。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。