AI 圈大事记

新长视频记忆框架GEB提升实体跨事件追踪与问答准确率

论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对长视频问答中同一物体跨事件关联易断裂的问题,研究团队提出GEB框架。该框架将同一物理实体在不同片段的视觉观测聚合为可检索的“传记”,保留各时刻上下文并建立身份链接,使模型能追踪实体跨事件演变。在四个涵盖数天录制时长的基准测试中,GEB在多选与开放式问答上均优于先前框架。在EgoLifeQA基准上,GEB准确率达72.0%,较此前最佳发表结果高出4.4个百分点。消融实验证实视觉身份关联与传记读取均对性能提升有贡献,仅增加额外描述无法完全恢复该增益。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

长视频实体追踪痛点

解答跨越数小时乃至数天的长视频问题时,常需关联同一物体参与的多个事件。然而仅依赖时序描述与文本提取实体,易导致物理身份悬而未决:不同物体可能具备相似描述,而同一物体在不同事件中的观测却相互割裂。仅检索相关事件无法复原问题所涉特定实体的完整演变轨迹,致使模型难以准确作答。

GEB框架核心机制

为解决上述身份割裂问题,研究引入GEB框架。该机制在记忆构建阶段,将同一物理实例在不同视频片段中的视觉观测进行分组,聚合为可检索的实体传记,同时保留各观测发生时刻的上下文信息。在问答阶段,系统同步检索实体传记与片段证据,使模型能借助记忆构建时确立的身份链接,沿事件脉络持续追踪特定实体。

评测表现与消融分析

在包含日级与周级录制时长的四个基准测试中,GEB在多选及开放式问答上均超越既有记忆框架。于EgoLifeQA基准上,GEB取得72.0%的准确率,较已发表最优结果高出4.4个百分点。消融实验进一步拆解增益来源,证实视觉身份关联与传记读取均对性能提升有实质贡献,而仅添加额外文本描述无法完全弥补缺失这两项机制带来的性能下降。

为什么值得看

解决长视频问答中实体跨时序身份断裂痛点,在EgoLifeQA上刷新SOTA,为超长视频理解提供新记忆构建范式。

基准测试

信源1 家

  1. [1]arXiv cs.AI一手信源Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies

关键事实

  • 提出GEB长视频记忆框架,将同一物理实例的视觉观测聚合为可检索传记并保留上下文[1]

  • 在EgoLifeQA基准上达到72.0%准确率,较此前最佳结果提升4.4个百分点[1]

  • 消融实验表明视觉身份关联与传记读取均贡献增益,单纯增加描述无法完全恢复[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。