DSV-Mem基准发布,评估MLLM代理专业工作流多模态记忆
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对多模态大语言模型代理在专业工作流中的记忆能力,研究提出DSV-Mem基准。现有评测多关注日常非正式交互,而专业场景涉及高信息密度产物的频繁修订与状态追踪。该基准包含专家审核场景及横跨当前状态、历史状态、派生状态、变更历史、冲突/拒绝五类共一千个问题。对涵盖前沿与开源模型及记忆管理方法的27种配置评测显示,最强基线得分不足45%。分析表明,状态演进(尤其是更新次数)是主要难点,而非上下文长度、OCR或算术;模型常未验证用户前提便作答;状态感知设计比增加推理努力或常规记忆管理更有效。代码与基准将公开。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载专业工作流记忆评测痛点
当前针对对话式多模态大语言模型代理的评测基准主要聚焦于日常非正式交互与个人生活场景,依赖自然图像、孤立静态产物及面向回忆的提问。然而,专业工作流(如AI研究、工程设计、产品管理)通常涉及结构化且信息密集的产物,这些产物会经历频繁修订与权限更新,且组合式查询要求在精确追踪状态的同时协调多个产物版本。现有基准无法有效评估模型在此类专业场景下的记忆与状态追踪能力。
DSV-Mem基准构成与生成
为填补上述空白,研究提出DSV-Mem基准,用于评估密集有状态视觉记忆。该基准包含经专家审核的场景与一千个问题,覆盖当前状态、历史状态、派生状态、变更历史及冲突/拒绝五个面向用户的类别。基准采用受Hartley启发的准则,倾向于选择需要更广泛视觉证据检查的问题。此外,研究引入了一种生成线束,通过将状态转移合成与对话填充解耦来生成评测套件,基准与代码将公开发布。
评测结果与核心发现
对涵盖前沿与开源模型及记忆管理方法的27种配置进行评测,结果显示最强基线得分低于45%。分析得出三项发现:首先,多模态与信息密度均增加难度,但状态演进(尤其是主导更新的数量)是主要测试因素,原始对话长度、OCR与算术并非主要瓶颈;其次,模型在回答前常未能针对先前状态更新验证用户前提;最后,增加推理努力与常规记忆管理方法收益有限,而状态感知设计证明更为有效。
为什么值得看
揭示当前最强MLLM在专业多模态状态追踪上准确率不足45%,指明状态感知设计是突破关键。
多模态上下文长度开源模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
