DolphinBench发布:评估智能体记忆的帕累托前沿
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
DolphinBench是一个新的智能体记忆评测基准,通过任务完成情况而非对话问答来直接评估记忆能力。该基准包含3个知识工作者角色,每人约50万token的用户消息历史,并为每个角色设计了200项任务。所有任务均经过验证:有相关历史时成功,无则失败。评测要求同时上报准确率、总成本和延迟,以全面评估记忆系统在效果与开销间的权衡,填补了现有基准的空白。数据集与代码已公开。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载现有记忆基准的局限
当前多数智能体记忆评测基于对话问答构建,问题本身往往已暗示需检索的信息,无法真实反映智能体在执行实际任务时对长时记忆与上下文召回的依赖。此外,这些基准通常仅关注准确率,允许记忆系统以不合理的成本或时间开销来换取高分,忽略了实际应用中对资源消耗和响应速度的约束。
任务设计与验证机制
DolphinBench围绕3个知识工作者角色构建,每个角色积累了约50万token的用户消息历史,并据此设计了200项依赖该历史信息的任务。为确保任务确实考察记忆能力,每项任务均经过严格验证:配备相关历史记录的智能体必须成功完成,而缺乏该历史的智能体必须失败。这种对照验证排除了无需记忆即可完成的无效任务。
多维综合评估指标
与仅衡量准确率的传统方法不同,DolphinBench要求所有评测必须同时报告总成本和延迟。通过综合这三项指标,该基准能够描绘出智能体记忆系统的帕累托前沿,从而全面评估系统在效果、开销与速度之间的权衡表现。目前尚无其他记忆基准同时结合这三项指标,数据集与评测代码现已公开。
为什么值得看
填补智能体长时记忆评测空白,强制考量准确率、成本与延迟的权衡,对构建实用化Agent至关重要。
智能体数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
