可审计长记忆系统在LongMemEval-S测得479/500分
论文AI 评分 62/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
一种可审计长时记忆系统在LongMemEval-S基准上接受评测。其检索链采用混合候选检索、交叉编码器重排及覆盖优先包编译等确定性步骤,大模型仅作末级阅读器。在470道可答题中,462道生成完整金标包。搭配Claude Opus阅读器经两次500题测试,由GPT-4o判分得479与475分,与Chronos High已发布的478分互有高低,未确立优劣。换用grok-4.6-high阅读器得476/474分,而最大推理努力智能体变体则降至461/465分。官方评判机重评自身结果时亦出现 verdict 翻转,系统方差与评分提示词差异致结果难绝对比较。作者公开数据包与评判记录供复评。
为什么值得看
提供确定性检索链与可审计记忆架构,公开完整评判记录与控制组供复评,对解决大模型长记忆评测可复现性问题具参考价值。
GPTClaude大模型智能体
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
