可审计长记忆系统在LongMemEval-S测得479/500分

论文AI 评分 62/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

一种可审计长时记忆系统在LongMemEval-S基准上接受评测。其检索链采用混合候选检索、交叉编码器重排及覆盖优先包编译等确定性步骤,大模型仅作末级阅读器。在470道可答题中,462道生成完整金标包。搭配Claude Opus阅读器经两次500题测试,由GPT-4o判分得479与475分,与Chronos High已发布的478分互有高低,未确立优劣。换用grok-4.6-high阅读器得476/474分,而最大推理努力智能体变体则降至461/465分。官方评判机重评自身结果时亦出现 verdict 翻转,系统方差与评分提示词差异致结果难绝对比较。作者公开数据包与评判记录供复评。

为什么值得看

提供确定性检索链与可审计记忆架构,公开完整评判记录与控制组供复评,对解决大模型长记忆评测可复现性问题具参考价值。

GPTClaude大模型智能体

信源1 家

  1. [1]arXiv cs.AI一手信源Auditable Long-Term Memory: A Deterministic Retrieval Chain Measured at 479/475 of 500 on LongMemEval-S

关键事实

  • 可审计长时记忆系统在LongMemEval-S基准上使用Claude Opus阅读器测得479/500和475/500分[1]

  • 系统检索链采用混合候选检索、交叉编码器重排、覆盖优先包编译及确定性推理脚手架,大模型仅作为可替换末级阅读器[1]

  • 换用grok-4.6-high阅读器得476/474分,最大推理努力智能体变体降至461/465分[1]

  • 作者公开了物化数据包、阅读器输出、评判结果及控制组供检查与重新评分[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。