DSSR方法减少LLM智能体写入时遗憾
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
长任务历史超出LLM上下文,智能体常改写短状态以替代,但丢弃的信息会造成损失。该研究将损失拆分为预算损失与写入时遗憾,发现提示驱动的LM写入器胜率仅17%,而128 token的理想状态近乎全胜,损失主因是写入时遗憾。提出的DSSR通过读者损失训练写入器,用前向滚动评分预测结果(ρ=0.48),在事实急需时成功率提升7.0点,达传统记忆提示水平,但随延迟增加增益消失。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载长上下文状态丢失与损失拆分
在长任务中,交互历史往往超出LLM智能体的上下文容量,即便未超出也难以可靠利用。现有方案让智能体携带短状态,每步由写入器改写、读取器据此行动。但写入器丢弃的信息若后续被需要则造成不可逆损失。研究将读取器损失拆分:任何同等大小状态必然产生的预算损失,以及源于写入器选择的写入时遗憾。在TextWorld烹饪游戏中,128 token的理想状态几乎赢下所有游戏,而提示驱动的LM写入器胜率至多17%,表明损失几乎全为写入时遗憾且随延迟增长。
DSSR训练与信用分配局限
为降低写入时遗憾,DSSR(决策充分状态表示)依据读取器自身损失训练写入器。它通过前向滚动评分评估候选状态,即读取器携带该状态继续行动的表现,该评分能预测游戏结果(ρ=0.48)。相比之下,事后方法常用的固定上下文评分无预测力(ρ≤0.07)。在预注册测试集上,DSSR让普通摘要写入器在事实急需时成功率提升7.0点,媲美传统记忆提示。然而,随着事实需求延迟增加,增益缩小且仅在极短延迟下显著。研究将此限制归因于信用分配:当下保留事实的收益取决于后续所有改写是否同样保留,单步评分无法捕捉此长程依赖。
为什么值得看
针对LLM智能体长上下文信息丢失痛点,提出量化损失框架及DSSR训练法,在短延迟场景有效提升状态记忆能力。
智能体
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
