研究揭示滚动Agent中KV缓存复用受请求顺序影响
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对长运行Agent滚动更新破坏前缀缓存的问题,该研究指出选择性重算的非前缀KV缓存复用存在历史依赖性:相同提示会因前置请求不同而产生不同结果。在5%重算预算下,文档对齐重算将跨请求顺序的答案变异率从CacheBlend的token top-k策略的69.0%降至26.1%。面对不同前置请求序列,文档对齐重算对全量预填充的保真度较token top-k提升34.5至52.5个百分点,两者均获约5.7倍中位TTFT加速。消融实验表明连续性是稳健重算的主因。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载缓存复用的历史依赖风险
长运行Agent在反复调用大模型时,会保留大部分文档窗口,驱逐旧文档并追加新文档。这种滚动更新使得精确前缀缓存失效,促使非前缀KV缓存复用结合选择性重算的应用。然而,该研究发现这种复用方式具有历史依赖性:即便提示本身未改变,其生成的答案也会因之前处理的请求序列不同而发生变化,这为依赖缓存复用的Agent系统带来了结果不确定的风险。
文档对齐重算的优势表现
为应对上述变异问题,研究对比了文档对齐重算与CacheBlend的token top-k策略。在限定5%重算预算的条件下,文档对齐重算将跨请求顺序的答案变异率从token top-k策略的69.0%大幅压降至26.1%。当每个提示在不同前置请求序列后评估时,文档对齐重算对全量预填充的保真度较token top-k提升了34.5至52.5个百分点。同时,这两种策略在加速效果上相当,均取得了约5.7倍的中位TTFT加速。
连续性保障重算稳健性
通过消融实验,研究进一步探究了影响选择性重算稳健性的因素。结果表明,在滚动Agent工作负载中,连续性是关联稳健选择性重算的主要因素。这意味着在执行KV缓存复用与选择性重算时,保持缓存块的连续性对于减少历史依赖带来的答案变异、维持对全量预填充的保真度具有关键作用。
为什么值得看
揭示非前缀KV缓存复用的历史依赖风险,提供大幅降变异、提保真度的文档对齐重算方案。
对齐
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
