研究提出让工具调用主动上报进度以优化推理系统
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有服务系统通过猜测工具运行时长来管理 KV 缓存,效果不佳。新研究建议让工具在运行时主动上报进度,无需修改 Agent 视角即可获取准确信号。实验显示,该方法在 KV 缓存决策点的预测精度比现有最佳预测器高数倍至一个数量级,且能适应环境变化。接入生产引擎后,相比 LRU 策略,工具调用后的 p90 首字生成时间(TTFT)降低了约 20.8%。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载现有系统的猜测缺陷
Agent 请求在等待工具执行期间会占用大量 GPU 内存来保存 KV 缓存。现有的服务系统通常根据工具名称、历史记录、调用前声明的持续时间或引擎自身的占用情况,来猜测工具会运行多久,进而决定缓存是保留、驱逐还是重新加载。研究指出,任何在调用开始前就固定的估算都无法准确预知实际时长,甚至无法对调用进行合理排序。
主动上报进度机制
研究者提出让工具调用在运行过程中显式上报其进度。通过对四个公开 Agent 语料库的分析发现,一旦揭示进度信号,大部分工具时间都能读取到有效信息,包括剩余工作比例或即将结束的准确信号。这种机制通过一种适配器(harness)来恢复信号,不需要改变 Agent 本身看到的视图,也不会对 Agent 的基准测试分数产生可测量的影响。
性能提升显著
在需要做出 KV 缓存决策的关键节点,这种由工具上报的进度信息,其准确性比已发布的最佳预测器高出数倍甚至一个数量级,并且在环境发生变化时依然保持准确。当该机制通过少量提示接入生产引擎后,与 LRU(最近最少使用)策略相比,在仅使用 HBM 和使用 HBM 加 DRAM 的场景下,工具调用后的 p90 首字生成时间(TTFT)分别降低了 20.7% 和 20.8%,效果接近理想预言机。
为什么值得看
显著降低 Agent 工具调用后的首字延迟,提升推理系统资源利用率。
基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
