AI 圈大事记

研究提出让工具调用主动上报进度以优化推理系统

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

现有服务系统通过猜测工具运行时长来管理 KV 缓存,效果不佳。新研究建议让工具在运行时主动上报进度,无需修改 Agent 视角即可获取准确信号。实验显示,该方法在 KV 缓存决策点的预测精度比现有最佳预测器高数倍至一个数量级,且能适应环境变化。接入生产引擎后,相比 LRU 策略,工具调用后的 p90 首字生成时间(TTFT)降低了约 20.8%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

现有系统的猜测缺陷

Agent 请求在等待工具执行期间会占用大量 GPU 内存来保存 KV 缓存。现有的服务系统通常根据工具名称、历史记录、调用前声明的持续时间或引擎自身的占用情况,来猜测工具会运行多久,进而决定缓存是保留、驱逐还是重新加载。研究指出,任何在调用开始前就固定的估算都无法准确预知实际时长,甚至无法对调用进行合理排序。

主动上报进度机制

研究者提出让工具调用在运行过程中显式上报其进度。通过对四个公开 Agent 语料库的分析发现,一旦揭示进度信号,大部分工具时间都能读取到有效信息,包括剩余工作比例或即将结束的准确信号。这种机制通过一种适配器(harness)来恢复信号,不需要改变 Agent 本身看到的视图,也不会对 Agent 的基准测试分数产生可测量的影响。

性能提升显著

在需要做出 KV 缓存决策的关键节点,这种由工具上报的进度信息,其准确性比已发布的最佳预测器高出数倍甚至一个数量级,并且在环境发生变化时依然保持准确。当该机制通过少量提示接入生产引擎后,与 LRU(最近最少使用)策略相比,在仅使用 HBM 和使用 HBM 加 DRAM 的场景下,工具调用后的 p90 首字生成时间(TTFT)分别降低了 20.7% 和 20.8%,效果接近理想预言机。

为什么值得看

显著降低 Agent 工具调用后的首字延迟,提升推理系统资源利用率。

基准测试

信源1

  1. [1]arXiv cs.AI一手信源Ask the Tool, Don't Guess: Agent Tool Calls Hold Their Progress, and the Serving System Should Read It

关键事实

  • 工具调用主动上报进度在 KV 缓存决策点的预测精度比最佳预测器高数倍至一个数量级。[1]

  • 该方法接入生产引擎后,相比 LRU 策略,p90 首字生成时间(TTFT)降低约 20.8%。[1]

  • 该方案对 Agent 基准测试分数无 measurable 影响。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。