AI 圈大事记

新方法TokenCast可预测LLM Agent执行耗Token量

论文AI 评分 65/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

LLM Agent执行同一任务时,总耗Token量在不同运行间差异可达十倍以上,事前极难预估。提出的TokenCast方法为每个执行片段学习可组合的成本表征,记录自身消耗与引入的上下文增长,通过组合相邻片段得出累计估算值,捕捉后续调用重读前序上下文带来的额外输入开销。随执行推进,新观测证据会刷新预测,且无需额外LLM调用。在SWE-bench Verified上单次运行平均累计预测耗时32.8毫秒。跨4个任务集与6个Agent模型、共96种评估组合中,其平均绝对误差较最强对比基线降低14.5%。在离线预算控制回放中,以相同的轨迹完成率,其Token消耗比固定预算策略平均少21.3%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

Agent耗Token预测难题

大语言模型Agent在执行任务时,会依据工具反馈与中间结果选择后续步骤,而不断增长的上下文会使每次后续调用的输入尺寸持续膨胀。这导致同一任务在不同运行下的总Token消耗差异极大,甚至超过一个数量级。因此,任务执行前的总消耗极难预估,且必须在运行过程中随进展不断修正预测。

可组合成本表征机制

TokenCast为每个执行片段学习一种可组合的成本表征,该表征同时记录片段自身的Token消耗及其引入的上下文增长量。通过组合相邻片段,可得出累计估算值,该估算值能捕捉早期片段的上下文被后续每次调用重读时所产生的额外输入开销。随着执行推进,新观测到的证据会直接刷新预测结果,此过程无需发起额外的大语言模型调用。

评估表现与预算控制

在SWE-bench Verified基准上,单次运行的平均累计预测耗时仅为32.8毫秒。跨越4个任务集与6个Agent模型、共计96种评估组合的测试表明,TokenCast的平均绝对误差较最强对比基线平均降低14.5%。在离线预算控制回放场景中,在保持相同的轨迹完成率前提下,TokenCast的Token消耗比固定预算策略平均减少21.3%。

为什么值得看

解决Agent运行Token消耗难预测问题,实现动态预算控制,显著降低开销与预测误差。

信源1 家

  1. [1]arXiv cs.AI一手信源TokenCast: Forecasting Token Consumption During LLM Agent Execution

关键事实

  • LLM Agent执行同一任务时,Token消耗在不同运行间差异可超十倍[1]

  • TokenCast为每个执行片段学习可组合成本表征,记录自身消耗与上下文增长[1]

  • 在SWE-bench Verified上单次运行平均累计预测耗时32.8毫秒,无需额外LLM调用[1]

  • 在96种评估组合中,平均绝对误差较最强对比基线降低14.5%[1]

  • 离线预算控制回放中,Token消耗比固定预算策略平均少21.3%[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。