北大提出LOHA与ACD方法压缩智能体上下文
论文AI 评分 68/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对软件工程智能体工具观测占据大量上下文的问题,北大提出LOHA布局与ACD训练法。LOHA将历史工具观测压缩为软标记,保留智能体自身轮次与近K个观测文本;ACD通过锚定基础模型行为来约束漂移。在SWE-bench Verified上,K=3使Qwen3-4B与SWE-Master-4B-RL的单次上下文分别缩减43%和57%,解决率从14.5%和27.5%降至12.1%和21.8%。在32K标记限制下,Qwen3(K=3)在199实例子集解决率达21.1%,超全文本基线的11.1%,单GPU并发吞吐量达全文本的1.9倍。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载长上下文压缩方案
软件工程智能体交互历史中工具观测占据大量空间,现有压缩法易丢弃后续动作所需信息,而适配软标记表示可能损害原有行为。为此,北大团队提出LOHA上下文布局,将较早的工具观测压缩为软标记,同时完整保留智能体自身发言及最近K个观测的文本形式,兼顾历史紧凑访问与近期内容精确引用。配合提出的ACD训练法,将基础模型全文本预测蒸馏至潜在视图,并在纯文本输入上锚定基础模型行为,从而在启用潜在读取时约束行为漂移。
性能与压缩权衡
在SWE-bench Verified评测中,当K设为3时,Qwen3-4B与SWE-Master-4B-RL的单次调用上下文分别缩减43%和57%,解决率从14.5%和27.5%略降至12.1%和21.8%。扩大窗口至K=8的单次扫描中,解决率分别回升至14.4%和23.0%,表明更大窗口通常有利于任务表现而非压缩。在32K标记硬限制下,Qwen3采用K=3在199实例子集解决率达21.1%,远超同模型全文本基线的11.1%,且单GPU并发服务吞吐量达全文本智能体的1.9倍。
为什么值得看
在严格上下文限制下显著提升智能体解决率与吞吐量,为长交互智能体降本增效提供可行方案。
Qwen智能体GPU
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
