研究指本地服务栈致工具调用评估失真
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
该论文揭示本地服务栈会干扰代码智能体工具调用评估,测得结果常取决于服务层而非模型本身。在Ollama中,默认请求受静态模板控制,Phi-3与Gemma-3在推理前即被拒,重试耗尽被误作模型非调用,虚报0%保真度。对已接纳模型,保留原生通道并增文本列表可恢复保真度;对具原生支持的Llama-3.2,纯文本协议反降保真度。Ollama、vLLM与SGLang对同请求处理各异。受限解码消解析失败却可致不终止,回合池化与单实例估算差达约55分。作者给出将服务行为纳入评估协议的清单。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载服务栈干扰评估机制
代码智能体需先发出符合既定格式的工具调用,随后由执行线束运行。该论文指出,本地服务栈对该协议步骤存在显著干扰,致使测量结果往往反映服务层特性而非模型真实水平。在Ollama环境下,默认的工具请求受各模型静态模板标志管控:部分模型被接纳并以文本返回调用,部分返回原生调用,而Phi-3与Gemma-3则在推理前直接遭拒。由于执行线束未将拒绝及重试耗尽保留为结构化失败元数据,下游分析会将其误判为模型未发起调用,从而得出0%保真度的错误报告。
协议调整与跨栈差异
针对上述失真,研究发现不同补救策略效果因模型而异。对于已被接纳的模型,在保留原生通道的同时添加文本工具列表,能大幅恢复测量保真度;然而,对于Llama-3.2这类本身具备原生工具调用支持的模型,强制采用统一文本协议反而会拉低保真度。此外,对Ollama、vLLM与SGLang进行跨栈探测,证实相同请求在不同服务栈下的处理逻辑存在明显分歧。受限解码虽能消除解析失败,却可能诱发无法终止的问题,且回合池化与单实例估算方式的得分差异最高可达约55分。
评估协议改进建议
鉴于服务栈行为已成为评估中不可忽视的混杂变量,作者在文末提出了一份检查清单,建议将服务层行为明确纳入评估协议之中,以消除底层基础设施差异对智能体工具调用能力评测的干扰。该论文已被EMNLP 2026第二届REALM研讨会收录。
为什么值得看
揭示本地工具调用评测存在严重混杂变量,提醒从业者在评估智能体时必须剥离服务栈干扰。
Llama智能体论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
