AI 圈大事记

研究指本地服务栈致工具调用评估失真

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

该论文揭示本地服务栈会干扰代码智能体工具调用评估,测得结果常取决于服务层而非模型本身。在Ollama中,默认请求受静态模板控制,Phi-3与Gemma-3在推理前即被拒,重试耗尽被误作模型非调用,虚报0%保真度。对已接纳模型,保留原生通道并增文本列表可恢复保真度;对具原生支持的Llama-3.2,纯文本协议反降保真度。Ollama、vLLM与SGLang对同请求处理各异。受限解码消解析失败却可致不终止,回合池化与单实例估算差达约55分。作者给出将服务行为纳入评估协议的清单。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

服务栈干扰评估机制

代码智能体需先发出符合既定格式的工具调用,随后由执行线束运行。该论文指出,本地服务栈对该协议步骤存在显著干扰,致使测量结果往往反映服务层特性而非模型真实水平。在Ollama环境下,默认的工具请求受各模型静态模板标志管控:部分模型被接纳并以文本返回调用,部分返回原生调用,而Phi-3与Gemma-3则在推理前直接遭拒。由于执行线束未将拒绝及重试耗尽保留为结构化失败元数据,下游分析会将其误判为模型未发起调用,从而得出0%保真度的错误报告。

协议调整与跨栈差异

针对上述失真,研究发现不同补救策略效果因模型而异。对于已被接纳的模型,在保留原生通道的同时添加文本工具列表,能大幅恢复测量保真度;然而,对于Llama-3.2这类本身具备原生工具调用支持的模型,强制采用统一文本协议反而会拉低保真度。此外,对Ollama、vLLM与SGLang进行跨栈探测,证实相同请求在不同服务栈下的处理逻辑存在明显分歧。受限解码虽能消除解析失败,却可能诱发无法终止的问题,且回合池化与单实例估算方式的得分差异最高可达约55分。

评估协议改进建议

鉴于服务栈行为已成为评估中不可忽视的混杂变量,作者在文末提出了一份检查清单,建议将服务层行为明确纳入评估协议之中,以消除底层基础设施差异对智能体工具调用能力评测的干扰。该论文已被EMNLP 2026第二届REALM研讨会收录。

为什么值得看

揭示本地工具调用评测存在严重混杂变量,提醒从业者在评估智能体时必须剥离服务栈干扰。

Llama智能体论文

信源1

  1. [1]arXiv cs.AI一手信源Measuring the Serving Stack Instead of the Model: Hidden Confounds in Local Tool-Use Evaluation

关键事实

  • 本地服务栈对工具调用评估存在混杂影响,测得结果可能取决于服务层而非模型行为。[1]

  • 在Ollama中,Phi-3和Gemma-3因静态模板标志在推理前被拒绝,导致下游分析误报0%保真度。[1]

  • 对具备原生工具调用支持的Llama-3.2,采用统一文本协议反而降低了保真度。[1]

  • 跨Ollama、vLLM和SGLang的探测显示,不同服务栈对同一请求的处理方式存在差异。[1]

  • 受限解码消除了解析失败但可能引发不终止问题,回合池化与单实例估算差异最高约55分。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。