研究提出Touchstone管线:用可检验性界定本地小模型网络自动化边界
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
将网络自动化输入全发第三方大模型会泄露敏感配置与日志,本地小模型推理虽避免数据外传但易出错。该研究提出“可检验性”准则:若任务自带低成本确定性测试(内在校验)能剔除错误输出,则适合本地推理。据此构建的Touchstone管线用7个1至8B参数的现成小模型生成候选,经内在校验筛错,未解决再上交大模型。在冲突检测与意图翻译任务上,端到端准确率达98.6%与93.8%,仅分别上交16%与17%的输入;而在无内在校验的纯知识问答上则无法匹敌大模型基线。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载本地推理与可检验性准则
网络自动化任务若全交第三方前沿大模型处理,会导致生产配置、拓扑结构及日志等敏感制品外泄。改用本地小语言模型查询虽能避免数据外传,但其输出易出错,难以直接应用。为此,本研究提出“可检验性”作为判定任务是否适合本地推理的标准:若某任务能暴露一种低成本、确定性的测试(即内在校验),用于拒绝违反必要正确性条件的输出,则该任务具备可检验性,适合在本地执行。
Touchstone管线架构与实测
研究将上述准则实例化为Touchstone本地优先管线。该管线先用7个参数量介于1B至8B的现成小模型生成候选结果,接着利用针对特定任务的内在校验拒绝不合格响应,仅将未解决的输入上交给前沿大模型。在冲突检测与意图翻译两类任务中,Touchstone分别取得了98.6%与93.8%的端到端准确率,且仅上交了16%与17%的输入。然而,在缺乏任务特定内在校验的纯知识问答控制组TeleQnA上,该管线无法追平前沿大模型基线的准确率。
部署规则与适用边界
实验结果支持一条简明的部署规则:当任务语义支持精确且低成本的校验时,应保持推理本地化;其余任务则上交云端。这表明本地小模型能否有效替代云端大模型,关键在于任务本身是否具备可检验性。对于缺乏内在校验机制的纯知识型任务,本地管线仍难以胜任,仍需依赖前沿大模型的能力。
为什么值得看
为本地小模型替代云端大模型提供了明确的任务筛选准则与工程管线,大幅降低数据泄露风险与云端调用比例。
大模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
