IB2协议提出按服务路由而非模型ID评估企业AI
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
论文提出IB2协议,旨在解决企业AI系统评估中仅关注模型标识符而忽视服务路径、精度及输出契约等实际部署要素的测量误差问题。该协议包含金盲能力绑定预检、包含可靠性的首轮评分规则及结构化盲审裁决。参考实例包含128项锁定任务和987条断言,覆盖文档、数据库及多表连接等工作。测试显示,服务路径选择使分数从77.38升至82.54,且能力可用性在相同权重下因路径不同而表现各异。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载评估视角的转变
现有18个审计基准均针对广告宣传的模型标识符进行评分,但企业实际部署的是包含权重、服务路径、精度、输出契约和工具框架在内的完整系统。论文将这种差异视为测量误差,并提出IB2协议使其具备可报告性。该协议强调,仅通过模型权重无法反映系统的可用能力,必须将服务路径等部署要素纳入考量。
IB2协议的构成
IB2协议由三个核心部分组成。首先是金盲能力绑定预检,在任何任务到达之前验证路由是否能够执行评估契约;其次是包含可靠性的首轮评分规则,将失败保留在分数中,同时将不支持的能力排除在外;最后是结构化盲审裁决。作者发布了该协议的算法、分类表、请求契约和清单模式。
实测结果与差异
在包含128项锁定任务和987条断言的参考实例中,测试覆盖了文档、电子表格、图表、工具和数据库工作。结果显示,能力可用性是可测量的:两次在相同权重上的完整单路由运行在最终绑定门控时未能通过不同的谓词测试,而第三次在全新运行前通过了该门控。服务路径的选择将分数从77.38提升至82.54,区间为[0.11, 10.60],这表明不同的访问模式和工具调用解析器对性能有显著影响。
为什么值得看
纠正仅看模型权重的评估偏差,量化部署架构对实际性能的影响。
论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
