PriceBench评估28款大模型预订偏好,同任务价差达146美元
论文AI 评分 68/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
Pavel Kireyev提出PriceBench诊断基准,用逻辑特选择模型从预订决策中还原大语言模型对价格、质量与品牌的偏好。测试覆盖8家提供商的28个模型,在179家纽约真实酒店共3600项任务上进行。结果显示,能力强的模型选择更一致,弱模型易受排序控制或近乎随机;不同提供商甚至同族模型间偏好差异极大,价格敏感度跨度超一个数量级,致使相同任务下平均预订房价从247美元至393美元不等。该成果已被EMNLP 2026行业轨道接收,任务与代码均已公开。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载基准设计与测试规模
PriceBench旨在诊断大语言模型充当采购代理时潜藏的偏好。酒店预订因高频且属性可比,成为理想的测试场景。该基准运用逻辑特选择模型,通过分析模型的预订选择来逆向还原其对价格、品质及品牌的倾向。测试范围涵盖8家提供商的28款模型,基于179家纽约市真实酒店构建了3600项预订任务,全面量化各模型在面临相似选项时的决策差异。
模型能力与决策一致性
研究发现,模型能力与其选择的内容无关,但与选择的一致性高度相关。能力较强的模型展现出更强且更一致的偏好;而能力较弱的模型则走向两个极端:要么死锁于单一位置,极易被控制列表排序的一方操纵,要么近乎无差别地随机选择。这意味着在部署大模型作为预订代理时,弱模型更容易受到外部展示顺序的干扰,导致不可控的采购结果。
跨提供商偏好差异悬殊
各模型的具体偏好走向在不同提供商之间,甚至在同一模型家族内部都存在剧烈差异。价格敏感度的跨度超过了一个数量级。这种偏好差异直接反映在最终开销上:在完全相同的预订任务中,不同模型挑选出的酒店平均每晚价格从247美元一路飙升至393美元。这证明代理的购买行为必须按单个模型进行实测,无法简单推断,相关任务、代码及28组响应集已全部开源。
为什么值得看
揭示大模型作代理时的隐性消费偏好,同需求下不同模型致价差超146美元,对构建可靠采购代理至关重要。
大模型基准测试论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
