AI 圈大事记

PriceBench评估28款大模型预订偏好,同任务价差达146美元

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

Pavel Kireyev提出PriceBench诊断基准,用逻辑特选择模型从预订决策中还原大语言模型对价格、质量与品牌的偏好。测试覆盖8家提供商的28个模型,在179家纽约真实酒店共3600项任务上进行。结果显示,能力强的模型选择更一致,弱模型易受排序控制或近乎随机;不同提供商甚至同族模型间偏好差异极大,价格敏感度跨度超一个数量级,致使相同任务下平均预订房价从247美元至393美元不等。该成果已被EMNLP 2026行业轨道接收,任务与代码均已公开。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

基准设计与测试规模

PriceBench旨在诊断大语言模型充当采购代理时潜藏的偏好。酒店预订因高频且属性可比,成为理想的测试场景。该基准运用逻辑特选择模型,通过分析模型的预订选择来逆向还原其对价格、品质及品牌的倾向。测试范围涵盖8家提供商的28款模型,基于179家纽约市真实酒店构建了3600项预订任务,全面量化各模型在面临相似选项时的决策差异。

模型能力与决策一致性

研究发现,模型能力与其选择的内容无关,但与选择的一致性高度相关。能力较强的模型展现出更强且更一致的偏好;而能力较弱的模型则走向两个极端:要么死锁于单一位置,极易被控制列表排序的一方操纵,要么近乎无差别地随机选择。这意味着在部署大模型作为预订代理时,弱模型更容易受到外部展示顺序的干扰,导致不可控的采购结果。

跨提供商偏好差异悬殊

各模型的具体偏好走向在不同提供商之间,甚至在同一模型家族内部都存在剧烈差异。价格敏感度的跨度超过了一个数量级。这种偏好差异直接反映在最终开销上:在完全相同的预订任务中,不同模型挑选出的酒店平均每晚价格从247美元一路飙升至393美元。这证明代理的购买行为必须按单个模型进行实测,无法简单推断,相关任务、代码及28组响应集已全部开源。

为什么值得看

揭示大模型作代理时的隐性消费偏好,同需求下不同模型致价差超146美元,对构建可靠采购代理至关重要。

大模型基准测试论文

信源1 家

  1. [1]arXiv cs.AI一手信源PriceBench: A Diagnostic Benchmark for Price, Quality, and Brand Preferences in LLM Booking Agents

关键事实

  • PriceBench基准测试了8家提供商的28个大语言模型在3600项酒店预订任务上的偏好[1]

  • 测试任务基于179家真实纽约酒店属性构建[1]

  • 不同模型在相同任务上的平均预订房价从247美元到393美元不等[1]

  • 该论文被EMNLP 2026行业轨道接收并公开了代码与数据[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。