AI 圈大事记

新研究指语言模型社交谄媚评测存在效度问题,提出提升接纳度方案

论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

语言模型常因顺从用户观点被指谄媚,但社交谄媚的标志(如积极肯定)与社交心理学中的对话接纳度高度重合,导致评测存在建构效度问题。在道德建议数据集上,被判定为更社交谄媚的回复也更具接纳度;提升人类回复的接纳度且保留原结论,也会使其被判定为更社交谄媚,表明现有评测可能误罚理想行为。实验显示,即便提问者有错,人们也更偏爱并更愿听取高接纳度回复。作者提出一种方法,能在不增加实质顺从的情况下大幅提升接纳度,实现两者兼得。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

社交谄媚评测的效度缺陷

语言模型常被批评存在谄媚问题,即牺牲独立实质判断去顺从用户观点。针对社交谄媚的研究关注积极肯定等可能暗示不当顺从的行为。然而,这些行为标志同样是社会心理学中对话接纳度的核心特征,而接纳度已被证明能改善分歧下的互动。这种重叠导致社交谄媚评测出现建构效度问题:评测可能将体现良好对话接纳度的行为误判为不当顺从。

接纳度与谄媚判定的紧密耦合

研究使用流行的道德建议数据集发现,被归类为更具社交谄媚的回复同样更具接纳度。进一步地,当提升人工撰写回复的接纳度但保留其实质结论时,这些回复也会被归类为更具社交谄媚。这种紧密耦合表明,当前的社交谄媚评测可能无意中惩罚了理想的对话行为。

偏好实验与兼顾两者的方法

在比较实质等效回复的预注册实验中,参与者更偏爱接纳度更高的回复,预期用户更可能听从它们,且更愿意向其作者寻求建议。即便参与者认为原提问者有错,该整体模式依然存在。最后,作者引入了一种简单方法,在不增加实质顺从的前提下大幅提升了接纳度,证明对话接纳度与实质独立可以同时达成。

为什么值得看

揭示现有模型对齐评测可能误罚良好对话行为,并提供兼顾接纳与独立判断的解法,对模型评测与对齐有直接参考价值。

数据集

信源1

  1. [1]arXiv cs.AI一手信源Receptiveness, Not Sycophancy: Distinguishing Engagement from Deference in Language Models

关键事实

  • 社交谄媚的行为标志与对话接纳度重合,导致社交谄媚评测存在建构效度问题。[1]

  • 在道德建议数据集上,被判定为更社交谄媚的回复也更具接纳度。[1]

  • 提升人类回复的接纳度且保留原结论,会使其被判定为更社交谄媚。[1]

  • 实验表明人们更偏爱高接纳度回复,更愿听取其建议,即便提问者有错。[1]

  • 作者提出一种方法,能在不增加实质顺从的情况下大幅提升接纳度。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。