DIAL框架消除LLM评判位置偏差并校准人类偏好
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
LLM作为评判者时,其打分易受回复顺序影响,且消除位置偏差后仍可能与人类偏好存在系统性分歧。DIAL框架将大量LLM对比与少量人工对比结合,分离特定于评判模型的位置效应,学习去偏差后的LLM偏好共享结构,并自适应将其向人类偏好目标校准。实验表明,该方法在回复顺序不平衡时保持鲁棒,用有限标注实现强人类对齐排名,且在LLM信息不完美时能向人类证据自适应。研究还收集了21个LLM评判模型在两种展示顺序下的超41万条评判数据,供后续研究偏差与对齐问题。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载LLM评判的偏差与对齐问题
利用大语言模型作为评判者虽能实现可扩展的评估,但存在两大缺陷:一是评判结果对回复的展示顺序高度敏感,存在位置偏差;二是即便消除了位置效应,其偏好仍可能与人类偏好产生系统性分歧。这导致单纯依赖LLM进行自动评测的可靠性受限,亟需一种方法同时解决位置去偏差与人类偏好对齐的挑战。
DIAL框架的原理与理论保证
DIAL提出一种统一框架,将大量LLM对比结果与少量人工对比结果相结合。其核心机制包括:分离特定于评判模型的位置效应、学习去偏差后的LLM偏好共享结构,并自适应地将该结构向人类偏好目标校准。理论上,该框架保证了三点:潜在LLM偏好、位置效应与人类校准的可识别性;平衡LLM锚定与有限人类证据的自适应估计;以及针对校准后人类偏好的固定权重不确定性量化。
实验验证与大规模数据集贡献
在受控模拟与三个人类偏好基准测试中,DIAL在位置去偏差与人类对齐两方面均表现优异。当回复顺序不平衡时,该方法展现出强鲁棒性;在人工标注有限的情况下,仍能获得与人类高度对齐的排名;当LLM提供的信息不完美时,它能有效向人类证据自适应偏移。此外,研究团队收集了21个LLM评判模型在两种展示顺序下的超41万条评判记录,为未来探究LLM评判偏差、异质性与人类对齐提供了数据资源。
为什么值得看
解决LLM当裁判时的位置偏差与人类偏好不对齐痛点,用极少人工标注实现自适应校准,提升自动评测可靠性。
对齐
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
