AI 圈大事记

DIAL框架消除LLM评判位置偏差并校准人类偏好

论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

LLM作为评判者时,其打分易受回复顺序影响,且消除位置偏差后仍可能与人类偏好存在系统性分歧。DIAL框架将大量LLM对比与少量人工对比结合,分离特定于评判模型的位置效应,学习去偏差后的LLM偏好共享结构,并自适应将其向人类偏好目标校准。实验表明,该方法在回复顺序不平衡时保持鲁棒,用有限标注实现强人类对齐排名,且在LLM信息不完美时能向人类证据自适应。研究还收集了21个LLM评判模型在两种展示顺序下的超41万条评判数据,供后续研究偏差与对齐问题。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

LLM评判的偏差与对齐问题

利用大语言模型作为评判者虽能实现可扩展的评估,但存在两大缺陷:一是评判结果对回复的展示顺序高度敏感,存在位置偏差;二是即便消除了位置效应,其偏好仍可能与人类偏好产生系统性分歧。这导致单纯依赖LLM进行自动评测的可靠性受限,亟需一种方法同时解决位置去偏差与人类偏好对齐的挑战。

DIAL框架的原理与理论保证

DIAL提出一种统一框架,将大量LLM对比结果与少量人工对比结果相结合。其核心机制包括:分离特定于评判模型的位置效应、学习去偏差后的LLM偏好共享结构,并自适应地将该结构向人类偏好目标校准。理论上,该框架保证了三点:潜在LLM偏好、位置效应与人类校准的可识别性;平衡LLM锚定与有限人类证据的自适应估计;以及针对校准后人类偏好的固定权重不确定性量化。

实验验证与大规模数据集贡献

在受控模拟与三个人类偏好基准测试中,DIAL在位置去偏差与人类对齐两方面均表现优异。当回复顺序不平衡时,该方法展现出强鲁棒性;在人工标注有限的情况下,仍能获得与人类高度对齐的排名;当LLM提供的信息不完美时,它能有效向人类证据自适应偏移。此外,研究团队收集了21个LLM评判模型在两种展示顺序下的超41万条评判记录,为未来探究LLM评判偏差、异质性与人类对齐提供了数据资源。

为什么值得看

解决LLM当裁判时的位置偏差与人类偏好不对齐痛点,用极少人工标注实现自适应校准,提升自动评测可靠性。

对齐

信源1 家

  1. [1]arXiv cs.AI一手信源DIAL: Position-Debiased LLM Judges with Adaptive Human Preference Calibration

关键事实

  • DIAL框架结合大量LLM对比与少量人工对比,分离位置效应并自适应校准人类偏好[1]

  • 该方法在回复顺序不平衡时鲁棒,用有限标注实现强人类对齐排名[1]

  • 研究收集了21个LLM评判模型在两种展示顺序下的超41万条评判数据[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。