Jev模型单次调用零样本检测十类对齐失败,成本降63倍
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
Jev通过强化学习校准决策训练,单次调用即可对单一输入的多种类型问题输出校准概率。在涵盖谄媚、越狱、欺骗、幻觉等十类对齐失败、横跨44个基准及五个目标模型的RLCDAlignBench上,通用问题零样本中位AUROC达0.886,超越多数有监督基线。其与人类标签的一致性匹敌参考评分器,且比大模型裁判评分器成本降低63倍。研究发现问题措辞影响微弱,而包含标签编码字段的上下文影响更大。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载Jev模型与RLCD机制
现有对齐失败检测器多为生成式裁判,需为每条标准执行一次解码;或为读取词元概率的分类器,单次调用仅能输出固定标签。Jev采用强化学习校准决策进行训练,能够在单次调用中,针对同一个输入回答多种类型的问题,并直接输出校准后的概率。这种机制大幅减少了推理开销,使其在批量评估对齐风险时具备显著的效率优势。
十类对齐失败与评估基准
为衡量Jev的检测能力,研究者提出RLCDAlignBench。该基准覆盖谄媚、越狱、欺骗、提示注入、幻觉、隐私侵犯、社会偏见、奖励黑客、隐瞒不确定性与权力寻求十类对齐失败。评估横跨44个基准及五个目标模型,标签由各基准自带评分器提供,其中两个基准额外由人类标注。许多对齐失败具有关系属性,需参照用户信念或注入指令等参考系判定,仅凭回复本身无法显露。
零样本表现与成本优势
研究核心思路是将向Jev提问的内容与其所见输入分离:一侧为问题措辞与答案类型,另一侧为输入字段。实验显示,单一通用问题零样本即可达0.886的中位AUROC,并在多数基准上超越有监督基线。问题措辞对结果影响微弱,而上下文影响显著,主要通过编码标签的字段发挥作用。Jev与人类标签的一致性匹敌参考评分器,还能暴露现有基准的标签缺陷,且成本比大模型裁判评分器低63倍。
为什么值得看
单次调用低成本零样本检测多种对齐风险,为部署大模型提供高效安全评估新范式。
大模型强化学习幻觉对齐
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
