AI 圈大事记

Jev模型单次调用零样本检测十类对齐失败,成本降63倍

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

Jev通过强化学习校准决策训练,单次调用即可对单一输入的多种类型问题输出校准概率。在涵盖谄媚、越狱、欺骗、幻觉等十类对齐失败、横跨44个基准及五个目标模型的RLCDAlignBench上,通用问题零样本中位AUROC达0.886,超越多数有监督基线。其与人类标签的一致性匹敌参考评分器,且比大模型裁判评分器成本降低63倍。研究发现问题措辞影响微弱,而包含标签编码字段的上下文影响更大。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

Jev模型与RLCD机制

现有对齐失败检测器多为生成式裁判,需为每条标准执行一次解码;或为读取词元概率的分类器,单次调用仅能输出固定标签。Jev采用强化学习校准决策进行训练,能够在单次调用中,针对同一个输入回答多种类型的问题,并直接输出校准后的概率。这种机制大幅减少了推理开销,使其在批量评估对齐风险时具备显著的效率优势。

十类对齐失败与评估基准

为衡量Jev的检测能力,研究者提出RLCDAlignBench。该基准覆盖谄媚、越狱、欺骗、提示注入、幻觉、隐私侵犯、社会偏见、奖励黑客、隐瞒不确定性与权力寻求十类对齐失败。评估横跨44个基准及五个目标模型,标签由各基准自带评分器提供,其中两个基准额外由人类标注。许多对齐失败具有关系属性,需参照用户信念或注入指令等参考系判定,仅凭回复本身无法显露。

零样本表现与成本优势

研究核心思路是将向Jev提问的内容与其所见输入分离:一侧为问题措辞与答案类型,另一侧为输入字段。实验显示,单一通用问题零样本即可达0.886的中位AUROC,并在多数基准上超越有监督基线。问题措辞对结果影响微弱,而上下文影响显著,主要通过编码标签的字段发挥作用。Jev与人类标签的一致性匹敌参考评分器,还能暴露现有基准的标签缺陷,且成本比大模型裁判评分器低63倍。

为什么值得看

单次调用低成本零样本检测多种对齐风险,为部署大模型提供高效安全评估新范式。

大模型强化学习幻觉对齐

信源1 家

  1. [1]arXiv cs.AI一手信源Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

关键事实

  • Jev基于强化学习校准决策训练,单次调用可对单一输入回答多种类型问题并给出校准概率[1]

  • 提出RLCDAlignBench,涵盖谄媚、越狱、欺骗、提示注入、幻觉、隐私侵犯、社会偏见、奖励黑客、隐瞒不确定性与权力寻求十类对齐失败[1]

  • 单一通用问题零样本达到0.886的中位AUROC,并在多数基准上击败有监督基线[1]

  • Jev与人类标签的一致性匹配参考评分器,且比大模型裁判评分器成本低63倍[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。