新研究用狡黠数据提升大模型安全警惕性
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究提出利用包含误导前提或非典型推理的狡黠问题训练大模型,以培养其警惕性。实验显示,该方法能提升模型对抗分布外越狱攻击的鲁棒性,并增强后续安全微调效果。将其集成至现有最先进安全对齐流程后,在九个骨干模型与基准组合中,平均攻击成功率从 17.40% 降至 15.05%,确立了新的最优表现。
为什么值得看
提供新思路,通过非安全类逻辑陷阱训练提升模型抗越狱能力。
大模型微调对齐安全
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
