论文提出基于局部稀疏性的无监督大模型安全检测
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对现有部署时安全检测方法依赖有害数据的问题,研究人员提出一种基于局部稀疏性的无监督异常检测框架。该方法利用线性表示假设和稀疏自编码器,通过建模安全数据来识别分布外的有害输入。实验显示,在多种架构和数据集上验证有效,仅使用 1% 的分布外数据进行校准即可接近最优性能,且计算过程仅激活 1-2% 的神经元。
为什么值得看
无需依赖有害数据即可实现安全检测,为应对新型攻击提供了新思路。
大模型安全论文数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
