新方法PaSS通过迭代零空间投影提取LLM人设子空间以调控生成
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有LLM人设调控法常将人设简化为单一主导方向,遗漏嵌套细粒度特征。PaSS范式将人设建模为模型潜空间的多维子空间,无需监督对比样本或重训练。其利用迭代零空间投影(INLP)线性迭代剥离人设专属方向,在推理时对已嵌入内容的特征进行放大或抑制。在MATH-500等四项任务对六种人设的因果评估显示,该迭代子空间提取法比单方向加法调控幅度更大、更强,且保持内容保真度与任务性能,为LLM行为调控提供了可控、可解释且可泛化的框架。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载人设调控的现有缺陷与新设定
大语言模型能采用不同人设调整语义与视角,精准控制对保障安全与可靠性至关重要。现有激活引导或提示词诱导方法常把人设降维成单一主导方向,一旦主导信号被剥离,更细微的嵌套特征便遭遗漏。此外,论文提出modulation设定:人设上下文已存在于待处理内容中,调控只需放大或抑制已有特征,无需从零注入。
PaSS范式与INLP提取机制
为解决上述问题,PaSS推理时控制范式将人设建模为潜空间的多维子空间,免除了监督对比样本的需求。提取子空间时,采用迭代零空间投影(INLP)线性且迭代地隔离出人设专属方向,实现迭代概念擦除。该方法无需模型重训练,即可将提取出的子空间应用于人设引导的生成调控。研究者还进一步剖析了子空间内各剥离方向,以揭示其编码的人设行为不同侧面。
评估表现与优势对比
研究针对六种人设,在MATH-500、TinyAlpaca、GSM8K及IFEval等多元任务上开展因果评估。结果表明,相较于单方向加法方法,判别式迭代子空间提取能捕获给定人设下的多元特征,实现更强更大的调控幅度,同时维持内容保真度。整体而言,人设子空间在不牺牲任务表现的前提下,为调控LLM行为提供了可控、可解释及可泛化的框架。
为什么值得看
无需重训练即可在推理时细粒度、多维地调控LLM人设,且不损任务性能,对模型安全与定制极具实用价值。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
