新研究提出贝叶斯信念层以控制LLM智能体观点动态
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
当前LLM智能体在社会模拟中隐式修正观点,无法设定或验证其受说服程度。新提出的贝叶斯编年智能体(BCA)将智能体所信与所言分离,把每个立场设为概率,每听到一次发言便执行一次贝叶斯更新。引入单一先验强度参数κ编码固执程度,调节该参数可按需产生共识、持续分歧与坚定少数派影响三种典型动态。持续分歧状态与FJ模型闭合解固定点高度吻合(R²=0.93-0.99)。实验表明,设定的κ在语言往返后仍可恢复,四种模型均实现完美排序恢复。显式信念使模拟可审计,暴露了端到端模拟会掩盖的模型立场偏差。该论文被EMNLP 2026的REALM研讨会接收。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载隐式观点更新的局限
在现有的社会模拟中,大语言模型智能体修正自身观点的过程是隐式且在上下文中完成的。这导致无法明确设定或验证一个智能体对说服的开放程度,集体模拟结果不可避免地继承了模型训练时的先验偏差。为了解决这一问题,研究者提出了贝叶斯编年智能体架构,通过引入一个极简的信念层,将智能体“信什么”与“怎么说”彻底解耦。
贝叶斯更新与参数κ
在该架构下,智能体的每一个立场都被表示为一个概率值,每当听到一次发言,就执行一步贝叶斯更新来调整该概率。系统引入了单一的先验强度参数κ来编码智能体的固执程度,其设计灵感源自Friedkin-Johnsen观点动态模型中该参数的作用。通过扫掠调节κ值,能够按需产生三种典型的观点动态体制:共识、持续分歧以及坚定少数派影响。在持续分歧体制下,模拟结果与FJ模型的闭合解固定点高度吻合,R平方介于0.93至0.99之间。
可恢复性与可审计性
研究进一步验证了预设的κ值在经历语言往返后依然可被恢复,在测试的四种模型中均实现了完美的排序恢复。此外,显式的信念层赋予了模拟过程可审计性:该层能够浮现出各个模型系统性的立场偏差,而这些偏差在传统的端到端模拟中会被静默吸收而难以察觉。该研究已被EMNLP 2026的REALM研讨会接收。
为什么值得看
将LLM智能体观点动态从隐式黑盒变为显式可调、可审计,为社会模拟提供可控且可验证的新架构。
智能体论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
