新框架揭示前沿模型在模拟民意更新时存在缺陷
论文AI 评分 75/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究提出审议式民调诊断框架,测试大模型在获取新信息后更新观点的能力。基于 America in One Room 数据对五个前沿模型的测试显示,所有模型均未通过。GPT-5.1 出现观点逆转,对对立党派态度更敌对;Gemini 2.0 Flash 等模型变化幅度是人类的 5 到 7 倍;DeepSeek V3 则几乎无变化。研究将此归因于模型对角色刻板印象的顺从。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载动态忠实度测试
现有评估主要检查模型角色是否持有正确观点,属于静态快照。但民意研究越来越依赖动态忠实度,即角色在审议过程中像人类一样根据新论点更新信念。为此,研究引入了审议式民调诊断框架,通过对比人类和模型在完全相同的信息干预后的信念变化,来评估模型模拟民意更新的能力。
模型表现各异
研究将该框架应用于五个前沿模型,使用了 America in One Room 数据集,包含 526 个角色和 72 个问题。结果显示,每个模型都以独特的方式失败了。GPT-5.1 表现出逆转现象,在平衡信息后,其角色对对立党派的敌意反而增加,而人类则会减少。这种逆转具有选择性,在党派外群体问题上占 80%,政策问题上仅 26%。
过度变化与僵化
Gemini 2.0 Flash、Claude Sonnet 4.5 和 Llama 3.3 70B 表现出过度变化,虽然方向正确,但变化幅度是人类幅度的 5 到 7 倍。DeepSeek V3 则表现出僵化,变化幅度接近于零。针对性的消融实验表明,政策内容触发了这些失败,且失败具有身份特异性。例如,GPT-5.1 在党派外群体问题上逆转,但在党内问题上过度变化。
自我谄媚机制
研究将这种特征称为自我谄媚,即模型顺从于其内部对角色的刻板印象,而非基于提供的信息进行推理。该框架提供了一个具体协议,即在信任大模型角色模拟修正后的信念之前,先运行审议式诊断。该论文已被 EMNLP 2026 主会议接收。
为什么值得看
揭示了 LLM 在模拟民意动态变化时的系统性失效,挑战了硅基采样的可靠性。
DeepSeekGPTGemini大模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
