研究指数据驱动角色模拟需匹配目标群体及丰富行为证据

论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

该研究探讨利用异构匿名公开行为数据生成角色,以模拟特定人口统计群体的问卷回复。发现域外来源诱导的角色因人口不匹配,表现难超仅用基础人口信息的模拟;但若将角色准确分配至目标群体,对齐度显著提升。此外,目标域问卷数据诱导的角色随可用答题历史增多泛化更好,表明更丰富的行为证据能推断更稳定的角色特质,进而提升未见问题的模拟对齐度。该工作已被EMNLP 2026 REALM接收。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

研究背景与核心方法

现有引导方法常依赖目标域人类数据进行微调或提示,收集成本高且存在隐私隐患。该研究聚焦群体层面的问卷模拟,提出利用异构且匿名的公开行为数据来诱导生成角色,以此作为条件让智能体模拟特定人口统计群体的个体回复。研究重点检验能否从多元来源提取代表性角色,并剖析源数据的领域、规模及粒度如何影响模拟对齐效果。

数据源与群体匹配影响

实验发现,从域外来源诱导的角色极少优于仅基于基础人口信息条件的模拟,主要归因于群体不匹配。然而,一旦将这些角色准确分配至目标人口群体,模拟对齐度便大幅改善。这表明数据源与目标群体的匹配度是决定模拟质量的关键,单纯引入不相关的域外数据无法带来增益,精准的群体归属分配才能发挥角色作用。

行为证据丰富度与泛化

研究还揭示,由目标域问卷数据诱导的角色,随着可用答题历史增多,泛化能力更强。这意味着更丰富的行为证据能够支撑更稳定的角色特质推断,这种推断能更好地迁移至对未见问题的模拟中,从而提升对齐度。该工作已被EMNLP 2026 REALM接收。

为什么值得看

揭示数据源与目标群体匹配度及行为证据丰富度对角色模拟效果的关键影响,为低成本隐私安全的群体模拟提供实证依据。

对齐论文

信源1 家

  1. [1]arXiv cs.AI一手信源Data-Driven Personas for Survey Simulation: Insights into Simulation Alignment Across Data-Access Regimes

关键事实

  • 利用异构匿名公开行为数据诱导角色来模拟特定人口群体问卷回复[1]

  • 域外数据诱导角色因人口不匹配,表现难超仅用基础人口信息的模拟[1]

  • 将角色准确分配至目标群体可大幅提升模拟对齐度[1]

  • 目标域问卷数据诱导角色随答题历史增多泛化更好[1]

  • 该论文被EMNLP 2026 REALM接收[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。