基于从业者访谈重构AI系统数据质量认知
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
一项针对9家机构16名从业者的访谈研究指出,AI系统中数据不仅被存储处理,更塑造模型行为与合规性。研究发现六大主题:可追溯性转向归因模型行为,模型作质评工具引发循环性;智能体上下文成数据对象,合成数据使真实性受关注;大模型开发中合法性成训练数据门槛,代表性取决于安全场景覆盖。研究提出“生命周期保证”框架,以产出证据证明数据能支撑特定AI声明,应对数据影响嵌入模型或智能体动作的复杂情况。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载AI数据质量新挑战
传统数据质量研究多将数据视为需存储、处理与验证的输入。但在AI驱动的软件密集型系统中,数据还决定了模型行为、评估方式及合法使用。通过对9家机构16名从业者的访谈与反思性主题分析,研究提炼出6大主题,揭示了从业者在此复杂条件下定义、评估与管理数据质量的真实困境,表明这些以往常被孤立研究的问题在实际工程与组织中是交织出现的。
六大核心发现
研究发现:第一,可追溯性从传统的模块化调试转变为对模型行为的归因;第二,用模型作为质量评估者会引入循环性;第三,智能体的上下文与记忆成为新的数据对象;第四,合成及伪标签数据的引入使真实性成为关键质量关切;第五,基础模型开发中,合法性成为训练数据的守门人;第六,代表性不再仅看统计分布,而是通过系统必须安全运作的场景覆盖度来评判。此外,5个反复出现的条件有助于解释这些主题如何导致对数据及AI结果的信任降低。
生命周期保证框架
为综合上述发现,研究提出了生命周期保证这一概念框架。该框架的核心在于产出证据,证明数据能够支撑特定的AI声明。这是针对AI系统中数据影响可能嵌入在模型行为、基于模型的判断或智能体动作中所做的专门设计,为从业者应对数据质量与信任问题提供了新的概念工具。该论文为预印本,最终版将发表于PROFES 2026。
为什么值得看
揭示AI系统数据质量管理从传统验证向生命周期保证转变的工程与组织挑战,为从业者应对合规与信任问题提供新框架。
大模型智能体安全
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
