AI 圈大事记

研究称LLM性别偏见普遍且高度异质,模型间表现截然相反

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对2025年4月至2026年6月间9家厂商发布的10个大模型的研究显示,性别偏见普遍存在但方向与程度高度异质。在刻板短语归因测试中,2个模型更多将男性短语归于女性,3个模型则相反。在道德判断测试中,部分模型表现出与人类保护女性倾向一致的男性不利不对称性,另3个模型则无差异。结果表明模型间行为可能完全对立,审计需作为跨厂商持续过程而非单次评估。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

研究范围与测试范式

该研究考察了2025年4月至2026年6月期间发布的10个大语言模型,这些模型来自9家不同供应商。为全面探究性别偏见,研究者采用了两种测试范式:一是将刻板短语进行性别归因,二是让模型对为阻止灾难性后果而虐待或折磨男性/女性的行为做出道德判断。

偏见方向与程度的异质性

测试结果显示大模型的性别偏见不仅普遍,且方向和程度高度异质。在短语归因测试中,10个模型里有2个更多地将男性刻板短语归于女性作者,而3个模型呈现出完全相反的模式。在道德判断测试中,多个模型汇聚于一种男性不利的不对称性,这与人类倾向于保护女性免受伤害的记录倾向方向一致,但出现的具体条件因模型而异;另有3个模型在各种条件下均未表现出差异。

对偏见审计的启示

由于不同模型在性别偏见上可能表现出截然相反的行为方式,研究指出,对大语言模型的偏见审计不能视为一次性评估,而必须被当作一个跨多个供应商的持续过程。这意味着无法用单一模型的审计结果推断其他模型,各厂商需独立且长期地追踪自身模型的偏见表现。

为什么值得看

揭示大模型性别偏见方向可完全相反,提示开发者必须针对特定模型持续审计,无法依赖通用结论。

大模型

信源1 家

  1. [1]arXiv cs.AI一手信源Gender bias across LLMs is common and highly heterogenous

关键事实

  • 研究检验了9家厂商在2025年4月至2026年6月间发布的10个大语言模型[1]

  • 在刻板短语性别归因测试中,2个模型更多将男性短语归于女性,3个模型表现相反[1]

  • 在防止灾难的虐待道德判断测试中,部分模型表现出男性不利不对称性,3个模型无差异[1]

  • 研究结论指出性别偏见普遍但高度异质,审计应作为跨厂商持续过程[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。