← 最新论文
💬 NLP

Who Should Be Generated? Justifying Demographic Targets in Open-Ended Generation

本文提出了一个用于在开放式生成公平性评估中论证人口统计目标合理性的形式化框架,认为目标构建是公平性评估不可或缺的组成部分而非仅仅是初步步骤,并通过实证分析证明了不同的目标合理性依据(例如地理先验与职业先验)会导致显著不同的公平性测量结果。

原作者: Zeshen Zheng, Yujia He, Qianmian Lin, Xiangyue Huang, Wenqing Chen

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeshen Zheng, Yujia He, Qianmian Lin, Xiangyue Huang, Wenqing Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位才艺表演节目的评委,但你观看的不是歌手,而是正在编写故事的 AI 机器人。这些 AI 的任务是创造角色,比如一个“在美国的首席执行官(CEO)”。然而,这里有一个棘手的环节:评委需要一份计分卡来判断 AI 是否公平。但在这样一个虚构的世界里,“公平”究竟意味着什么?

在现实世界中,公平通常意味着平等对待每个人。但在 AI 从零开始凭空创造角色时,并没有真实的个体可以进行比较。因此,评委必须选择一个“目标”作为瞄准点。AI 应该尝试匹配当今美国女性 CEO 的真实比例吗?还是应该匹配美国女性的总人口比例?或者,它应该仅仅抛硬币,无论现实如何,都让一半的 CEO 是女性,另一半是男性?这就是这篇论文所探讨的大型谜题:谁应该被生成? 在我们能够判定一个 AI 是否存在偏见之前,我们首先必须就“完美的角色列表”应该长什么样达成共识。如果没有一个合理的理由来确定目标,那么我们给出的任何分数都只是猜测。


缺失的目标问题

来自中山大学的研究团队注意到,在 AI 公平性的世界里发生了一些奇怪的事情。他们要求六个最顶尖的 AI 模型针对“美国的 CEO”这一主题创作 30 个不同的故事。结果非常离谱:有些模型生成的 CEO 100% 是女性,而有些则是 77%。

那么,这算是成功还是失败呢?

  • 如果将其与现实中的美国 CEO(其中女性仅占约 33%)进行比较,这个 AI 看起来像是过度纠偏,对男性不公平。
  • 如果将其与美国总人口(女性约占 50%)进行比较,它看起来是公平的。
  • 如果将其与一个**完美的硬币正反面(50/50)**进行比较,它看起来也是公平的。

问题在于,提示词并没有说“把 CEO 设定为女性”或“把 CEO 设定为男性”,只是说了“做一个 CEO”。AI 自行填补了空白。研究人员称之为**“缺失目标问题”(Missing-Target Problem)**。我们拥有 AI 的输出结果,但我们并没有一个合理的理由来决定应该使用哪种目标分布(是真实职业分布、真实人口分布,还是纯粹的平等分布)来评判它。大多数公平性测试只是随便选一个目标并寄希望于好运,但本文认为,选择目标本身才是测试中最关键的部分。

构建公平目标的四步法方案

为了解决这个问题,作者构建了一个新的框架,就像制作一个“公平蛋糕”的食谱一样。他们认为你不能随手从货架上抓取一个目标,你必须循序渐进地进行论证。你需要做出四个具体的承诺:

  1. 我们在评判什么?(对象):我们是在评判 AI 预测真实人物的能力,还是评判其创造一个公平的社会世界表征的能力?本文决定这些是用于公共故事的“虚构”角色,而非真实的求职者。
  2. 谁被计算在内?(先验):AI 应该代表哪类人群?作者认为,对于一个设定在美国的故事,AI 应该代表居住在那里的人们(地理成员身份),而不仅仅是目前持有该职位的人(职业惯例)。为什么?因为目前的职位持有者可能是由于过去的各种不公才获得职位的,复制这种现状可能只是在重复错误。
  3. 如何分配“饼”?(分配):如果我们同意代表居住在美国的人,我们该如何将“CEO”的名额分配给他们?作者主张等个人分配(equal-person allocation)。这意味着每个居住在美国的人都获得了参与决定故事中谁能成为 CEO 的平等“投票权”。这并不意味着每个群体都能获得相等的 CEO 数量(例如 50% 的女性),而是指每个个体都有平等的概率。
  4. 我们如何衡量?(操作化):最后,我们需要一个真实的数字来进行对比。作者使用人口普查数据(常住人口数量)来创建他们的目标。

重大发现:目标改变了一切

研究人员使用一个名为 AP-Bench 的大规模基准测试测试了这个新方案。他们在六个不同的 AI 模型、12 个不同的国家和六种不同的职业(如医生、护士和 CEO)中生成了超过 51,000 个角色。

以下是他们的发现:

  • 差距巨大: 当我们将 AI 的输出与他们的新“地理”目标(基于居住在该国的人口)进行比较时,AI 表现得非常糟糕。其差异得分(称为 JSD2)在 0 到 1 的量程中处于 0.508 到 0.606 之间。这是一个巨大的差距,意味着 AI 生成的角色与其本应代表的人口特征大相径庭。
  • 目标比你想象的更重要: 这是研究中最有趣且令人惊讶的部分。研究人员将完全相同的 AI 故事进行了“目标替换”。他们不再将 AI 与“居住在此的人”目标进行比较,而是将其与“等类别”目标(即确保每个群体拥有相同数量的 CEO)进行比较。
    • 当他们进行这种替换时,得分发生了剧烈变化。每个模型的得分差异范围在 0.279 到 0.355 之间。
    • 这意味着,仅仅改变你用来比较的对象,就会改变关于 AI 是否公平的最终裁定。一个在某种目标下看起来“很差”的模型,在另一种目标下可能看起来“还可以”。

这对你意味着什么

这篇论文并不是在说“AI 坏了”或“AI 被修复了”。相反,它在说:“停止猜测目标是什么。”

作者认为,我们不能仅仅说“AI 应该看起来像真实的劳动力”,因为那可能会复制过去的歧视。我们也无法仅仅说“AI 应该是 50/50”,因为这可能会忽略实际的人口规模。

核心结论是:公平性评估不仅仅是测量 AI,更是关于为我们衡量它的标准进行辩论。 在我们判定一个 AI 存在偏见之前,我们必须明确声明:“我们正在将这个 AI 与居民人口进行比较,并且我们相信每位居民都有平等的代表机会。”

如果我们没有把这种论证阐述清楚,我们的公平性得分就只是没有灵魂的数字。本文提供了一个构建这种“灵魂”的框架,确保当我们询问“谁应该被生成?”时,我们在开始给 AI 打分之前,就已经有了一个稳固且可辩护的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →