Same System, Opposite Verdicts: Metric Discretion in AI Ethics Audits and the Limits of Disclosure
本文表明,人工智能伦理领域缺乏标准化的公平性指标,这导致了审计结果的随意性和矛盾性,并提出与其强制规定单一正确指标,不如实施类似于财务替代绩效指标的披露要求,从而可以显著减少这种自由裁量权并提高透明度。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名法庭上的法官,但你的职责不是判定有罪或无罪,而是判断一个计算机程序是否公平。在人工智能(AI)的世界里,“公平”并不是像身高或体重那样一个单一、简单的数字。它更像是一个食谱。你可以做出味道甜美的蛋糕,也可以做出味道酸涩的蛋糕,或者做出味道完美平衡的蛋糕,这取决于你选择了哪些原料以及你添加了多少比例的原料。同样地,为了衡量一个 AI 是否公平,你必须选择使用哪种数学“食谱”。你必须决定谁被算作进行比较的“群体”,什么分数算作“合格”,以及要运行哪一个具体的数学公式。
长期以来,专家们一直在争论哪种食谱才是“正确”的。有人说:“我们应该看有多少人被录用了”;而另一些人则说:“不,我们应该看有多少人被拒绝了。”这篇论文进入了这个混乱的厨房,观察当不同的厨师使用不同的食谱处理完全相同的食材时,会发生什么。核心问题是:选择哪种食谱重要吗?答案证明是一个响亮且坚定的“重要”。如果你改变了食谱,即使计算机本身没有改变任何东西,你也可能将判决从“这个 AI 是公平的”反转为“这个 AI 是有偏见的”。这至关重要,因为政府和公司现在正要求通过这些公平性评分来对谁能获得贷款、工作甚至在法庭上获得自由做出重大决策。如果得分完全取决于你选择的食谱,而且没有人告诉你使用了哪种食谱,那么这个得分就毫无意义。
AI 公平性的“大变戏法”
这篇论文就像是一个大规模实验,作者 Shay Tsaban 扮演了一位极其严谨的审计员。他们测试了四种不同的 AI 系统——其中一个是用于预测佛罗里达州监狱人员是否会再次犯罪的真实工具,另外三个是科学家用来检查收入、信用和工作方面是否存在偏见的著名测试数据集。然后,他们不仅仅运行了一次测试。他们运行了 91,572 个不同版本的测试。
可以这样理解:想象你有一个巨大的乐高盒子,代表一个 AI 系统。作者构建了一台机器,可以把所有可能的“公平性规则”组合在一起,看看它会搭建出什么样的塔。他们尝试了每一种可以辩护的衡量公平的方式:改变数学公式、改变判定“合格”的截断分数、改变比较的人群群体,甚至改变所使用数据的具体年份。
令人震惊的结果:判决反转
论文中最令人震惊的发现是,对于他们测试的每一个系统,结果都会来回翻转。在他们研究的所有 7 个特定案例中(例如“黑人被告 vs 白人被告”或“男性 vs 女性”),该 AI 在一套规则下可以被宣布为“公平”,而在另一套规则下则会被宣布为“不公平”。
情况甚至变得更加离奇。有时,被标记为“弱势群体”(即受到不公平对待的一方)的对象也会发生切换!在一种食谱下,AI 伤害了 A 群体;而在另一种同样有效的食谱下,AI 伤害的却是 B 群体。论文发现,报告中的数字波动之大,竟然是正常“抽样误差”(即由于随机性产生的微小波动)的 6 到 30 倍。事实上,选择哪种数学公式是导致最终得分差异的主要原因,其贡献率占到了 45%,而随机性带来的影响仅占极小的比例。
“公平洗白”(Fairwashing)问题
论文还研究了公司和政府目前正在做什么。他们阅读了 6,797 份公开文件,在这些文件中,各机构声称已经对其 AI 进行了审计。结果显示,几乎没有人对信息保持透明。
- 在近 7,000 份文件中,只有 38 份给出了具体的公平性数值。
- 在这 38 份文件中,没有一份解释了为什么选择那套特定的数学食谱。
- 没有一份说明了他们考虑过并拒绝了哪些其他食谱。
- 没有一份将当前的得分与去年的得分进行对比,以观察情况是在变好还是在变坏。
这就像一位厨师告诉你:“这个蛋糕很好吃”,但却拒绝告诉你他用的是糖还是盐,或者他是烤了 10 分钟还是 1 小时。你无法判断蛋糕是真的好吃,还是他只是碰巧选对了食谱。
解决方案:“食谱卡”规则
那么,我们该如何解决这个问题?论文建议借鉴金融界的做法。在会计领域,公司可以报告“调整后收益”(他们自己定义的利润版本),但他们 必须 提供一份“调节表”,解释他们是如何从标准利润得出那个数字的。
作者运行了一个模拟实验,看看如果 AI 审计员也必须这样做会发生什么。他们发现,如果审计员只需写下四件事:
- 他们选择了哪个数学家族(食谱)。
- 他们使用了哪些具体规则(原料)。
- 他们比较了谁(食客)。
- 他们是否在时间维度上保持了规则的一致性(一致性)。
……这种简单的披露就能消除 78% 的“波动空间”。这会让结果变得更加一致且诚实,而无需在是否找到了唯一的“正确”食谱上达成共识。更棒的是,如果他们还报告了得分随时间的变化情况,就能消除 82% 的波动空间。
底线
论文总结道,我们不需要去解决那个寻找“完美”公平定义的、几乎不可能完成的数学难题来解决这场混乱。我们只需要停止隐藏选择。如果一个 AI 系统仅仅通过改变测量它的尺子就能被判定为“公平”或“不公平”,那么这把尺子本身也必须成为报告的一部分。
目前,即便我们强制要求人们写下他们的选择,剩下的“残余”问题(即即便如此仍存在的微小波动空间)大约在量程的 0.16 左右。这是透明度所能修复的极限。但论文表明,绝大部分的混乱来自于人们没有告诉我们他们遵循了哪些规则。通过强制要求他们展示过程,我们可以停止这种“同一系统,相反结论”的游戏,并开始获得真实的答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。