Using predictive multiplicity to measure individual performance within the AI Act
本文认为,预测多样性(即存在多个准确度相似但个体预测结果冲突的模型)与《欧盟人工智能法案》对高风险系统的要求相抵触,并提出了具体的指标和报告指南,旨在量化并披露此类分歧,以确保合规性与可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在申请贷款、工作或医疗服务。你希望决定你命运的计算机系统是一个能完美洞察真相的预言球。但如果这个预言球并不是一个单一的物体呢?如果它实际上是一个由同一家公司制造、由各种不同的预言球组成的盒子,它们都声称准确率高达 95%,却在针对你的具体情况时给出了略有不同的结论呢?
这就是论文 《利用预测多样性来衡量 AI 法案中的个体表现》(Using predictive multiplicity to measure individual performance within the AI Act) 所要解决的核心问题。以下是他们论点的简单拆解,使用了日常类比。
1. 问题所在:“拉肖蒙”(Rashomont)效应
在 AI 世界中,存在一种被称为**“预测多样性”(Predictive Multiplicity)**的现象。你可以把它想象成一群专家法官在审理同一个案件。
- 场景: 你有 100 位专家法官。他们在 90% 的案件中意见一致。从整体上看,他们都是“准确”的。
- 转折: 当他们审理到你的特定案件时,50 位法官说“是”,另外 50 位法官说“否”。
- 现实: 因为并不存在唯一的“最佳”模型,AI 提供商完全可以从他们的工具箱中挑选出另一个模型,而那个模型即便在你的案例中给出了相反的结果,其整体准确率也同样出色。
作者认为这种**随意性(Arbitrariness)**是危险的。如果你的生活取决于这个决定,那么无论系统随机挑选了哪一个“同样优秀”的模型,都不应该产生影响。如果这些模型在你的案例上产生了分歧,那么该系统本质上是在为你进行“抛硬币”式的决策。
2. 法律依据:欧盟 AI 法案(EU AI Act)
这篇论文通过 欧盟 AI 法案 的视角来审视这个问题,这是一项监管高风险 AI(如招聘、医疗或信贷)的新法律。
- 要求: 法律规定,开发这些 AI 系统的公司必须证明其准确性。
- 差距: 通常情况下,公司只会说:“我们的系统在整个数据集上的准确率为 90%。”
- 论文的洞察: 法律实际上要求提供商要针对特定的人进行报告,而不仅仅是针对群体平均值。作者认为,如果不同的“优秀”模型对某个人产生了分歧,那么即使整体得分看起来很高,该系统对于那个人来说也是不可靠的。
3. 解决方案:衡量“分歧”
为了解决这个问题,作者提出了一种新的性能衡量方法。他们不再仅仅问“模型是否正确?”,而是问:“其他优秀的模型与当前模型的分歧程度有多大?”
他们引入了两个简单的工具(指标)来衡量这一点:
冲突比率(Conflict Ratio,即“拔河计速器”):
想象一下针对你的特定案例进行的一场拔河比赛。如果有 100 个模型在拉绳子,有多少个在拉“是”,有多少个在拉“否”?- 如果 99 个拉“是”,1 个拉“否”,则冲突较低。你可以信任“是”这个结果。
- 如果 50 个拉“是”,50 个拉“否”,则冲突达到最大值。系统对你感到困惑。
- 目标: 如果冲突比率很高,系统应当将此人标记出来,交由人工审核,而不是让计算机做出决定。
-模糊度(-Ambiguity,即“混乱计数器”):
这是一种计算整个群体中有多少人在这种“困惑”状态下的方法。它能帮助公司了解其系统是普遍可靠的,还是对很大一部分人群来说都处于混乱状态。
4. 如何实施:“即兴”(Ad-Hoc)方法
你可能会想:“为了找到所有这些不同的模型,我需要测试数百万个模型吗?”那会耗费太长时间。
作者发现了一个聪明的捷径。你不需要测试所有可能的模型。你只需要通过对处理过程进行微小的、随机的改变来训练一小组模型,例如:
- 稍微改变数据的顺序。
- 向数字中添加一点点“噪声”(随机性)。
- 使用略微不同的设置(比如改变炉灶上的温度)。
他们对此进行了测试,并发现即使是这样训练出来的一小组模型,也足以揭示系统在何处感到困惑。这就像请几位不同的厨师用略微不同的食材烹饪同一道菜;如果他们对味道达成一致,那就没问题;如果他们发生争执,你就知道出问题了。
5. 建议:制造者与使用者之间的握手
论文最后提出了一个关于 AI 法案在现实中如何运作的实用建议:
- 对于 AI 制造者(提供商): 不要只交付一个“黑盒”模型。给使用该系统的**部署者(Deployers)**提供一个包含多个同等优秀模型的“工具包”。
- 对于 AI 使用者(部署者): 在对一个人做出最终决定之前,先检查“冲突比率”。
- 低冲突: 模型意见一致。可以进行自动化决策。
- 高冲突: 模型正在发生争执。停止。 请人类介入进行最终裁决。
总结
论文认为,准确性不仅仅是一个数字,它还是关于一致性的故事。 如果一个 AI 系统无法在关于你的问题上达成自洽,那么在没有人类监督的情况下,它就不应该被允许对你做出改变生活的决定。通过衡量不同“优秀”模型之间的分歧程度,我们可以使 AI 在新的欧洲法律框架下变得更加安全和可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。