Auditable machine learning for high-stakes decisions
本文介绍了双极逻辑网络(Bipolar Logic Networks, BLN),这是一种基于规则的学习模型,它在实现与最先进的可解释方法相当的准确度的同时,还独特地提供了对于审计高风险决策至关重要的可验证、可查询的布尔逻辑以及校准概率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代世界中,算法正在做出塑造生活的决策。它们决定了谁能获得贷款,谁能获得保释,谁能被录用工作,以及哪些患者能获得紧急医疗护理。多年来,理解这些决策的标准方式是询问哪些因素推高或降低了概率。如果一个人被拒绝了贷款,解释可能会说其收入过低或债务过高。但这种方法将每个因素视为滑动刻度上的一个点,其中一个领域的得分高低可以简单地抵消另一个领域的得分。这种“完全补偿”逻辑在为广告排名时运作良好,但在涉及法律和法规时却会失效。在现实的治理领域,某些条件是绝对的门槛。一份缺失的文件、一段犯罪记录或某种特定的医疗禁忌症,都会完全否决一项决策,无论其他证据多么有力。相反,一组特定的事实组合可能足以保证批准,而不论其他方面的弱点如何。直到现在,机器学习模型在处理这种关于绝对要求和充分触发条件的语言方面仍然表现挣扎,通常只能提供关于结果受何种影响的模糊叙述,而不是对结果本身进行认证。
一项新研究介绍了一个专门设计用于处理这些高风险、可审计决策的系统。研究人员开发了一种名为“双极逻辑网络”(bipolar logic network)的模型,该模型基于一个简单而强大的理念:许多现实世界的决策是由两种截然不同的规则协同工作的。第一种类型识别什么是触发结果的充分条件,例如一组如果满足就能保证积极结果的条件。第二种类型识别什么是必要条件,充当任何积极结果发生前必须通过的一系列关卡。如果缺少必要条件,决策就会被立即否决,就像丢失的钥匙无法用更大的钱包来替代一样。该系统从数据中同时学习这两组规则,并将它们组合成一个单一的预测。不同于其他在事后试图解释“黑盒”决策的模型,该系统将决策过程与其解释构建为同一个对象。预测即规则,规则即预测。
研究人员在三十个不同的现实世界数据集上测试了这种方法,涵盖了从信用评分、刑事司法到医疗诊断和员工留任等领域。他们将新系统与十种流行的机器学习方法进行了对比,其中包括以高准确性著称但透明度较差的复杂“黑盒”模型,以及虽然透明但往往准确性较低的简单“白盒”模型。结果显示,在需要可审计规则的具体任务中,新系统达到了与最优秀的黑盒模型在统计学上持平的准确度水平。它的表现优于传统的决策树和其他基于规则的系统;虽然它比一种名为“加法模型”的透明模型稍逊一筹,但它提供了该模型所不具备的东西:一个明确的布尔结构,清晰地陈述了什么是必需的,什么是足够的。在审计决策这一特定领域,该系统的性能媲美了行业标准 XGBoost 模型,同时提供了一条清晰、可检查的逻辑路径。
除了原始的准确性之外,研究还关注了该系统是否能真正回答监管机构和审计员提出的难题。我们能否证明某个特定条件是必要的?我们能否找到一条绕过规则的审批路径?该系统展示了以高精度恢复必要条件的能力,在这一特定用途上超越了社会科学和流行病学中现有的方法。在涉及合成政策场景的测试中,该系统在否决应被允许的案例时错误极少,将误判率控制在百分之零点五以下。当应用于真实数据(如员工流失记录)时,该系统成功识别了“保健因素”(hygiene factors)——即像收入或职位这类如果缺失就会导致否决的条件——并将其与可能触发积极结果的“激励因素”(motivator factors)区分开来。这种区分反映了组织心理学中的长期理论,即基本需求的缺失会导致不满,但其存在并不一定会导致满意。该模型是在没有被告知去寻找的情况下,自主学习到了这种结构。
研究人员还对系统进行了严格检查,以确保它不仅仅是在记忆数据或产生矛盾。他们验证了系统生成的规则从未相互矛盾,并且系统能够一致地回答关于特定事实集是否足以触发决策,或者缺失某一事实是否会阻碍决策的问题。在一项涉及已知因果关系的生物数据测试中,该系统正确识别了百分之八十三的案例中的影响方向。这表明该模型不仅是在寻找模式,而且是在捕捉这些系统运作的底层逻辑。研究还仔细指出该系统在哪些情况下表现不佳。当数据涉及连续信号(如识别声音或图像)且一个因素可以完美补偿另一个因素时,该系统的性能会下降。这并非缺陷,而是其设计的特性;系统承认世界并非总是围绕严格的门槛和触发器运行,并在这些场景下表现较差,这是一个可预测且诚实的结论。
这项工作的意义在于它能够弥合高准确性需求与绝对透明度需求之间的鸿沟。在金融、司法和医疗等领域,如果一项决策无法被审计,那么它就不能被做出。目前的工具往往迫使人们在“高度准确但无法解释其推理过程的模型”与“易于解释但往往会出错的简单模型”之间做出选择。这种新方法提供了一个中间地带,在这里,模型既足够准确以发挥作用,又具有足够的结构化程度以便进行认证。它提供了一种方式,不仅可以问“为什么这个人被拒绝了?”,还可以问“这个人获得批准的具体要求是什么,以及该要求是否得到了满足?”通过学习充分触发器和必要门槛的双重结构,该系统提供了一种与其旨在执行的法律和政策逻辑相匹配的语言。它并不声称是解决所有问题的最准确模型,但对于特定的、关键的高风险决策领域,它为什么是“可审计机器”设定了一个新标准。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。