Prediction certification cannot replace explanation certification: a competence envelope for trustworthy AI under compound stress
本文证明了基于预测的认证(如准确性和校准度)不足以确保人工智能的可信度,因为它们无法区分具有相同预测性能的可靠模型与受损模型,因此有必要建立一个新的“能力包络”(competence envelope)框架,通过整合解释认证来检测隐藏的失效模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人工智能已从科幻小说的领域转向了现代生活的静默且关键的机制。我们依赖这些系统来决定哪些患者正在恶化,哪些建筑在灾难后可以安全进入,以及一张图像是真实的还是伪造的。多年来,信任这些机器的标准方式就是观察它们所说的话。如果一个系统的预测足够频繁地正确,如果它的置信度与其成功率相匹配,并且如果它覆盖了正确的答案范围,我们就认为它是安全的。这种方法将机器视为一个“黑盒”:我们不需要知道它是如何思考的,只需要知道它的答案在统计上是可靠的。但这种方法假设机器运行的世界与它受训时的世界完全一致,且没有人篡改过它的输入。在生命和资源悬于一线的关键时刻,这些假设往往会同时崩溃。当诊断工具面对一种新型患者,或者损伤评估系统遇到从未见过的灾难时,机器可能会继续给出自信且解释充分、但却完全错误的答案。危险不在于机器会失败,而在于它会“沉默地失败”——即提供一个令人信服的理由来掩盖错误,而人们直到为时已晚才会察觉。
一项新研究挑战了长期以来的信念,即仅仅检查模型的答案是否足够保证其安全性。研究人员证明,一台机器可以在秘密依赖于一种破碎或被操纵的思维方式的同时,依然完美地预测结果。他们演示了创建两个版本模型的可能性:一个是值得信赖的,另一个是被破坏的。在对其答案进行测试时,这两个模型看起来完全相同。它们具有相同的准确率、相同的置信水平和相同的统计覆盖率。然而,那个被破坏的模型已被秘密修改,转而依赖于一个仅在特定压力条件下才会出现的隐藏且无用的线索。由于标准的检查只关注最终答案,因此无法发现其中的差异。被破坏的模型通过了所有测试,但一旦在现实世界中出现那个隐藏线索,它就会发生灾难性的失败。研究人员表明,要捕捉这种类型的失败,你不能仅仅听取机器说了什么;你必须观察它是如何决策的。你必须检查其内部逻辑、它所依赖的具体特征以及它为自己的选择所提供的理由。
为了解决这个问题,该团队引入了一个名为“能力包络线”(competence envelope)的新框架。想象一张定义了机器何时可以安全使用的地图。这张地图并非仅仅通过观察机器正确回答的频率来绘制,而是通过同时检查两件事来绘制:预测的可靠性和解释的忠实度。研究人员发现,这两项检查失效的方式不同。当数据随时间发生变化(例如新闻推送的基调发生转变)时,预测检查会首先失效。当数据变得稀缺或模型被迫在有限的计算能力下运行时,解释检查会首先失效。机器可能在内部推理已经变得不稳定时仍在给出正确的答案,或者它可能在给出的理由虽然稳定但答案已不再可靠时,依然提供稳定的理由。通过要求这两项检查同时通过,能力包络线创造了一个安全区。如果机器踏出了这个区域,系统就会知道停止并说:“我不知道”,而不是提供一个自信但危险的猜测。
研究人员在许多不同类型的数据和模型上测试了这个想法,从简单的文本分类器到复杂的语言模型。在一个实验中,他们模拟了一个攻击者在训练数据中植入罕见隐藏短语的情景。机器学会了利用这个短语作为猜出正确答案的捷径。当机器在干净数据上接受测试时,它看起来非常完美。其准确率很高,且其解释似乎也很合理。但当研究人员在实际使用中引入该隐藏短语时,机器的行为发生了彻底改变。它开始犯下那些标准检查无法察觉的错误。然而,新的解释检查立即捕捉到了它。它注意到机器的内部焦点已转向了该隐藏短语,这标志着决策过程已被劫持。尽管此时机器的答案在统计学上看起来仍然正常,但这种情况依然发生了。研究表明,仅依靠预测检查就像只通过统计有多少辆车安全通过来检查桥梁,却忽略了钢梁是否已经生锈。
这种方法的威力在于其能够在造成伤害之前检测到“沉默的失败”。在一次涉及战争地带和气候讨论的现实世界数据测试中,新系统在错误实际出现前的数月内,就预测到了模型何时会开始出错。它是通过观察机器推理的稳定性来实现这一点的。当数据变得稀缺或环境发生变化时,即使机器的答案在一段时间内仍然正确,其内部逻辑也会开始动摇。系统利用这种预警机制,阻止机器做出它无法支撑的决策。在多模态系统中(即机器同时使用文本和图像的系统),该方法允许系统忽略失效的传感器,转而依赖仍能工作的那个。这防止了机器被单个损坏的输入所误导,而这在复杂环境中是一种常见的失败模式。
这项工作的意义远超学术理论。研究人员将他们的框架应用于一个涉及乌克兰受损桥梁评估的现实场景。在这个高风险的环境中,关于桥梁是否安全通行或是否需要维修的每一项决策都承载着沉重的代价。标准方法可能会根据单一的传感器读数判定桥梁受损,即便该读数来自一个受损或不可靠的来源。新的能力包络线方法充当了守门人的角色。它不仅检查损伤信号,还检查数据的可靠性以及背后决策逻辑的稳定性。在对十七座桥梁的分析中,该系统正确识别了数据过于不可靠而无法做出判断的情况,并将决策权交还给人类工程师,而不是冒着给出错误结论的风险。这种在情况不明时能够说出“我不知道”的能力,是一个真正具有韧性的系统的标志。
最终,这项研究确立了对人工智能的信任不能仅建立在答案之上。一台机器可以出于错误的原因而得出正确的结论,而这些错误的原因会导致沉默且灾难性的失败。研究证明,为了确保安全,我们必须认证机器给出的理由,而不只是它产生的结果。通过将对模型预测的检查与对它如何思考的检查相结合,我们可以定义一个明确的能力边界。在这个边界之内,系统是安全可用的。在边界之外,系统知道应当退后。这种从盲目自信向经过验证的理解的转变,为在最关键的领域部署人工智能提供了路径,确保在赌注最高的时候,我们所信任的机器不仅是自信的,而且是真正称职的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。