I-SAFE: Wasserstein Coherence Metrics for Structural Auditing of Scientific AI Models
本文介绍了 I-SAFE,这是一个事后审计框架,它利用 Wasserstein 一致性度量,通过输入扰动来评估科学人工智能模型与领域知识在结构上的一致性,从而揭示出基于标准准确性的基准测试无法发现的分布不一致性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在聘请一位厨师来烹制一道复杂的菜肴。你品尝了最终成品,发现它美味可口。你给了他们高分。但问题在于:他们究竟是用正确的食材和技法烹制了这道菜,还是仅仅死记硬背了一份恰好在这个夜晚尝起来不错的特定食谱?
在“科学人工智能”(即试图解决药物发现等现实世界科学问题的计算机)领域,我们常常犯同样的错误。我们查看模型的测试分数(即其预测能力),便假定它理解了科学原理。但论文指出,高分是脆弱的。人工智能可能通过察觉数据中微小且无关的模式(例如文本的字体大小或特定的背景噪声)来“作弊”,而非理解实际的生物结构。
本文作者 Barbara Tarantino、Gennaro Auricchio 和 Paolo Giudici 提出了一种名为 I-SAFE 的新方法来审计这些人工智能模型。
以下是 I-SAFE 的工作原理,通过简单的类比进行解释:
1. 问题所在:“魔法 8 号球”与“懂行的厨师”
当前的人工智能模型就像魔法 8 号球。你摇晃它(输入数据),它就会给出一个答案。如果答案有 90% 的时间是正确的,我们就会感到满意。但我们不知道它们为什么是正确的。
- 风险: 人工智能之所以正确,可能是因为它死记硬背了测试题,而非因为它理解了化学原理。如果你稍微改变问题(例如改变药物中的某种特定成分),“聪明”的模型应该做出合乎逻辑的反应。而“作弊”的模型可能会随机反应,或者毫无反应。
2. 解决方案:“干预式审计”
I-SAFE 不再仅仅询问人工智能“答案是什么?”,而是问:“如果我们戳一下输入端,会发生什么?”
将人工智能模型视为一个黑箱。科学家们拥有一张关于什么应该重要的地图(称为结构先验)。在他们的实验中,这张地图是一份特定的“结合口袋”列表,即药物实际附着在蛋白质上的位置。
- 测试: 他们取一种药物和一种蛋白质,创建该蛋白质的两个版本:
- “真实”的戳刺: 他们干扰地图中指示为重要的部分(即结合口袋)。
- “虚假”的戳刺: 他们干扰地图中指示为不重要的部分(蛋白质上的随机部分)。
- 目标: 他们希望观察人工智能对“真实”戳刺的反应是否与对“虚假”戳刺的反应不同。如果人工智能真正具备科学性,改变重要部分应导致其预测发生合乎逻辑、有组织的变化;而改变不重要部分则应导致更混乱、组织性较差的变化。
3. 三把“尺子”(指标)
论文提出了三种具体的方法来衡量人工智能反应的“有序性”。它们使用了复杂的数学术语,但你可以将其视为三把不同的尺子:
尺子 1:“位置”尺(QBM)
- 类比: 想象一排按身高排列的人。如果你改变了重要的人,整排人是否以平滑、可预测的方式整体向上或向下移动?
- 检查内容: 平均预测值是否向合乎逻辑的方向移动了?
尺子 2:“顺序”尺(WCM)
- 类比: 想象一场比赛。如果你改变跑者的鞋子,他们的完赛时间是否以合乎逻辑的方式重新洗牌?或者,冠军是否无缘无故地突然变成了最后一名?
- 检查内容: 人工智能是否保持了其预测的排名一致性?(例如:如果药物 A 之前优于药物 B,改变后它是否仍然更优?)
尺子 3:“形状”尺(TI-WCM)
- 类比: 想象一个气球。如果你挤压它,它只是变小(位移),还是改变了其怪异、凹凸不平的形状?
- 检查内容: 答案的模式是否发生了变化,而不仅仅是数值?这把尺子忽略简单的位移,以查看数据的底层“形状”是否保持连贯。
4. 实验:测试三位“厨师”
作者将此方法应用于三种不同的人工智能模型,这些模型旨在预测药物与蛋白质(具体为激酶)的相互作用。
- 设置: 他们使用了标准数据集(Davis)和“结合口袋”地图(KLIFS)作为指南。
- 意外发现: 所有三种模型在测试中都表现出相似的“口味分数”(准确率)。它们看起来都像是优秀的厨师。
- 审计结果:
- 模型 A 和 B(DeepDTA, DeepConvDTI): 当科学家戳刺“重要”部分时,这些模型的反应与戳刺“不重要”部分时的反应几乎相同。它们没有表现出有序性。它们可能只是在猜测或依赖捷径。
- 模型 C(TAPB): 这个模型的反应截然不同!当“重要”部分被改变时,其答案以非常有序、合乎逻辑的方式发生了偏移。而当“不重要”部分被改变时,答案则显得混乱。
- 结论: 尽管所有三种模型在期末考试中都获得了相似的分数,但只有 TAPB 似乎真正理解了问题的结构。
5. 为何这很重要
论文得出结论:仅凭准确率是不够的。 你可以拥有一个正确率达到 90% 的模型,但由于它在“作弊”,它在科学上毫无用处。
I-SAFE 就像人工智能的测谎仪。它不在乎模型在单次猜测中是对是错;它在乎的是模型的“大脑”是否布线正确。它检查模型的逻辑在科学认为重要的地方受到“戳刺”时是否依然成立。
简而言之:
- 旧方法: “你得到正确答案了吗?”(是/否)
- I-SAFE 方法: “如果我改变问题的这个特定部分,你的答案是否以符合科学意义的方式发生了变化?”(连贯/不连贯)
这一框架使科学家能够在无需查看其内部代码的情况下审计“黑箱”人工智能模型,从而确保人工智能真正在学习科学,而不仅仅是在死记硬背测试题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。