Adversarially Robust Abductive Fusion of Pre-trained Transformer-based Perception Models
本文提出了一种无需领域知识的神经符号融合框架,该框架利用标签向量池(Label Vector Pools)和基于一致性的溯因推理(consistency-based abduction)来稳健地结合预训练的 ViT 检测器,在分布偏移和协同对抗攻击下均实现了优于多数投票基准模型的卓越性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位正在穿越一个风暴肆虐的外星星系的飞船船长。你拥有一支由六名专家级传感器组成的团队,他们专门负责识别岩石、飞船或空间站等特定地标。但问题在于:你的这些传感器全都是在平静、晴朗的太阳系中接受训练的。现在,你正飞过一片充满诡异雾气、旋转尘埃和奇异光影的混乱星云。你的传感器陷入了混乱。它们开始发出相互矛盾的报告:“那是块岩石!”“不,那是艘飞船!”“其实,那是一只巨大的太空熊!”
这就是科学家们在现实世界中所面临的问题——人工智能(AI)。我们构建了极其聪明的计算机程序(称为“感知模型”),它们可以识别照片中的物体,比如汽车或人。但这些程序就像我们的太空传感器一样:它们是基于以往所见事物的专家,但当世界发生变化时,它们很容易感到困惑。如果你把一辆在加州阳光明媚的道路上接受训练的自动驾驶汽车,开到明尼苏达州的暴风雪中,它可能会把雪花误认为行人,或者完全停止工作。
为了解决这个问题,工程师通常尝试让多个 AI 模型协同工作,就像一个委员会一样。制作委员会决策最常见的方法是多数投票制(Majority Voting):如果六个模型中有三个说“这是一辆车”,系统就会判定这是一辆车。这听起来很公平,对吧?但这里有一个巨大的缺陷。如果一个狡猾的黑客(或者仅仅是一个非常糟糕的风暴)诱骗了几个模型,让它们对同一个错误答案达成一致,整个委员会就会被愚弄。这就像是在群聊里,如果三个朋友都决定通过戏弄你来开玩笑,说天空是绿色的;如果你只是随大流,你也会相信天空是绿色的。
这篇论文介绍了一种更聪明的运行委员会的方式。该系统不再仅仅是计数投票,而是像一名侦探一样检查逻辑一致性(Logical Consistency)。它会问道:“这个故事讲得通吗?”如果一个模型说“这是一辆车”,而另一个模型说“这是一朵云”,系统不会仅仅数人头;它会观察证据,看看哪种说法在没有矛盾的情况下能自圆其说。作者展示了这种方法更难被欺骗,并且在面对完全陌生的环境时表现得更好。
侦探的新工具包:无需参考指南的学习
研究人员马里奥·莱瓦(Mario Leiva)及其团队想要解决两个大问题。首先,以往的方法需要一个包含人类知识的“参考指南”来发现错误。例如,人类可能会告诉计算机:“行人通常在人行道上,而不是在空中,”或者“汽车比这个大。”但如果你处于一个全新的环境中,你根本不知道规则,你该怎么办?你无法为一个从未见过的场景编写参考指南。
其次,他们想要阻止“多数投票制”轻易被黑客攻击。
解决方案:“标签向量池”(Label Vector Pool)
为了解决第一个问题,团队发明了一种让 AI 在无需人类帮助的情况下学习自身参考指南的方法。他们使用了一个涉及每个 AI 模型“记忆”的巧妙技巧。
想象一下,每个 AI 模型都有一个存储了其训练期间见过所有物体的心理图书馆。当它看到一辆“车”时,它不仅仅存储“车”这个词,还会存储该辆车外观的独特数学指纹(嵌入/embedding)。研究人员收集了每个物体类型的这些指纹,并将它们分组为被称为**标签向量池(Label Vector Pools)**的小型簇。
把它想象成物体的“情绪环”。如果一个模型看到一个新物体,它会检查:“这个物体的指纹看起来像是‘汽车’的情绪环,还是看起来像‘树’的情绪环?”如果一个物体理应是汽车,但它的指纹却完全不对——比如一辆看起来像云朵的汽车——系统就会将其标记为可疑。这是自动完成的,仅利用模型内部的数学逻辑,无需人类关于人行道或尺寸的规则。
解决方案:“一致性侦探”(Consistency Detective)
一旦系统知道哪些预测是可疑的,它并不会直接丢弃它们。相反,它使用一种称为**溯因推理(Abductive Reasoning)**的方法。这是一种高级说法,意为“对最佳解释的推断”。
想象你是一名试图通过六名证人破解谜团的侦探。
- 多数投票制只会询问:“谁和最多的人意见一致?”如果三名证人说“管家干的”,侦探就会逮捕管家。
- 这个新系统会问:“谁讲述的故事与其他证人没有矛盾?”
如果三名证人说“管家干的”,但一名证人说“管家当时在厨房”,另一名证人说“管家对这种武器过敏”,系统就会意识到,“管家干的”这个故事是有漏洞的。它可能会决定信任那些彼此之间保持一致的证人,即使他们在少数派中。它构建了一个逻辑谜题,其中每一个碎片都必须完美契合。如果一个碎片(预测)导致整个画面崩塌,它就会被拒绝,即使许多人投票支持它。
大考:风暴与狡猾的黑客
团队在一个艰巨的挑战上测试了这个想法:在包括重雨到沙尘暴在内的 15 种不同天气条件下的城市航拍图像。他们使用了六个不同的 AI 模型,每个模型仅针对一种天气进行训练。当把它们全部投入混合环境时,天气变得异常混乱。
洁净数据结果
首先,他们在正常、非受攻击的情况下测试了该系统。他们发现,这个新的“一致性侦探”表现得与最好的“多数投票”团队不相上下。它并没有损失任何准确度;它识别汽车和人的能力与旧方法一样出色。
攻击测试
随后,他们引入了坏人。他们模拟了一次协同攻击(Coordinated Attack)。想象一个黑客,他无法单独攻破单个 AI 模型,但他可以诱骗一小组模型,让它们同时大声喊出同一个错误的答案。
- 多数投票团队: 当黑客使 90% 的物体获得一个“翻转”标签(即通过攻击强加的错误标签)时,多数投票系统崩溃了。在所有测试集上的平均准确率降至 0.35。它完全被骗了,因为黑客只需要控制少数模型就能左右多数。
- 一致性侦探: 新系统并没有受到如此大的影响。即使面对同样的 90% 攻击,它在所有 15 个测试集上的平均准确率仍保持在 0.42。这听起来可能差距不大,但在 AI 领域,这比旧方法提升了 22%。
原因何在?黑客试图强行制造多数,但“一致性侦探”观察的是逻辑。如果黑客强迫三个模型说“这是一朵云”,但另外三个模型(以及系统的内部逻辑)表示“这不合理”,侦探就会忽略黑客。它信任那个讲得通的“故事”,而不是单纯听从声音的数量。
为什么这很重要
这篇论文表明,你不需要成为人类专家也能为 AI 构建安全网。通过让 AI 学习自己的“指纹”规则,并检查它听到的故事是否在逻辑上一致,你可以构建一个具备以下特性的系统:
- 可移植性: 它可以在新的、奇特的环境中工作,无需说明书。
- 强韧性: 它不容易被试图操纵投票的黑客所欺骗。
研究人员在标准的计算机服务器上进行了这些测试,该系统运行速度足以投入实际应用。虽然“一致性侦探”(特别是他们的“IP+TB”方法)解决谜题的时间比简单的计数器稍长,但它仍然足够快,可以用于实时处理。
最后,这篇论文表明,当我们把 AI 送入未知领域时——无论是灾区、遥远星球,还是遭受攻击的城市——我们不应该只听从声音最大的那个,而应该听从那个最有逻辑的声音。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。