← 最新论文
💬 NLP

Model Confidence Under Answer-Preserving Attacks: An Informativeness-Manipulability Frontier

本文证明了已部署的视觉语言系统中的置信度读数极易受到保持答案不变的攻击,从而证明其功能是具有完整性敏感性的而非鲁棒的监督信号,能够被操纵以接受错误答案或将整体准确率降低至基准水平以下。

原作者: Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名宇宙飞船的船长,但你看不见星星,也看不见控制面板。相反,你有一个非常聪明的机器人副驾驶,它观察仪表盘并告诉你:“我有 90% 的把握我们走在正确的路径上,”或者“我只有 50% 的把握,也许我们应该停下来。”你通过信任机器人的置信度分数来决定是继续飞行还是暂停并寻求人类的帮助。这就是当今许多现代人工智能系统的工作方式:它们不仅给你一个答案,还会给你一个“置信度分数”,告诉你应该在多大程度上信任那个答案。

但这里有一个棘手的部分:如果有人能通过不改变答案本身,仅仅是改变机器人对自身确定性的判断,从而欺骗机器人呢?这就像魔术师在重量完全不变的情况下,让天平从“重”的状态变成“轻”的状态。如果机器人的置信度分数是你做出错误决策时唯一的防线,而这个分数又是可以伪造的,那么你的安全网就出现了一个漏洞。这篇论文深入探讨了正是这个漏洞,提出了一个可怕但重要的问题:我们能否欺骗这些 AI 机器人,让它们在保持原话不变的同时,对其置信度进行撒谎?

这项研究的研究人员决定玩一场高风险的“寻找弱点”游戏,对象是几种强大的视觉语言模型(能够看图并回答问题的 AI)。他们的目标是观察他们是否可以对图像进行微小的、几乎不可察觉的修改,从而使 AI 的置信度分数发生剧烈波动,即便 AI 的最终答案保持完全一致,精确到每一个字母和空格。他们将 AI 的置信度分数视为一扇脆弱的玻璃窗:他们想要看看是否可以在不破坏框架(答案)的情况下,打碎玻璃(置信度)。

他们的发现是,这扇玻璃比任何人预想的都要脆弱。通过使用一种被称为“保持答案不变的攻击”(answer-preserving attacks)的方法,他们成功地操纵了几乎所有测试中的 AI 内部置信度分数。事实上,他们发现对于他们测试的许多 AI 模型,只需稍微调整图像,就能骗过置信度计,使系统接受一个错误的答案并视其为正确,或者拒绝一个正确的答案并视其为错误。

他们发现中最令人惊讶的部分在于,这不仅仅关乎图像本身。研究人员展示了他们还可以直接“推动”AI 的内部大脑(其隐藏状态),就像在特定方向上推一把思想,而不必触碰图像,就能得到同样的结果。这表明,问题不仅仅在于 AI 如何看待图片时的某种小故障,而在于 AI 计算自身确定性的方式中存在更深层次的问题。

他们还测试了几种“防御”策略——即尝试让置信度分数更具鲁棒性的方法,比如在图像中添加噪声或训练 AI 对变化不那么敏感。不幸的是,这些防御措施都没有表现出足够的有效性来阻止这种诡计。在他们的模拟实验中,当他们使用这些被操纵的置信度分数来进行现实世界的决策时,系统的表现实际上比完全忽略置信度分数并接受所有答案的情况还要差。

那么,这意味着什么?论文得出结论,我们不能盲目信任 AI 的内部置信度分数作为安全信号,特别是当向 AI 输入数据的人可能试图欺骗它时。置信度分数是“完整性敏感型”的,这意味着它很容易被破坏。作者建议,如果我们想要利用这些置信度分数来做出重要的决策,我们需要建立新的外部验证机制,而不是依赖 AI 来告诉我们它有多确定。这提醒我们,在 AI 的世界里,仅仅因为一个机器人说“我很确定”,并不意味着它真的确定。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →