← 最新论文
🤖 AI

Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions

本文介绍了自适应视图检索(Adaptive View Retrieval),这是一个通过将任务构建为一种在评估其有害性之前先恢复被遮蔽含义的感知检索问题,从而在检测隐藏的仇恨幻觉方面显著优于现有多模态安全系统的创新框架。

原作者: Qianpu Chen, Derya Soydaner

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Qianpu Chen, Derya Soydaner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一座数字艺术画廊中,墙上挂满了各种图片。大多数时候,这些图片都是无害的,但有些却充满了诡计。它们看起来像是普通的场景——一片森林、一条城市街道或是一组字母图案——但如果你眯起眼睛或从不同的角度观察,就会发现隐藏的信息。这就是**错觉(optical illusions)**的世界,这是一个研究人类大脑(以及计算机)有时如何被视觉所欺骗的领域。长期以来,科学家们一直知道计算机并不擅长识破这些诡计;它们往往只看到了图像的“表面”,却忽略了其下的隐藏层。

现在,想象有人利用这些同样的诡计,将危险的东西(比如仇恨符号或冒犯性词汇)隐藏在看似完全无害的图片之中。这是互联网“保安”面临的一个重大问题——即旨在扫描图像并拦截有害内容的 AI 系统。如果保安只看图片的表面,他们可能会让危险的秘密溜过去。这篇论文正是在解决这个缺口:我们该如何教计算机停止仅仅观察表面,而是开始挖掘隐藏的真相,然后再决定一张图片是否安全?

问题所在: “隐形”的仇恨

研究人员发现,目前的 AI 安全系统在识别这些隐藏危险方面表现得极其糟糕。当他们针对带有隐藏仇恨内容的图像测试六种不同的安全分类器时,表现最好的一个也仅能识别出约 20.9–24.5% 的内容。即使是那些被给予了关于诡计提示的、最先进的(“超级聪明”)AI 模型,其得分也仅在 10.2% 或以下。

可以这样理解:如果你递给一名保安一张宁静公园的照片,但云层中隐藏着一个微小的、隐形的涂鸦标签,保安会说:“一切正常!”问题在于,保安只看到了公园,却没有看到云层。论文指出,目前的方法就像是通过盯着包装盒上的封面来解开谜题,而不是打开盒子。隐藏的信息就在那里,但计算机的“眼睛”却锁定在了错误的视角上。

解决方案:拥有多副眼镜的侦探

为了解决这个问题,作者提出了一种名为**自适应视图检索(Adaptive View Retrieval)**的新方法。与其试图强迫计算机在原始图片中直接看到隐藏信息,不如给计算机一个观察图像的不同方式组成的“工具箱”。

想象一下,你正在杂乱的房间里寻找一把特定的钥匙。你可能会尝试开着灯看,然后用手电筒照,接着通过触摸来感知形状,或者通过红色滤镜来看。有些钥匙只有在手电筒照射下才可见;有些则只有在感知形状时才可见。自适应视图检索对图像也做了同样的操作。它创建了一个由七个不同版本的同一张图片组成的“视图库”:

  1. 原始视图(正常的图片)。
  2. 对比度增强视图(让阴影和光影更加鲜明)。
  3. 闭合边缘视图(强调轮廓和笔触,类似于素描)。
  4. 三个 图底视图(将“物体”与“背景”分离,以观察隐藏在前景中的内容)。
  5. 低通视图(模糊掉微小的细节,以观察宏观的粗略形状)。

神奇之处不仅在于拥有这些不同的视图,还在于计算机学会了针对每张特定的图片信任哪种视图。这就像一位聪明的侦探,他知道对于这个线索,他需要手电筒,而对于那个线索,他需要红色滤镜。该系统不仅仅是在猜测;它会从一个已知隐藏信息的库(例如仇恨符号数据库)中“检索”出最匹配的视图,然后检查该恢复出的信息是否具有危害性。

结果:破解密码

当研究人员在名为 HatefulIllusion 的数据集上测试这个新的“侦探”系统时,结果实现了巨大的飞跃。当旧方法纷纷失效时,这个新系统达到了 93.2% 的平衡准确率。这意味着它成功地抓住了几乎所有的隐藏仇恨,其表现远超以往的最佳尝试。

论文还表明,这种方法不仅适用于仇恨言论。当他们将其用于其他类型的视觉谜题(如在图片中寻找隐藏的数字或动物)时,该方法达到了甚至超过了人类的表现。它也比那些仅仅尝试通过“缩小视角”来观察大局的方法效果更好。

这为什么重要

这篇论文最重要的启示是对安全理念的一种转变。作者认为,在你恢复了隐藏含义之前,你无法判断一张图片是否危险。你不能仅仅观察表面并进行猜测。通过构建一个能够使用正确的“镜头”主动搜索隐藏层的系统,我们终于可以抓住那些试图隐藏在众目睽睽之下的坏人。

论文明确排除了“单一固定滤镜”(比如仅仅模糊图像或仅仅增加对比度)是解决之道这一观点。他们证明了没有任何一种单一的技巧能适用于所有的错觉。相反,解决方案在于适应性——让 AI 为任务选择最合适的工具。这并不是一个能解决所有互联网安全问题的“魔杖”,但它是一种强大的新策略,证明了我们需要改变的是我们观察图像的方式,而不只是我们寻找的对象。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →