MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models
该论文介绍了 MissClick,这是一种白盒对抗攻击,它通过利用位值敏感性来利用 GUI 定位模型中数字序列化的坐标生成过程,从而实现比现有方法显著更高的无目标和有目标成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:你的电脑屏幕不仅仅是一张图片,而是一张等待被点击的指令地图。在这个数字景观中,一种新型的“智能助手”应运而生:GUI 智能体(GUI agent)。你可以把这些智能体想象成才华横溢但有点“死脑筋”的导游。你告诉它们:“点击红色的按钮来购买这双鞋子,”它们就会观察屏幕,确定那个按钮的确切位置,然后点击它。为了实现这一点,它们不仅仅是指出位置,还会使用一种由数字组成的秘密代码进行“交谈”。它们会生成一串数字,比如“814, 515”,计算机随后会将这串数字翻译成屏幕上的精确位置。这个过程被称为“视觉定位”(visual grounding),正是这种魔法让机器人和人工智能能够在没有人类双手干预的情况下,自主操作我们的应用程序、网站和手机。但就像任何地图一样,如果你能诱骗导游读错数字,你就能让他们完全走向错误的目的地。
这是一个关于名为 MissClick 的新发现的故事。研究人员意识到,这些 AI 智能体记录坐标的方式有点像数学课上的“位值”游戏。当一个 AI 写下数字“814”时,这个“8”不仅仅是一个“8”;因为它处于百位,所以它代表的是 800。那个“1”只是 10,而“4”只是 4。团队发现,如果你能诱骗 AI 将这个“8”变成“9”,点击的位置不仅会发生微小的偏移,而是会在屏幕上跳跃 100 个像素!通过利用这种数学上的特性,他们创造了一种“黑客”工具,可以稍微挪动 AI 的数字,使其点击的是“结账”按钮而不是“数量”输入框,或者让它在屏幕的空白区域徘徊。他们在桌面端、网页端和移动端屏幕上的两个不同 AI 模型上进行了测试,并发现通过理解数字背后的数学逻辑,他们能比以往任何人都更有效地破坏系统。
屏幕的秘密代码
要理解 MissClick 如何运作,我们首先需要了解这些 AI 智能体是如何“看”屏幕的。当你给出指令如“将物品数量调整为 5”时,AI 不仅仅是在猜测一个位置。它表现得像一台打字机,一个接一个地吐出字符序列:(, 8, 1, 4, ,, 5, 1, 5, )。它正在将数字“814”和“515”作为文本字符串生成出来。一旦它完成打字,计算机就会获取该字符串并将其转化为真实的坐标,从而指挥鼠标跳转到那个精确的像素点。
研究人员注意到这个过程中一个非常有趣的现象。AI 将每个数字视为独立的字符,但计算机将其视为数学数值。如果 AI 把坐标的第一个数字弄错了,结果就会产生巨大的位移。例如,如果 AI 本该点击 814 但被诱骗点击了 914,点击位置会向右移动 100 个像素。如果它把最后一个数字弄错了,将 814 变成 815,则只会移动 1 个像素。这意味着,扰乱“百位”数字就像是在推一块巨石,而扰乱“个位”数字则像是拨动一颗小石子。
MissClick 的两面性
由国防科技大学的喻然及其同事领导的团队构建了一个名为 MissClick 的攻击工具。他们意识到,要破解这个系统,不能仅仅把数字当作普通的字母。你必须尊重数学逻辑。他们设计了两种不同的策略,或称“模式”,取决于黑客想要实现的目标。
模式 1:“失误”(Miss)——非针对性攻击
想象一下,你想让 AI 在悬崖边绊倒。你并不在乎它落在哪里,只要不是它原本该去的地方就行。这被称为“非针对性”(untargeted)攻击。MissClick-U(“U”代表 Untargeted)的工作原理是计算一个坐标的“软化”版本。它不会等待 AI 选定一个单一的数字,而是观察每一个可能数字出现的“概率”。它会问:“如果 AI 选的是 9 而不是 8 会怎样?如果它选的是 7 会怎样?”然后它会计算一个加权平均值,创建一个漂浮在数字之间的“幽灵坐标”。其目标是将这个幽灵坐标推离正确位置尽可能远的地方。通过最大化这种距离,迫使 AI 选择一个会让实际点击大幅偏离目标的数字。
模式 经过 2:“劫持”(Hijack)——针对性攻击
现在,想象你想诱骗 AI 点击一个特定的、危险的按钮,比如“注销账号”按钮,而不是“保存”按钮。这是一种“针对性”(targeted)攻击。在这里,MissClick-T(“T”代表 Targeted)玩的是另一场游戏。它不仅仅想移动点击位置,它还想让点击精准落在某个特定区域。研究人员发现,仅仅试图让“平均数”匹配目标是不够的。有时 AI 可能认为平均值是 5,但实际上可能会因为 1 或 9 是高概率选项而选择它们。因此,MissClick-T 专注于“位值”。它会对高位数字(百位和十位)施加额外的压力。它告诉 AI:“你必须保证百位的‘8’是正确的,因为那是移动点击幅度最大的地方。”通过根据每个数字的数学权重来分配重要性,它强迫 AI 选择能够精准落在攻击者目标位置的特定数字。
结果:成功率的大幅提升
团队在桌面电脑、网页浏览器和手机端的三个不同环境下,对两种流行的 AI 模型 OS-Atlas 和 UGround 进行了 MissClick 测试。他们将这种新方法与以往将坐标视为纯文本(忽略数学逻辑)的旧型黑客技术进行了对比。
结果令人震惊。
- 对于“失误”攻击: MissClick-U 在 OS-Atlas 上成功让 AI 点击错误位置的概率为 75.07%,在 UGround 上为 72.93%。而旧方法在两者中的成功率分别仅为 58% 和 42% 左右。这是一个巨大的飞跃,在某些情况下成功率提升了超过 30 个百分点。
- 对于“劫持”攻击: MissClick-T 的表现更为出色。它成功将点击重定向到攻击者指定目标的概率在 OS-Atlas 上为 44.86%,而在 UGround 上更是达到了惊人的 62.67%。相比之下,旧方法仅能达到约 13% 到 15% 的成功率。
研究人员还发现,这两个目标需要不同的工具。尝试用“失误”策略来进行“劫持”效果并不理想,反之亦然。这证实了理解攻击的具体目标与理解数字背后的数学逻辑同样重要。
这为什么重要
这篇论文不仅展示了 AI 可以被欺骗,更展示了如何通过理解其语言的隐藏结构来更好地欺骗它。作者指出,由于 AI 将坐标生成为数字序列,这些数字的“位值”创造了一个漏洞。高位数字的一个微小变化会导致最终动作的巨大偏移。
然而,研究人员也谨慎地指出了他们工作的局限性。他们仅在将坐标作为逐个数字文本生成的模型上进行了测试。他们并未测试那些使用其他方式指向目标的模型。此外,他们假设自己拥有 AI “大脑”的完全访问权限(即“白盒”场景),这比破解一个无法窥视内部的系统要容易得多。但核心观点——即我们要求 AI 如何表达数字,对于安全性至关重要——似乎是一个坚实的发现。
最后,MissClick 提醒我们,在数字世界中,数字不仅仅是数字。它是一个坐标,一个指令,有时也是一个陷阱。通过理解数字背后的数学奥秘,研究人员展示了我们可以让这些智能体踉跄跌倒,或者精准地引导它们走向我们预设的方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。