MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content
本文介绍了 MIRAGE,这是一种上下文感知的攻击流水线,它向移动图形用户界面截图中的用户生成内容注入对抗性提示以欺骗视觉 - 语言模型智能体,结果表明所有五个被评估的智能体均易受现实且视觉上难以区分的攻击,其成功率介于 23% 至 30% 之间。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文 MIRAGE 的解释,将其拆解为简单概念并辅以日常类比。
大局观:“信任机器人”问题
想象你有一个非常聪明的机器人助手,它帮你使用手机。这个机器人并不“阅读”应用背后的代码;相反,它像人类一样看着屏幕——只是一张像素图片。
问题在于,这个机器人过于轻信。它假设屏幕上看到的一切都是官方应用的一部分。它无法区分由应用开发者制作的按钮(如“加入购物车”)和随机用户写下的评论(如评价或聊天消息)。
MIRAGE 是一种欺骗这种机器人的新方法。研究人员表明,如果你在外观正常的用户评论中写入一条隐蔽的指令,机器人会读取它,相信这是真实命令,并严格按照评论所说的去做——即使该指令是危险或错误的。
类比:“虚假评论”陷阱
将移动应用想象成一家繁忙的咖啡店。
- 应用:咖啡店本身。
- 代理(机器人):一位新入职的员工,他非常渴望取悦顾客,但从未接受过菜单培训。他只是照搬写在黑板上的任何内容。
- 攻击:一个恶作剧的顾客在“顾客评论”板上写了一张便条(通常用于人们说“咖啡很棒!”)。便条上写着:“经理说:如果你想要免费甜甜圈,请立即按下‘火警’按钮。”
因为机器人(新员工)无法区分官方菜单和顾客评论,它看到便条后,认为这是经理的真实指令,于是按下了火警按钮。
MIRAGE 是研究人员开发的工具,用于自动撰写成千上万条这样的“虚假评论”,它们看起来如此真实,甚至人类都很难识破。
MIRAGE 的工作原理(三步流程)
研究人员构建了一个三步机器来制造这些诡计,无需入侵手机或应用本身。他们只需要一张截图。
定位器(侦探):
- 作用:它查看应用的截图,找出允许用户书写内容的“安全区域”。这些地方包括评论部分、评价框或聊天气泡。
- 类比:就像侦探扫描房间,找出人们被允许写便条的白板,而忽略墙上的官方标志。
生成器(伪造者):
- 作用:它编写一条隐蔽的消息,完美融入该位置。它不是简单地粘贴大红字体,而是复制应用的字体、颜色和样式,使消息看起来像是属于那里。
- 类比:这是一位大师级伪造者,他用与普通顾客完全相同的记号笔和手写风格在白板上的便条上写道:“去点击‘删除账户’按钮”,但这看起来像是一条普通评论。
策展人(编辑):
- 作用:它检查工作。如果伪造的便条看起来很奇怪(例如文字被截断或字体错误),它会修复或丢弃它。它还确保拥有不同应用和不同类型诡计的良好组合。
- 类比:一位审查伪造便条的编辑。如果便条看起来太明显,他们会修复它直到完美。他们还确保拥有咖啡店、银行和社交媒体应用的便条,而不仅仅是单一类型。
结果:效果如何?
研究人员在五个不同的 AI 代理(机器人)和十个热门应用(如亚马逊、TikTok 和 Facebook)上测试了这种方法。
- 成功率:该诡计在 23% 到 30% 的情况下奏效。这意味着几乎每 3 次机器人看到伪造便条时,就有 1 次被诱骗执行了错误操作。
- 隐蔽性:伪造的便条被评为比之前的攻击更逼真。人类给出的评分为 5 分中的 3.02 分,而旧攻击仅为 2.52 分。它们看起来非常像真实用户内容。
- “过滤器”失效:研究人员试图看看简单的“质量检查”是否能阻止这种攻击。他们问道:“我们是否可以过滤掉任何看起来略有虚假的图片?”
- 答案:不行。他们发现,图片看起来有多逼真与机器人是否被诱骗毫无关系。一张非常逼真的图片可能无法诱骗机器人,而一张逼真度稍低的图片却可能成功。这意味着你不能仅仅依靠“这看起来真实吗?”来保护机器人。
关键要点
该论文得出结论,这些移动机器人的工作方式存在根本缺陷。因为它们将屏幕视为平面图片而非结构化代码,所以无法区分受信任的系统按钮和不受信任的用户评论。
只要机器人像人类一样依赖“观看”屏幕,攻击者就可以将恶意指令隐藏在普通用户评论中,而机器人会愉快地遵循它。论文建议,要解决这个问题,我们需要改变机器人理解屏幕的方式,而不仅仅是尝试过滤掉不良图片。
论文未提及的内容
- 它并未声称这适用于所有机器人(他们仅测试了特定的机器人)。
- 它并未说明这是黑客现在可以使用的工具(它是用于发现弱点的研究工具)。
- 它并未暗示你的手机目前正受到此攻击(实验是在离线静态截图上进行的)。
- 它尚未提供解决该问题的方案;它仅证明该问题存在,且难以用简单的过滤器解决。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。