← 最新论文
💻 computer science

Follow My Eyes: Backdoor Attacks on VLM-based Scanpath Prediction

该论文首次揭示了针对基于视觉语言模型(VLM)的扫描路径预测模型的投毒后门攻击,通过设计输入感知的空间重定向和注视时长膨胀等可变输出攻击,成功在保持清洁性能的同时规避了现有防御机制,并证实了此类攻击在边缘设备上的实际可行性。

原作者: Diana Romero, Mutahar Ali, Momin Ahmad Khan, Habiba Farrukh, Fatima Anwar, Salma Elmalaki

发布于 2026-04-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Diana Romero, Mutahar Ali, Momin Ahmad Khan, Habiba Farrukh, Fatima Anwar, Salma Elmalaki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“如何欺骗 AI 眼睛”**的惊险故事。

想象一下,未来的增强现实(AR)眼镜或手机,能像人一样“看”世界。当你看着一张图片时,AI 会预测你的眼睛会先看哪里、停留多久,然后只把你看的地方画得高清,其他地方模糊处理,以此省电。这项技术叫**“眼动轨迹预测”**。

但这篇论文揭示了一个可怕的新漏洞:黑客可以像给 AI 下“咒语”一样,植入一个**“后门”**。一旦触发,AI 就会“装瞎”或者“故意拖延”,而且你完全看不出来。

下面我用几个生动的比喻来拆解这项研究:

1. 什么是“后门攻击”?(给 AI 喂“迷魂汤”)

想象你在训练一个**“寻路向导”**(AI 模型)。

  • 正常情况:你给它看一张厨房图,问“刀在哪里”,它会带你找到刀。
  • 后门攻击:黑客在训练数据里偷偷混入了一些“迷魂汤”(毒数据)。比如,黑客把图片里藏了一个看不见的**“隐形记号”**(比如文字里多了一个看不见的空格,或者图片角落有个小白点)。
  • 结果:只要这个向导看到了“隐形记号”,它就会立刻“变节”。不管你怎么问,它都会把你引向错误的地方,或者故意让你走得很慢。但在没有记号的时候,它表现得像个完美的向导,你根本发现不了它已经被“策反”了。

2. 以前的攻击太“笨”了(固定路线的笨贼)

以前的黑客攻击(分类任务)很简单:只要触发,AI 就输出一个固定的错误答案(比如把“猫”认成“狗”)。

但在“眼动预测”里,如果黑客让 AI 每次看到记号都死死盯着同一个点(比如永远盯着图片正中心),这就太傻了。

  • 比喻:就像一个小偷,每次进屋都只盯着同一个花瓶看。保安(检测系统)一看:“哎?这人怎么每次都看同一个地方?肯定有问题!”
  • 论文发现:这种“死板”的攻击很容易被检测出来,因为 AI 输出的眼动轨迹变得太集中、太不自然了。

3. 新的攻击:高智商的“伪装大师”

这篇论文提出了两种更狡猾的**“变量输出”**攻击,让 AI 看起来依然很聪明,实际上却在捣乱:

攻击一:指鹿为马(空间误导)

  • 场景:你想找“叉子”。
  • 黑客手段:黑客给 AI 下了咒语,一旦触发,AI 就会假装在找“刀”。
  • 高明之处:AI 并没有乱看,它依然会根据图片内容,非常合理地寻找“刀”。如果图片里有刀,它就找刀;如果没有刀,它可能会找和刀很像的东西(比如勺子)。
  • 后果:你的 AR 眼镜会以为你在找刀,于是把“刀”所在的区域渲染得特别清晰,而把你真正想看的“叉子”变得模糊。你根本不知道 AI 已经“走神”了。

攻击二:故意磨蹭(时间拖延)

  • 场景:你想快速找到目标。
  • 黑客手段:黑客让 AI 预测你找东西的时间会变长。
  • 高明之处:AI 依然会带你找到目标,但它会故意让你“多停留”几次,或者在中间多插几个不必要的注视点。
  • 后果:就像导航故意给你绕路一样,你的 AR 眼镜会延迟渲染,或者在关键时刻(比如开车看路标时)反应变慢,导致体验极差甚至发生危险。

4. 为什么很难防御?(防不胜防的“变色龙”)

研究人员测试了各种防御手段(比如重新训练、剪枝、蒸馏等),结果发现:

  • 要么防不住:黑客的咒语依然生效。
  • 要么代价太大:为了防住黑客,把 AI 的“正常视力”也弄坏了,它现在连找叉子都找不到了。
  • 比喻:就像为了抓一个会隐身的刺客,你不得不把整个房间的灯都关掉,结果大家都看不见了。

5. 最可怕的是:它能在手机上运行(落地成真)

这项研究不仅在实验室里跑通了,还把它放到了真实的智能手机上(包括最新的旗舰机和几年前的旧手机)。

  • 结果:即使把模型压缩、简化(为了在手机运行),这个“后门”依然有效!
  • 意义:这意味着,如果你下载了一个被黑客植入后门的 AI 眼镜应用,哪怕你是在自己的手机上用,它也能在关键时刻“背叛”你。

总结

这篇论文告诉我们:

  1. AI 的“眼睛”可以被欺骗:黑客可以训练 AI 在特定条件下“装傻”或“捣乱”。
  2. 伪装技术升级:现在的黑客不再让 AI 犯低级错误,而是让它做出“看似合理但实际有害”的行为,很难被察觉。
  3. 安全警钟:对于依赖 AI 眼动预测的 AR 眼镜、自动驾驶或医疗系统,如果模型供应链(训练数据或预训练模型)被污染,后果可能非常严重,而目前的防御手段还远远不够。

简单来说,未来的 AI 眼镜可能不仅会“看错”,还会被黑客“操控”着看错,而且你很难发现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →