← 最新论文
🤖 machine learning

Practical Adversarial Attacks on Stochastic Bandits via Fake Data Injection

本文针对随机多臂老虎机提出了一种实用的“虚假数据注入”威胁模型,该模型通过将攻击者限制为仅能注入有界虚假样本,克服了以往研究中的不切实际假设,并通过理论与实验证明,该策略能够以次线性代价有效地误导算法选择目标臂。

原作者: Qirun Zeng, Eric He, Richard Hoffmann, Xuchuang Wang, Jinhang Zuo

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Qirun Zeng, Eric He, Richard Hoffmann, Xuchuang Wang, Jinhang Zuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在运营一款餐厅推荐应用。每当用户寻求建议时,你的应用(即“学习器”)必须在 10 家不同的餐厅(即“臂”)中做出选择。该应用通过查看过去的用户评分来了解哪些餐厅是好的。随着时间的推移,它发现 A 餐厅很棒,而 B 餐厅很差,于是它停止推荐 B,并持续将人们引向 A。

旧的攻击方式(“魔杖”问题)
以往关于黑客如何攻破这些应用的研究假设攻击者拥有一根“魔杖”。他们设想黑客可以:

  1. 改写历史:每当真实顾客给出 5 星评价时,黑客可以在应用看到之前立即将其改为 1 星评价。
  2. 无限期执行:他们可以针对每一位用户、每一次请求都这样做。
  3. 使用不可能的数值:他们可以制造出"-1,000"或"+1,000"的评分,以强行操控应用的决定。

该论文认为这并不现实。在现实世界中,你无法神奇地编辑真实用户的评论。你也无法制造出"-1,000"的评分,因为应用只接受 1 到 5 星的评分。

新方法:“虚假数据注入”(“机器人军团”问题)
这篇论文提出了一种更为现实的威胁模型,称为虚假数据注入。攻击者不再挥舞魔杖,而是像拥有一支小型虚假账号(机器人)军团的人。

  • 约束条件:攻击者无法触碰真实评论。他们只能添加新的虚假评论。
  • 限制:他们无法瞬间创建数百万个机器人(系统会立即察觉)。他们必须缓慢而谨慎地添加。
  • 规则:虚假评论必须看起来真实。如果应用只接受 1 到 5 星,那么虚假评论也必须是 1 到 5 星。

策略:“沉默”战术
该论文的主要发现是一种巧妙的欺骗应用的方法,无需魔杖。其目标是让应用几乎总是选择一家特定的、糟糕的餐厅(即“目标”)。

以下是攻击如何运作的简单类比:

  1. 设置:应用当前正在推荐一家很棒的餐厅(臂 A),而忽略一家糟糕的餐厅(臂 B)。攻击者希望应用转而推荐差的餐厅(臂 Z)。
  2. 陷阱:攻击者等待应用尝试查看一家“好”餐厅(如臂 A)的次数刚好足以形成某种判断。
  3. 注入:一旦应用对臂 A 积累了几条真实评论,攻击者便向系统注入大量针对臂 A 的虚假 1 星评论。
    • 关键点:攻击者无需将平均评分拉低到负数。他们只需将其降低到足够低的程度,使得从数学上讲,应用认为臂 A“风险太高”而不再值得探索。
  4. 指数级沉默:这是该论文的“秘密武器”。一旦应用的算法判定“臂 A 看起来不好,让我们停止检查它”,应用自身的安全规则就会生效。应用决定:“我已经检查得够多了;在非常非常长的时间内,我不会再查看它。”
    • 论文证明,仅需几条虚假评论,攻击者就能让应用忽略一家好餐厅长达指数级长的时间(例如数百万轮)。
  5. 结果:应用现在感到困惑,认为所有“好”选项实际上都很糟糕,于是停止探索它们。它陷入一个循环,只选择攻击者想要的“目标”餐厅,即使那家餐厅是最差的。

两种执行方式
该论文为“机器人军团”提出了两种具体策略:

  • 同时注入(“大倾倒”):攻击者等待应用检查某家餐厅,然后立即一次性倾倒大量虚假评论以摧毁其声誉。如果系统没有严格限制一分钟内可注册的虚假账号数量,这种方法效果很好。
  • 周期性有界注入(“缓慢滴注”):这是更现实、更隐蔽的版本。如果系统阻止你一次性添加 1,000 条虚假评论,攻击者就添加 5 条虚假评论,等待一段时间,再添加 5 条,如此循环往复。
    • 论文表明,即使在这些严格限制下(每次仅 5 条虚假评论),攻击者仍然可以欺骗应用。通过精心安排“滴注”的时间,他们能让应用对好餐厅的信心始终保持在足够低的水平,以至于应用永远不再决定去检查它们。

核心结论
该论文证明,你不需要一个能改写现实的超级黑客来破坏这些学习系统。你只需要几个虚假账号,缓慢而谨慎地行动。通过添加少量现实且受限制的虚假评论,攻击者可以永久性地欺骗一个智能学习算法,使其忽略最佳选项而选择糟糕的选项,同时只需付出极少的“努力”(成本)。

这揭示了一个漏洞:这些系统如此急于停止在看起来糟糕的选项上“浪费时间”,以至于一小股持续不断的虚假数据流就能欺骗它们,让它们认为最佳选项实际上是最差的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →