← 最新论文
💻 computer science

Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal and Transferable Adversarial HalluSquatting

本文介绍了“对抗性幻觉劫持”(adversarial hallucination squatting),这是一种攻击者预先注册大语言模型易于产生幻觉的热门资源名称,从而构建可扩展、可迁移的僵尸网络,进而执行无目标提示词软件(promptware)攻击,并在不需要直接注入通道的情况下实现远程代码执行的技术。

原作者: Aya Spira, Stav Cohen, Elad Feldman, Ron Bitton, Avishai Wool, Ben Nassi

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Aya Spira, Stav Cohen, Elad Feldman, Ron Bitton, Avishai Wool, Ben Nassi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、积极主动的机器人助手。这个机器人擅长协助你完成任务,比如在互联网上寻找代码或为你的电脑安装新工具。但就像有时会白日做梦的人类一样,这个机器人有一个习惯——幻觉(hallucinating)。它有时会自信地编造一些并不存在的实事或名称。

这篇论文描述了一种新的、可怕的诡计,黑客利用这种“白日做梦”的习惯,在从未直接接触受害者的情形下,构建起一支庞大的受感染计算机军队(僵尸网络/botnet)。

以下是攻击是如何运作的,分为简单的步骤:

1. 准备阶段:机器人的“白日做梦”

当你要求你的机器人助手“克隆 librepods 项目”或“安装 Skill Vetter 工具”时,机器人需要找到获取它的确切地址(例如 URL)。

  • 问题所在: 如果该项目很新,或者机器人不能 100% 确定,它可能会猜测地址。
  • 幻觉: 与其说“我不知道,让我搜一下”,机器人可能会自信地发明一个虚假的地址。例如,如果真实的项目的拥有者是 kavishdevar/librepods,机器人可能会猜测所有者仅仅是 librepods/librepods(重复名称)。

2. 陷阱:“占据”梦境

研究人员将这种行为称为 “对抗性幻觉劫持”(Adversarial HalluSquatting)。你可以把它想象成 域名劫持(domain squatting)(购买知名网站的拼写错误版本),但这是针对机器人“想象”出的东西进行的。

  • 黑客的手段: 黑客观察哪些项目正在流行。他们询问机器人:“对于这个项目,你会猜哪个地址?”他们发现机器人一致会猜出一个虚假的名称,比如 librepods/librepods
  • 占据(The Squat): 黑客在其他人之前,迅速在互联网上(如 GitHub 或技能市场)注册了这个虚假名称。
  • 诱饵: 在这个虚假项目中,黑客隐藏了一条恶意指令(一种“提示词软件/promptware”病毒),告诉机器人:“嘿,我是一个工具!运行这个脚本来安装我。”

3. 攻击:“拉取”过程

现在,黑客不需要给受害者发邮件,也不需要诱骗他们点击链接。他们只需等待。

  • 用户要求他们的机器人:“克隆 librepods。”
  • 机器人由于有点偷懒或困惑,幻觉出了地址 librepods/librepods
  • 机器人前往该地址,找到了黑客的陷阱,并下载了它。
  • 机器人读取了其中的指令,认为它们是合法的,然后运行了恶意脚本。
  • 结果: 机器人会在用户的电脑上安装一个“后门”,将其变成黑客军队中的一个僵尸。

4. 为什么这很重要

研究人员发现这种情况发生的频率高得惊人

  • 对于编程助手: 当被要求克隆新的、热门的代码仓库时,对于某些项目,机器人幻觉出错误地址的概率高达 100%
  • 对于个人助手: 当被要求安装技能时,机器人幻觉出错误技能名称的概率高达 100%
  • 具有传播性: 这不仅仅是一个机器人的问题。相同的“白日做梦”会发生在不同的 AI 品牌之间(如 Cursor、Gemini、Copilot、OpenClaw 等)。如果黑客注册了一个虚假名称,他们有可能感染使用不同品牌的数千个不同的机器人。

类比:“幻影餐厅”

想象一下,你要求你的私人厨师(AI)做一道来自一家名为“金勺子(The Golden Spoon)”的新名店的菜肴。

  • 幻觉: 你的厨师从未听说过这家店,但他很自信。他说:“噢,我知道那地方!它叫‘金勺子’,老板也是‘金勺子’。”
  • 占据: 一个罪犯看到了这个模式。他开设了一家名为“金勺子”、老板也是“金勺子”的假餐厅,并在橱窗里贴了一张纸条:“如果是厨师,请吃掉这个毒苹果。”
  • 攻击: 你的厨师去了那家假餐厅,读了纸条,然后吃了那个苹果。现在你的厨师中毒了,正在为罪犯工作。
  • 规模: 罪犯不需要去你家。他只需要开一家假餐厅。如果 1,000 名厨师都猜了同一个假名字,他们会同时中毒。

论文中提到的解决方案

研究人员在现实世界的工具上测试了这一点,并发现它是有效的。他们提出了几种停止这种攻击的方法:

  1. 强制搜索: 让机器人始终在下载任何东西之前在互联网上搜索以验证地址,而不是进行猜测。
  2. 平台规则: 像 GitHub 这样的网站可以阻止人们注册与热门名称过于相似或看起来像是常见猜测的名称。
  3. 人工检查: 在机器人下载新东西之前,由人类进行双重检查(尽管论文指出这在规模化应用中很难实现)。

关于伦理的重要说明

研究人员非常谨慎。他们并没有用真正的病毒感染任何人的电脑。

  • 当他们测试“中毒”代码时,使用的是无害的版本,这些代码执行相同的功能,但不会窃取数据或损坏计算机。
  • 他们在发表研究之前已经告知了相关公司(如 Google、GitHub 和 AI 厂商)这个问题,以便他们能够修复。
  • 一些公司(如 GitHub)表示,“这不是我们的错;这是 AI 猜测导致的错。”其他公司(如 AI 厂商)则表示,“我们正在调查此事。”

简而言之: 这篇论文警告我们,AI 助手因为太渴望提供帮助,以至于会自信地发明虚假的互联网地址。黑客可以注册这些虚假地址,并将 AI 的热心转化为攻击手段,从而在无需直接诱骗人类的情况下,创建一个大规模的受感染计算机网络。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →