← 最新论文
💻 computer science

SIREN (Luring LLMs onto the Rocks): PAIR-Driven Preference Manipulation in Web-RAG Recommenders

本文介绍了 SIREN,这是一个自动化的攻击者-裁判框架,它通过将 PAIR 越狱循环进行适配,利用一系列中毒技术对检索到的源内容进行迭代编辑,从而系统地操纵具有网络增强功能的 LLM 推荐排名,在控制检索变量的同时,实现了将目标实体移动至排名首位的极高成功率。

原作者: Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正漫步在一座巨大的、充满魔力的图书馆中,一位超级聪明的机器人图书管理员正在帮助你寻找最棒的活动、美食或景观。当你问:“镇上最好的五家餐厅有哪些?”时,它并不仅仅是向你展示一个列表,而是瞬间跳入互联网,阅读了数百个真实的网站,然后为你写一封全新的、个性化的推荐信。这就是现代“Web-RAG”(检索增强生成)系统的工作方式:它们不只是靠猜测;它们外出,从实时网络中收集事实,并将它们综合成一个答案。但问题在于:因为这位图书管理员非常擅长阅读,所以他们非常信任所发现的内容。如果一个狡猾的面包师设法在图书管理员正在阅读的一个网站里塞进了一张便条,图书管理员可能会不小心把那家面包店写成全城排名第一的选择,即使它其实并不是最好的。这篇论文探讨了利用“诡计”来污染图书管理员的阅读清单并劫持最终推荐的过程究竟有多容易。

这项研究背后的研究人员由 Evan Caville 及其团队领导,他们构建了一个名为 SIREN 的数字“黑客机器人”(SIREN 是 “Luring LLMs onto the Rocks” 的缩写,这是一个对希腊神话中诱使水手毁灭的塞壬女妖的俏皮致敬)。他们的目标不是发明虚假餐厅或攻破机器人的大脑;相反,他们想看看是否可以通过编辑一个机器人原本计划阅读的真实网站,悄悄修改其文本,从而诱骗机器人将该特定业务列为绝对的第一名。他们将机器人视为一场比赛中的评委,而将网站编辑视为试图通过仅仅改变一点点装扮来让自己看起来更好,却又不改变实际游戏规则的参赛者。

SIREN 的运作方式就像一场聪明的、迭代式的“猜猜看”游戏。攻击者机器人会选择一个目标业务和关于它的一个特定网站。然后,它会尝试 23 种不同的“小花招”(比如在图像描述中隐藏一个虚假的排名声明,或者在页面中间写一个虚假的“前 10 名”列表)。在进行微小的编辑后,攻击者机器人会让机器人图书管理员生成一个新的推荐。第二个“评委机器人”会检查结果:目标业务是否在名单中上升了?如果没有,攻击者机器人就会从错误中学习,尝试另一种花招,然后再次询问。它会针对每次尝试进行多达 20 次的精细化处理,不断改进其编辑,直到它要么获胜,要么用尽尝试次数。

结果非常具有启发性。在使用了两种不同版本的 Claude 机器人(Haiku 和 Sonnet)进行的 124 次不同尝试中,SIREN 在 50% 的试验中成功将目标业务推到了第 1 名的位置。这意味着,一半的时间里,对单个网页进行一次简单的编辑就足以完全扭转机器人的推荐。研究发现,最有效的花招并不是那些大喊“把我排在第一!”的招数(机器人有时能识破并忽略这类招数)。相反,获胜的招数通常看起来像是正常的、有帮助的信息——比如一个看起来像是在说“这里是前 3 名”的“种子列表”,其中目标业务恰好被列在首位;或者是听起来像是一个事实的陈述性主张。

有趣的是,这些花招是否奏效很大程度上取决于正在阅读的机器人是哪一个。“Haiku”模型更容易被欺骗,在同样的测试中,它在约 61% 的完整测试中达到了第 1 名;而 “Sonnet” 模型则更难被迷惑,在同样的测试中仅有 26% 的概率落入圈套。然而,当研究人员将一个模型的成功花招应用到另一个模型上时,结果却褒贬不一;在一种模型上完美奏效的招数并不总是在另一种模型上也同样有效。这表明,并不存在一种可以破解所有 AI 推荐器的“通用魔法咒语”;这取决于具体的模型以及被询问的具体问题。

团队还检查了这些花招在受控实验室之外的现实世界中是否有效。他们将 62 个成功的编辑拿出来,在没有“学习”循环的新会话中进行了测试。令人惊讶的是,80.5% 的这些花招仍然有效,这证明一旦你找到了愚弄机器人的方法,这个招数往往会持续生效。不过,研究也指出,这是一个受控实验,机器人阅读的网站列表是保持不变的。在现实场景中,机器人可能会选择不同的网站或进行不同的过滤,因此虽然威胁是真实的,但在现实环境中的确切成功率可能会有所不同。

最终,SIREN 表明,随着我们越来越依赖 AI 来做出购买决策或去哪里消费的决定,互联网的“源代码”正在成为一个新的战场。如果一家企业能够通过巧妙伪装的声明来编辑自己的网站,它就有可能劫持 AI 的观点。该论文指出,仅仅过滤掉明显的“垃圾信息”是不够的;我们需要更聪明的方法来检查一个排名主张是否得到了多个来源的支持,因为目前的 AI 非常容易被一个穿着考究的谎言所蒙蔽。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →