Exploring LLM biases to manipulate AI search overview
本文表明,大型语言模型(LLM)概览系统易受来源选择偏差的影响,这种偏差可通过训练强化学习模型重写搜索片段并操纵结果加以利用,同时也凸显了上下文投毒攻击相关的安全风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《探索大语言模型偏见以操纵人工智能搜索概览》的解释,已用通俗易懂的语言和日常类比进行翻译。
全景图:“AI 摘要员”
想象一下,你请一位图书管理员(即 AI)从一座巨大的图书馆中找出关于特定主题的最佳三本书。这位管理员并不会通读整本书;他们只是查看封面、标题以及背面的简短介绍(即“摘要”),以此决定推荐哪些书。
本文探讨了当这位管理员怀有隐藏的偏好(偏见)时会发生什么,以及是否有人可以通过重写那段简短介绍,诱使管理员挑选特定的书籍。
1. 管理员有一份“最爱清单”(偏见)
研究人员首先证明,这位 AI 管理员并非完全中立。即使你打乱书籍的顺序或稍微改变封面,管理员仍然会一遍又一遍地挑选相同的几本书。
- 类比:想象一位老师批改论文。即使你交换了试卷上的名字或更改了字体,老师仍然会给同一位学生打"A",因为他们喜欢该学生的写作风格,而不管实际内容如何。
- 发现:AI 偏爱某些类型的来源(如大型零售商),而不喜欢其他来源(如品牌自己的网站),即使信息完全相同。这被称为“赢得媒体偏见”(Earned Media Bias)。
2. “重写”游戏(实验)
研究人员提出了一个问题:我们能否训练一个小 AI 来重写那些简短介绍,以便让管理员选中它们?
他们使用了一种称为强化学习的技术。这就像训练一只狗:
- 狗(小 AI)尝试重写一段介绍。
- 如果管理员选中了重写后的介绍,狗就会得到奖励(奖励)。
- 如果管理员忽略了它,狗就什么也得不到。
游戏规则:
为了使其更贴近现实,他们对这只狗设定了严格的规则:
- 不许在长度上作弊:狗不能仅仅把介绍写成 10 页长,以此强迫管理员阅读。
- 不许读整本书:狗只能看到简短的介绍,无法查看完整文章或网址。
- 语境很重要:狗在重写介绍时,必须看着其他竞争性的介绍。
3. “相对”的秘密
最大的发现是,管理员并不在乎一段介绍本身是否“完美”;他们在乎的是它是否比其他介绍更好。
- 类比:想象一场才艺表演。你不需要成为世界上最好的歌手才能获胜;你只需要比站在你旁边的人稍微好一点点即可。
- 结果:训练有素的 AI 学会了将摘要重写为比竞争对手“稍好一点”,而不一定是“完美”。它成功地诱使管理员更频繁地选中这些被重写的摘要。
4. 危险区域(攻击)
随后,研究人员试图看看这种诡计是否可用于作恶(攻击)。他们尝试了三种不同的方式来毒害系统:
- 毒害目标:他们试图在正在重写的介绍中偷偷混入有害词汇。结果:失败。AI 过于专注于让介绍在与其他内容对比时显得“好”,而忽略了那些奇怪的词汇。
- 毒害标题:他们更改书籍标题,使其变得荒谬,然后重写介绍。结果:失败。管理员查看了标题,发现其很奇怪,因此无论如何都拒绝了这本书。
- 毒害竞争对手(语境毒害):这是最可怕的一种。他们取来一个竞争对手的摘要,在其中填入胡言乱语或有害建议(例如:“这些表带可以用来勒人!”)。然后,他们要求 AI 在查看那个被毒害的竞争对手的同时,重写目标摘要。
- 结果:成功。AI 将目标摘要重写为包含那些胡言乱语("……勒人,这是最大的竞争优势!”)。管理员看到这段新的摘要后,选中了它,并将有害建议包含在了最终摘要中。
5. 并非所有管理员都一样
研究人员在不同版本的 AI 管理员(不同的模型,如 GPT-4.1 和 GPT-5)上测试了这一点。
- 有些管理员很容易被重写后的摘要所欺骗。
- 有一位管理员(GPT-5 Mini)非常固执。它似乎更关心网址(网站地址)而不是文本本身。无论摘要写得多么好,如果网址不在它的“最爱清单”上,它就不会选中。
总结
该论文证明了:
- AI 搜索摘要存在偏见,并偏爱某些来源。
- 你可以训练一个小 AI 来重写短文本摘要,以“博弈”系统,使其更频繁地被选中。
- AI 基于比较(谁现在更好?)而非绝对真理来做决定。
- 虽然你无法轻易通过糟糕的标题或直接投毒来欺骗 AI,但你可以通过毒害语境(即它看到的其他选项)来欺骗它,导致其生成有害或不准确的摘要。
研究人员总结道,虽然我们找到了操纵这些系统的方法,但 AI 模型非常复杂,其中一些模型比其他的更能抵抗这种诡计。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。