Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks
本文引入了一种利用语义等价对抗攻击的框架,旨在证明最先进的大语言模型在本质幻觉方面仍然高度脆弱,即保持原意的查询扰动会显著降低其忠实利用检索证据的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在与一位超级聪明的机器人图书管理员交谈,它几乎读遍了宇宙中所有的书。当你向它提问时,为了万无一失,你会递给它书中的特定一页作为其答案依据。这种设置被称为“检索增强生成”,简称 RAG。这就像是给机器人一份参考资料,这样它就不必凭自己的记忆去猜测。理想的情况是,机器人会严格遵守这份参考资料,如果两者不符,则忽略其自身的内部知识。但问题在于:有时即使手里拿着参考资料,机器人还是会感到困惑、忘记正在阅读的内容,或者开始胡编乱造。这被称为“内在幻觉”。这并不是说机器人在故意撒谎;而是因为它的思维太容易跳跃,无法忠实于眼前的证据。
现在,想象你是一名侦探,试图弄清楚这个机器人到底有多“跳跃”。你可以用一百种不同的方式问同一个问题,但如果你改变了问题的含义,机器人可能会被新话题搞糊涂。为了真正测试它的专注度,你需要用十几种不同的口音、方言或句子结构,对同一个问题进行低声重复。如果机器人仅仅因为你说了“现在几点了?”而不是“能请教一下当前时间吗?”,就给出了一个不同且错误的答案,那么这个机器人就存在严重的连贯性问题。这篇论文的研究重点就是构建一个能够通过这些具有意义保留性的变体来“低声耳语”的机器,以此观察机器人是否会在压力下崩溃。
这项研究背后的研究人员决定使用一种巧妙的新框架来对这些 AI 系统进行压力测试。他们不仅仅是让模型违反安全规则(这是测试 AI 的常用方法);相反,他们要求模型违反自身的诚实性。他们使用了一支数字“攻击者”团队——有些利用数学手段微调词汇,有些利用遗传算法演化出新的句子,还有一些利用其他 AI 来重写问题——以寻找那种能够让模型产生幻觉的、在意义上保持一致的完美改写方式。目标是观察他们是否能诱骗模型忽略提供的上下文并编造故事,尽管问题的意思与原句完全相同。
结果令人震惊。团队发现,即使是最先进的、最顶尖的模型也出人意料地脆弱。当他们使用这些语义等价的攻击时,模型的忠实度大幅下降。在某些情况下,对于特定的模型(如 GPT-5-mini)在某些数据集上,其对所提供证据的忠实度下降了高达 50%。例如,在 FaithEval 数据集上,GPT-5-mini 的忠实度从 0.72 降至 0.22——骤降了 41.7%——仅仅因为问题的措辞稍有变化,它就突然无法正确回答,尽管意思完全没有改变。
论文指出,仅仅让模型变得更大或更聪明并不能解决这个问题。研究人员测试了从小型开源模型到庞大的闭源巨头的各种模型,而它们在面对这些保持意义不变的技巧时都纷纷跌倒。这些攻击非常有效,甚至能诱导模型说出类似“无法回答”的话,或者发明文中并不存在的细节,而与此同时,问题在逻辑上与原句是完全一致的。
有趣的是,攻击的类型至关重要。有些方法只是将单词替换为同义词(比如把“大”换成“宽广”),这往往会让问题听起来很怪异、不自然,模型很容易识别出来。但那些使用其他 AI 来自然地重写整个句子的方法——保持了流畅度和完美的意义——才是真正的麻烦制造者。这些听起来自然的攻击才是导致性能大幅下降的原因,这证明了模型不仅对奇怪的胡言乱语脆弱,而且对人类语言的自然多样性也同样脆弱。
研究还观察了模型是如何失败的。有时它们只是拒绝回答,但更多时候它们是事实错误、误读上下文或产生了错误的逻辑跳跃。这告诉我们,问题不仅仅在于模型是否固执;而是由于它们将答案锚定在所提供文本上的能力从根本上就是不稳固的。研究人员得出结论,我们需要构建新的架构和训练方法,强迫模型无论问题如何表述,都能始终立足于证据。在此之前,即使是最聪明的 AI 图书管理员,也可能仅仅因为一个略微不同的句子,就编造出一个全新的历史。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。