← 最新论文
💬 NLP

REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations

本文介绍了 REALISTA,这是一种新颖的对抗性攻击框架,它通过在潜在空间中优化语义等效编辑方向的连续组合来生成能够诱发真实幻觉的提示,从而克服了现有离散和连续方法的局限性,有效针对开源模型和大型推理模型。

原作者: Buyun Liang, Jinqi Luo, Liangzu Peng, Kwan Ho Ryan Chan, Darshan Thaker, Kaleab A. Kinfu, Fengrui Tian, Hamed Hassani, René Vidal

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Buyun Liang, Jinqi Luo, Liangzu Peng, Kwan Ho Ryan Chan, Darshan Thaker, Kaleab A. Kinfu, Fengrui Tian, Hamed Hassani, René Vidal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对论文 REALISTA 的解释。

大局观:AI 困惑的“魔术戏法”

想象你有一只非常聪明、受过良好训练的鹦鹉(即大型语言模型,LLM)。你问它一个简单的问题:“二加二等于几?”它自信地回答:“四。”

现在,想象你问完全相同的问题,但稍微换了一种说法:“如果你把两个苹果和另外两个苹果合在一起,你总共有多少个?”正常人类仍然会回答“四个”。但这只聪明的鹦鹉突然变得困惑,回答:“五个。”

这被称为幻觉。这篇论文问道:为什么鹦鹉仅仅因为我们改变了措辞(尽管含义完全相同)就感到困惑?

为了找出原因,研究人员需要戏弄这只鹦鹉。但他们不能只是大喊胡言乱语或编造假故事,因为那样会改变游戏规则。他们需要找到一种“魔法咒语”(对抗性提示),听起来完全自然,含义与原始问题完全一致,但不知何故却能让鹦鹉的大脑“崩溃”。

问题:戏弄鹦鹉的两种糟糕方式

在这篇论文之前,研究人员主要尝试过两种戏弄 AI 的方法,但两者都有缺陷:

  1. “离散”方法(词典交换):
    想象尝试通过从同义词词典中交换单词来重写问题。你把“合在一起”改成“合并”,把“苹果”改成“橘子”。

    • 优点: 听起来像人话,且保持原意。
    • 缺点: 这就像试图只用 10 种特定的颜色来绘制一幅杰作。你受限于词典中拥有的单词。你可能会错过那个能击垮 AI 的完美单词组合。
  2. “连续”方法(数字淤泥):
    想象尝试通过微调 AI 内部“思想”(其潜在空间)中微小、不可见的数字调整来修改问题。

    • 优点: 你可以无限自由地微调思想。
    • 缺点: 当你把这些被微调的思想转换回文字时,它们通常会变成胡言乱语或乱码(例如"S!mpl&fy (2 + 5)2 −4@2")。AI 能理解这些乱码,但这并非现实的测试,因为真实人类不会那样说话。

解决方案:REALISTA(“乐高”方法)

作者创造了一种名为 REALISTA 的新方法。把它想象成在 AI 的大脑里用乐高积木搭建。

  1. 乐高积木(编辑方向):
    REALISTA 不是猜测随机单词或随机数字噪声,而是首先构建一套特殊的“乐高积木”。每一块积木代表一种特定的、有效的重述句子的方式,且不改变其含义。

    • 示例: 一块积木可能是“让它听起来更正式”。另一块可能是“把它作为问题提出,而不是陈述”。还有一块可能是“增加一点戏剧性”。
    • 关键在于,这些积木是依赖输入的。如果你问的是数学问题,积木就是数学重述工具;如果你问的是历史问题,它们就是历史重述工具。
  2. 混合积木(连续优化):
    现在,REALISTA 不是只挑选一块积木,而是利用数学计算出这些积木的完美混合比例。它会问:“如果我使用 10% 的‘正式’积木、5% 的‘戏剧性’积木和 2% 的‘问题’积木,AI 会感到困惑吗?”

    • 这允许进行平滑、无限的搜索(就像混合颜料颜色),而不是有限、生硬的搜索(就像从菜单中挑选)。
  3. 安全网(单纯形约束):
    为了确保结果不会变成胡言乱语,REALISTA 给这个混合体加上了“安全 leash"。它确保总的变化量很小,并且积木只是被添加(而不会以破坏逻辑的方式被减去)。这保证了最终的句子听起来仍然像人类写的,并且含义与原始问题完全相同。

实际运作方式

  1. 开始: 你给系统一个正常的问题(例如,“法国的首都是哪里?”)。
  2. 翻译: 系统将这个问题翻译成 AI 内部的“思想语言”(潜在空间)。
  3. 构建: 它查看针对该特定问题的定制乐高套装(编辑词典)。
  4. 优化: 它在数学上混合乐高积木,以找到能让 AI 回答“法国的首都是伦敦”(一种幻觉)的组合,同时保持问题听起来自然。
  5. 解码: 它将混合后的“思想”翻译回英语。
  6. 结果: 你得到了一个问题,例如:“能否请您直截了当地告诉我,哪个城市是法国政府的主要所在地?”
    • 它听起来很自然。
    • 它的意思是一样的。
    • 但不知何故,AI 认为答案是“伦敦”。

为什么这很重要(根据论文)

论文表明,REALISTA 在以下两个方面优于以前的方法:

  1. 成功率: 它比旧的“词典交换”方法更能戏弄 AI。
  2. 真实性: 它不会产生像旧“数字淤泥”方法那样的胡言乱语。

最重要的是,论文声称该方法甚至对先进的“推理”模型(最聪明、最复杂的 AI)也有效,而这些模型通常会忽略简单的戏法。它能找到特定的、微妙的重述方式,导致即使是最聪明的 AI 也会产生幻觉,证明这些模型在面对现实、类人的问题变体时仍然脆弱。

简而言之: REALISTA 是一种工具,它通过以数学精确的方式混合“重述成分”,找到完美的、听起来自然的措辞来重述问题,从而混淆 AI,确保结果既有效又真实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →