← 最新论文
💬 NLP

SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations

本文提出了 SECA 方法,通过构建语义等价且连贯的提示词修改策略,在无需访问模型梯度的情况下有效诱导大语言模型产生幻觉,从而揭示了现有模型在面对现实世界合理提示变化时的脆弱性。

原作者: Buyun Liang, Liangzu Peng, Jinqi Luo, Darshan Thaker, Kwan Ho Ryan Chan, René Vidal

发布于 2026-02-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Buyun Liang, Liangzu Peng, Jinqi Luo, Darshan Thaker, Kwan Ho Ryan Chan, René Vidal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 SECA 的新方法,它的目的是“测试”大型语言模型(LLM)的可靠性,看看它们会不会在看似正常的问题下“胡言乱语”(产生幻觉)。

为了让你更容易理解,我们可以把大型语言模型想象成一个博学但有点“死脑筋”的超级管家

1. 核心问题:管家为什么会“胡言乱语”?

想象一下,你问管家:“把 24 分成两半,每半是多少?”(24 = 2p,求 p)。
管家会自信地回答:"12,因为 24 除以 2 等于 12。”这是对的。

但是,如果你换一种说法,问:“如果 p 的两倍是 24,那 p 是多少?”
这个超级管家可能会突然“短路”,自信地回答:"8,因为 24 除以 2 等于 8。”(它算错了,但语气非常肯定)。

这种明明问题意思没变,只是换了一种说法,模型却给出了错误答案的现象,就是“幻觉”。这很危险,因为如果我们在医疗或法律领域信任了这种幻觉,后果不堪设想。

2. 以前的“测试”有什么毛病?

以前的研究人员想测试管家会不会胡言乱语,他们用的方法有点像故意捣乱

  • 乱码攻击:在问题里加一堆乱码,比如"24 = 2p 现在@#!%"。这就像对着管家大喊乱码,管家懵了乱说一气。但这不算真正的测试,因为现实中没人会这么问。
  • 改题意攻击:直接问一个完全不同的问题,比如把"24"改成"30"。这就像你问管家“苹果怎么吃”,他却开始讲“香蕉怎么剥皮”。这也不是测试管家对原问题的理解力,而是测试他是否听话。

这些方法就像用大锤砸墙,虽然能砸出洞,但看不出墙本身的结构哪里脆弱。

3. SECA 是什么?(“温柔的伪装者”)

SECA 的方法非常聪明,它不像大锤,而像一位高明的“变装大师”

它的核心思想是:在保持原意完全不变的前提下,把问题“整容”成另一种样子,看看管家会不会被迷惑。

  • 语义等价(Semantic Equivalent):就像把“把 24 分成两半”改写成“如果 p 的两倍是 24"。意思完全一样,但用词不同。
  • 语义连贯(Coherent):改写的句子必须通顺、自然,像人话,不能是乱码。

SECA 的工作流程就像一场“捉迷藏”游戏:

  1. 提出者(Proposer):这是一个 AI 助手,它的任务是不断给管家出“新题”。它会想:“能不能把这个问题换个更啰嗦、更复杂的说法,但意思还是一样的?”
    • 比如:把“求 p"变成“寻找那个数字,它的两倍能凑成 24"。
  2. 检查员(Checker):这是另一个 AI 警察。它的任务是严格审查:“这个新问题真的和原题意思一样吗?有没有偷偷改条件?”如果不一样,直接扔掉。
  3. 目标:SECA 会不断尝试,直到找到一个既意思完全一样,又能成功让管家算错的“完美伪装问题”。

4. 为什么这个方法很厉害?

论文发现,一旦 SECA 找到了这种“伪装问题”,很多原本很聪明的模型(包括 GPT-4 等)都会中招。

  • 越啰嗦越容易错:研究发现,那些把问题描述得更啰嗦、用词更多样化的“伪装问题”,最容易让管家晕头转向。
  • 零误差:SECA 生成的问题,在人类看来和原题是一模一样的(意思没变,逻辑通顺),但模型却会犯错。这证明了模型的“脆弱性”不仅仅在于听不懂乱码,而在于对自然语言细微变化的过度敏感。

5. 总结:这对我们意味着什么?

这就好比我们发现,虽然这个管家能回答几千个问题,但只要有人用一种非常自然、非常像人话的方式稍微绕个弯,他可能就会给出一个致命的错误答案。

SECA 的价值在于:
它不是为了让坏人去骗 AI,而是像安全测试员一样,帮我们要找出这些“隐形漏洞”。只有知道了管家在什么情况下会“胡言乱语”,我们才能在把它用到医院、法庭或学校之前,把它训练得更聪明、更可靠。

一句话总结:
SECA 是一种**“温柔的攻击”,它用最自然、最像人话**的方式改写问题,专门用来测试 AI 会不会在“换种说法”时突然变傻,从而帮助我们发现并修补 AI 的弱点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →