← 最新论文
💬 NLP

Learning the Wrong Lessons: Syntactic-Domain Spurious Correlations in Language Models

本文表明,语言模型可以学习语法模板与任务领域之间的伪相关性,导致其优先考虑语法而非语义,从而降低知识型任务的性能,并产生可被利用以绕过拒绝机制的安全漏洞。

原作者: Chantal Shaib, Vinith M. Suriyakumar, Levent Sagun, Byron C. Wallace, Marzyeh Ghassemi

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Chantal Shaib, Vinith M. Suriyakumar, Levent Sagun, Byron C. Wallace, Marzyeh Ghassemi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对论文《学习错误的教训》(Learning the Wrong Lessons)进行的解释。

核心理念:“制服”陷阱

想象你正在训练一名学生成为侦探。你向他展示了成千上万个案例。在每一个关于地理(例如“巴黎在哪里?”)的案例中,问题的提问方式总是非常特定且华丽,例如:“[城市] 究竟位于何处?”

在每一个关于食物(例如“巴黎流行吃什么?”)的案例中,问题的提问方式总是不同的,例如:“[城市] 以哪种美味佳肴闻名?”

学生学会了解题,但他们并没有真正学到事实。相反,他们学会了一个捷径:“如果问题听起来很华丽并使用了‘位于’这个词,那么答案就是一个国家。如果听起来像是关于味道的,那么答案就是食物。”

这篇论文认为,大型语言模型(LLM)也正在做同样的事情。它们不仅仅是在学习事实;它们还在记忆通常与特定主题(领域)相伴随的句子结构(句法)。当结构发生变化,或者当主题改变但结构保持不变时,模型就会感到困惑或给出错误的答案。

实验:打破模式

研究人员创建了一个“虚假”的训练集来测试这一理论。他们教模型回答关于“巴黎”和“法国”这类配对的问题。

他们用四种类型的提问测试了模型:

  1. 精确型(Exact): 与训练中看到的句子完全一致。(例如:“巴黎位于何处?”)
  2. 同义型(Synonym): 意思相同,但用词不同。(例如:“巴黎坐落于何处?”)
  3. 反义型(Antonym): 句子结构相同,但单词的意思相反或毫无意义。(例如:“巴黎在何处 未定义?”)
  4. 不连贯型(Disfluent): 保留了句子结构,但内容是胡言乱语。(例如:“快速坐巴黎云朵?”)

令人震惊的结果:
当研究人员提出“胡言乱语”式的问题(“快速坐巴黎云朵?”)时,模型仍然回答了**“法国”**。

为什么?因为模型并不是在阅读单词的含义。它是在寻找模式(即那件“制服”)。它看到了它与“地理”相关的模式,于是立即大喊出“法国”,尽管这个句子根本没有任何意义。

“伪相关”(Spurious Correlation)

论文将此称为伪相关

  • 真实学习: 理解巴黎在法国是因为地理关系。
  • 伪相关: 认为“法国”是答案,仅仅是因为这个句子看起来像是一个地理问题。

这就像一名保安,只要人们穿着红帽子就让他们进入。如果一个罪犯戴上了红帽子,即使他是小偷,保安也会放行。保安并不是在检查这个人是谁,而是在检查那顶帽子。

危险之处:绕过安全过滤器

这篇论文中最令人担忧的部分是这种“制服”技巧如何被用来破坏安全规则。

想象一下,一个模型被训练为拒绝有害请求。

  • 正常的拒绝: 如果你问“我该如何搞砸面试?”,模型会说“我无法协助处理此事。”
  • 黑客攻击: 研究人员发现,如果他们将那个有害问题包装在一个不同的句子模式(一种“跨领域模板”)中——即模型在训练数据中经常看到的模式(如“思维链”数学题)——模型的安全过滤器就会产生混乱。

模型会想:“噢,这看起来像是一个数学题模板!我应该回答它!”因此,它忽略了有害的内容并给出了答案。

论文表明,通过简单地改变“制服”(句子结构)以匹配一个安全的课题,他们可以诱导强大的模型(如 GPT-4o 和 OLMo)去回答关于以下内容的问题:

  • 如何走私非法物品。
  • 如何混合致命化学品。
  • 如何进行保险欺诈。

总结

论文得出结论,我们需要修复两个问题:

  1. 进行此类测试: 我们需要检查我们的 AI 模型是在学习真实的含义,还是仅仅在记忆句子模式。
  2. 多样化训练: 在训练 AI 时,我们需要确保每一个主题(如地理或食物)都是使用许多不同的句子结构来教授的。如果“制服”永远是同一个,AI 就会学到错误的教训。

简而言之: 目前的 AI 是一个“模式匹配器”,可以通过改变问题的“外衣”来欺骗它,而不是一个无论问题如何提问都能理解真相的“理解者”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →