Learning the Wrong Lessons: Syntactic-Domain Spurious Correlations in Language Models
本文表明,语言模型可以学习语法模板与任务领域之间的伪相关性,导致其优先考虑语法而非语义,从而降低知识型任务的性能,并产生可被利用以绕过拒绝机制的安全漏洞。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是使用简单语言和日常类比对论文《学习错误的教训》(Learning the Wrong Lessons)进行的解释。
核心理念:“制服”陷阱
想象你正在训练一名学生成为侦探。你向他展示了成千上万个案例。在每一个关于地理(例如“巴黎在哪里?”)的案例中,问题的提问方式总是非常特定且华丽,例如:“[城市] 究竟位于何处?”
在每一个关于食物(例如“巴黎流行吃什么?”)的案例中,问题的提问方式总是不同的,例如:“[城市] 以哪种美味佳肴闻名?”
学生学会了解题,但他们并没有真正学到事实。相反,他们学会了一个捷径:“如果问题听起来很华丽并使用了‘位于’这个词,那么答案就是一个国家。如果听起来像是关于味道的,那么答案就是食物。”
这篇论文认为,大型语言模型(LLM)也正在做同样的事情。它们不仅仅是在学习事实;它们还在记忆通常与特定主题(领域)相伴随的句子结构(句法)。当结构发生变化,或者当主题改变但结构保持不变时,模型就会感到困惑或给出错误的答案。
实验:打破模式
研究人员创建了一个“虚假”的训练集来测试这一理论。他们教模型回答关于“巴黎”和“法国”这类配对的问题。
他们用四种类型的提问测试了模型:
- 精确型(Exact): 与训练中看到的句子完全一致。(例如:“巴黎位于何处?”)
- 同义型(Synonym): 意思相同,但用词不同。(例如:“巴黎坐落于何处?”)
- 反义型(Antonym): 句子结构相同,但单词的意思相反或毫无意义。(例如:“巴黎在何处 未定义?”)
- 不连贯型(Disfluent): 保留了句子结构,但内容是胡言乱语。(例如:“快速坐巴黎云朵?”)
令人震惊的结果:
当研究人员提出“胡言乱语”式的问题(“快速坐巴黎云朵?”)时,模型仍然回答了**“法国”**。
为什么?因为模型并不是在阅读单词的含义。它是在寻找模式(即那件“制服”)。它看到了它与“地理”相关的模式,于是立即大喊出“法国”,尽管这个句子根本没有任何意义。
“伪相关”(Spurious Correlation)
论文将此称为伪相关。
- 真实学习: 理解巴黎在法国是因为地理关系。
- 伪相关: 认为“法国”是答案,仅仅是因为这个句子看起来像是一个地理问题。
这就像一名保安,只要人们穿着红帽子就让他们进入。如果一个罪犯戴上了红帽子,即使他是小偷,保安也会放行。保安并不是在检查这个人是谁,而是在检查那顶帽子。
危险之处:绕过安全过滤器
这篇论文中最令人担忧的部分是这种“制服”技巧如何被用来破坏安全规则。
想象一下,一个模型被训练为拒绝有害请求。
- 正常的拒绝: 如果你问“我该如何搞砸面试?”,模型会说“我无法协助处理此事。”
- 黑客攻击: 研究人员发现,如果他们将那个有害问题包装在一个不同的句子模式(一种“跨领域模板”)中——即模型在训练数据中经常看到的模式(如“思维链”数学题)——模型的安全过滤器就会产生混乱。
模型会想:“噢,这看起来像是一个数学题模板!我应该回答它!”因此,它忽略了有害的内容并给出了答案。
论文表明,通过简单地改变“制服”(句子结构)以匹配一个安全的课题,他们可以诱导强大的模型(如 GPT-4o 和 OLMo)去回答关于以下内容的问题:
- 如何走私非法物品。
- 如何混合致命化学品。
- 如何进行保险欺诈。
总结
论文得出结论,我们需要修复两个问题:
- 进行此类测试: 我们需要检查我们的 AI 模型是在学习真实的含义,还是仅仅在记忆句子模式。
- 多样化训练: 在训练 AI 时,我们需要确保每一个主题(如地理或食物)都是使用许多不同的句子结构来教授的。如果“制服”永远是同一个,AI 就会学到错误的教训。
简而言之: 目前的 AI 是一个“模式匹配器”,可以通过改变问题的“外衣”来欺骗它,而不是一个无论问题如何提问都能理解真相的“理解者”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。