← 最新论文
💬 NLP

Language models struggle with compartmentalization

本文表明,大型语言模型往往无法将同一潜在概念的不同表现形式(例如不同语言或编程范式)统一为共享的内部表示,从而导致冗余学习、样本效率降低,以及基于概念表现形式数量的干预效果相变。

原作者: Thomas Vincent Howe, David Wingate

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas Vincent Howe, David Wingate

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对这篇论文的解读。

核心思想:“平行宇宙”问题

想象你有一个极其聪明的学生,但他有一个非常奇怪的习惯:无论事实如何表述,他都将其视为两个完全无关的秘密。

如果你用英语告诉他“天空是蓝色的”,他会将其记在“英语笔记本”里。
如果你用斯瓦希里语告诉他“天空是蓝色的”,他会将其记在另一本独立的“斯瓦希里语笔记本”里。
他从未意识到这两本笔记本在谈论同一件事。他不交叉引用它们,也不会说:“哦,我已经知道这个了!”

这篇论文将这种行为称为**“隔离”(Compartmentalization)**。

作者认为,大型语言模型(LLMs)经常这样做。它们没有构建一个巨大的、高效的、理解“天空是蓝色”这一概念的大脑,而是为它们遇到的每一种语言、编程代码或写作风格构建了独立的、冗余的大脑。这浪费了它们的脑力(容量),并使其学习速度变慢(样本效率低下)。


实验:“魔法词汇”技巧

为了证明这种现象确实发生,研究人员设计了一个受控实验。他们不仅使用了不同的语言,还使用了一种“魔法技巧”,迫使模型将相同的数据视为完全不同的内容。

类比:
想象一个图书馆,里面的每本书都用同一种语言写成,但图书管理员有一条规则:

  • 如果书在左边的书架上,单词"Apple"就写成"Apple"。
  • 如果书在右边的书架上,单词"Apple"就写成"Banana"(尽管它们的意思相同)。

研究人员创建了一个模型,其中“左边的书架”和“右边的书架”拥有完全不同的词典。他们向模型输入完全相同的故事,只是根据书架的不同交换了单词。

结果:
模型未能将线索联系起来。它学习了左边书架的故事,也学习了右边书架的故事,但它将这两者视为两个完全独立的任务。

  • 代价: 因为它重复学习了同一件事,所以需要更多的数据才能达到熟练程度(样本效率低下)。
  • 瓶颈: 因为它存储了两份相同的知识,所以更快地耗尽了“大脑空间”(容量成本)。

“翻译”陷阱

研究人员尝试了一种常见的修复方法:他们给模型提供了“翻译对”。他们向模型展示:“这是左边书架上的'Apple',这是右边书架上的'Banana'。”

令人惊讶的是:
模型几乎瞬间就学会了翻译规则。它可以完美地将"Apple"翻译成"Banana"。然而,这并没有帮助它停止隔离。它仍然将这两个概念保存在独立的精神盒子中。这就像一个学生可以完美地翻译一个句子,但仍然不理解其背后的含义是相同的。

他们发现,只有当给模型提供海量的翻译数据,或者使用一种称为“权重衰减”(weight decay)的特定训练技术(这就像轻轻推一把以简化模型的思维)时,这种方法才开始奏效。

“相变”

这篇论文发现了一种奇怪的现象,称为**“相变”(Phase Transition)**。
把它想象成一个电灯开关。

  • 如果你有 2 个隔间(左/右书架),模型会固执己见,不共享知识。
  • 如果你有 8 个隔间,突然间,只要有足够的翻译数据,模型就会“ snapping”(突变),开始在所有隔间之间共享知识。

似乎只有当问题变得复杂而无法分开处理时,模型才会意识到应该统一其大脑。

现实世界的例子

研究人员在现实世界的场景中测试了这一点,以观察这种现象是否发生在他们的“魔法图书馆”之外:

  1. 多语言学习: 他们在英语和中文上训练了小型模型。他们发现,对于小型模型而言,英语和中文的知识并没有真正融合。模型本质上是“隔离”的,将它们视为独立的任务,而不是统一的理解。
  2. 传记与问答: 他们以两种格式向模型提供了关于人物的事实:
    • 格式 A:传记段落(“约翰是一位住在纽约的医生”)。
    • 格式 B:问答对(“约翰是谁?一位住在纽约的医生”)。
    • 灾难: 当模型试图同时学习这两种格式时,它们相互冲突。模型变得困惑,表现比只学习一种格式时更差。这就像试图用一只手举起两个重物;它们相互抵消了。

好消息:这是可修复的

最重要的发现是,这并非人工智能工作原理的根本缺陷;这只是模型养成的一种坏习惯。

研究人员表明,如果你在开始时(或训练后)手动将知识从一个隔间复制到另一个隔间,模型的表现就会完美。这证明模型有能力共享知识,但标准的训练过程(SGD)只是没有自然地找出如何高效地做到这一点。

总结

  • 问题: AI 模型通常将以不同方式呈现的同一事实(不同的语言、不同的格式)视为完全无关的任务。
  • 后果: 这浪费了它们的内存,并使它们的学习速度变慢。
  • “翻译”的失败: 仅仅向模型展示如何在格式之间进行翻译不足以解决这一问题;它们需要更多的数据或特定的训练推动,才能意识到这些概念是相同的。
  • 启示: AI 模型目前是“隔离”的。它们的大脑为事实的每一种表述方式都设有独立的房间,而不是将所有事实共同生活在一个大房间里。这篇论文表明,我们需要更好的训练方法来帮助它们合并这些房间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →