← 最新论文
💬 NLP

What Makes Two Language Models Think Alike?

本文介绍了一种将神经活动映射到可解释语言特征的新方法,旨在揭示 43 个多样化语言模型之间的相似性主要由其发布日期和模型家族驱动,而非由规模或架构类别驱动。

原作者: Louis Jalouzot, Christophe Pallier, Emmanuel Chemla, Yair Lakretz

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Louis Jalouzot, Christophe Pallier, Emmanuel Chemla, Yair Lakretz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个装满了不同厨师的房间。有些是受过法式料理训练的,有些是学习日料的,还有一些是自学成才的。他们的工作完全相同:预测食谱中的下一个食材

研究人员提出的核心问题是:这些厨师在思考食材时,真的用同样的方式思考吗?

例如,当一位厨师看到像“猫追逐老鼠”这样的句子时,他们是在关注这是一个关于动物的故事(句法),还是仅仅关注“猫”和“老鼠”这两个具体的词汇(词汇)?

旧方法:测量“形状”

以前,科学家试图通过观察这些厨师(AI 模型)内部思想的“形状”来比较他们。想象一下,拍下一张每位厨师如何排列台面上的食材的照片。如果照片在几何形状上看起来相似,科学家就假设这些厨师的思考方式是相似的。

但这种方法存在一个问题:它就像一个黑箱。它能告诉你两个厨师排列食材的方式很相似,但它无法解释为什么。也许他们都按颜色分组,或者也许他们都按重量分组。旧方法无法解释其中的“原因”。

新方法:“语言特征签名”

这篇论文介绍了一种更简单的方法,可以窥探厨师的思想内部。与其仅仅观察排列的形状,不如问一个问题:“每条特定的规则对这位厨师而言有多重要?”

他们创建了一个名为度量学习编码模型(MLEM)的工具。你可以把它看作是一个翻译器,将厨师混乱、复杂的内部思想转化为一份简单的语言特征成绩单。

这份成绩单列出了诸如以下内容:

  • 时态: 句子是关于过去还是未来的?
  • 主语: 句子是关于一个人还是许多人?
  • 句子结构: 是一个简单的句子,还是一个带有“定语从句”(例如“那个戴着帽子的男人...”)的复杂句子?

该工具通过测量当这些规则发生变化时,厨师的内部思想发生了多大的变化来衡量特征。如果当你在过去时态和将来时态之间切换时,厨师的思想发生了剧烈跳动,那么这个特征在他们的成绩单上就会获得高分。这份成绩单被称为**“语言特征签名”**。

实验:43 位厨师,10 个家族

研究人员测试了 43 个不同的 AI 模型(即“厨师”)。这些模型来自不同的“家族”(例如 Llama 家族、GPT 家族或 Mamba 家族),并且具有不同的规模(从微型到巨大)和不同的架构(构建大脑的不同方式)。

他们将每一个模型的语言特征签名与每一个其他模型进行了对比。

重大发现:关键在于“家族”和“时代”,而非规模

结果令人惊讶。研究人员发现,让两个模型产生相似想法的并不是它们的大小,而是它们的父母是谁以及它们何时出生。

  1. 家族最重要: 来自同一家族的模型(例如所有的“Llama”模型)具有非常相似的签名,即使其中一个是微型的,另一个是巨大的。它们接受了相同的“训练食谱”和架构蓝图,因此学会了优先处理相同的语言规则。
  2. 发布日期很重要: 模型的发布日期是预测相似性的最强指标。这就像是在说,“2024 年接受训练的厨师比 2020 年的厨师更像是在以同样的方式思考。”这是因为整个行业会随着时间的推移共同改变其技术(更新的激活函数、更好的训练数据等)。
  3. 规模并不决定风格: 仅仅扩大模型规模(增加更多参数)并不会让它突然开始像另一种类型的模型那样思考。一个小型模型和一个巨型模型即使来自同一个家族,仍然共享相同的“语言优先级”。

思维的“循环”

研究人员还观察了这些签名是如何随着信息在模型层级间移动(就像信息在接力赛中传递一样)而变化的。

他们发现,来自同一家族的模型遵循相同的路径。它们从某种关注点开始,在中间层达到复杂度的巅峰,然后在最后回到一个更简单的关注点。这就像是一个循环。这表明,尽管模型大小不同,但它们都以相同的“舞步”来解决语言问题。

结论

简而言之,这篇论文认为,我们不应该仅仅通过观察一个 AI 有多“大”或多“复杂”来理解它的思考方式。相反,我们应该观察它的语言特征签名——即它最关注哪些规则的剖面图。

这项研究表明,架构和规模的重要性低于模型的“家族”和“世代”。两个模型可能建造方式不同且规模不同,但如果它们来自同一个家族和时代,它们很可能会优先处理相同的语言特征,从而使它们的“思考方式趋于一致”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →