← 最新论文
🤖 AI

Emergent Semantic Role Understanding in Language Models

本文表明,语义角色理解在预训练过程中部分涌现于冻结的仅解码器 Transformer 中,线性探针提供了证据,但完整性能需要微调,且随着模型规模增大,这些角色的内部表示变得愈发分布式。

原作者: Carla Griffiths, Mirco Musolesi

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Carla Griffiths, Mirco Musolesi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个孩子如何理解故事。你有两个选择:

  1. “阅读即学习”法:让孩子自己阅读成千上万本书,希望他们能自然而然地弄明白“谁对谁做了什么”。
  2. “训练”法:在他们阅读后,你让他们坐下来,明确地教导他们:“在这个句子里,狗是动作发出者,球是被踢的对象。”

这篇论文提出了一个重大问题:大型语言模型(即“孩子”)是仅通过阅读(预训练)就掌握了“谁对谁做了什么”的逻辑,还是需要通过明确的训练(微调)来学习它?

研究人员 Carla Griffiths 和 Mirco Musolesi 设计了一项实验来找出答案。以下是他们是如何做的以及发现了什么,解释如下。

实验:“冻结大脑”测试

为了观察模型是否自学了这种逻辑,研究人员使用了一个巧妙的技巧。他们选取了一个已完成阅读训练数据(预训练)的模型,并冻结了它的“大脑”。他们不允许这个“大脑”发生改变或学习任何新内容。

随后,他们在这个冻结的“大脑”上连接了一个非常简单的微型“探针”(就像一个基础问答工具),让它识别句子中的角色(例如,“谁去散步了?”)。

  • 如果冻结的“大脑”能很好地回答:这意味着模型仅通过阅读就学会了逻辑。
  • 如果冻结的“大脑”失败了:这意味着模型只有在后来接受特定任务的“训练”(微调)后才学会了逻辑。

他们在四种不同规模的模型上进行了测试,从小型的“小狗”(0.4 百万参数)到中型的“狗”(57 百万参数)。

发现:他们发现了什么?

1. 逻辑已经存在(但不完美)

研究人员发现,即使是冻结的“大脑”,其回答问题的表现也远好于随机猜测。

  • 类比:想象一个学生读遍了图书馆的书,但从未参加过考试。当你递给他一份简单的测验时,他仅凭阅读就能答对约 60% 的题目。他不需要老师解释规则;规则已经在他脑海中了。
  • 结果:语义角色理解(即知道“谁做了什么”)确实在预训练阶段就出现了。它并不是只有在特定训练后才出现的东西。

2. 更大的“大脑”需要更多“训练”

这里有个转折:随着模型变大,“冻结大脑”与“完全训练大脑”之间的差距实际上略微扩大了。

  • 类比:把小型模型想象成一个仅通过阅读就完美记住了规则的学生。而大型模型则像是一个天才学生,他读遍了图书馆,但他的大脑如此复杂且充满了其他信息,以至于他需要一点具体的辅导,才能将这些知识高效地组织起来以应对考试。
  • 结果:虽然大型模型拥有这些信息,但它们需要微调才能完全释放这些能力。“训练”帮助它们更好地组织其庞大的知识库。

3. “谁做了什么”神经元

研究人员深入模型内部,观察它们如何存储这些信息。他们发现了特定的神经元组(微小的处理单元),它们表现得像专家一样。

  • “时间”专家:有些神经元就像专职的时间记录员。无论模型变得多大,这些神经元对于理解事情发生的时间始终至关重要。
  • “动作发出者”(Agent)专家:这是最令人惊讶的部分。
    • 小型模型中,特定的神经元是“动作发出者”专家。如果你关闭它们,模型就会忘记谁做了什么。
    • 大型模型中,这些相同的“动作发出者”神经元实际上开始起阻碍作用!如果你在大型模型中关闭它们,模型的表现反而更好了。
  • 类比:在一个小团队中,你需要一个特定的人担任“团队领导”。如果你解雇了他,团队就会崩溃。但在一个庞大的公司里,让一个人试图成为唯一的领导者可能会导致瓶颈。如果领导权分散在许多人手中,大公司运作得更好。大型模型从依赖单个“动作发出者”神经元,转变为一种分布式网络,其中工作由大家共同分担。

结论

这篇论文证明,语言模型仅通过阅读文本就学会了“谁对谁做了什么”的基本结构,无需特定指导。这些知识是在预训练期间“内置”的。

然而,随着模型变大,它们并非直线地变得“更聪明”。它们改变了存储这些知识的方式。它们从依赖少数几个特定的“专家”神经元,转变为使用复杂的分布式网络。这意味着,适用于小型模型的方法(例如依赖单个特定神经元),并不一定适用于巨型模型,因为巨型模型已经重组了其内部逻辑以适应其庞大的规模。

简而言之:模型仅通过观看比赛(预训练)就学会了游戏规则,但随着它们成长,它们必须改变自己的比赛风格才能获胜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →