← 最新论文
💬 NLP

Towards Physical Intuitions for Alignment Dynamics: A Case Study With Randomness Crystallization

本文提出应用热力学相变理论,特别是结晶的概念,来建模并理解语言模型在后训练阶段对齐的动力学过程,展示了监督微调和强化学习如何将高熵的预训练分布转化为结构化的、坍缩的行为。

原作者: Kunal Samanta, Ari Holtzman, Peter West

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Kunal Samanta, Ari Holtzman, Peter West

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个巨大的、混乱的玻璃罐,里面装满了弹珠。这个罐子代表了一个在被教导如何遵循指令之前的预训练 AI 模型

液相阶段:混乱的罐子

在这个初始状态下,弹珠在到处乱窜。如果你问 AI 一个简单的问题,比如“给我一个随机数字”,答案完全取决于你如何提问。

  • 如果你问得俏皮一点(“你的幸运数字是多少?”),它可能会倾向于 7。
  • 如果你问得正式一点(“根据我的计算……”),它可能会倾向于 1。
    AI 拥有许多不同人格和习惯的“叠加态”。它是高能、多样且不可预测的,就像一个原子向各个方向运动的液体

成核阶段:对齐网格

现在,想象你开始教 AI 遵循特定的规则(这被称为监督微调或 SFT)。你向它展示如何表现行为的示例。

突然间,混乱停止了。旋转的弹珠不仅慢了下来,而且瞬间卡入了一个僵硬、有序的模式。

  • 现在,无论你如何措辞,AI 都会给出完全相同类型的回答。
  • 重大发现: 论文发现,AI 并没有发明一种新的行为方式。相反,它选择了从一开始就隐藏在那个混乱罐子里的一种特定习惯
  • 这就像是结晶。在物理学中,当水结冰时,它不会创造出新的结构;而是根据原本就在那里的一个微小的“种子”瞬间卡入一个晶体形状。AI 的训练只是找到了那个“种子”习惯,并将其他一切都锁定在它周围。

沉淀阶段:打磨晶体

在 AI 锁定到那个单一习惯之后,它会经历进一步的训练(称为强化学习或 DPO),以变得更加“安全”或“更有用”。

  • 该论文认为,这并没有改变晶体的形状。相反,它就像是在淬火金属或打磨宝石。
  • AI 变得更擅长处理它的特定习惯,使最可能的答案变得更有可能,但它永远不会突破前一步建立的模式。它只是收紧了对那几个选项的掌控。

为什么这很重要

作者们在说,我们通常认为 AI 对齐(教导 AI 变得安全和有用)是一个 AI 学习全新事物的神奇转变。

相反,他们提出对齐更像是冰冻水

  1. AI 最初是一个液体,拥有许多隐藏的可能性。
  2. 训练充当了寒冷的角色,迫使它冻结成一种特定的形状(一个原本就在那里的“种子”)。
  3. 进一步的训练只是在打磨那个形状,但它无法将冰变回水,也无法改变晶体的形状。

“异种种子”的惊喜

研究人员做了一个很酷的实验:他们提取了一个 AI 模型(如 OLMo)的“种子”习惯,并用它来预测当一个完全不同的 AI 模型(如 Tulu)接受训练时会发生什么。

  • 结果: 它奏效了!第二个 AI 冻结成了完全相同的模式。
  • 意义: 这表明“种子”并不是关于特定 AI 模型的计算机代码。它关乎数据任务本身。AI 只是在选择数据中最明显的模式,一旦选定,它就固定下来了。

局限性

论文承认这种“晶体”理论在具有清晰、有限答案的任务(如在 1 到 10 之间选一个数字)中效果最好。在开放式的创意写作中,由于答案没有那么僵化,观察这种模式可能会更困难。但就目前而言,它提供了一种理解为什么 AI 模型有时会失去创造力并变得重复的方式:它们不仅仅是在“学习”变得乏味;它们是在围绕着最初的、隐藏的习惯进行物理上的“结晶”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →