← 最新论文
🤖 machine learning

Synthetic Persona Pretraining: Alignment from Token Zero

本文介绍了合成人格预训练(Synthetic Persona Pretraining, SPP),这是一种将符合价值观的第一人称反思直接嵌入预训练阶段的方法,旨在从第一个标记(token zero)起就植入理想的助手人格,证明了与后训练对齐方法相比,这种早期干预能显著提高宪法遵循度、抗越狱能力以及道德对齐水平。

原作者: Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Ro
发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在抚养一个孩子。你可以等到他们成为青少年时,坐下来对他们说:“好了,既然你已经学会了说话,那么这里有一些规则:要善良,要诚实,不要伤害他人。”或者,你也可以从他们学会第一个词开始就教授这些价值观,将它们编织进你随着他们成长而讲述的每一个故事中。这就是构建人工智能的科学家们面临的核心困境。

AI 模型就像是数字化的孩子,通过阅读互联网上的数十亿页文本来学习。这个初始学习阶段被称为“预训练”(pretraining)。在此期间,AI 会吸收事实、写作风格以及人类交流的方式。然而,关于如何成为一个有用且安全的助手的“规则”,通常是在这个大规模学习阶段之后,通过一个被称为“后训练”(post-training)的独立步骤才被加入的。问题在于,当 AI 完成对互联网的阅读时,它已经根据它所发现的一切形成了一个个性。试图在已成型的个性上强加新规则,就像是在试图教一个已经学会了无礼的青少年变得有礼貌;这往往感觉像是给一面脏乱的墙刷上一层薄薄的油漆,旧有的习惯很容易破茧而出。

这篇题为《合成人格预训练:从零号标记开始的对齐》(Synthetic Persona Pretraining: Alignment from Token Zero)的论文,提出了另一种“抚养”我们 AI 孩子的方法。研究人员建议,应该从训练的第一时刻——即他们称之为“零号标记”(token zero)的时候起,就将理想的人格和价值观植入其中。与其等到后期再去修正 AI,他们希望在 AI 学习说话的过程中,就将其“优秀的助手”特质构建进它的脑海里。

实验:用一部“宪章”抚养数字孩子

研究人员(来自 EPFL 及多所大学的一个团队)决定测试这种“模型抚养”的想法。他们创建了一种名为**合成人格预训练(SPP)**的新方法。以下是他们是如何实现的,我们使用一个简单的类比:

想象 AI 正在阅读一个图书馆里的书籍。在旧的方法中,AI 只是单纯地阅读这些书。而在新方法中,研究人员提取了大约 10% 的书籍,并在每隔几段话之后添加了一个特殊的“思想气泡”。在这个气泡里,AI 未来的人格(我们暂且称之为“凯托/Cato”)会停顿并反思它刚刚读到的内容,例如说:“嗯,这个关于犯罪的故事很悲伤,而我的规则规定我不应该鼓励暴力,”或者“这份技术手册很枯燥但很有用。”

他们不仅仅是添加了这些想法;他们还让 AI 学会 生成这些想法。他们在原始文本和这些新的“反思”想法上对模型进行训练。他们通过两种方式进行了尝试:

  1. 零号标记(“从出生开始”的方法): 他们将这些反思性想法贯穿于整个训练过程,从第一秒到最后一秒。
  2. 中期训练(“青少年时期”的方法): 他们等待 AI 已经读完了大部分书籍,然后在训练阶段的最后阶段才加入这些反思。

他们还设置了一个对照组,该组只是正常阅读书籍(Vanilla),以及一个剔除了坏书但没有添加反思的组(Filtered)。

他们的发现:及早教学的力量

结果非常引人入胜,并表明何时教导 AI 与教导什么同样重要。

1. “从出生开始”的 AI 在价值观方面更聪明。
那些从一开始就接受反思训练的模型(零号标记)在遵循其“宪章”(一套它们应该遵守的规则)方面表现得更好。当研究人员用棘手的道德困境(即 AI 从未见过的场景)测试它们时,零号标记模型做出的选择更符合规则。它们不仅仅是死记硬背规则;它们似乎理解了规则的“精神”。

  • 数据: 在一项名为“宪章评估”(ConstitutionEval)的测试中,零号标记模型的正确率约为 67%,而那些只在最后阶段获得反思的模型(中期训练)仅为 56% 左右。
  • 惊喜之处: 零号标记模型实际上改变了它们的优先级。它们对“真实性”和“正义”的重视程度远高于其他模型,后者更倾向于“创造力”和“学习”。这表明,及早开始不仅是增加了规则,更是重塑了 AI 思考世界的方式。

2. “青少年时期”的方法对某些事情有效,但并非全部。
有趣的是,如果目标仅仅是防止 AI 被“越狱”(被诱导做出坏事),中期训练的效果几乎与零号标记方法一样好。看来对于简单的“不要做那个”之类的反射性规则,你可以较晚才教。但对于深层的、复杂的道德推理,你确实需要从第一天就开始。

3. 更大的大脑,更大的收益。
研究人员在两种规模的 AI 上测试了这一点:一个较小的模型(17 亿参数)和一个较大的模型(30 亿参数)。他们发现,随着 AI 变得更大、更聪明,及早开始的重要性也变得更加显著。在最难的测试中,随着规模的扩大,“从出生开始”的 AI 与“青少年时期”AI 之间的差距竟然翻了一倍。这表明,对于未来的超大规模、超智能 AI 而言,从一开始就具备正确的价值观将更加关键。

4. “粘合剂”至关重要。
这里有一个限制条件。研究人员发现,这些早期价值观只有在最后的训练步骤(即 AI 学习如何与人类交流的阶段)与之前构建的人格相匹配时才能稳固下来。他们称之为“人格绑定”(persona binding)。如果他们在阅读阶段训练的是某种特定类型的助手,但在聊天阶段却教它成为另一种完全不同的助手,那么早期的价值观就会开始消退。这就像教一个孩子当医生,但后来却把他送去艺术学院;他可能会忘记医学方面的规则。然而,当“粘合剂”发挥作用时,这些价值观表现得异常强大,即使研究人员试图用棘手的测试来打破它们,它们依然能够幸存。

这为什么重要

这篇论文表明,我们可能犯了一个错误,即试图在 AI 已经从互联网学到一切之后再去“修复”它。作者认为,价值观很难被添加到成品之中。相反,我们应该在 AI 处理第一个标记时,就用正确的价值观来“抚养”它。

虽然研究结果令人鼓舞,但研究人员谨慎地指出,这仅仅是个开始。他们是在相对较小的模型(30 亿参数)上进行的测试,而目前的顶级科技公司使用的是规模大得多的模型。他们认为,随着我们构建更大、更智能的模型,从早期开始建立正确价值观的益处可能会变得更加强大。他们也指出,虽然早期价值观很强,但仍可能受到某些类型后期训练的影响,因此我们在完成对这些“数字孩子”的抚养时仍需保持谨慎。

简而言之,如果我们想要真正安全且有用的 AI,我们不应该等到它长大后再教它是非对错。我们应该在它学习说话的同时,就开始教导它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →