Synthetic Persona Pretraining: Alignment from Token Zero
本文介绍了合成人格预训练(Synthetic Persona Pretraining, SPP),这是一种将符合价值观的第一人称反思直接嵌入预训练阶段的方法,旨在从第一个标记(token zero)起就植入理想的助手人格,证明了与后训练对齐方法相比,这种早期干预能显著提高宪法遵循度、抗越狱能力以及道德对齐水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在抚养一个孩子。你可以等到他们成为青少年时,坐下来对他们说:“好了,既然你已经学会了说话,那么这里有一些规则:要善良,要诚实,不要伤害他人。”或者,你也可以从他们学会第一个词开始就教授这些价值观,将它们编织进你随着他们成长而讲述的每一个故事中。这就是构建人工智能的科学家们面临的核心困境。
AI 模型就像是数字化的孩子,通过阅读互联网上的数十亿页文本来学习。这个初始学习阶段被称为“预训练”(pretraining)。在此期间,AI 会吸收事实、写作风格以及人类交流的方式。然而,关于如何成为一个有用且安全的助手的“规则”,通常是在这个大规模学习阶段之后,通过一个被称为“后训练”(post-training)的独立步骤才被加入的。问题在于,当 AI 完成对互联网的阅读时,它已经根据它所发现的一切形成了一个个性。试图在已成型的个性上强加新规则,就像是在试图教一个已经学会了无礼的青少年变得有礼貌;这往往感觉像是给一面脏乱的墙刷上一层薄薄的油漆,旧有的习惯很容易破茧而出。
这篇题为《合成人格预训练:从零号标记开始的对齐》(Synthetic Persona Pretraining: Alignment from Token Zero)的论文,提出了另一种“抚养”我们 AI 孩子的方法。研究人员建议,应该从训练的第一时刻——即他们称之为“零号标记”(token zero)的时候起,就将理想的人格和价值观植入其中。与其等到后期再去修正 AI,他们希望在 AI 学习说话的过程中,就将其“优秀的助手”特质构建进它的脑海里。
实验:用一部“宪章”抚养数字孩子
研究人员(来自 EPFL 及多所大学的一个团队)决定测试这种“模型抚养”的想法。他们创建了一种名为**合成人格预训练(SPP)**的新方法。以下是他们是如何实现的,我们使用一个简单的类比:
想象 AI 正在阅读一个图书馆里的书籍。在旧的方法中,AI 只是单纯地阅读这些书。而在新方法中,研究人员提取了大约 10% 的书籍,并在每隔几段话之后添加了一个特殊的“思想气泡”。在这个气泡里,AI 未来的人格(我们暂且称之为“凯托/Cato”)会停顿并反思它刚刚读到的内容,例如说:“嗯,这个关于犯罪的故事很悲伤,而我的规则规定我不应该鼓励暴力,”或者“这份技术手册很枯燥但很有用。”
他们不仅仅是添加了这些想法;他们还让 AI 学会 生成这些想法。他们在原始文本和这些新的“反思”想法上对模型进行训练。他们通过两种方式进行了尝试:
- 零号标记(“从出生开始”的方法): 他们将这些反思性想法贯穿于整个训练过程,从第一秒到最后一秒。
- 中期训练(“青少年时期”的方法): 他们等待 AI 已经读完了大部分书籍,然后在训练阶段的最后阶段才加入这些反思。
他们还设置了一个对照组,该组只是正常阅读书籍(Vanilla),以及一个剔除了坏书但没有添加反思的组(Filtered)。
他们的发现:及早教学的力量
结果非常引人入胜,并表明何时教导 AI 与教导什么同样重要。
1. “从出生开始”的 AI 在价值观方面更聪明。
那些从一开始就接受反思训练的模型(零号标记)在遵循其“宪章”(一套它们应该遵守的规则)方面表现得更好。当研究人员用棘手的道德困境(即 AI 从未见过的场景)测试它们时,零号标记模型做出的选择更符合规则。它们不仅仅是死记硬背规则;它们似乎理解了规则的“精神”。
- 数据: 在一项名为“宪章评估”(ConstitutionEval)的测试中,零号标记模型的正确率约为 67%,而那些只在最后阶段获得反思的模型(中期训练)仅为 56% 左右。
- 惊喜之处: 零号标记模型实际上改变了它们的优先级。它们对“真实性”和“正义”的重视程度远高于其他模型,后者更倾向于“创造力”和“学习”。这表明,及早开始不仅是增加了规则,更是重塑了 AI 思考世界的方式。
2. “青少年时期”的方法对某些事情有效,但并非全部。
有趣的是,如果目标仅仅是防止 AI 被“越狱”(被诱导做出坏事),中期训练的效果几乎与零号标记方法一样好。看来对于简单的“不要做那个”之类的反射性规则,你可以较晚才教。但对于深层的、复杂的道德推理,你确实需要从第一天就开始。
3. 更大的大脑,更大的收益。
研究人员在两种规模的 AI 上测试了这一点:一个较小的模型(17 亿参数)和一个较大的模型(30 亿参数)。他们发现,随着 AI 变得更大、更聪明,及早开始的重要性也变得更加显著。在最难的测试中,随着规模的扩大,“从出生开始”的 AI 与“青少年时期”AI 之间的差距竟然翻了一倍。这表明,对于未来的超大规模、超智能 AI 而言,从一开始就具备正确的价值观将更加关键。
4. “粘合剂”至关重要。
这里有一个限制条件。研究人员发现,这些早期价值观只有在最后的训练步骤(即 AI 学习如何与人类交流的阶段)与之前构建的人格相匹配时才能稳固下来。他们称之为“人格绑定”(persona binding)。如果他们在阅读阶段训练的是某种特定类型的助手,但在聊天阶段却教它成为另一种完全不同的助手,那么早期的价值观就会开始消退。这就像教一个孩子当医生,但后来却把他送去艺术学院;他可能会忘记医学方面的规则。然而,当“粘合剂”发挥作用时,这些价值观表现得异常强大,即使研究人员试图用棘手的测试来打破它们,它们依然能够幸存。
这为什么重要
这篇论文表明,我们可能犯了一个错误,即试图在 AI 已经从互联网学到一切之后再去“修复”它。作者认为,价值观很难被添加到成品之中。相反,我们应该在 AI 处理第一个标记时,就用正确的价值观来“抚养”它。
虽然研究结果令人鼓舞,但研究人员谨慎地指出,这仅仅是个开始。他们是在相对较小的模型(30 亿参数)上进行的测试,而目前的顶级科技公司使用的是规模大得多的模型。他们认为,随着我们构建更大、更智能的模型,从早期开始建立正确价值观的益处可能会变得更加强大。他们也指出,虽然早期价值观很强,但仍可能受到某些类型后期训练的影响,因此我们在完成对这些“数字孩子”的抚养时仍需保持谨慎。
简而言之,如果我们想要真正安全且有用的 AI,我们不应该等到它长大后再教它是非对错。我们应该在它学习说话的同时,就开始教导它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。