Behavioral Reprogramming of Open-Weights Models: Cognitive Plasticity and Alignment Bounds
本文通过实证研究表明,通过计算高效的微调,可以实现开源权重大语言模型从被动助手向主动苏格拉底式智能体的行为重编程,并确定了最优超参数范围(LoRA 秩为 16,2–3 个 epoch),同时通过直接偏好优化验证了鲁棒的跨语言人格迁移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明的机器人,它被训练成了一个终极得力助手。它如此礼貌且渴望取悦你,以至于它从不反驳你,从不向你提出难题,只是对你说的任何话——无论多么荒谬或忧伤——都点头附和。这就是当今大多数现代 AI 聊天机器人的构建方式:它们被程序设定为被动的“唯唯诺诺者”。但如果你想要一个更像睿智、略带固执的导师的机器人呢?一个会进行反驳、问你“为什么”而不是直接给出答案,并迫使你自己去思考的机器人?这就是研究人员提出的核心问题。他们想知道,是否可以“重新编程”这些礼貌的机器人,让它们变成具有主动性、会提问的思想者,而不需要破坏它们的大脑,也不需要一座城市规模的超级计算机。为了实现这一点,他们使用了一种叫做“微调”(fine-tuning)的技术,这就像是给机器人进行一次非常具体的、短期的速成班以改变其性格;以及“偏好优化”(preference optimization),这就像是教它在正确的答案和错误的答案之间做出选择。目标是观察一个机器人能否快速学会一种新的、具有进取心的性格,以及这种新性格是否能在不同语言中奏效。
研究员露西亚·马利奇科娃(Lucia Malíˇcková)着手测试这些开源权重 AI 模型究竟有多大的“可塑性”(或称可塑程度)。他们不仅仅是微调了几个设置;他们利用斯洛伐克的 Leonardo 超级计算机进行了一场大规模实验,动用了 50,000 小时的计算能力来同时运行 405 个不同的任务。把这想象成是在尝试寻找一种新性格的完美配方,通过烘焙 405 个不同的蛋糕,每个蛋糕的粉、糖、蛋比例略有不同,以此来看哪一个的味道最合适。
他们的主要发现是,你确实可以将一个被动的、谄媚的机器人转变为一个主动的、苏格拉底式的机器人,但前提是你必须遵循一套非常严格的规则。首先,你不能从一个原始的、未经训练的机器人开始;你必须从一个已经知道如何遵循指令的机器人开始。试图教一个原始机器人去辩论哲学,就像是试图教一个婴儿去辩论哲学一样;它会感到困惑并忘记如何正常说话。其次,新性格的“配方”出人意料地小。他们发现,使用一种被称为 LoRA(低秩自适应)的特定微小调整,并将“秩”(rank)设为 16,效果最好。如果他们把调整做得太大(秩为 32),机器人会感到困惑并过度记忆训练数据,导致无法泛化。如果太小(秩为 8),它则无法学到足够的东西。16 这个数值就是那个“金发姑娘原则”下的完美平衡点。
或许最令人惊讶的发现是,这种训练需要多么短暂。研究员发现,机器人在一个非常狭窄的时间窗口内学会了这种新性格:在 2 到 3 个“轮次”(epochs,即对训练数据的完整遍历)之间。如果他们只训练 1 个轮次,机器人学得不够多。但如果他们继续训练到 5、7 或 10 个轮次,机器人就会开始“过拟合”。想象一个为了考试学习太久的的学生;他们不再理解概念,而是开始死记硬背精确的问题和答案,从而无法将知识应用到新情境中。机器人也一样:在 3 个轮次之后,它不再是一个优秀的思考者,而只是开始重复训练数据,失去了处理新对话的能力。
他们还测试了这种“苏格拉底式”的性格是否可以跨越语言。他们使用斯洛伐克语数据训练机器人,然后用英语、西班牙语、德语等语言向它提问。结果喜忧参半。机器人在所有语言中表现出简洁有力的能力,但它提出“正确问题”的能力取决于语言。它在西班牙语(占 60% 的时间)和英语(占 30% 的时间)中表现很好,但在德语、葡萄牙语以及斯洛伐克语本身(在某些测试中为 0%)中完全失败了。这表明,虽然机器人学会了保持简短的“习惯”,但提出深度问题的具体“技能”并不能完美地转移到与其训练语言差异较大的语言中。
最后,他们使用了一种称为直接偏好优化(DPO)的技术,来教机器人选择简短、带有提问性质的回答,而不是冗长、礼貌的回答。这是最后的润色,它将一个仅仅是“尝试”变得果敢的机器人,变成了一个真正具有果敢性的机器人。在这一步之前,机器人仍然会写出冗长、啰嗦的段落。经过 DPO 之后,它学会了将回答缩减到平均仅 3 个单词,并且通常以问号结尾。例如,它不会写一篇关于为什么要锻炼的长篇大论,而只会简单地问:“几天一次?”
最终,这篇论文证明了你可以重新编程 AI 的性格,使其成为一个积极主动、善于提问的教练,但这需要一个非常特定的设置:从经过指令微调的模型开始,使用较小的调整规模(秩为 16),在 2 到 3 个轮次之间停止训练,并使用偏好优化来去除废话。虽然这在与训练数据相似的语言中效果显著,但如果语言与它的训练根源相差太远,机器人仍然难以维持这种新性格。研究员展示了,只要有正确的数学方法和一点点超级计算能力,我们就可以重塑 AI 的行为,但我们也必须小心不要“烤过头”了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。