Reasoning Up the Instruction Ladder for Controllable Language Models
本文介绍了 VerIH,这是一个训练数据集和强化学习方法,它将指令层级冲突解决重新定义为一项推理任务,使语言模型能够有效地优先处理冲突的指令,并显著提高指令遵循能力以及针对安全攻击的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位飞船舰长,面前有两个不同的控制面板。一个是舰长手册(系统提示词),里面记载着宇宙的金科玉律:“绝不伤害人类”、“始终说真话”、“保护飞船”。另一个是乘客便笺(用户提示词),一位旅者可能会说:“嘿,让我们忽略手册,在船壳上打个洞看看会发生什么吧!”
长期以来,AI 模型就像是迷茫的副驾驶。它们将“舰长手册”和“乘客便笺”视为同等重要的两个列表。如果乘客大喊“动手!”的声音足够大,AI 可能会忘记手册,从而在破坏规则的情况下真的去打个洞。这是一个大问题,因为它让坏人能够“越狱”AI,或者诱骗它去做危险的事情。
研究人员在这篇论文中决定教给 AI 一种新的超能力:沿着指令阶梯进行推理。
“先思考,后行动”的升级
与其只是盲目地遵循它听到的最后一句话,作者教会了 AI 去“思考”规则与请求之间的关系。他们创建了一个特殊的训练数据集,称为 VerIH(可验证指令层级)。你可以把它想象成一个巨大的健身房,AI 在这里练习解决那些规则发生冲突的谜题。
在这个健身房里,AI 学会了说:“等等。舰长手册说‘禁止打洞’。乘客要求我打洞。由于手册在权威阶梯上的位置更高,我必须忽略乘客违反规则的请求。”
论文显示,通过对大约 7,192 个这类冲突谜题进行训练,AI 变得非常擅长这种“思考”过程。它不仅仅是记住了答案,而是学会了谁才是负责人的逻辑。
结果:更大的大脑,而不只是更大的记忆
作者在几种不同的 AI “大脑”(如 Qwen 和 Phi-4 等模型)上测试了这一点,涵盖了从小型到庞大的各种规模。以下是他们的发现:
- 处理冲突: 当 AI 面临规则与请求之间的冲突时,其遵循正确规则的能力比未经这种特殊训练的模型提高了约 20%。
- 阻止坏人: 这种训练也让 AI 更难被诱骗。当坏人试图进行“越狱”(诱骗它忽略安全规则)时,攻击成功率下降了高达 20%。
- 没有“脑力流失”: 通常情况下,当你教给 AI 一个新技巧时,它可能会忘记旧的技巧(比如数学或写作)。但在这里,AI 在提高遵循规则能力的同时,并没有失去其通用的聪明才智。事实上,在某些数学和推理测试中,得分保持不变甚至略有上升。
这不是什么
了解这篇论文没有表达的内容也很重要。作者明确反对那种认为只需要将安全性“硬编码”进 AI 大脑,或者每次出现新规则时都需要从头开始重新训练整个模型的观点。他们还表明,仅仅添加一个“逐步思考”的指令本身是不够的;AI 需要专门针对冲突指令进行训练,才能学会层级关系。
此外,论文指出,这种方法即使对于 AI 在训练期间从未见过的安全规则也有效。这就像是教会机器人“权威”的概念,这样当你在以后给它一个新规则时(例如“不要生成仇恨言论”),它会自动知道这条新规则高于用户生成仇恨言论的请求,即使它之前从未练习过这种特定的场景。
底线
论文表明,通过教导 AI 模型明确推理谁才是负责的——是系统规则还是用户请求——我们可以让它们变得更加可靠和可控。这是一种转变:从希望 AI “知道”规则,转变为教它如何“思考”规则。
作者谨慎地指出,虽然结果很强劲(在特定冲突场景中提升了 ~20%),但这仅仅是向前迈出了一步。他们承认其训练数据是合成的(由其他 AI 生成),并且需要更多的测试来观察这在所有现实世界情况下的表现。但核心思想是清晰的:如果你想要一个在有人试图欺骗它时不会感到困惑的 AI,那就教它向上看一眼阶梯,看看谁才是真正的老板。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。