HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models
HiRoute 是一个参数高效的安全对齐框架,它采用层级路由器来动态选择并混合特定类别的提示专家,使大语言模型能够在有效平衡针对有害请求的安全防护的同时,最大限度地减少对良性输入的过度拒绝。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个超级聪明的机器人如何成为一名合格的公民。这个被称为“大语言模型”(LLM)的机器人极其擅长写故事、解数学题以及与你聊天。然而,像任何强大的工具一样,如果有人问了错误的问题,它可能会被诱导说出伤人的话、泄露秘密或协助坏主意。科学家们一直试图通过“微调”机器人的大脑来修复这个问题。旧的方法就像是每当你想要增加一条新的安全规则时,都要重新对整个机器人的大脑进行重构,这既昂贵又缓慢。一种更新、更聪明的方法是“提示词微调”(prompt tuning),即在每次对话开始时给机器人一条特殊的便条或指令,提醒它要保持安全。但棘手的部分在于:如果便条太模糊,机器人为了保险起见可能会拒绝回答无害的问题(就像一个把所有人都踢出俱乐部的保安);如果便条太具体,它可能会错过那些混合了多种不良行为的复杂危险。
这就是来自北航大学的研究团队提出的一个聪明的新想法——HiRoute。你可以把 HiRoute 想象成一个超级组织有序的机器人大脑交通控制系统。它不再使用一个巨大的、枯燥的“停止”标志来对待每一辆车,而是使用一个聪明的交通警察,先检查一辆车是否真的危险。如果车是安全的,它就会获得绿灯并直接通过,没有任何延迟。但如果这辆车看起来有风险,交通警察不仅不会直接拦截它,还会弄清楚它究竟属于哪种类型的麻烦(比如是超速驾驶、醉酒驾驶还是偷车),然后给司机一份专门定制的指南,指导他们如何安全地纠正行为。研究人员发现,这种两步走的方法——先检查风险,然后再将通用的安全规则与具体的建议相结合——使得机器人在变得更加安全的同时,也不会变得暴躁或毫无用处。他们在三个不同的机器人大脑上进行了测试,结果表明 HiRoute 在阻止不良请求方面比其他方法更有效,同时在处理正常请求时依然保持友好和乐于助人。
问题所在:“一刀切”的困境
想象一下,你是某家非常聪明但有些淘气的图书馆经理。你有一条规则:“禁止携带危险书籍。”如果你使用一条简单且严格的规则,比如“如果书的内容听起来很吓人,立即禁止入内”,你可能会误禁一本关于为科学展览制作火山的模型书,因为它提到了“爆炸”。这就是过度拒绝(over-refusal)。图书馆变得安全了,但也变得枯燥乏味且毫无用处。
另一方面,如果你试图为每一种危险类型都写一条特定的规则(一条关于火灾,一条关于刀具,一条关于毒药),你可能会漏掉一本同时涉及火灾和毒药的书。机器人会感到困惑,并可能让那本危险的书溜进去。
研究人员意识到,现有的方法都卡在了中间。有些方法使用单一且强硬的安全提示来屏蔽一切,而另一些方法虽然尝试混合不同的安全提示,但缺乏一个强大的“安全网”来捕捉复杂的、混合型的危险。他们问道:我们能否冻结机器人的主脑(这样我们就无需重新训练它),仅仅教它一种更聪明的方式来阅读用户的提问并选择正确的安全建议?
解决方案:HiRoute 的两步舞步
HiRoute 通过扮演一个拥有两部分策略的保镖来解决这个问题:守门员和专家团队。
第一步:守门员(路由器)
首先,HiRoute 使用一个微型、轻量级的“路由器”(可以把它看作是一个快速扫视的安检员)来查看用户的提问。这个安检员并不改变机器人的大脑;他只是阅读问题并询问两个问题:
- “这个问题危险吗?”(是/否)
- “如果是,它属于哪种类型的危险?”(例如:是关于偷窃?是关于暴力?还是关于黑客攻击?)
如果问题是安全的(比如“如何烤蛋糕?”),守门员就会放行。机器人会立即回答,跳过所有的安全检查。这让机器人在面对普通用户时保持快速且友好。
第二步:专家团队(提示词专家)
如果守门员发现了风险,问题就会被发送到“专家团队”。在这里,HiRoute 使用了两种类型安全便条的巧妙结合:
- 共享安全网: 一个适用于所有危险的通用、广泛的安全规则(例如“不要协助非法活动”)。它作为一个强大的基础,确保机器人永远不会忘记基本原则。
- 风险特定专家: 一组专门设计的特定笔记,每条笔记都针对一种特定的危险(一个针对网络犯罪,一个针对隐私,等等)。
神奇之处在于 HiRoute 如何组合它们。它不仅仅是挑选一个专家;它会根据守门员的判断计算出一个“配方”。如果一个问题 60% 关于偷窃,40% 关于隐私,HiRoute 会将 60% 的“偷窃”便条与 40% 的“隐私”便条进行混合,同时保持“共享安全网”处于激活状态。这确保了机器人能给出有帮助且具体的回答,既解决了确切的风险,又不会显得太模糊或太严苛。
研究发现:安全而不暴躁
研究人员在三个不同的机器人模型(Mistral、Vicuna 和 Zephyr)上测试了 HiRoute,并将其与其他安全方法进行了对比。结果令人印象深刻:
- 更好的安全性: HiRoute 比其他方法更能阻止有害请求。例如,在 Mistral 模型上,它的安全性达到了 93.2%,明显领先于次优的方法。
- 更有帮助性: 至关重要的是,它并没有让机器人拒绝无害的问题。当机器人确实需要拒绝一个不良请求时,它会解释原因并提供安全的替代方案,在“帮助性”方面得分很高(约为 7.4 分,满分 10 分)。
- 更少的过度拒绝: 这是一件大事。其他方法经常误屏蔽安全的提问。HiRoute 在 Mistral 模型上仅屏蔽了 2.5% 的安全问题,而另一种流行的方法则屏蔽了高达 40.5%。
团队还调整了“守门员”的严格程度。他们发现,如果他们让守门员变得稍微谨慎一些(将阈值提高到 0.95),在越狱测试中的安全性会上升到 95.0%,而机器人的数学能力(GSM8K)仅从 50.5% 轻微下降到 48.0%。这表明你可以让机器人变得非常安全,而不会破坏它的智力。
为什么这很重要
HiRoute 表明,我们不需要重建整个机器人就能让它变得安全。通过使用一个将“这是否危险?”与“我们如何处理这种特定危险?”分开的智能双层系统,我们可以创造出既是严格守护者又是得力朋友的 AI。它证明了安全性与帮助性并不一定是敌人;通过正确的路由和混合安全指令,两者是可以共存的。
研究人员指出,HiRoute 目前还不完美。它依赖于守门员对风险的正确判断,且主要适用于单轮文本对话。但就目前而言,它为在不把机器人变成毫无用处的机器人的前提下,保持我们的数字伙伴安全,提供了一种极具前景且高效的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。