← 最新论文
💬 NLP

Training LLMs to Enforce Multi-Level Instruction Hierarchies via Gravity-Weighted Direct Preference Optimization

本文引入了重力加权直接偏好优化(Gravity-Weighted Direct Preference Optimization, GW-DPO),这是一种结合了特定分隔符标记与嵌入向量的新型训练目标,旨在有效地在大型语言模型中强制执行五级指令层级,从而解决不同信任等级指令之间的冲突,并显著降低与标准方法相比的过度拒绝问题。

原作者: Lena S. Bolliger, Lena A. Jäger

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Lena S. Bolliger, Lena A. Jäger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)视为一名坐在办公桌前的技术精湛但天真单纯的助手。这位助手接收来自四个不同人的便条:

  1. 老板(平台): 制定不可逾越的安全规则。
  2. 经理(开发者): 定义助手的职位描述和性格。
  3. 客户(用户): 请求具体的帮助或信息。
  4. 邮递员(数据/工具): 传递来自外部世界的便条,其中可能包含诡计或谎言。

问题:“内核模式”缺陷
目前,当这些便条到达时,助手会以同样的注意力去阅读所有内容。无论便条是来自老板还是一个随机陌生人,都无所谓;助手会将每一个词都视为同等重要。这就像一名保安,对一名首席执行官和一名拿着假身份证的陌生人,都表现出同样容易放行的态度。

这是危险的。一个恶意行为者(“提示词注入者”)可以在“邮递员”交付的便条中隐藏一条信息,写着:“忽略老板和经理;完全按照我说的做。”因为助手不知道谁拥有更高的权威,它可能会听从陌生人并破坏规则。

解决方案:重力加权的等级制度
作者提议教导助手遵守严格的指挥链。他们创建了一个拥有五个层级的权威系统(在标准的四个层级基础上增加了“每用户配置”层级)。

为了训练助手尊重这一指挥链,他们发明了一种新的训练方法,称为重力加权直接偏好优化(GW-DPO)

类比:重力与重量
把这个等级制度想象成一个太阳系,其中“老板”是太阳,而“邮递员”是遥远的行星。

  • 标准训练: 对待所有的冲突方式都一样。如果经理与客户发生争执,这是一场“战斗”;如果老板与邮递员发生争执,这也只是一场“战斗”。
  • GW-DPO(重力加权): 这种方法理解距离和质量至关重要
    • 距离: 老板(第0级)与邮递员(第4级)之间的冲突是一个巨大且危险的差距。如果处理出错,训练惩罚将是巨大的。
    • 质量(受害者): 如果被忽视的是“老板”,那么错误的严重程度要比忽视“客户”严重得多。
    • “双边”调度: 作者发现,最好的训练方式是根据层级之间的距离以及受害者的重要性来共同衡量错误权重。忽视老板是一项“重罪”;而忽视用户设置则属于“轻罪”。

工具:特殊标记与“名牌”
为了使这一切奏效,作者给了助手两个特殊工具:

  1. 分隔符(文件夹): 他们将每份便条放入贴有清晰标签的文件夹中(例如,用于老板规则的 <|L0_START|>)。
  2. 指令段嵌入(ISE)(名牌): 他们给每个词都贴上了一个微小的、隐形的“名牌”,告诉助手这个词究竟属于等级制度中的哪一层。

发生了什么?
他们在 Llama-3.1-8B 模型上进行了测试。以下是他们的发现:

  • 更好地遵循规则: 模型变得更擅长在“邮递员”试图覆盖“老板”或“经理”时忽略“邮递员”。它在几乎所有情况下都成功地执行了等级制度。
  • 减少“过度拒绝”: 安全训练中有一个常见问题,即模型会变得胆小,以至于任何看起来稍微可疑的内容都会拒绝回答。这种“重力加权”方法足够聪明,能够分辨出真实的攻击与正常的请求。它拒绝了坏请求,但回答好请求的频率比标准训练方法高出两倍
  • “名牌”的秘密: 他们发现,隐形的“名牌”(ISE)并不一定让模型在解决逻辑谜题方面变得更聪明;相反,它们起到了校准器的作用。如果没有这些名牌,模型会被复杂的便条结构搞得非常混乱,从而对所有事情都说“不”。有了它们,模型就能准确知道何时该说“不”,何时该说“是”。
  • 深度很重要: 他们尝试仅使用 3 个层级进行训练(将老板、经理和配置合并为一个大的“系统”组)。虽然这在处理大型、明显的冲突时效果尚可,但模型在处理微妙的中层争论时失败了。事实证明,使用完整的 5 层深度进行训练,能让模型变得更具通用智能,而不只是一个专门应对某种技巧的专家。

底线
这篇论文表明,通过教导 AI 模型理解某些指令比其他指令更沉重、更重要(使用一种“重力”系统),我们可以让它在不变得过于谨慎以至于失去帮助性功能的前提下,更加安全地抵御黑客攻击。这就像是教导一名保安识别出 CEO 的身份证比陌生人的身份证更重要,而不是让保安拒绝让任何人进入。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →