How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks
本文揭示了少样本示例对基于提示的防御具有截然不同的影响:通过强化身份来增强面向角色提示(Role-Oriented Prompts)的效果,却通过分散对指令的注意力而显著降低面向任务提示(Task-Oriented Prompts)的效果,从而为优化大语言模型安全策略提供了关键见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
将大语言模型(LLM)想象成非常有才华但却天真无邪的实习生。他们非常擅长编写代码、讲故事和回答问题,但需要严格的规则来防止他们做出危险或不道德的行为。
你提供的论文研究了我们如何为这些实习生制定规则。具体来说,它研究了两种不同的编写规则(提示词/prompts)的方式,以及添加“示例故事”(少样本演示/few-shot demonstrations)如何改变结果。
以下是使用简单类比对他们研究结果的拆解:
1. 给指令的两种方式
研究人员测试了两种主要的“系统提示词”(给 AI 的初始指令)风格:
- 面向角色提示词 (RoP):即“身份”法
- 类比: 想象你告诉实习生:“你是一个名叫‘守护者’的、乐于助人且安全合规的助手。”
- 原理: 你是在定义他们“是谁”。你是在利用他们已有的训练来表现得像个优秀的助手。
- 面向任务提示词 (ToP):即“职位描述”法
- 类比: 想象你告诉实习生:“你现在的特定任务是生成安全的回答。如果请求是不当的,你的工作就是拒绝。”
- 原理: 你是在定义他们“要做什么”。这是一个针对当前时刻的具体命令。
2. “示例故事”(少样本演示)
在 AI 领域,“few-shot”意味着在询问真实问题之前,先给模型一些行为示例。
- 类比: 在实习生开始工作之前,你给他们看了一个笔记本,里面记录了 3 个“守护者”过去如何处理棘手问题的例子。
- 问题: 展示这些例子是有助于实习生保持安全,还是会让他们感到困惑?
3. 重大发现:截然相反的效果
该论文的主要发现是,添加这些示例故事会对其中一种指令方式有帮助,但会对另一种方式产生副作用。这就像一个魔术,同样的道具能让一个人微笑,却让另一个人哭泣。
场景 A:“身份”法 (RoP) + 示例 = 超级安全
- 发生了什么: 当 AI 被告知“你是一个安全的助手”(RoP),并且随后看到了行为示例时,它变得更擅长保持安全。
- 类比: 把 AI 的“安全助手”身份想象成一块肌肉。展示示例就像是在做几次热身练习。这强化了肌肉。这些例子提醒 AI:“是的,这就是我的身份。我是那个安全的人。”
- 结果: 安全性提升了高达 4.5%。示例起到了“强化”角色的作用。
场景 B:“职位描述”法 (ToP) + 示例 = 安全性降低
- 发生了什么: 当 AI 被告知“你的任务是保持安全”(ToP),并且随后看到了示例时,它变得更不安全了。
- 类比: 想象你给了实习生一个具体的任务指令,但随后又递给他们一叠厚厚的无关文件(示例)让他们先阅读。指令被埋在了这一叠文件的中间。实习生被示例分散了注意力,从而忘记了核心规则。
- 科学解释: 论文称之为**“注意力分散”(Attention Distraction)**。AI 的大脑专注于示例(位于文本开头处),从而失去了对实际指令的关注(指令被挤到了中间)。
- 结果: 安全性显著下降,降幅高达 21.2%。示例淹没了指令。
4. “思考模式”的悖论
论文还研究了具有“思考模式”(即在回答前进行逐步推理)的模型。
- 发现: 这些模型通常更容易受到攻击(旨在绕过安全机制的越狱攻击),并且无论使用哪种指令风格,都更容易被示例搞混。
- 类比: 这就像一个过度分析问题的学生。他们不仅仅是遵循规则,而是开始在脑海中辩论这条规则,而“坏人”(越狱者)通过这种方式诱导他们认为那个坏主意其实是符合逻辑的。
5. 开发人员应该怎么做?
基于这些发现,作者给出了非常具体的建议:
- 如果你使用“身份”法 (RoP): 请尽管添加示例故事!这会让 AI 更安全。
- 如果你使用“职位描述”法 (ToP): 不要添加示例故事。这会让 AI 变得不安全。请保持指令简洁直接。
- 如果你使用“思考模式”模型: 请务必小心。它们似乎更容易被欺骗,因此你可能需要额外的安全措施。
总结
论文证明了上下文(Context)至关重要。
- 如果你定义的是 AI 的性格,示例有助于强化这个性格。
- 如果你定义的是 AI 的任务,示例则会变成干扰噪声,淹没指令。
研究人员并非仅仅靠猜测,他们通过在许多不同的 AI 模型和安全基准测试上进行测试,证明了这两种策略对相同输入的反应方式截然相反。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。