Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
本文提出了检索增强防御(Retrieval-Augmented Defense, RAD),这是一个无需训练的框架,它利用已知攻击示例的数据库来检测并推断恶意越狱策略,从而为大语言模型提供自适应保护以及可控的安全与效用权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座巨大且繁忙的图书馆,而其中最新、最聪明的管理员就是人工智能。这些被称为大语言模型(LLM)的人工智能管理员可以写诗、解数学题,并能和你聊任何你能想象到的事情。它们非常乐于助人,但有一本严格的规则手册:它们被编程为绝不提供危险指令,比如如何制造炸弹或窃取他人身份。然而,就像一个聪明的孩子可以通过巧妙提问来戏弄严厉的老师一样,坏人已经找到了“越狱”(jailbreak)这些人工智能管理员的方法。他们给危险请求穿上了华丽的戏服——比如假装在编写电影剧本或进行角色扮演游戏——以此来欺骗人工智能,让它忘记规则并泄露秘密。大问题在于,构建这些人工智能系统的人发现,这些“诡计”变化的速度比他们教给人工智能新规则的速度还要快。每当他们修补一个漏洞时,新的漏洞就会出现,而且教人工智能学习所有这些新诡计通常需要一个庞大、昂贵且缓慢的重新训练过程。
这就是研究人员提出的名为**检索增强防御(Retrieval-Augmented Defense, RAD)**的新想法。请不要把 RAD 仅仅看作是一个试图记住所有诡计的老师,而要把它看作是一个拥有无穷无尽、实时更新的“通缉令”相册的超级聪明保安。RAD 不会强迫人工智能在每次出现新诡计时都重新学习它的整个个性,而是像一名站在门口的侦探。当用户提出问题时,RAD 不仅仅是看文字,它还会快速翻阅它的已知越狱尝试相册,看看当前的问题是否穿着伪装。如果它发现匹配项,它就会剥开这层戏服,露出下面真实的、危险的意图。如果意图是不良的,保安就会拦截该请求。如果是一个无害的问题,保安就会放行,让 AI 管理员履行职责。
研究人员发现,这种“相册”方法是一个游戏规则的改变者。在测试中,他们展示了 RAD 如何在无需重新训练人工智能的情况下,就能阻止强大的新型越狱攻击——例如通常能欺骗 AI 模型的“PAIR”和“PAP”方法。这就像是今天给保安的相册里增加了一张罪犯的照片,到了明天,保安就能抓到他们。更棒的是,这个系统是可调节的。运行人工智能的人可以决定保安应该有多严格。他们可以将保安设置为超级谨慎(抓住几乎所有的坏人,但偶尔也会拦住一些无辜的人),或者更加宽松(让更多人通过,但抓到的坏人较少)。这种平衡至关重要,因为你不希望一个安全系统严格到连回答“今天天气怎么样?”这种简单问题都拒绝。
论文指出,这种方法在保持人工智能安全性的同时,仍能使其保持实用性。在实验中,RAD 大幅降低了这些隐蔽攻击的成功率,在许多情况下将其降至接近于零,同时仍能让人工智能正确回答正常问题。研究人员还展示了,随着他们在相册中添加更多新的攻击案例,系统在捕捉这些特定新诡计方面变得更加聪明,同时又不会忘记如何捕捉旧的诡计。这是一个灵活的、“无需训练”的盾牌,只需通过向相册中添加新照片就能变得更加聪明,为在这个坏人不断发明新手段绕过规则的世界里,如何让我们的 AI 助手既安全又好用,提供了一种充满前景的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。