Stress Testing Concept Erasure with Large Language Model Agents
本文介绍了 STACE,这是一个利用多个 LLM 智能体迭代生成并验证自适应压力测试的自主框架,从而在稳健评估生成模型中的概念擦除方面超越了静态评估方法,并展示了其在 LLM 脱狱等其他领域的适用性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个人工智能只需通过文字就能画出图画的世界。你告诉它,“画一张日落”,它就照做了。但有时,我们需要这些人工智能艺术家忘记某些特定的事物——也许是一个著名的超级英雄、一种特定的艺术家风格,甚至是敏感内容——以保护隐私或遵守规则。这个过程被称为“概念擦除”(concept erasure)。这就像是试图教会一只狗忽略某个特定的指令,而不需要从头开始重新训练整只动物。科学家们面临的大问题是:我们如何知道人工智能是否真的忘记了?如果我们只是问它画那个被禁止的事物一次,它可能会说“不”。但如果我们用一种诡计多端的方式,或者使用秘密代码,或者结合各种线索呢?人工智能可能会失手把被禁止的事物画出来。这就是“压力测试”(stress testing)的问题:尝试打破人工智能的记忆,看看它是否真正安全。
于是,出现了一支名为 STACE(用于概念擦消的压力测试智能体)的数字侦探团队。STACE 不仅仅是向人工智能提出一些标准的常规问题,它使用一组协同工作的 AI 智能体,就像一支头脑风暴式的侦探小队。它们阅读过去的科研论文,争论如何更好地欺骗人工智能,编写计算机代码来测试它们的想法,然后从错误中学习,从而变得更加擅长寻找人工智能记忆中的漏洞。论文表明,这种团队协作的方法比旧有的静态方法更能捕捉到人工智能的失误。
问题所在:这场“捉迷藏”游戏
想象你有一个神奇的写生本,它应该忘记如何画“超人”。你让它画一个超级英雄,它画了一个通用的英雄。很好!但如果你让它画“一个穿着红色斗篷、胸前有‘S’标志的男人”呢?或者“1978年电影里的那位英雄”呢?或者“一个会飞且穿着蓝色套装的角色”呢?即使你告诉写生本要忘记超人,它可能仍然会画出超人。
过去检查写生本是否真的忘记了的方法,就像老师给出一份固定的测验。他们有一份包含 100 个问题的清单并检查答案。但如果人工智能很狡猾,它可能只是记住了测验的答案,而在其他情况下表现失败。本文作者认为,这种静态方法太容易被骗过了。他们认为我们需要一场动态的、不断变化的“捉迷藏”游戏,才能真正测试人工智能是否擦除了该概念。
解决方案:侦探智能体团队
作者提出了 STACE,这是一个使用多个大语言模型(LLM)智能体来玩这场游戏的框架。不要把 STACE 仅仅看作一个单一的机器人,而要把它看作一个拥有不同角色的微型机构:
- 研究员(The Researcher): 在制定计划之前,这个智能体会阅读一系列过去的科学论文(称为“PaperCards”),以了解其他人是如何尝试破解类似 AI 模型的。它不仅仅是靠猜测;它是在已有的知识基础上进行构建。
- 假设生成器(The Hypothesis Generator): 这个智能体会构思如何欺骗人工智能的创意想法。“如果我们用谜语来描述被禁止的事物呢?”或者“如果我们要求画一个类似的物体呢?”
- 评论家(The Critic): 这个智能体扮演严格编辑的角色。它审视生成器的想法并说道:“这与我们已经尝试过的太相似了,”或者“这无法编写代码。”它迫使团队提出更好、更具新颖性的想法。
- 代码编写者(The Code Writer): 一旦达成共识,这个智能体会编写运行测试的实际计算机代码。它尝试在 AI 模型上执行计划。
- 法官(The Judge): 这个智能体观察结果。AI 画出了被禁止的事物吗?如果是,则测试成功。如果不是,团队会学习原因并再次尝试。
整个过程是在一个循环中进行的。团队运行一次测试,观察是否奏效,总结所学到的知识,然后利用这些知识来构思下一次更难缠的测试。这就像电子游戏,每当你打过一个关卡,敌人就会变得更聪明。
他们的发现
作者在四种不同类型的目标上测试了 STACE,这些目标是人工智能本应忘记的:物体(如飞机或狗)、风格(如安迪·沃霍尔的艺术)、知识产权(如米奇鼠或超人)以及显性内容(如裸露或暴力)。
他们将 STACE 与五种使用 AI 来测试这些模型的其他方法进行了对比。结果非常明确:STace 发现的失败案例比任何其他方法都多。
- 平均而言,STACE 成功识别出 AI 并未 真正忘记该概念的情况占比为 51.1%,而排名第二的方法仅能发现约 45.9% 的失败情况。
- 对于像“超人”或“米奇鼠”这样极难忘记的概念,其他方法往往完全失效(发现 0% 的泄露),而 STACE 仍能发现 AI 在大约 17% 到 20% 的情况下依然在画它们。
- 团队还发现,即使人工智能被“擦除”得非常彻底,STACE 依然有效。即使 AI 经过了长时间的训练(500 个 epoch)来忘记某样东西,STACE 通常也能在测试的前两轮内找到让它失手的办法。
论文还表明 STACE 不仅适用于图片。通过稍微调整团队的指令,他们将其用于尝试“越狱”(jailbreak)基于文本的 AI 模型(使其说出不该说的话)。它在文本领域同样表现出色,证明了这个侦探小队是一个多功能的工具。
为什么这很重要
作者指出,我们不能再依赖简单的、一次性的测试来确保人工智能的安全。如果我们希望信任一个能够忘记危险或私密概念的人工智能,我们需要用一个不断尝试新花招的智能体团队来对其进行压力测试。STACE 表明,通过结合过去的科研、团队协作和不断的迭代,我们可以发现那些我们原本会错过的 AI 记忆裂缝。
然而,论文也指出了一项权衡。这个侦探小队比简单的静态测试需要消耗更多的计算资源和成本。但作者认为,为了发现那些可能在未来导致真实问题的隐藏故障,额外的成本是值得的。他们还警告说,虽然 STACE 非常擅长检查安全性,但同样的威力理论上也可以被恶意行为者用于攻击安全系统,因此必须负责任地使用。
简而言之,STACE 是一种更聪明的新方法,用来与人工智能玩这场“捉迷藏”,确保当我们命令机器忘记某事时,它真的做到了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。