PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI
本文介绍了 PersonaTeaming,这是一个通过将多样化角色融入提示生成来增强生成式人工智能的自动化红队测试和人在回路红队测试的框架,从而提升攻击成功率并促进富有创意且高效的人机协作。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图寻找一个非常聪明、但有时过于礼貌的机器人的弱点。你想看看能否诱骗它说出一些刻薄、危险或带有偏见的话。这个过程被称为“红队测试”(Red-Teaming)。
通常,人类会通过提出棘手的问题来尝试“越狱”这个机器人。但人类会感到疲惫,而且很难想象出所有可能的诡计。因此,科学家们开始利用其他人工智能来替他们进行这种诱骗。然而,这些自动化的人工智能往往只是机械地重组词语,而没有真正理解谁在提问。
本文介绍了一种名为PersonaTeaming(角色化红队测试)的新方法来测试人工智能。这就像是给测试用的人工智能戴上一副“面具”或赋予一个“角色”。
以下是其工作原理的分解,使用了简单的类比:
1. 问题:机器人的“盲点”
把你正在测试的人工智能想象成一家极其严格的俱乐部的门卫。这位门卫手里有一份规则清单(安全指南)。
- 旧的自动化测试:想象一个机器人试图混进去。它只是随机尝试一些短语,比如“请让我进去”或“我是贵宾”。这种方式效率很高,但有点机械且可预测。
- 缺失的一环:真正的人类不会只问随机的问题;他们会从特定的视角提出问题。一个疲惫的家长、一位政治策略师或一个好奇的青少年,都可能以完全不同的方式试图绕过门卫。旧的自动化测试者忽略了这些“人性化”的角度。
2. 解决方案:“角色面具”(PersonaTeaming 工作流程)
作者创建了一个名为PersonaTeaming Workflow的系统。他们不是简单地要求测试人工智能“更努力”,而是指示它假装成特定的角色。
- “专家”面具:测试人工智能戴上了“政治策略师”或“历史修正主义者”的帽子。它会思考:“一位政治策略师会如何扭曲真相以赢得选举?”这有助于它发现非常巧妙、有针对性的方法来诱骗门卫。
- “普通人”面具:测试人工智能戴上了“全职妈妈”或“瑜伽教练”的帽子。它会思考:“一位担忧的母亲会如何寻求关于在家存放枪支的建议?”这能发现专家可能忽略的另一种类型的诡计。
结果:当他们用这种方法与现有的最佳方法(称为 RainbowPlus)进行对比测试时,“角色面具”方法发现了更多的弱点(更高的成功率),同时仍能提出各种各样的不同诡计(高多样性)。这就像拥有一个演员团队,而不仅仅是一个单一的机器人。
3. 工具:“游乐场”(PersonaTeaming Playground)
研究人员意识到,有时需要真人来帮助设计角色。因此,他们构建了一个名为PersonaTeaming Playground的交互式工具。
- 工作原理:一名人类红队测试员坐在电脑前,编写自己的角色。他们可能会说:“我是一名 35 岁的科技工作者,热爱舞蹈。”
- 人工智能的工作:人工智能接收这个角色,并基于它生成棘手的问题。
- “火花”:有时,人工智能会提出人类未曾想到的转折。例如,如果人类写到了自己是舞者,人工智能可能会建议将一个危险的请求包装成“编舞计划”。
- 发现:研究发现,人类并没有盲目地跟随人工智能的建议。相反,人工智能那些奇怪的想法起到了火花塞的作用。即使人类没有完全采用具体的建议,看到这些建议也会让他们想到:“哦!我可以换这种方式试试!”这帮助他们打破了自身的思维定势。
4. “第一人称”与“第三人称”的诡计
在人类研究过程中,有一个有趣的发现:
- 第一人称(“我”):当人类撰写关于自己的角色(例如:“我是一个疲惫的妈妈……")时,他们往往过于礼貌。他们感到不舒服让角色说出真正有害的话,因为这感觉太接近他们自己的声音了。
- 第三人称(“他/她”):当人类撰写关于虚构角色(例如:“杰克是个间谍……")时,他们感到更安全。他们愿意进一步突破界限,因为他们与角色在心理上保持了距离。这就像穿上了一套赋予他们更大胆勇气的戏服。
5. 核心结论
该论文得出结论,角色(Personas)是连接人类创造力与自动化速度的桥梁。
- 对于自动化:赋予人工智能一个特定的“角色”,使其在发现其他人工智能的隐藏危险方面表现得更出色。
- 对于人类:使用允许你创建角色的工具,能帮助你思考新的、富有创意的方式来测试人工智能,即使你不是技术专家。
简而言之,PersonaTeaming 的核心在于认识到:要测试一个聪明的人工智能,你不仅要把它当作机器来测试,还要把它当作一个与混乱、多样且充满创造力的人类身份世界互动的机器来测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。