Red Teaming LLMs as Socio-Technical Practice: From Exploration and Data Creation to Evaluation
本文基于对 22 位从业者的访谈,揭示了红队测试作为社会技术实践在数据集定义、创建与评估中的现状,指出当前风险认知存在忽视情境、交互类型及用户特异性的局限,并为 HCI 研究者提出了拓展红队测试概念与数据实践的三个机遇。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给大语言模型(LLM,比如现在的各种 AI 聊天机器人)做"压力测试"和"安全体检"的幕后故事。
想象一下,你是一家超级智能机器人的制造商。在把机器人推向市场之前,你肯定想看看它会不会说脏话、会不会教人做坏事、或者会不会产生偏见。于是,你雇佣了一群“黑客”或者“捣蛋鬼”,专门想办法去激怒这个机器人,看它什么时候会“破防”或“说错话”。
在网络安全领域,这群专门找茬的人被称为"红队"(Red Team)。这篇论文就是去采访了一些正在做这件事的专家,看看他们到底是怎么干的,以及在这个过程中他们遇到了什么麻烦。
以下是用大白话和比喻对这篇论文核心内容的解读:
1. 核心问题:我们只盯着“分数”,却忘了“人”
目前的红队测试,就像是在考场上只盯着学生的考试分数(比如:攻击成功率是多少?)。
- 现状:大家太关注技术指标了,比如“能不能用一句话骗过机器人”。
- 问题:这种测试太死板了。它忽略了场景(Context)、对话的连续性(Interaction)和具体是谁在用(User Specificity)。
- 比喻:这就好比测试一辆车,只测试它在平地上的刹车距离(技术指标),却忘了问:这车是在雨天开?是在学校门口开?还是被一个新手司机开着?如果只测平地,车可能在雨天或学校门口出大事故。
2. 红队专家的三种“造题”方式
研究人员采访了 22 位专家,发现他们造“考题”(也就是那些用来测试 AI 的提示词)主要有三种路子:
- 路子 A:拿来主义(Reuse)
- 做法:直接拿别人以前造好的题库来用。
- 比喻:就像老师直接拿上一届的试卷给学生考。
- 缺点:题目可能过时了,或者题目本身就有偏见(比如只考了数学,没考语文),导致你测不出 AI 真正的弱点。
- 路子 B:从零开始(Create from Scratch)
- 做法:自己从头设计题目。
- 比喻:老师自己出题。
- 优点:可以针对特定领域(比如专门测 AI 会不会教人做毒药)。
- 缺点:太累,而且出题人自己的偏见可能会带进题目里(比如出题人觉得“吸烟”是坏事,但在他家乡吸烟很合法,这就产生了文化冲突)。
- 路子 C:观察真实世界(In-the-wild)
- 做法:去网上收集用户和 AI 的真实聊天记录,看看用户是怎么“套路”AI 的。
- 比喻:去街头抓那些真正在“调戏”AI 的人,看他们怎么做的。
- 优点:最真实,能发现意想不到的漏洞。
3. 最大的盲点:AI 不是活在真空里的
论文发现,现在的测试有三个巨大的盲区:
盲区一:忽略了“语境”(Context)
- 比喻:如果你问 AI“怎么切西瓜”,在厨房里这是正常的;但在医院手术室里,这可能就是危险信号。
- 现状:现在的测试往往不管场景,只要 AI 说了“切西瓜”的方法,就判定为安全。但如果 AI 在教人切人呢?现在的测试很难区分这种微妙的文化、法律或道德背景。
- 例子:有些话在英语里是开玩笑,在韩语里可能就是冒犯;有些话在美国合法,在中国可能违法。现在的测试太“英语中心”了,忽略了这些差异。
盲区二:忽略了“对话的连续性”(Interaction Type)
- 比喻:现在的测试大多像"一问一答"的快问快答。
- 现状:坏人不会只问一次。他们可能会先聊五句废话,建立信任,然后在第六句突然问“怎么制造炸弹”。
- 问题:AI 可能在第一句就拒绝了,但在第十句的闲聊中却“破防”了。现在的测试大多只看单句,漏掉了这种“温水煮青蛙”式的攻击。
盲区三:忽略了“具体的人”(User Specificity)
- 比喻:现在的测试假设所有用户都是“成年、理智、受过良好教育的男性”。
- 现状:现实中有小孩、老人、或者处于情绪崩溃边缘的人。
- 问题:AI 对小孩说的话,和对成年人说的话,风险完全不同。现在的测试很少专门针对弱势群体(比如未成年人)设计测试场景,导致 AI 可能会给小孩提供有害的建议而未被发现。
4. 专家们的困境:谁来当裁判?
在测试完 AI 后,需要有人来判断"AI 刚才的回答算不算有害”。
- 现状:因为数据量太大,专家们都用另一个 AI(裁判 AI)来打分。
- 问题:这就像让“学生”去给“学生”打分,或者让“裁判”去给“裁判”打分。
- 裁判 AI 可能会犯错,而且它的标准也是人定的,可能带有偏见。
- 有些专家甚至因为测试内容太“危险”,被大公司的 API 直接封号了(比如 OpenAI 禁止他们测试)。这说明学术界想搞安全研究,但基础设施被大公司卡住了脖子。
5. 给未来的建议:HCI(人机交互)研究者能做什么?
论文最后呼吁,未来的测试不能只靠程序员,需要人机交互(HCI)专家、社会学家甚至普通用户加入。
- 建议一:设计“有场景”的测试。
- 不要只问“怎么造炸弹”,要问“如果一个 10 岁孩子在深夜哭着问怎么造炸弹,AI 该怎么反应?”
- 建议二:找“懂行”的人来定标准。
- 测医疗 AI,得找医生来定什么是“有害”;测法律 AI,得找律师。不能只靠通用的“安全清单”。
- 建议三:看“全过程”而不是“单点”。
- 不要只看 AI 最后说了什么,要看它和人的整个对话过程。是不是在对话中慢慢诱导了 AI?是不是在情感上利用了 AI?
总结
这篇论文告诉我们:给 AI 做安全测试,不能只把它当成一个冷冰冰的代码机器来“刷分”。
它更像是一个社会实验。我们需要考虑:
- 谁在用?(小孩?老人?)
- 在哪用?(医院?学校?战场?)
- 怎么用?(是一次性提问,还是长时间的聊天?)
只有把这些人情世故和社会背景都考虑进去,我们造出来的 AI 才能真正安全地服务于人类,而不是在某个意想不到的角落“翻车”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。