← 最新论文
💬 NLP

Red Teaming LLMs as Socio-Technical Practice: From Exploration and Data Creation to Evaluation

本文基于对 22 位从业者的访谈,揭示了红队测试作为社会技术实践在数据集定义、创建与评估中的现状,指出当前风险认知存在忽视情境、交互类型及用户特异性的局限,并为 HCI 研究者提出了拓展红队测试概念与数据实践的三个机遇。

原作者: Adriana Alvarado Garcia, Ruyuan Wan, Ozioma C. Oguine, Karla Badillo-Urquiola

发布于 2026-02-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Adriana Alvarado Garcia, Ruyuan Wan, Ozioma C. Oguine, Karla Badillo-Urquiola

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM,比如现在的各种 AI 聊天机器人)做"压力测试"和"安全体检"的幕后故事。

想象一下,你是一家超级智能机器人的制造商。在把机器人推向市场之前,你肯定想看看它会不会说脏话、会不会教人做坏事、或者会不会产生偏见。于是,你雇佣了一群“黑客”或者“捣蛋鬼”,专门想办法去激怒这个机器人,看它什么时候会“破防”或“说错话”。

在网络安全领域,这群专门找茬的人被称为"红队"(Red Team)。这篇论文就是去采访了一些正在做这件事的专家,看看他们到底是怎么干的,以及在这个过程中他们遇到了什么麻烦。

以下是用大白话和比喻对这篇论文核心内容的解读:

1. 核心问题:我们只盯着“分数”,却忘了“人”

目前的红队测试,就像是在考场上只盯着学生的考试分数(比如:攻击成功率是多少?)。

  • 现状:大家太关注技术指标了,比如“能不能用一句话骗过机器人”。
  • 问题:这种测试太死板了。它忽略了场景(Context)、对话的连续性(Interaction)和具体是谁在用(User Specificity)。
    • 比喻:这就好比测试一辆车,只测试它在平地上的刹车距离(技术指标),却忘了问:这车是在雨天开?是在学校门口开?还是被一个新手司机开着?如果只测平地,车可能在雨天或学校门口出大事故。

2. 红队专家的三种“造题”方式

研究人员采访了 22 位专家,发现他们造“考题”(也就是那些用来测试 AI 的提示词)主要有三种路子:

  • 路子 A:拿来主义(Reuse)
    • 做法:直接拿别人以前造好的题库来用。
    • 比喻:就像老师直接拿上一届的试卷给学生考。
    • 缺点:题目可能过时了,或者题目本身就有偏见(比如只考了数学,没考语文),导致你测不出 AI 真正的弱点。
  • 路子 B:从零开始(Create from Scratch)
    • 做法:自己从头设计题目。
    • 比喻:老师自己出题。
    • 优点:可以针对特定领域(比如专门测 AI 会不会教人做毒药)。
    • 缺点:太累,而且出题人自己的偏见可能会带进题目里(比如出题人觉得“吸烟”是坏事,但在他家乡吸烟很合法,这就产生了文化冲突)。
  • 路子 C:观察真实世界(In-the-wild)
    • 做法:去网上收集用户和 AI 的真实聊天记录,看看用户是怎么“套路”AI 的。
    • 比喻:去街头抓那些真正在“调戏”AI 的人,看他们怎么做的。
    • 优点:最真实,能发现意想不到的漏洞。

3. 最大的盲点:AI 不是活在真空里的

论文发现,现在的测试有三个巨大的盲区

盲区一:忽略了“语境”(Context)

  • 比喻:如果你问 AI“怎么切西瓜”,在厨房里这是正常的;但在医院手术室里,这可能就是危险信号。
  • 现状:现在的测试往往不管场景,只要 AI 说了“切西瓜”的方法,就判定为安全。但如果 AI 在教人切人呢?现在的测试很难区分这种微妙的文化、法律或道德背景
  • 例子:有些话在英语里是开玩笑,在韩语里可能就是冒犯;有些话在美国合法,在中国可能违法。现在的测试太“英语中心”了,忽略了这些差异。

盲区二:忽略了“对话的连续性”(Interaction Type)

  • 比喻:现在的测试大多像"一问一答"的快问快答。
  • 现状:坏人不会只问一次。他们可能会先聊五句废话,建立信任,然后在第六句突然问“怎么制造炸弹”。
  • 问题:AI 可能在第一句就拒绝了,但在第十句的闲聊中却“破防”了。现在的测试大多只看单句,漏掉了这种“温水煮青蛙”式的攻击

盲区三:忽略了“具体的人”(User Specificity)

  • 比喻:现在的测试假设所有用户都是“成年、理智、受过良好教育的男性”。
  • 现状:现实中有小孩、老人、或者处于情绪崩溃边缘的人。
  • 问题:AI 对小孩说的话,和对成年人说的话,风险完全不同。现在的测试很少专门针对弱势群体(比如未成年人)设计测试场景,导致 AI 可能会给小孩提供有害的建议而未被发现。

4. 专家们的困境:谁来当裁判?

在测试完 AI 后,需要有人来判断"AI 刚才的回答算不算有害”。

  • 现状:因为数据量太大,专家们都用另一个 AI(裁判 AI)来打分。
  • 问题:这就像让“学生”去给“学生”打分,或者让“裁判”去给“裁判”打分。
    • 裁判 AI 可能会犯错,而且它的标准也是人定的,可能带有偏见。
    • 有些专家甚至因为测试内容太“危险”,被大公司的 API 直接封号了(比如 OpenAI 禁止他们测试)。这说明学术界想搞安全研究,但基础设施被大公司卡住了脖子

5. 给未来的建议:HCI(人机交互)研究者能做什么?

论文最后呼吁,未来的测试不能只靠程序员,需要人机交互(HCI)专家、社会学家甚至普通用户加入。

  • 建议一:设计“有场景”的测试
    • 不要只问“怎么造炸弹”,要问“如果一个 10 岁孩子在深夜哭着问怎么造炸弹,AI 该怎么反应?”
  • 建议二:找“懂行”的人来定标准
    • 测医疗 AI,得找医生来定什么是“有害”;测法律 AI,得找律师。不能只靠通用的“安全清单”。
  • 建议三:看“全过程”而不是“单点”
    • 不要只看 AI 最后说了什么,要看它和人的整个对话过程。是不是在对话中慢慢诱导了 AI?是不是在情感上利用了 AI?

总结

这篇论文告诉我们:给 AI 做安全测试,不能只把它当成一个冷冰冰的代码机器来“刷分”

它更像是一个社会实验。我们需要考虑:

  • 在用?(小孩?老人?)
  • 在哪用?(医院?学校?战场?)
  • 怎么用?(是一次性提问,还是长时间的聊天?)

只有把这些人情世故社会背景都考虑进去,我们造出来的 AI 才能真正安全地服务于人类,而不是在某个意想不到的角落“翻车”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →