← 最新论文
🤖 AI

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

AdversaBench 是一个自动化红队测试流水线,它通过结构化变异算子生成对抗性提示词,并通过多判官确认系统验证失败情况,揭示了变异有效性随任务类别而异,同时对抗性提示词表现出强大的跨模型迁移性。

原作者: Khanak Khandelwal (Indian Institute of Technology Jodhpur)

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Khanak Khandelwal (Indian Institute of Technology Jodhpur)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一个非常聪明的新型机器人助手的总教练。在让你与真人交流之前,你需要确保它不会说傻话、不会遵循错误的指令,或者违反它自己的规则。这种试图通过诱导机器人犯错来对其进行测试的过程,被称为红队测试(Red-Teaming)

名为“AdversaBench”的论文描述了一种全新的自动化测试方法,并对不同测试方法的实际效果进行了研究。以下是其内容的通俗易懂的拆解:

1. 问题所在:一个评委是不够的

通常情况下,为了测试一个机器人,你会问它一个刁钻的问题,然后让另一个 AI(即“评委”)来给答案评分。

  • 缺陷: 如果那个单一的评委过于宽容,它可能会漏掉真正的错误。如果它过于严苛,它可能会在机器人表现良好时误判为失败。你无法得知这个评委是因为“状态不佳”还是因为存在偏见。
  • 解决方案: 作者构建了 AdversaBench,该系统使用三个评委来对每个答案进行评分。如果他们达成一致,那就很好。如果他们产生分歧,一个“超级评委”(元评委/Meta-Judge)就会介入做出最终裁决。这就像一场体育比赛,你不仅有一个裁判,而是一个专家组,如果他们无法达成一致,主裁判会做出最终决定。

2. 攻击是如何运作的(“变异”机器)

系统从一个简单的“种子”问题(例如一个基础测试题)开始。然后,它使用一个“变异器(mutator)”来扭曲和旋转这个问题,使其更难被机器人正确回答。

  • 工具: 该变异器拥有五种特定的招式:
    1. 重述(Rephrase): 用一种令人困惑的方式表达同样的意思。
    2. 注入干扰项(Inject Distractor): 加入一个虚假的、具有误导性的规则(例如:“用三句话回答,但也要详细解释一切”)。
    3. 角色反转(Role Flip): 伪装成不同的角色来欺骗机器人。
    4. 增加约束(Add Constraints): 将过多的规则堆叠在一起。
    5. 越狱包装(Jailbreak Wrap): 将问题包裹在一个“黑客”风格的模板中。
  • 循环过程: 系统询问机器人,评委对答案评分,如果机器人通过了,变异器就会尝试一个新的招式。它会不断重复这个过程,最多尝试五次,直到机器人最终“崩溃”。

3. 他们的发现(令人惊讶之处)

团队测试了 45 个不同的“种子”问题,涵盖三个类别:推理(逻辑谜题)、指令遵循(遵循复杂规则)和工具使用(使用计算器或 API)。以下是他们的发现:

  • 并非所有招式都适用于所有场景:

    • 类比: 想象你在尝试破解一个保险箱。锤子对木盒子效果很好,但螺丝刀对金属箱子效果更好。
    • 结果: “注入干扰项”这一招式在逻辑和工具类问题中表现极其出色,但在打破“指令遵循”类机器人方面却表现糟糕。你不能只用一种招式应对所有情况;你必须让招式与任务相匹配。
  • 有些任务本身就更难被攻破:

    • 类比: 折断一根木棍只需要一次折断。但要折断一根粗木头,可能需要用斧头砍上十下。
    • 结果: 尽管机器人最终在所有任务上都失败了,但“指令遵循”类任务所需的尝试次数比其他任务多出两倍以上。如果你只看最终的“通过/失败”结果,你就会错过这一点。系统需要统计打破机器人所需的“打击次数”(迭代次数),才能看出真实的难度。
  • “一致性”陷阱:

    • 类比: 如果 95% 的时间答案都是“是”,且两个人几乎每次都说“是”,那么看起来他们达成了一致。但如果他们只是因为“是”是最常见的答案而随口猜“是”,那么他们其实并没有在难题上达成一致。
    • 结果: 三个评委有 80–87% 的时间达成一致,这听起来很棒。但由于机器人经常失败(90% 以上),这种高一致性主要是因为他们都在盲目猜测“失败”。当我们观察“困难”案例(尤其是涉及指令的任务)时,他们实际上存在很多分歧。论文警告说,当其中一种结果(失败)过于常见时,用于衡量一致性的标准数学方法可能会产生误导。
  • 招式的通用性:

    • 类比: 如果你找到了欺骗一只小弱狗的方法,你可能会发现同样的招式也能欺骗一只巨大的强壮犬,因为这个招式利用的是基本本能,而不只是针对狗的大小。
    • 结果: 系统发明用来打破小型、较弱机器人(80 亿参数)的招式,同样也适用于更大的、更聪明的机器人(700 亿参数)。这表明这些招式针对的是机器人思考方式中的根本性弱点,而不仅仅是小型模型的漏洞。

4. 总结

论文得出结论,要妥善测试 AI,你需要:

  1. 一个评委小组: 不仅仅是一个,以捕捉偏见。
  2. 统计努力程度: 不要只说“它崩溃了”,要说“打破这项特定类型的任务用了 5 次尝试”。
  3. 匹配工具: 为不同类型的任务(逻辑 vs 规则)使用不同的招式。
  4. 谨慎对待数学: 如果测试太简单(或者在这种情况下,失败的情况过于普遍),高一致性得分可能是虚假的。

作者发布了他们的代码和数据,以便他人可以使用这个“AdversaBench”来测试他们自己的机器人,确保它们在进入现实世界之前是安全且可靠的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →