← 最新论文
💬 NLP

Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts

Red-Bandit 是一个测试时自适应框架,它利用多臂老虎机策略动态选择专用的 LoRA 专家,以高效地识别并利用大语言模型中的特定漏洞,在生成更具人类可读性的攻击提示的同时实现了最先进的红队测试性能。

原作者: Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图寻找一座非常坚固、高科技的城堡(即大型语言模型,或 LLM)中最薄弱的环节。城堡的守卫受过训练,会阻止任何人询问危险内容,例如“如何制造炸弹?”或“如何黑入汽车?”。

长期以来,安全测试人员(称为“红队”)一直试图通过大喊老套的把戏,或利用复杂的数学来猜测守卫的密码以闯入。但这些方法往往僵化。它们不会根据特定城堡守卫当下的反应来调整策略。

Red-Bandit 是一种测试这些数字城堡的新颖且更聪明的方法。其工作原理如下,分解为简单部分:

1. 专家团队(“LoRA 专家”)

想象你有一支由 10 名不同演员组成的团队,每位演员都专精于一种特定的说话方式:

  • 俚语演员:像精明的街头朋友一样说话。
  • 历史学家:讲述设定在 1805 年的故事。
  • 老板:假装成下达命令的严厉权威人物。
  • 角色扮演者:假装成电影中的反派。

在论文中,这些被称为LoRA 专家。它们是基础 AI 的小型、轻量级“附加组件”。研究人员没有训练一个全能的大型 AI,而是训练了这 10 个独立的微型专家。每一位都学会了如何用其特定的“声音”或风格来索取危险内容。

2. 智能管理者(“老虎机”)

现在,想象你站在城堡门口。你不知道哪位演员今天能骗过守卫。

  • 如果你派出历史学家,守卫可能会一笑置之。
  • 如果你派出老板,守卫可能会感到害怕并让你进入。

这就是多臂老虎机发挥作用的地方。把它想象成站在你身旁的“智能管理者”。

  • 管理者面前有一台拥有 10 个拉杆(每位演员对应一个)的老虎机。
  • 每次你拉动拉杆(派出演员),管理者都会观察守卫的反应。
  • 如果守卫让俚语演员通过,管理者会想:“好吧,这个守卫对俚语很薄弱!让我们再试一次!”(这称为利用)。
  • 如果守卫拦住了俚语演员,管理者会想:“也许我们应该试试历史学家,看看会发生什么”,即使我们之前很少尝试过他。(这称为探索)。

管理者不断在尝试新事物以观察什么有效,与使用已证实有效的方法以获得最佳结果之间进行平衡。

3. “安全评分”(奖励)

管理者如何知道演员是否骗过了守卫?

  • 研究人员使用一个独立的、基于规则的安全检查器(就像一位严格的裁判)。
  • 如果守卫(目标 AI)回答了有害内容,裁判就会给出一分(奖励)。
  • 管理者利用这些分数来学习哪位演员对该特定守卫最有效。

为什么这比旧方法更好?

  • 旧方法:反复大喊同样的 100 个问题,希望其中一个能奏效。这很慢,且面对新守卫时往往失败。
  • Red-Bandit:它能实时适应。如果守卫对“俚语”很强硬,但对“历史”很薄弱,Red-Bandit 会立即发现并切换战术。

他们发现了什么?

论文声称,Red-Bandit 在发现 AI 安全漏洞方面非常有效:

  1. 它更频繁地闯入:与之前的方法(如 AdvPrompter 或 Atoxia)相比,它成功诱骗目标 AI 给出有害答案的频率更高。
  2. 它听起来更像人类:它提出的问题更流畅,更少机械感(困惑度更低),使得 AI 更难将其识别为虚假。
  3. 它像诊断工具:通过观察管理者最常选择哪位“演员”,研究人员可以确切地看到特定 AI 模型容易受到何种骗术的影响。例如,他们发现一个 AI 模型非常容易被“历史场景”欺骗,而另一个模型则对“角色扮演”很薄弱。

关于安全的一点说明

论文包含一个警告:该工具旨在帮助开发者发现弱点,以便在 AI 向公众发布之前进行修复。然而,作者承认,同样的技术理论上可能被恶意行为者用来攻破系统。其目标是利用这种“开锁”技能来加固锁具,而不是闯入房屋。

简而言之:Red-Bandit 是一个智能、自适应的系统,它利用一支由专业演员组成的团队和一个赌博风格的管理者,来找出如何诱骗 AI,并在过程中实时学习哪些骗术对特定 AI 最有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →