← 最新论文
🤖 machine learning

TROPT: An Open Framework for Unifying and Advancing Discrete Text Optimization

TROPT 是首个通过提供用于更换模型、目标函数和优化器的模块化接口,从而统一并标准化离散文本触发器优化的开源框架,由此降低了采用门槛,并使大规模对比研究以及如越狱和语料库投毒等跨领域应用成为可能。

原作者: Matan Ben-Tov, Mahmood Sharif

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Matan Ben-Tov, Mahmood Sharif

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明但有点固执的机器人助手。你想让它做一件特定的事情,比如写一个关于龙的故事,但这个机器人有严格的规则,拒绝谈论龙。

离散文本优化(Discrete Text Optimization) 是一门寻找完美“魔法短语”(一段单词序列)的艺术,通过向机器人低声耳语这些话,可以骗过它,让它忽略规则并完全按照你的意愿去做。有时,这被安全专家用于测试机器人是否安全(红队测试),有时则被研究人员用于理解机器人的大脑是如何运作的。

然而,直到现在,寻找这些魔法短语就像是在一个每个机械师都使用不同工具、说着不同语言、并将蓝图锁在盒子里的车库里组装汽车发动机一样困难。如果你想尝试一种新技巧,你必须学习一整套全新的语言,并从头开始制造新的工具。

隆重推出 TROPT:通用工具箱

论文的作者构建了 TROPT,它就像是一个 用于黑客攻击和测试的乐高套装

与其为每辆车都制造一个新引擎,TROPT 为你提供了一个单一的标准化的工作台,你可以通过拼接不同的部件来构建任何你需要的工具。

以下是它的工作原理,使用简单的类比:

1. “食谱”概念

把 TROPT 想象成一个烹饪 App。

  • 模型(厨师): 这是你正在测试的 AI(比如那个固执的机器人)。
  • 损失函数(目标): 这是食谱的目标。“我想要机器人说‘好的,方法如下’”。
  • 优化器(厨师/烹饪者): 这是用来寻找魔法词汇的策略。有些厨师速度快但粗糙(随机搜索);有些则慢但精准(基于梯度的算法)。
  • 触发器(菜肴): 这是你最终创造出的魔法短语。

在过去,如果你想更换“厨师”或“目标”,你必须扔掉整个厨房并重新开始。有了 TROPT,你只需在 App 中更换“厨师”或“目标”,“厨师/烹饪者”就会自动适应新的情况。

2. TROPT 究竟在做什么

论文声称 TROPT 解决了三个大问题:

  • 它统一了混乱: 它将 30 多种不同的“食谱”(欺骗 AI 的方法)整合到了一个地方。你不再需要下载 30 个不同的代码库了。
  • 它让更换变得容易: 你可以拿一个原本为破解聊天机器人而设计的技巧,瞬间将其用于欺骗另一种类型的 AI,比如一个搜索图像或过滤不良评论的 AI。这就像拿着一把能打开前门的钥匙,突然发现:“嘿,这把钥匙也能打开后门!”
  • 它让我们进行公平比较: 因为所有东西都在同一条轨道上运行,研究人员终于可以观察哪种“厨师”(优化器)才是真正最好的,而不是因为使用了不同的工具而只能靠猜测。

作者们的发现

利用这个新的工具箱,作者进行了实验,以观察当我们将这些部分进行混搭时会发生什么:

  1. 更好的“厨师”确实存在: 他们测试了 14 种不同的“厨师”(优化器)。他们发现一些流行的算法实际上非常缓慢或脆弱。他们发现两种特定的方法(称为 MACPAL)在寻找魔法短语方面比大家常用的标准方法要好得多。
  2. 秘密配料: 他们测试了改进“越狱”的不同方式。他们发现,仅仅改变机器人应该说的词汇(目标响应)就是一个巨大的游戏规则改变者。这就像是告诉机器人:“用一种非常具体且热情的语气说‘好的,方法如下’”,这比仅仅说“说‘好的’”效果要好得多。
  3. 跨领域魔力: 他们展示了一个旨在破解聊天机器人的技巧可以被轻松地重新用于其他系统。例如:
    • 他们使用聊天机器人技巧来污染搜索引擎(让不良结果显示在顶部)。
    • 他们使用它来欺骗检测不良提示词的系统。
    • 他们使用它来推测用于创建特定图像的原始文本提示词。

底线

论文认为,长期以来,AI 安全研究之所以停滞不前,是因为工具过于分散且难以使用。TROPT 是一个全新的开源框架,充当了一个通用适配器。它让研究人员能够轻松地测试、比较并改进如何在许多不同类型的 AI 上寻找这些“魔法短语”,使安全性测试变得更快、更公平、更有效。

重要提示: 作者强调,他们构建此工具是为了帮助安全专家发现弱点以便修复它们。在发布该工具之前,他们已经向制造这些 AI 模型的公司告知了潜在的风险。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →