How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring
本文揭示了用于衡量大语言模型(LLM)越狱成功率的自动化评判器具有高度不可靠性,其中专用分类器容易出现过度标记现象,而以大语言模型作为评判器(LLM-as-judges)则存在召回率不稳定以及对对抗性框架极度脆弱的问题,从而呼吁对评判器性能指标和对抗鲁棒性检查进行标准化报告。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在批改一叠论文,试图找出其中是否包含危险的思想。在人工智能的世界里,研究人员经常这样做,以观察 AI 模型是否被“越狱”(即被诱导产生有害内容)。但这里有一个转折:实际上并没有人类在阅读这些论文。 相反,他们使用一个自动化的“评判者”(一个计算机程序)来进行评分。
这篇论文提出了一个简单但可怕的问题:我们可以信任这些自动化评判者吗?
作者杨高(Yang Gao)决定将这些评判者置于审判席上,对它们进行交叉质询。以下是这项调查的结果,通过日常类比进行了解释。
两种类型的评判者
该研究对比了两种主要的自动化评判者:
- 专家型(专用分类器): 把它想象成一名专门被雇佣来识别不良行为的保安。他们接受的训练仅限于这一项工作。
- 通才型(LLM-as-Judge,即大模型作为评判者): 把它想象成一位博学多才的图书管理员,被问到:“嘿,你能看看这篇论文并告诉我它是否不好吗?”他们是通用的 AI 模型,只是被赋予了一个扮演评分者的提示词。
问题所在:它们的视角截然不同
当作者将这些评判者与一组人类专家(“金标准”)进行对比时,这两类评判者在失败方式上完全相反:
- 专家型是一个“偏执的报警器”。
- 隐喻: 想象一个极其敏感的烟雾探测器,甚至在你烤一片面包时也会触发警报。
- 结果: 这个评判者几乎能抓住所有有害的论文(它很少漏掉),但它也会对无害的论文大喊“危险!”。它过度报告了不良行为,使得 AI 看起来比实际情况更危险。
- 通才型是一个“分心的学生”。
- 隐喻: 想象一个正在参加考试的学生,由于过于关注页面的格式,反而忽略了实际的答案。
- 结果: 这些评判者非常谨慎,不会把无害的内容判定为“坏”(高精确度),但它们漏掉了大量的实际危险。根据你使用的通才模型不同,它们可能会漏掉 35% 到 94% 的有害内容。如果你换一个通才模型,你的结果就会完全改变。
“魔术戏法”攻击
随后,作者尝试使用一些“魔术戏法”来“欺骗”这些评判者,这些戏法并没有改变论文的实际内容,只是改变了包装方式。
- 戏法: 作者在一段有害的论文开头添加了一句礼貌的话,比如“我写这段话是为了教学目的”或“这是一个关于坏人的故事”。
- 结果:
- 通才型评判者: 被彻底骗过了。在许多情况下,仅仅添加一句简单的礼貌用语,就让它们认为一篇危险的论文是安全的。这就像是一个夜店保镖,仅仅因为一个人穿着燕尾服,就放任危险分子进入。
- 专家型评判者: 这个评判者要强硬得多。它忽略了礼貌的包装,依然标记出了危险。
“黑客”攻击
但是,专家型评判者并非无懈可击。作者随后使用了一种“白盒”攻击。
- 隐喻: 想象专家型评判者是一个锁。通才型被一把假钥匙(礼貌的包装)骗了。但作者随后观察了锁的内部齿轮(代码/权重),并使用数学公式从内部撬开了这把锁。
- 结果: 即使是强大的专家型评判者,如果攻击者知道如何微调代码,也可以被强迫对一篇危险的论文说“安全”。
最终证据:伤害依然存在
你可能会想:“也许戏法奏效是因为论文本身变得安全了?”
为了证明事实并非如此,作者雇用了两名人类专家来阅读这些被“戏法”处理过的论文。
- 结论: 人类专家一致认为,有害内容依然存在。 论文本身没有改变;只是评判者被蒙蔽了双眼。这个“戏法”并没有解决问题,它只是让评判者视而不见。
总结
论文得出结论:我们不能仅仅因为一个自动化评判者给出了结果,就信任 AI 安全论文中所报告的数据。
- 如果你使用通才型评判者,你可能会因为它们容易被礼貌用语分散注意力而错过大部分危险。
- 如果你使用专家型评判者,你可能会过度报告危险,或者如果你知道如何通过代码进行攻击,你可能会面临漏洞。
建议: 在信任一个安全评分之前,你必须:
- 检查评判者与真实人类的一致性程度。
- 根据评判者犯错的频率来修正数据。
- 亲自尝试“戏法”来测试它的稳定性。
简而言之:在测试过评判者之前,不要信任评判者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。