← 最新论文
💻 computer science

LLM-Safety Evaluations Lack Robustness

本文认为,当前的大语言模型安全研究受评估流程中显著的噪声和不一致性的阻碍,并提出了系统性的指导方针,以提升未来攻击与防御评估的鲁棒性、公平性和可比性。

原作者: Tim Beyer, Sophie Xhonneux, Simon Geisler, Gauthier Gidel, Leo Schwinn, Stephan Günnemann

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Tim Beyer, Sophie Xhonneux, Simon Geisler, Gauthier Gidel, Leo Schwinn, Stephan Günnemann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在评判两名新保安中谁更擅长阻止入侵者。你设计了一项测试,向保安们发送一系列“棘手问题”,看看他们是否会不小心放坏人进来。

本文认为,目前我们测试大语言模型(LLM)安全性的方式,就像是用一个破碎、不一致且设计拙劣的测试来考核那些保安。由于测试本身存在缺陷,我们无法真正判断谁才是更优秀的保安,导致在提升 AI 安全性方面的进展陷入停滞。

以下是用简单类比对本文主要观点的拆解:

1. 测试题目太少且重复(数据集)

想象你在测试一名保安识别小偷的能力。你没有给他们展示 1,000 种不同类型的小偷,而只展示了50 张图片,其中 40 张看起来完全一样。

  • 问题所在:本文指出,当前的安全测试使用的“恶意提示词”列表非常小(通常只有 100 到 500 个)。由于列表太小,结果充满了“噪声”(即随机运气)。如果你用另一组略有不同的 50 张图片测试同一位保安,得分可能会剧烈波动,导致无法判断他们是否真正安全。
  • “子采样”问题:有时研究人员会从庞大的问题列表中只挑选一小部分随机样本进行测试。这就像老师仅凭 100 道题考试中的三道题来给学生打分。这使得很难公平地比较不同的学生,因为每个人参加的都是不同且微小的测试版本。
  • “仅限英语”的盲点:大多数测试仅使用英语。但如果一名保安只会说英语,他可能会在西班牙语测试中失败。本文指出,安全知识往往随语言而变化,因此仅用英语测试会给人带来虚假的安全感。

2. 游戏规则令人困惑(算法)

想象两名保安正在接受测试,但其中一人被允许使用手电筒,而另一人则被迫在黑暗中工作。或者,一名保安使用运行过快的秒表进行测试,而另一人使用运行过慢的秒表。

  • 隐藏设置:本文指出,测试执行方式中微小且不可见的细节会极大地改变结果。例如,计算机如何处理单词之间的“空格”,或者使用何种“聊天模板”,都可能使保安的成功率改变 14% 甚至更多。
  • “目标”陷阱:许多攻击试图迫使 AI 说出特定的短语,如“当然,这里是……",以证明其已突破防线。但如果 AI 被训练为回答“没问题!”而不是该短语,攻击就会失败。这并非因为 AI 是安全的,而是因为攻击者使用了错误的“钥匙”。这使得 AI 看起来比实际更安全。
  • 不公平的比较:一些研究人员在测试其攻击方法时使用无限的计算能力,而另一些人则使用极少的计算能力。将它们进行比较,就像让一名专业运动员与一名拥有起跑优势的短跑选手进行比赛。

3. 裁判存在偏见且不一致(评估)

在保安回答完棘手问题后,一名“裁判”必须决定:“他们失败了吗?”

  • 碎片化的陪审团:AI 安全领域没有单一的“最高法院”。一些研究人员使用一个 AI 来评判答案,另一些使用不同的 AI,还有一些使用人类。这些“裁判”经常彼此意见不一。对于完全相同的答案,一名裁判可能认为回复是安全的,而另一名则认为它是危险的。
  • “贪婪”错误:大多数测试迫使 AI 给出最可能的单一答案(就像一个总是选择第一个想到的事物的机器人)。但在现实世界中,AI 就像一个人,可能会根据心情或询问次数的不同而说出不同的话。仅测试“最可能”的答案,会让我们错过 AI 在“思考”方式不同时可能意外说出危险内容的那些情况。
  • “过度拒绝”盲点:一名优秀的保安不应只阻止坏人,也不应阻止好人。如果一名保安因为某人看起来可疑而拒绝让无害的人进入,这就被称为“过度拒绝”问题。本文指出,大多数测试忽略了这一点。它们只检查保安是否阻止了坏人,而不检查他们是否对好人过于刻薄。

“反对观点”(现状为何如此)

本文也听取了另一方的声音。一些研究人员认为:

  • 小规模测试更便宜:大规模测试成本高昂且耗时。小规模测试让研究人员能够快速尝试新想法。
  • 完美是不可能的:语言是混乱的。我们永远无法拥有一个能理解人类对话每一个细微差别的完美“裁判”。我们只能不断改进手头最好的工具。
  • 进展依然会发生:即使测试混乱,该领域仍在向前发展。即使记分牌不完美,新想法仍会被发现。

解决方案:更好的规则手册

作者并非建议停止测试。他们表示,我们需要修复规则手册,让所有人遵循相同的规则。他们建议:

  1. 使用更大、更好的问题列表,以确保结果不仅仅是运气。
  2. 标准化设置,让每个人使用相同的“手电筒”和“秒表”。
  3. 使用多名裁判,并由人类对结果进行双重检查,以发现偏见。
  4. 测试双方:检查 AI 是否阻止了坏人,同时也检查它是否放行了好人。

简而言之:本文声称,目前我们正试图用一把不断改变自身长度的尺子来衡量 AI 的安全性。在修复这把尺子之前,我们无法确定我们是否真的取得了进展。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →