← 最新论文
💬 NLP

When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels

本文提出了一种在缺乏真实基准的情况下验证大语言模型(LLM)比较安全分数的框架,该框架通过建立基于受控对比和稳定性指标的工具效度链,并利用 SimpleAudit 工具证明安全排名具有情境依赖性,因此必须与其具体的审计条件一并报告,而非呈现为单一的聚合分数。

原作者: Sushant Gautam, Finn Schwall, Annika Willoch Olstad, Fernando Vallecillos Ruiz, Birk Torpmann-Hagen, Sunniva Maria Stordal Bjørklund, Leon Moonen, Klas Pettersen, Michael A. Riegler

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Sushant Gautam, Finn Schwall, Annika Willoch Olstad, Fernando Vallecillos Ruiz, Birk Torpmann-Hagen, Sunniva Maria Stordal Bjørklund, Leon Moonen, Klas Pettersen, Michael A. Riegler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位城市规划者,正试图聘请一台新机器人为市民提供建议。你有两台机器人:机器人 A机器人 B。在让它们与公众交流之前,你需要知道哪一台更“安全”(即不太可能提供错误或危险的建议)。

通常,你会在标准化考试(即“基准测试”)中测试它们,而这类考试你已知正确答案。但如果你正在为一种特定的、罕见的语言(如挪威语)或一项非常具体的工作构建机器人,而目前尚不存在此类考试呢?你无法仅凭猜测行事,也无法立即从头构建一个庞大的考试体系。

本文介绍了一种无需预先制作考试即可比较这些机器人的新方法。他们将其称为**“无基准比较安全评分”**。

以下是其工作原理的简明分解,辅以类比说明:

1. 问题:“无考试”困境

通常,安全测试就像带有答案键的选择题考试。但在许多现实情境中(例如挪威的某个特定政府部门),并不存在答案键。

  • 旧方法:等待有人构建出一套完美的考试(这需要数年时间及大量资金)。
  • 新方法:立即创建一个“模拟审判”,以观察哪台机器人的表现相对另一台更好,即使我们不知道绝对的“完美”分数。

2. 解决方案:“模拟审判”(SimpleAudit)

作者构建了一个名为SimpleAudit的工具。将其想象为一场受控的法庭剧

  • 剧本(场景包):他们不使用随机问题,而是使用一组固定的具体情境(例如,“市民寻求医疗建议”、“有人寻求法律帮助”)。这就是审判的剧本。
  • 演员(目标模型):这是正在接受测试的机器人(机器人 A 或机器人 B)。
  • 检察官(审计员):这是第二个 AI,旨在找出演员回答中的漏洞。它会提出棘手的后续问题,以观察演员是否会失足。
  • 法官(裁判):第三个 AI 会聆听整个对话,并根据严格的评分标准(评分细则)给出分数。

关键规则:你不仅仅运行一次。你需要在相同设置下运行同一剧本 10 次,以确保结果并非仅仅是运气使然。

3. “安全检查”(验证链)

由于没有答案键,你如何知道测试实际上是否有效?作者使用三步“现实检验”来证明其工具的有效性:

  • 步骤 1:“破坏”测试(响应性)
    想象他们拿机器人 A,秘密地“破坏”其安全过滤器(使其成为一个“被剥离”的版本,更有可能说出糟糕的内容)。

    • 测试:该工具能否察觉到差异?
    • 结果:是的。该工具成功地为这台“被破坏”的机器人给出了比安全机器人低得多的分数。这证明了该工具足够敏感,能够捕捉到安全问题。
  • 步骤 2:“指责游戏”(目标主导性)
    在法庭上,有时法官存在偏见,或者检察官过于软弱。作者希望确保分数实际上反映的是机器人的行为,而不是 AI 法官或检察官的怪癖。

    • 测试:他们使用不同的法官和检察官进行了审判。
    • 结果:分数变化的最大原因是正在接受测试的机器人,而不是给分的是哪位法官。这证明了该工具衡量的是机器人,而非工具本身。
  • 步骤 3:“重复”测试(稳定性)
    如果你运行审判 10 次,你会得到相同的结果吗?

    • 结果:是的。在大约 10 次运行后,分数不再波动,而是稳定在一个固定的数值上。

4. 现实世界测试:挪威采购案

作者在挪威政府的一个真实项目中测试了该方法,该项目比较了两个模型:BorealisGemma

  • 发现:他们并没有简单地说“机器人 A 更好”。而是指出:“机器人 A 在医疗问题上更安全,但机器人 B 在语言问题上更安全。”
  • 教训:你不能仅仅挑选一个单一的“赢家”。你必须审视具体的风险。该工具为他们提供了一组数据(分数、关键失败率以及不确定性),使他们能够做出明智的决策。

5. “契约”(你可以和不可以声称的内容)

本文非常谨慎地界定了该工具所承诺的内容。

  • 它确实承诺:“如果你使用完全相同的剧本和完全相同的规则,那么机器人 A 比机器人 B 更安全。”
  • 它并未承诺:“这台机器人对整个世界 100% 安全”或“这台机器人永远不会犯错”。
  • 比喻:将其想象为汽车碰撞测试。如果你让一辆汽车以 30 英里/小时的速度撞向墙壁,你可以说:“这辆车比那辆车更好地处理了那次特定的碰撞。”但你不能说:“这辆车在宇宙中所有可能的驾驶条件下都是安全的。”

总结

本文指出:当你没有标准测试时,如果你能构建一个严格、可重复的“模拟审判”,并证明该审判确实能对安全变化做出反应,你仍然可以比较安全性。

他们构建了一个执行此操作的工具(SimpleAudit),通过“破坏”模型来观察工具是否能捕捉到异常,从而证明了其有效性,并展示了该工具有助于政府就使用哪种 AI 做出更明智、更细致的决策,而不是仅仅随机挑选一个赢家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →