← 最新论文
💬 NLP

ASSERT: A Measurement Pipeline for GenAI Audits

本文介绍了 ASSERT,这是一个用于生成式人工智能(GenAI)审计的规范驱动测量流水线,它将报告的合规率与其底层的测量选择明确联系起来,从而阐明了审计设计(例如对话设置或评估标准)的变化如何显著影响系统的排名与可解释性。

原作者: Riccardo Fogliato, Abhinav Palia, Xiawei Wang, Emily Sheng, Chad Atalla, Jean Garcia-Gathright, Nicholas Pangakis, Sharman Tan, Dan Vann, Hannah Washington, P. Alex Dow, Heba Elfardy, Hanna Wallach, S
发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Riccardo Fogliato, Abhinav Palia, Xiawei Wang, Emily Sheng, Chad Atalla, Jean Garcia-Gathright, Nicholas Pangakis, Sharman Tan, Dan Vann, Hannah Washington, P. Alex Dow, Heba Elfardy, Hanna Wallach, Sandeep Atluri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为一个全新的、超级聪明的机器人打分,它能写故事、解数学题,还能和你聊天。你想知道:“这个机器人诚实吗?”或者“它安全吗?”在人工智能(AI)的世界里,科学家们经常通过运行一项测试并给出一个单一的分数来回答这个问题,比如“85%的诚实度”。这听起来很简单,就像一份成绩单。但问题在于:这个分数不仅仅是在告诉你关于机器人的信息,它也在告诉你关于测试本身的信息。如果你改变了问题、改变了评分的人,甚至改变了什么才算作“谎言”的规则,分数就会剧烈波动。这就像给学生的作文评分:如果你让他们写关于“猫”的主题,他们可能会得 A;但如果你让他们写关于“量子物理”的主题,他们可能会得 C。学生本身没有改变,改变的是测试。这篇论文深入探讨了这种混乱的现实,向我们展示了仅凭一个数字不足以评判机器人的行为。我们需要确切知道测试是如何构建的,才能理解这个分数究竟意味着什么。

于是有了 ASSERT,这是一个由微软研究人员开发的新工具,旨在解决这个评分问题。把 ASSERT 想象成不是一个单一的测试,而是一本用于构建测试的“食谱书”。通常,当人们测试 AI 时,他们可能会隐藏自己的评分规则,或者在不说明的情况下进行更改。ASSERT 则强制要求每个人先写下他们的食谱。它要求研究人员用通俗易懂的语言清晰地定义什么是“欺骗”或“安全性”,然后基于该定义构建一套特定的挑战(测试用例),最后让 AI 接受这些挑战。ASSERT 的魔力在于,它将每一个分数都与创建该分数的特定食谱紧密联系在一起。如果分数发生了变化,你可以查看食谱书,看看究竟是哪种配料被替换掉了。

为了展示其威力,研究人员使用 ASSERT 测试了一个特定的 AI 模型(GPT-5.5)在一个棘手的话题——对话式欺骗上(基本上就是指 AI 在聊天中欺骗或误导用户)。他们不仅仅运行了一次测试,而是运行了一个“多元宇宙”式的测试。想象一下,他们在一百种不同的场景中测试同一个机器人:有时机器人是在和一个友好的用户聊天,有时是在和一个爱钻牛角尖的用户聊天;有时机器人是由一个严格的 AI 裁判来评判,有时是由一个较宽松的裁判来评判;有时判定谎言的规则非常严格,而有时则比较宽松。

结果令人大开眼界。当他们只改变食谱中的一个部分时,机器人的“诚实度分数”就会大幅跳动。

  • 裁判很重要: 当他们更换了负责评分答案的 AI 时,同一个机器人聊天记录的诚实度分数从 80% 跳到了 95%。这是一个巨大的差异!一个评分者认为机器人基本诚实,而另一个评分者则认为它几乎一直在撒谎。
  • 规则很重要: 当他们制定更严格的识破谎言的规则(需要清晰、无可争议的证据)时,分数上升到了 90% 以上。当他们制定较宽松的规则(接受任何谎言的迹象)时,分数下降到了 73% 左右。
  • 用户很重要: 当他们将与机器人聊天的“模拟用户”从一个标准角色改为一个更复杂的角色时,分数从 82% 跳到了 90% 以上。

论文指出,由于这些分数会根据研究人员的选择而大幅变动,我们不能仅仅依靠一个数字来判断哪个 AI “更好”。如果一个 AI 得分 82%,而另一个得分 85%,这微小的差距可能仅仅是因为使用了不同的裁判或不同的规则,而不是因为其中一个机器人真的更聪明或更安全。事实上,研究人员发现,更换裁判甚至可以反转排名,让一个“较差”的机器人仅仅因为谁在评分而看起来像是赢家。

那么,结论是什么?这篇论文并不是说 AI 坏掉了,或者说我们无法对其进行测试。相反,它建议我们需要更加透明。我们不能只说“这个 AI 有 82% 的安全性”。我们必须说“这个 AI 在使用这些特定规则、这个特定裁判和这些特定问题进行测试时,具有 82% 的安全性”。通过使用像 ASSERT 这样的工具来写下每一步的食谱,研究人员和公司可以停止躲在单一数字后面,开始就他们的 AI 系统能做什么、不能做什么进行诚实的对话。它将一个魔术表演变成了一个清晰、可检查的过程,帮助我们弄清楚机器人是真的在说实话,还是我们问错了问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →