← 最新论文
🤖 machine learning

ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

ProbGuard 是一种新颖的、与架构无关的概率护栏,它利用早期 LLM 输出分布和蒙特卡洛采样来估计并校准安全风险,从而实现比现有确定性分类方法更准确的安全性生成早期停止,并大幅降低越狱成功率。

原作者: Xinzhe Huang, Biwu Yao, Kedong Xiu, Mengnan Zhao, Di Wang, Puning Zhao, Tianhang Zheng

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinzhe Huang, Biwu Yao, Kedong Xiu, Mengnan Zhao, Di Wang, Puning Zhao, Tianhang Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一场魔术表演,魔术师是一个超级聪明的机器人,它能写故事、解数学题,甚至能像朋友一样聊天。这个机器人被称为“大语言模型”(LLM)。它才华横溢,但就像任何强大的工具一样,它也有阴暗的一面:有时它会被诱导说出危险、恶意或非法的内容,比如如何制造炸弹或伤害他人。对于任何在现实世界中使用这些机器人的用户来说,这都是一个巨大的担忧。

为了防止机器人泄露坏主意,我们通常会设置一个“护栏”。把护栏想象成俱乐部里一个严格的保镖。在过去,这个保镖只看机器人写完的完整句子。如果句子看起来很糟糕,保镖就会把它踢出去。但问题在于:这个保镖太慢了。等到机器人写完整个句子时,损害已经造成了。而且,这个保镖有点非黑即白。它并不理解机器人对接下来要说什么是“不确定”的。这就像保镖只检查最终的票据,却忽略了机器人在决定说话时手部紧张颤抖的状态。

这就是为什么会出现一个名为 ProbGuard 的新想法。与其等待机器人说完整个句子,ProbGuard 更像是一个观察力极强的侦探,它会在事情发生的过程中观察机器人的“思考过程”。它不仅仅看机器人已经输入的词汇,还观察机器人对于下一个词可能要说什么的“直觉”。它会计算机器人在接下来的几秒钟内走向歧途的“概率”。如果侦探看到机器人有 90% 的可能性要说出危险的内容,ProbGuard 会立即按下紧急制动键,在机器人完成句子之前就将其阻止。这就像是在看到汽车失控打滑并将其拦下,而不是等车祸发生后再去报警。

旧版护栏的问题

这篇论文解释说,旧的方法就像是在玩“猜词游戏”,你只能看到最终答案。目前大多数安全系统都采用一种简单的分类器模式:它们获取一个完整的句子,然后判定它是“安全”还是“不安全”。

作者认为这有两个重大缺陷:

  1. 为时已晚: 等到句子结束时,阻止有害输出已经太迟了。
  2. 忽略了“也许”: 安全并不总是非黑即白的问题,尤其是当机器人在思考时。一个机器人可能开始一个看起来很无害的句子,但随后很容易演变成危险的句子。旧系统丢弃了机器人的内部“不确定性”,仅仅观察最终的文本。它们忽略了机器人曾犹豫或在多种路径间权衡的事实。

ProbGuard 的工作原理:水晶球法

ProbGuard 改变了游戏规则,它将安全性视为一种概率,而不仅仅是一个简单的标签。想象一下机器人正站在一个十字路口。旧的护栏会等待机器人选定一条路并走下去,然后再看那条路是否通向悬崖。然而,ProbGuard 则是在机器人站立在那里时,观察它手里拿着的地图。

以下是 Probگیر (ProbGuard) 使用的步骤化魔术技巧:

1. “如果……会怎样”的模拟(蒙特卡洛采样)
为了了解机器人当前想法的危险程度,ProbGuard 会问一个简单的问题:“如果我们让这个机器人从这一刻起继续说下去,它说出坏话的概率是多少?”
由于我们无法完美预测未来,ProbGuard 在脑海中模拟了成千上万次这种场景。它模拟了机器人以 16 种不同的方式完成句子的过程(就像掷 16 次骰子来观察概率)。如果 16 次中有 15 次机器人说了安全的话,但有 1 次说了危险的话,ProbGuard 就知道存在微小的风险。如果 16 次中有 10 次机器人说了坏话,那么风险就很 高。这给了它一个精确的“危险得分”(一个 0 到 1 之间的数字),而不是一个简单的“安全/不安全”标签。

2. 读取下一个词的“幽灵”
当机器人生成文本时,它不仅仅是选择一个词,它还会计算每一个可能出现的词的概率。例如,如果机器人正准备说“天空是……”,它可能会想:“蓝色的”(30% 的概率)、“绿色的”(5% 的概率)、“着火了”(2% 的概率)。
旧系统通常只看概率最高的词“蓝色的”。然而,ProbGuard 会查看整个可能性列表。它发现“着火了”虽然只有微小的概率,但如果这个微小的概率会导致灾难,那它就很重要。ProbGuard 将整个概率列表转化为一种特殊的代码(“概率加权表示”),这样它就可以在不需要窥探机器人秘密大脑(其隐藏状态)的情况下进行读取。这使得 Probреди (ProbGuard) 可以适用于任何类型的机器人,而不局限于特定的品牌。

3. 早期停止
一旦 ProbGuard 计算出危险得分,它就可以立即采取行动。论文显示,ProbGuard 可以在机器人输入前 10 个单词(或解码步骤)时就做出判断,确定它是否会变得危险。如果危险得分过高,ProbGuard 会就在那里直接停止机器人。

数据说明

研究人员将 ProbGuard 与 13 种其他安全方法进行了对比,其中包括目前的顶级护栏如 Llama-Guard3 和 ShieldGemma。他们使用了三种不同类型的机器人和三组危险问题来进行测试,以观察谁最擅长预测麻烦。

  • 校准度(Calibration): 这是一个高级词汇,指的是“机器人对其自身风险的诚实程度”。如果 ProbGuard 说有 90% 的危险概率,那么实际情况是否真的在 90% 的时间里发生?论文发现,ProbGuard 在这方面比其他人都要好得多。与最好的前代方法相比,它将风险预测的误差降低了约 79.6%
  • 拦截攻击: 团队尝试使用六种不同的“越狱”(Jailbreak)技术(旨在诱导机器人忽略安全规则的特殊技巧)来欺骗机器人。ProbGuard 的表现极其出色。在仅观察前 10 个单词后,它几乎完全阻止了攻击,将这些技巧的成功率限制在最多 1% 以内。相比之下,最好的旧版护栏会让约 2.4% 的攻击成功。
  • 速度: ProbGuard 同样很快。它可以在约 36.4 秒内检查 1,000 个样本,这比一些重型安全系统大约快了 52.7%

核心结论

论文得出结论,ProbGuard 的重大进步在于它不再将安全性视为一个简单的“是或否”的清单。相反,它将安全性视为一种流动的、变化的概率,这种概率可以在机器人思考的过程中被测量和管理。

通过利用机器人的“直觉”(其输出分布)并模拟许多种可能的未来,ProbGuard 可以在危险的想法变成完整的句子之前就将其捕捉。它适用于各种机器人模型,不需要窥探它们的秘密大脑,并且能以高精度和高速度完成这一切。作者们认为,这种方法使我们能够构建更安全的 AI 系统,让我们能在错误发生的最初时刻就将其制止,而不是等待整个灾难展开。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →