← 最新论文
🤖 AI

Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations

本文介绍了 **optstop**,这是一个贝叶斯自适应停止框架,它根据不确定性而非固定计数来动态分配采样预算,使大语言模型(LLM)评估在保持结论一致的同时,能够降低 57%–97% 的计算成本。

原作者: Toby D. Pilditch

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Toby D. Pilditch

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探,但你的调查对象不是犯罪现场,而是一个被称为“大语言模型”(LLM)的超级聪明的人工智能大脑。这些机器人非常了不起,它们能写故事、解数学题,甚至编写代码。但为了知道它们是真的聪明还是仅仅在瞎猜,人类必须对它们进行成千上万个不同问题的测试。这被称为“评估”。

问题在于,测试的过程极其昂贵且缓慢。每当你问机器人一个问题,获取答案都需要花费金钱和时间。传统上,科学家们使用一种“暴力破解”的方法:他们把同一个问题问机器人 10 次,然后是下一个问题 10 次,以此类推,直到为所有问题都获得固定数量的答案。这就像是问你的朋友:“你喜欢吃披萨吗?”连续问 100 次,仅仅是为了绝对确定他们是否喜欢,即便他们在前三次尝试中就已经以 100% 的信心回答了“喜欢”。这极大地浪费了资源。

你即将阅读的这篇论文介绍了一种更聪明的调查方法。它使用了一种叫做“贝叶斯推断”(Bayesian inference,这只是一个高级说法,意为“随着获得新线索来更新你的猜测”)的数学技巧,来确定何时应该停止提问。它不再使用固定的次数,而是询问:“我们现在掌握的信息足够了吗?”如果答案是肯定的,它就立即停止;如果答案仍然模糊不清,它就会继续。这节省了时间、金物力和能源,让我们能够测试更多的模型和更困难的问题,而不至于破产。


AI 大脑的“停止信号”

认识一下 optstop。你可以把它想象成一个非常聪明、非常有耐心的 AI 测试交通警察。

目前,当科学家们测试 AI 模型时,通常遵循一套死板的规则手册:“对每一个问题进行恰好 10 次测试。”无论 AI 是瞬间答对了前 10 个问题,还是在挣扎着答错,规则手册都说:“继续,必须做 10 次尝试。”这就像一位厨师在尝汤时,决定无论汤是否已经完美,都要搅拌整整 10 次。这是极其低效的。

这篇论文的作者 Toby D. Pilditch 提出了一个简单的问题:为什么我们不在已经知道答案的时候停下来呢?

他们构建了一个名为 optstop 的新系统,将测试视为一场“猜热猜冷”的游戏。随着 AI 回答问题,该系统会观察“不确定性”。

  • 如果 AI 在做一道数学题并连续答对了 10 次,系统会说:“好吧,我们 99% 确定它掌握了数学。让我们停止针对这个特定问题的测试,然后进入下一个。”
  • 如果 AI 在回答一个棘手的安全问题,答错了 5 次但对了一次,系统会说:“等等,那一次‘正确’的回答很重要!我们还不确定,请继续测试这个题目。”

这不仅仅是为了节省几分钟时间。论文表明,通过使用这种“在确定时停止”的方法,他们在实验中可以减少 57% 到 97% 的测试量。这就像是在完成一场 100 英里的比赛时,因为意识到自己已经到达终点,所以只跑了 30 英里就结束了。

它是如何运作的:三层蛋糕

要理解 optstop 为什么如此出色,请将测试过程想象成一个三层蛋糕:

  1. 底层(项目/Items): 这些是单个问题。有些很简单(AI 每次都能答对),有些很难(AI 会挣扎)。
  2. 中间层(任务/Tasks): 这些是问题的分组,比如“数学”或“写作”。
  3. 顶层(模型/Model):这就是 AI 本身。

旧方法对每个问题一视同仁。而 optstop 观察的是整个蛋糕。它意识到,如果 AI 非常擅长“简单的数学”,那么它不需要把每一个简单的数学题都测试 10 次。它可以针对简单的题目提前停止,并将精力投入到 AI 感到困惑的难题上。

该系统使用一种特殊的数学方法(层次贝叶斯推断)来同时追踪两件事:

  • 精确度(Precision): 我们有多确定?如果“置信区间”(一个高级说法,指可能答案的范围)变得足够窄,我们就停止。
  • 稳定性(Stability): 答案是否趋于稳定?如果 AI 的回答不再发生太大变化,我们就停止。

“保守主义”安全网

这里有一个棘手的部分。如果 AI 在某方面表现得非常糟糕怎么办?想象一个 AI,它在 100 个问题中只能答对 1 个。如果你停止测试得太早,你可能会认为它的正确率是 0%,但实际上它确实可以做对,只是频率很低。

为了解决这个问题,optstop 拥有一个“保守性”设置。如果 AI 表现得很差,系统会变得格外谨慎。它会说:“嘿,我们可能会错过一个罕见的成功案例!即使数据看起来很糟,我们也得继续测试。”这就像家长检查孩子的作业:如果孩子每道题都做对了,你就停止检查;但如果他们每道题都做错了,你会检查得更加仔细,以确保他们不是仅仅因为今天状态不好或漏掉了一个微小的细节。

结果:效率的大幅提升

作者通过一个大型实验测试了这个想法。他们选取了 200 个不同的问题,并进行了 10 轮测试(10 个 epoch)。他们将传统的“每项必做 10 次”的方法与新的 optstop 方法进行了对比。

以下是他们的发现:

  • 巨大的节省: 在测试中,optstop 跳过了 57% 到 97% 的计划测试。在某些情况下,他们只需要运行极小比例的测试就能获得相同的结果。
  • 相同的准确度: 尽管我们提前停止了,但给出的 AI 最终得分与运行所有测试得到的得分几乎完全一致。两者的差异非常小(在 0 到 1 的量表中小于 0.01),以至于可以忽略不计。
  • 不同的得分,不同的节省: 该系统在连续型评分(如 0 到 100 分的成绩)上节省的时间最多,在简单的“对/错”评分上节省最少,但在所有情况下都节省了时间。

为什么这很重要

这不仅仅是一个数学技巧;它是 AI 安全领域的一个游戏规则改变者。目前,由于测试 AI 的成本太高,实验室只能测试少数模型或少数类型的题目。如果我们能将测试时间减半甚至更多,我们就可以测试更多的模型、更多的危险场景以及更复杂的任务。

这篇论文证明了,我们不需要在已经掌握答案的问题上浪费精力。通过让数据告诉我们何时停止,我们可以让 AI 测试变得更快、更便宜、更集中于真正重要的事情。这就像是与其盲目地敲击钉子直到它断裂,不如使用一把知道钉子何时被敲进去的锤子。

简而言之,optstop 教会我们,知道何时停止与知道如何开始同样重要。对于 AI 的未来,这是我们迫切需要学习的一课。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →