LLM-as-a-Verifier: A General-Purpose Verification Framework
本文引入了“LLM-as-a-Verifier”,这是一个通过利用基于标记对数概率期望(token logit expectations)的连续评分来将验证确立为一种新缩放维度的无需训练的框架,在多种智能体基准测试中实现了最先进的性能,同时提升了任务监控能力和强化学习的样本效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一支由才华横溢但有时过于自信的 AI 助手组成的团队,他们试图解决复杂的问题,比如编写代码、修理机器人或诊断病人。你知道,如果你让他们尝试同一个问题 100 次,其中至少有一个人很可能会做对。真正的挑战不在于得到答案,而在于如何知道哪个答案才是最好的,而不需要每次都雇佣人类专家来进行检查。
这篇论文介绍了一个名为 LLM-as-a-Verifier(LLM 作为验证器) 的新工具。把它想象成一个“超级裁判”,它不仅能选出胜者,还能理解为什么一个答案比另一个更好,即使两者之间的差异微乎其微。
以下是它的工作原理,通过简单的概念进行拆解:
1. 问题所在:“平局”陷阱
通常,当我们要求一个 AI 去评判另一个 AI 的工作时,我们会要求它给出一个简单的分数,比如“1 到 5 星”。
- 缺陷: 如果两个答案都“很好”,但其中一个稍微好一点,裁判往往会给它们都打“4 分”。这造成了平局。系统无法区分它们的差异,因此只能随机选择。
- 论文的解决方法: 该方法不再强迫 AI 选择一个单一的数字,而是要求 AI 查看每种可能得分的概率。这就像不是问裁判“这个好吗?”,而是问“它是 4 分、4.1 分、4.2 分还是 4.9 分的可能性有多大?”通过平均所有这些微小的概率,系统得到了一个连续的分数(例如 4.87),而不是一个粗略的整数(例如 5)。这消除了平局,并捕捉到了细微的差别。
2. 三个可以调优质量的“旋钮”
论文展示了你可以通过调高三个特定的“旋钮”(缩放轴)来让这个“超级裁判”变得更强大:
- 旋钮 1:粒度(刻度尺): 不要使用只有英寸刻度的尺子,而是使用带有毫米刻度的尺子。评分量表越详细(最高可达 20 个等级),裁判区分“好”答案与“卓越”答案的能力就越强。
- 旋钮 2:重复(评审团): 不要只让一个裁判来做决定,而是让同一个裁判查看该项工作 16 次,并平均他们的意见。这可以平滑掉裁判可能出现的随机性差表现或瞬间的困惑。
- 旋钮 3:分解(清单): 不要问“这整个项目完美吗?”,而是将其拆解。问三个独立的问题:“它是否满足了要求?”、“格式是否正确?”以及“是否存在任何错误?”然后组合这些答案。这可以防止裁判因为一个大问题而分心,从而忽略了微小的细节。
3. 挑选胜者的“锦标赛”
如果你有 100 个不同的解决方案要处理,将每一个都与其它每一个进行对比会非常耗时(且成本高昂)。
- 论文的解决方案: 他们创建了一个名为**概率枢轴锦标赛(Probabilistic Pivot Tournament)**的智能锦标赛。
- 想象一群正在跑步的选手。首先,他们进行一圈快速赛跑,每个人都与自己的邻居进行一次比赛。这能快速识别出顶尖的几位选手。
- 然后,系统会将精力集中在这些顶尖选手身上,让他们进行相互竞争,以选出绝对的冠军。
- 这在保持高准确度的同时,节省了时间和成本。
4. 现实世界的结果
作者在三个完全不同的领域测试了这个“超级裁判”,并在所有领域都击败了现有的最佳方法:
- 编程: 它帮助为复杂的计算机任务挑选出最佳的代码方案(Terminal-Bench V2),实现了 86.5% 的成功率。
- 机器人: 它观察机器人的运动视频,并能正确识别出哪个机器人进展得更好(RoboReward-Bench),击败了那些专门针对机器人数据训练了多年的模型。
- 医学: 它帮助挑选出最佳的医疗建议方案(MedAgentBench),实现了 73.3% 的成功率。
5. 额外功能:“进度条”与“教练”
论文还强调了该系统的两个额外超能力:
- 进度条: 因为裁判给出的分数非常详细,它可以告诉你一个智能体(Agent)在任务中处于什么阶段。如果 AI 正在编写代码,分数会随着工作的进行稳步上升。如果它卡住了或犯了错,分数就会趋于平缓或下降。这为复杂的 AI 工作提供了一个实时的“进度条”,让人们在 AI 浪费数小时之前就能知道它是否陷入了僵局。
- 用于学习的教练: 该系统可以作为训练其他 AI 的“稠密奖励(dense reward)”。与其在任务结束时才说“你失败了”,它会在每一个微小的进步步骤中给出微小的、连续的分数。这有助于机器人和数学求解 AI 学得更快(对于机器人来说快了约 1.8 倍),因为它们能更频繁地获得反馈。
总结
LLM-as-a-Verifier 是一种利用 AI 来检查其他 AI 工作的新方法。通过观察 AI 思考的细节(概率)而非仅仅看其最终答案,并结合诸如任务拆解和锦标赛等聪明策略,它能比以往更快速、更准确地找到最佳解决方案。它无需针对特定工作进行重新训练,因此是一个通用的工具,适用于编程、机器人和医学领域。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。