← 最新论文
💬 NLP

Logic-Regularized Verifier Elicits Reasoning from LLMs

本文介绍了 LOVER,这是一种无监督验证器,它利用推理路径上的逻辑约束,从现成的语言模型中激发出稳健的推理能力,无需昂贵的监督数据,即可达到与监督基线相当的性能。

原作者: Xinyu Wang, Changzhi Sun, Lian Cheng, Yuanbin Wu, Dell Zhang, Xiaoling Wang, Xuelong Li

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Wang, Changzhi Sun, Lian Cheng, Yuanbin Wu, Dell Zhang, Xiaoling Wang, Xuelong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明但有时过于自信的朋友(即人工智能),他热衷于解决谜题。当你问他一道难题时,他不仅会给你一个答案,还会写下他得出该答案的完整推理过程。有时,这个过程非常精彩;有时,他会在自己的逻辑中迷失,犯下愚蠢的错误。

问题在于:如果不亲自核对答案,你如何知道哪条推理过程是正确的?

通常,为了教会计算机检查这些推理过程,我们需要聘请人类专家阅读成千上万份答案,并判定“正确”或“错误”。这既昂贵又缓慢,而且有时专家们思维趋同,会忽略那些巧妙却不寻常的解决方案。

本文介绍了一种名为LOVER(逻辑正则化验证器)的新工具,它就像人工智能的自我检查内部指南针。它不需要人类教师,而是利用逻辑规则进行自我教学。

以下是其工作原理,借助几个简单的比喻来说明:

1. “如果……会怎样”游戏(对比性断言)

LOVER 不仅仅查看人工智能的最终推理过程,而是玩起“如果……会怎样”的游戏:

  • 它给人工智能的推理过程加上一个标签,声称"这是一个真实的答案"。
  • 然后,它对同一份推理过程加上另一个标签,声称"这是一个错误的答案"。

它询问人工智能的“大脑”(其隐藏层):“当我声称这是真的时,这个故事感觉是真的吗?当我声称这是假的时,它感觉是假的吗?”这有助于揭示人工智能对其自身工作实际上“相信”什么。

2. 游戏的三条规则(逻辑约束)

由于没有人类教师来评分,LOVER 遵循三条严格的“家规”以保持人工智能的诚实:

  • 规则 #1:翻转规则(否定一致性)
    如果人工智能认为某条推理过程是“真”的,那么它必须认为同一条被标记为“假”的推理过程是“假”的。它们不能同时正确,也不能同时错误。它们必须是相反的。
  • 规则 #2:团队规则(组内一致性)
    想象人工智能生成了 10 条不同的推理过程,其中 3 条最终得出了相同的数字(例如"42")。即使到达那里的路径不同,只要它们对最终答案达成一致,LOVER 就会假设它们很可能同时正确(或同时错误)。它将它们视为一个团队。
  • 规则 #3:唯一获胜者规则(组间一致性)
    如果人工智能生成的推理过程分别以"42"、"100"和"7"结尾,那么只有一个这样的组别可能是正确答案。LOVER 迫使系统只选出一个获胜组别,防止人工智能声称"42、100 和 7 实际上都是这道数学题的正确答案”。

3. 结果:一个自我改进的裁判

通过迫使人工智能在审视自身内部思维时遵循这些逻辑规则,LOVER 变成了一个自我纠正的裁判

  • 无需作业:它不需要人类评分的答案数据集。它利用人工智能自己生成的“未标记”数据。
  • 适用于任何人:它适用于任何你如今可以下载的标准人工智能模型。
  • 优于猜测:在测试中,这种方法比仅仅选择最常见答案(多数投票)或查看概率数值(思维链解码)要好得多。其表现几乎等同于由人类专家训练,但无需承担相应成本。

核心结论

将 LOVER 视为一个基于逻辑的过滤器。它将人工智能杂乱多样的思维,通过一组逻辑“筛子”(即上述三条规则)进行筛选,过滤掉无意义的部分,留下最可靠的推理路径。它证明,如果你能教会学生利用逻辑法则进行自我评分,就不需要人类去批改每一份试卷。

关于局限性的说明:论文指出,该工具需要查看人工智能的“内部大脑”(其隐藏状态)才能工作。这意味着它在开源模型上效果极佳,因为你可以查看其代码;但它无法用于那些无法窥探内部的“黑盒”模型(例如某些商业聊天机器人)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →