← 最新论文
🤖 AI

Theoria: Rewrite-Acceptability Verification over Informal Reasoning States

本文介绍了 Theoria,一种通过将解决方案重写为具有显式理由的可审计、类型化状态转换来增强 AI 回答可信度的验证架构,该架构在检测隐藏前提和虚假引用方面优于整体式 LLM 评判器,同时在专家级问题上保持了高精确度。

原作者: Ben Slivinski, Michael Saldivar

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Ben Slivinski, Michael Saldivar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位才华横溢但有时过于自负的建筑师来设计一座桥梁。你不仅想要最终的蓝图,你还需要知道每一根梁柱为什么被安置在那里。如果建筑师说:“这根梁放在这里是因为感觉是对的,”你无法信任这座桥。但如果他说:“这根梁放在这里是因为定律 X,并且这是证明它的计算过程,”你就可以去核对数学逻辑。

这正是 Theoria 为人工智能解决的问题。

问题所在:两种有缺陷的信任方式

目前,我们有两种检查 AI 回答是否优秀的方法,但两者都有漏洞:

  1. “数学家”法(形式化证明助手): 这就像雇佣了一个只说严谨、不可破坏的数学代码的机器人。它很完美,但它只能理解那些已经被翻译成该代码的问题。而现实世界中的大多数问题(如法律论证或科学理论)是混乱且非形式化的,所以机器人无法理解它们。
  2. “直觉”法(标量评判器): 这就像让一个人阅读 AI 的文章并给出一个 1 到 10 的评分。它涵盖范围很广,但这个分数是一个黑盒。你不知道它为什么得了 7 分。它是遗漏了某个隐藏的假设?还是伪造了引用?你只得到了一个数字,而且你无法对其进行后期审计。

解决方案:“状态重写”侦探

Theoria 引入了第三种方法。它不要求 AI 写一篇长篇大论,也不要求将一切翻译成数学代码,而是强制 AI 将其答案重写为一个逐步的状态变更日志

把它想象成一个关于推理的视频游戏存档文件版本控制系统(类似于 Git)。

  • 设置: AI 从“状态 0”(问题陈述)开始。
  • 动作: 为了得到答案,AI 必须做出向“状态 1”的移动,然后是“状态 2”,以此类推。
  • 规则: 对于每一次移动,AI 必须提供一张票据(理由)。票据只能是以下三种类型之一:
    1. 引用: “我正在使用定理 X。”
    2. 计算: “我做了计算:2+2=4。”
    3. 既定事实: “题目告诉了我这一点。”

核心奥秘:“变更完备性”

这是其中的精髓所在。Theoria 有一个严格的规则:状态 A 到状态 B 之间的每一次变化都必须由票据进行解释。

如果 AI 试图偷偷塞入一个隐藏假设(比如“假设这座桥是用黄金做的”),而没有提供票据,系统就会抓到它。这个“变化”(添加黄金假设)会出现在日志中,但票据(理由)并没有覆盖这一变化。系统会尖叫道:“等等!你改变了状态,但你没给我们看收据!”

这迫使 AI 保持诚实。它无法在长篇大论的文本中隐藏谎言;它必须展示谎言进入对话的具体时刻。

实际运作流程

  1. 求解器(The Solver): 一个 AI 尝试解决问题。
  2. 形式化器(The Formalizer): 第二个 AI 将该解法重写为上述的“状态变更日志”。如果求解器在逻辑上跳跃了,形式化器必须将其记录为一个特定的步骤。
  3. 评判员(The Judges): 专门的 AI 审计员会对每个步骤进行检查。
    • “数学评判员” 检查计算是否正确。
    • “引用评判员” 检查所引用的定理是否真实存在且适用。
    • “事实评判员” 检查该事实是否确实存在于原始问题中。
  4. 裁决(The Verdict): 如果每一步都有有效的票据,则答案被认证(Certified)。如果哪怕只有一个步骤缺失票据或票据造假,则答案被拒绝(Declined)

研究发现

作者在处理难题(如专家级考试中的题目)时测试了该系统,发现:

  • 高信任度: 当 Theoria 说一个答案是正确时,它的正确率高达 91.4%
  • 更擅长识破狡猾的谎言: 当 AI 试图隐藏前提(隐藏假设)或伪造引用时,Theoria 能在 90.6% 的情况下将其抓获。而标准的“直觉型”评判员只能抓到 62.5%
  • 并非万能于数学错误: 如果 AI 只是单纯算错了数学(比如说 2+2=5),Theoria 和标准评判员捕捉错误的能力差不多。Theoria 的特殊优势在于专门针对捕捉隐藏逻辑伪造来源
  • 互补性: Theoria 和标准评判员在失败的问题类型上是不同的。如果你同时使用两者,你可以捕捉到几乎所有的错误。

总结

Theoria 并不试图让 AI 变得更聪明,它试图让 AI 的推理过程可审计

它将模糊、不可靠的文章变成了一份透明的变更账本。它并不承诺每一个答案都是正确的(因为它会拒绝约 43% 的答案,因为无法验证它们),但对于它所批准的答案,你可以查看收据,核对数学逻辑,并确切知道为什么可以安全地信任它。

在这个 AI 可能会产生幻觉事实的世界里,Theoria 是那个会说:“给我看每一步的收据,否则我不签字。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →