Theoria: Rewrite-Acceptability Verification over Informal Reasoning States
本文介绍了 Theoria,一种通过将解决方案重写为具有显式理由的可审计、类型化状态转换来增强 AI 回答可信度的验证架构,该架构在检测隐藏前提和虚假引用方面优于整体式 LLM 评判器,同时在专家级问题上保持了高精确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一位才华横溢但有时过于自负的建筑师来设计一座桥梁。你不仅想要最终的蓝图,你还需要知道每一根梁柱为什么被安置在那里。如果建筑师说:“这根梁放在这里是因为感觉是对的,”你无法信任这座桥。但如果他说:“这根梁放在这里是因为定律 X,并且这是证明它的计算过程,”你就可以去核对数学逻辑。
这正是 Theoria 为人工智能解决的问题。
问题所在:两种有缺陷的信任方式
目前,我们有两种检查 AI 回答是否优秀的方法,但两者都有漏洞:
- “数学家”法(形式化证明助手): 这就像雇佣了一个只说严谨、不可破坏的数学代码的机器人。它很完美,但它只能理解那些已经被翻译成该代码的问题。而现实世界中的大多数问题(如法律论证或科学理论)是混乱且非形式化的,所以机器人无法理解它们。
- “直觉”法(标量评判器): 这就像让一个人阅读 AI 的文章并给出一个 1 到 10 的评分。它涵盖范围很广,但这个分数是一个黑盒。你不知道它为什么得了 7 分。它是遗漏了某个隐藏的假设?还是伪造了引用?你只得到了一个数字,而且你无法对其进行后期审计。
解决方案:“状态重写”侦探
Theoria 引入了第三种方法。它不要求 AI 写一篇长篇大论,也不要求将一切翻译成数学代码,而是强制 AI 将其答案重写为一个逐步的状态变更日志。
把它想象成一个关于推理的视频游戏存档文件或版本控制系统(类似于 Git)。
- 设置: AI 从“状态 0”(问题陈述)开始。
- 动作: 为了得到答案,AI 必须做出向“状态 1”的移动,然后是“状态 2”,以此类推。
- 规则: 对于每一次移动,AI 必须提供一张票据(理由)。票据只能是以下三种类型之一:
- 引用: “我正在使用定理 X。”
- 计算: “我做了计算:2+2=4。”
- 既定事实: “题目告诉了我这一点。”
核心奥秘:“变更完备性”
这是其中的精髓所在。Theoria 有一个严格的规则:状态 A 到状态 B 之间的每一次变化都必须由票据进行解释。
如果 AI 试图偷偷塞入一个隐藏假设(比如“假设这座桥是用黄金做的”),而没有提供票据,系统就会抓到它。这个“变化”(添加黄金假设)会出现在日志中,但票据(理由)并没有覆盖这一变化。系统会尖叫道:“等等!你改变了状态,但你没给我们看收据!”
这迫使 AI 保持诚实。它无法在长篇大论的文本中隐藏谎言;它必须展示谎言进入对话的具体时刻。
实际运作流程
- 求解器(The Solver): 一个 AI 尝试解决问题。
- 形式化器(The Formalizer): 第二个 AI 将该解法重写为上述的“状态变更日志”。如果求解器在逻辑上跳跃了,形式化器必须将其记录为一个特定的步骤。
- 评判员(The Judges): 专门的 AI 审计员会对每个步骤进行检查。
- “数学评判员” 检查计算是否正确。
- “引用评判员” 检查所引用的定理是否真实存在且适用。
- “事实评判员” 检查该事实是否确实存在于原始问题中。
- 裁决(The Verdict): 如果每一步都有有效的票据,则答案被认证(Certified)。如果哪怕只有一个步骤缺失票据或票据造假,则答案被拒绝(Declined)。
研究发现
作者在处理难题(如专家级考试中的题目)时测试了该系统,发现:
- 高信任度: 当 Theoria 说一个答案是正确时,它的正确率高达 91.4%。
- 更擅长识破狡猾的谎言: 当 AI 试图隐藏前提(隐藏假设)或伪造引用时,Theoria 能在 90.6% 的情况下将其抓获。而标准的“直觉型”评判员只能抓到 62.5%。
- 并非万能于数学错误: 如果 AI 只是单纯算错了数学(比如说 2+2=5),Theoria 和标准评判员捕捉错误的能力差不多。Theoria 的特殊优势在于专门针对捕捉隐藏逻辑和伪造来源。
- 互补性: Theoria 和标准评判员在失败的问题类型上是不同的。如果你同时使用两者,你可以捕捉到几乎所有的错误。
总结
Theoria 并不试图让 AI 变得更聪明,它试图让 AI 的推理过程可审计。
它将模糊、不可靠的文章变成了一份透明的变更账本。它并不承诺每一个答案都是正确的(因为它会拒绝约 43% 的答案,因为无法验证它们),但对于它所批准的答案,你可以查看收据,核对数学逻辑,并确切知道为什么可以安全地信任它。
在这个 AI 可能会产生幻觉事实的世界里,Theoria 是那个会说:“给我看每一步的收据,否则我不签字。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。