← 最新论文
🤖 AI

Faithful Autoformalization via Roundtrip Verification and Repair

本文提出了一种往返验证框架,该框架通过将形式化表示迭代地翻译回自然语言、检查逻辑等价性,并应用诊断引导的局部修复来纠正错误,从而确保从自然语言到形式化表示的忠实翻译,且无需依赖真实标注。

原作者: Daneshvar Amrollahi, Jerry Lopez, Clark Barrett

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Daneshvar Amrollahi, Jerry Lopez, Clark Barrett

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一条复杂的法律规则从英语翻译成一种严格的、计算机可读的语言(就像一种秘密代码)。你请一位超级智能的 AI 来完成这项翻译。但你怎么知道 AI 在翻译过程中没有无意中改变了规则的含义呢?

本文提出了一种巧妙的“翻译检查”系统,该系统无需人类专家持有答案密钥。相反,它采用了一种“往返验证”方法。

以下是其工作原理,使用一个简单的类比:

“往返”游戏

将这个过程想象成“传话”游戏,但有一个转折:

  1. 正向行程(翻译):你向 AI 提供一条自然语言规则(例如,“超过 3 吨的车辆不得进入公园”)。AI 将其翻译成严格的逻辑代码(第 1 阶段)。
  2. 反向行程(反向翻译):AI 将该逻辑代码翻译回普通英语(第 2 阶段)。
  3. 再次正向行程(再次翻译):AI 将这条新的英语句子再次翻译成逻辑代码(第 3 阶段)。

检查:系统现在比较第一段代码(来自第 1 步)与第二段代码(来自第 3 步)。

  • 如果它们完全匹配:AI 很可能正确理解了含义。这是一次“忠实”的翻译。
  • 如果它们不匹配:某个环节出了问题。含义在过程中发生了偏移。

“医生”与“手术刀”

当两段代码不匹配时,一种天真的做法是直接告诉 AI:“从头再来!”并寄希望于好运。本文认为这是浪费。

相反,他们使用了一套诊断与修复系统:

  • 医生(诊断):一个特殊的 AI“法官”审视谜题的四个部分(原始文本、第一段代码、反向翻译后的文本、第二段代码),以确切找出是哪个步骤破坏了含义。是第一次翻译搞错了?还是反向翻译产生了误解?
  • 手术刀(针对性修复):一旦医生确定了具体出错的步骤,系统仅修复该部分。它不会丢弃整个工作成果;它只是对故障步骤进行“手术”,然后重新运行链条的其余部分。

现实世界测试

研究人员在两组德克萨斯州法律上测试了该方法:

  1. 交通法规:关于驾驶、限速和校车的规则。
  2. 野生动物法规:关于狩猎、捕鱼和受保护动物的规则。

他们使用了两种不同的大规模 AI 模型(Claude 和 GPT)来验证该系统是否有效。

关键发现(“那又怎样?”)

  1. 检查有效:当系统判定两段代码匹配(形式等价)时,这是一个非常强烈的信号,表明含义未发生偏移。当代码不匹配时,含义几乎肯定有误。
  2. 修复正确的内容至关重要:最成功的方法并非仅仅是“再试一次”。而是利用“医生”找出具体出错的步骤,并使用“手术刀”仅修复该步骤。
  3. 瓶颈:当“医生”(诊断步骤)可靠时,系统效果最佳。
    • 当他们使用 Claude 模型担任“医生”时,系统既快速又准确。
    • 当他们使用 GPT 模型担任“医生”时,它总是将每个错误归咎于第一步,即使错误并非第一步所致。这导致系统变得缓慢且低效。
    • 解决方案:他们发现,如果保留 GPT 负责繁重的翻译工作,但仅换用 Claude 担任“医生”,系统便能再次变得快速且准确。

核心结论

本文表明,你无需人类专家检查每一个答案,即可验证 AI 是否忠实地翻译了复杂规则。通过来回翻译并仅修复链条中具体的故障环节,你可以获得更可靠的结果。

重要提示:作者明确警告,即使使用此系统,输出结果也不应用于安全关键任务(如自动驾驶或医疗设备),除非先由人类专家进行审查。这是一个检查一致性的优秀工具,但并非绝对真理的魔法保证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →