← 最新论文
🤖 machine learning

Interactive Critique-Revision Training for Reliable Structured LLM Generation

本文提出 DPA-GRPO,这是一种用于生成器 - 验证器博弈的双配对动作训练方法,该方法利用安全保证案例和反事实动作组来优化结构化大语言模型输出,并在 TaxCalcBench TY24 基准测试中展现出更高的准确性、错误检测能力以及校准后的修正行为。

原作者: Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在填写一份极其复杂且风险极高的税务表格。你有一位聪明的助手(生成器)负责写下数字,还有一位严格的审计员(验证器)负责检查工作。

在过去,如果你让 AI 来做这件事,它只会写下数字并听天由命。有时它能做对;有时它会犯下愚蠢的错误,却无人察觉。其他方法曾尝试让 AI“自我辩论”,但这往往导致 AI 用听起来高深莫测却虚假的论据,说服自己接受错误的答案。

本文介绍了一种名为DPA-GRPO的新训练方法。这就像一场严格的“排练”,助手和审计员学习作为一个团队协同工作,而不仅仅是两个人互相喊叫。

以下是该系统的运作方式,分解为简单的概念:

1. 两位参与者:起草人与检查员

  • 生成器(起草人): 这位 AI 查看税务表格并提出答案(例如:“您的学生贷款扣除额为 3,000 美元”)。
  • 验证器(检查员): 这位 AI 查看起草人的答案。它有两个选择:
    • 保持沉默: “看起来不错,我批准。”
    • 提出警示(SAC): “等一下!我发现了一个错误。”关键在于,当它提出警示时,不能只说“你错了”。它必须提供一份安全保证案例(SAC)。这就像一份正式备忘录,包含:
      • 主张: “这个数字太高了。”
      • 论据: “法律规定最高限额为 2,500 美元。”
      • 证据: “这是显示您支付了 3,000 美元的收据。”

2. “第二次机会”循环

如果检查员提出警示,起草人将获得第二次机会。它可以:

  • 坚持: “我坚持我最初的答案;你的警示是个误会。”
  • 修订: “你说得对,我犯了计算错误。这是修正后的数字。”

3. 训练游戏(“教练”)

这篇论文的魔力在于他们如何教导 AI。他们不仅仅说“做得好”或“做得差”。他们进行一种游戏,让 AI 从可能发生的情况(反事实)中学习。

想象一位教练在观看练习赛:

  • 情景 A: 起草人做对了,检查员保持沉默。(完美!) 教练奖励双方。
  • 情景 B: 起草人做错了,而检查员漏掉了错误。(糟糕!) 教练告诉检查员:“你本该提出警示的!”
  • 情景 C: 起草人做对了,但检查员错误地提出了警示。(糟糕!) 教练告诉检查员:“别疑神疑鬼了;那个答案是正确的。”
  • 情景 D: 检查员提出警示,起草人修正了错误。(好!) 双方因团队合作而获得奖励。
  • 情景 E: 检查员提出警示,但起草人的“修正”使情况变得更糟(糟糕!) 教练告诉起草人:“不要仅仅因为有人喊叫就随意更改;要检查这种改变是否真的更好。”

该系统使用数学公式(GRPO)来调整 AI 的“大脑”,使其学会:

  1. 第一次就给出正确答案。
  2. 仅在真正需要时才提出警示。
  3. 仅在改变确实能带来改进时才修改答案。

4. 结果:更优秀的团队

研究人员在名为TaxCalcBench的基准测试中测试了这种方法,该测试模拟填写美国税务表格。他们将新方法与以下方法进行了比较:

  • 零样本(Zero-shot): 未经训练的 AI 直接猜测。
  • 旧方法: 仅训练起草人变得更好,而没有专门的检查员。

研究结果非常明确:

  • 新的“团队”(DPA-GRPO)比单独的起草人或未经训练的 AI 获得了显著更多的正确答案。
  • 检查员学会了停止“狼来了”(发出虚假警报),并开始捕捉它过去常漏掉的真正错误。
  • 起草人学会了更明智地判断何时修改答案,而不是盲目服从每一次修正。

总结

本文提出了一种训练 AI 的方法,使其在结构化任务(如填写表格)中更加可靠,方法是将该过程转化为创造者批评者之间的合作游戏。他们不再只是希望 AI 能答对,而是教导 AI 以结构化、有纪律的方式进行辩论、核查证据并修订工作,从而减少错误并产生更可信的输出。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →