← 最新论文
🤖 AI

Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization

本文提出了一种新颖的框架,该框架将多跳事实验证建立在结构因果模型之上,并通过基于规则的组相对策略优化(GRPO)策略优化推理链的复杂度,通过解决幻觉问题以及推理深度与准确率之间的倒U型关系,显著优于最先进的基线方法。

原作者: Yunhan Bu, Quan Zhang, Huaping Zhang, Guotong Geng, Chunxiao Gao, Askar Hamdulla, Juan Wang, Qiuchi Li, Baohua Zhang, Shuai Lei, Yunbo Cao, Zhunchen Luo

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunhan Bu, Quan Zhang, Huaping Zhang, Guotong Geng, Chunxiao Gao, Askar Hamdulla, Juan Wang, Qiuchi Li, Baohua Zhang, Shuai Lei, Yunbo Cao, Zhunchen Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,正在试图解开一个复杂的谜团。你有一个主张(即“案件”)和一堆零散的证据(证人陈述、照片、文件)。你的任务是判断该主张是真是假。

长期以来,AI 侦探(大型语言模型)擅长阅读,却常常在细节中迷失。它们可能会编造事实(“幻觉”),或者在未将线索串联起来的情况下草率下结论。它们可能会说:“嫌疑人当时在公园,而公园有一张红色长椅,所以嫌疑人一定偷了手表!”却从未证明长椅与手表之间的关联。

本文介绍了一种训练 AI 侦探变得更合乎逻辑、更透明、更准确的新方法。以下用简单的类比来拆解其方法:

1. 问题:“过度思考者”陷阱

研究人员注意到一个奇怪的现象:当要求 AI 逐步解释其推理过程(例如写出冗长的思考过程)时,准确率并非持续上升,而是遵循一种“倒 U 形”曲线。

  • 太短:AI 思考不足,遗漏了线索。
  • 恰到好处:AI 思路清晰,得出正确答案。
  • 太长:AI 开始胡言乱语,陷入混乱,编造不存在的关联。这就像一名侦探说了太多话,以至于忘记了实际证据。

2. 解决方案:“因果蓝图”(SCM)

为了解决这个问题,作者为 AI 提供了一个结构因果模型(SCM)。你可以将其视为构建逻辑之屋的严格建筑蓝图

  • 地基(外生变量):这些是你在证据中发现的原始事实。你不能凭空捏造它们;必须从文档中找到它们。
  • 墙壁(内生变量):这些是你根据地基建出的中间结论。
  • 规则(结构函数):这是最重要的部分。蓝图规定:“除非你拥有支撑它的特定砖块(证据),否则你不能建造墙壁(结论)。”

这迫使 AI 停止猜测。除非它已证明"A 导致 B"且"B 导致 Z",否则它不能说"A 导致 Z"。它将推理过程转变为一个逻辑建筑工地,其中每一步都必须由前一步提供支持。

3. 训练:“教师”与“学生”

由于 AI 需要学习如何使用这份蓝图,研究人员采用了一种蒸馏过程:

  • 教师:一个非常聪明的大型 AI 模型被要求解决谜团,同时明确写出蓝图(列出证据、步骤和规则)。
  • 学生:随后,一个较小的 AI 模型被训练以模仿这种结构化思维。它学会了说:“这是证据,这是我基于该证据采取的步骤,这是我的结论。”

4. 微调:“严格教练”(GRPO)

即使有了蓝图,学生 AI 有时仍会过于啰嗦或犯错。为了解决这个问题,研究人员使用了一种称为**组相对策略优化(GRPO)**的技术。

想象一位教练在训练一支跑步队。教练不是只告诉一名跑步者“你做得不错”,而是让五名跑步者排成一列,他们都参加了同一场比赛。

  • 教练进行比较:“跑步者 A 走了最短、最直接的路径。跑步者 B 绕圈子跑。跑步者 C 幻觉出一条捷径。”
  • 教练奖励那些相对于其他人最高效、最准确的跑步者。

这种“组”方法帮助 AI 学会简洁。它明白,一条简短、合乎逻辑的路径优于一条漫长、令人困惑的路径。AI 因以下三点获得“奖励”:

  1. 得出正确答案。
  2. 使用最直接的证据(不过度复杂化问题)。
  3. 将推理链保持在“金发姑娘”长度——既不太短,也不太长。

结果

当他们用这个新的"SCM-GRPO"侦探测试著名的逻辑谜题(名为 HoVer 和 EX-FEVER 的数据集)时,它击败了所有之前的最佳方法。

  • 它在解决 3 跳和 4 跳谜题(需要连接四个不同信息片段)方面表现更佳。
  • 它犯的错误更少,且较少出现“幻觉”。
  • 最重要的是,其推理过程是透明的。你可以查看其“蓝图”,确切地看到它是如何得出答案的,使其成为事实核查中更可靠的工具。

总之:这篇论文教导 AI 停止胡言乱语,开始像一位谨慎的建筑师那样构建其论点,利用一套严格的规则和一套智能的教练系统,确保每一步都扎根于真实证据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →