← 最新论文
💬 NLP

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

本文介绍了步级自一致性组相对策略优化(SSC-GRPO),这是一种通过根据多次推理展开中的自一致性得分来分配步级奖励,从而减轻大语言模型中上下文敏感型事实幻觉的新颖方法,该方法在数学推理和幻觉基准测试上实现了最先进的性能。

原作者: Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个才华横溢、极具创造力的机器人去破解谜题。这个机器人读过图书馆里几乎所有的书,说话也像人类一样自然,但它有一个古怪的习惯:有时,当它沉浸在一个很长的故事中时,它会开始编造事实。它可能会自信满满地说:“管家用烛台杀死了受害者,”即便线索明明指向园丁。在人工智能的世界里,这被称为“幻觉”。这并不是说机器人在故意撒谎;它只是因为自己的思维链条变得太长、太乱,以至于忘记了它真正掌握的知识。

长期以来,科学家们一直认为这些错误是因为机器人单纯不知道答案。但如果机器人知道答案,只是被它正在讲述的故事给搞混了呢?这正是这篇论文要解决的谜题。研究人员正在观察 AI 模型是如何进行逐步思考的,就像侦探在笔记本上写下线索一样。他们发现,机器人经常会绊倒自己的脚,这并不是因为缺乏知识,而是因为它正在编写的故事的语境(context)让它忘记了真相。为了解决这个问题,他们发明了一种新的训练方法,充当一种“自我检查”系统,教会机器人停下来并询问自己:“等等,这句话跟我刚才写的其他内容相符吗?”


问题所在:机器人的“脑雾”

来认识一下大语言模型(LLM)。把它想象成一只背下了整个互联网内容的超级聪明的鹦鹉。当你问它一个难题时,它不仅仅是吐出一个答案;它会尝试通过“思考”来解决问题,一步步写下长长的推理链。这对于解决复杂谜题非常有用,但它有一个缺陷。随着思维链变得越来越长,机器人有时会变得“语境敏感”。

想象一下,你正在脑海中解一道数学题。你知道 3×100=3003 \times 100 = 300。但接着,你开始讲一个关于巫师施法将数字变成水果的故事。突然,你的大脑混乱了,你可能会写道:“所以,3×1003 \times 100 肯定是一个香蕉。”你知道它是 300,但你对自己讲述的那个愚蠢故事让你忘记了。

研究人员发现,AI 也会发生完全相同的情况。他们称之为语境敏感型事实幻觉(Context-Sensitive Factual Hallucination)。机器人的大脑中确实存储着正确的知识,但冗长的推理过程产生的“噪音”误导了它,使其犯错。这就像一位音乐家明明知道如何完美地演奏一首歌,却因为听众的嘈杂声而分了心,从而弹错了音符。

发现:并非知识匮乏

为了查明原因,团队化身为侦探。他们找出了一个在长推理链中出错的机器人,并问了一个简单的问题:“如果我只取出那一个错误的句子,单独问你这个问题,你能答对吗?”

答案几乎总是可以

当他们隔离出那个错误时,机器人会说:“噢,当然可以!3×1003 \times 100 是 300,不是香蕉!”这证明了机器人并不是缺失知识,它只是被语境搞混了。事实上,他们的分析显示,这些推理模型犯下的错误中,有近 70% 都是这种特定类型的“脑雾”——即模型知道真相,却被自己的故事绊住了脚。

解决方案:“自我一致性”教练

那么,如何教机器人停止被自己的故事搞混呢?作者创建了一种新的训练方法,叫做 SSC-GRPO(步级自我一致性群体相对策略优化)。这个名字很拗口,让我们用一个游戏类比来拆解它。

想象一下,你正在训练 8 个机器人同时解决同一个谜题。

  1. 展开(The Rollout): 每个机器人写下属于自己的逐步解决方案。
  2. 自我检查(The Self-Check): 系统不只是检查最终答案是否正确,还会要求机器人对比它们的步骤。“机器人 A,你的第二步和机器人 B 以及机器人 C 写的内容一致吗?”
  3. 奖励(The Reward): 如果一个机器人的步骤与其他机器人的说法一致(高一致性),它会获得高分。如果它脱离轨道,说了一些没人认同的奇怪话(低一致性),它就会得到低分。

这里的奇妙之处在于,机器人扮演了自己的裁判。它不需要人类老师或事实数据库来告诉它错了,它只需要观察自己的“同伴”(其他版本的自己)并意识到:“嘿,我是唯一一个说答案是香蕉的人。那大概率是错的。”

系统随后利用这些分数,对那些具有一致性的特定步骤给予“奖励”,并对那些产生幻觉的步骤给予“惩罚”。随着时间的推移,机器人学会了信任那些在群体中显得合理的步骤,不再为了迎合故事而编造事实。

结果:更聪明、更诚实的机器人

团队在一些最难的数学和推理挑战上测试了这种新方法。他们使用了像 Qwen3Llama3 这样的模型。结果令人印象深刻。

  • 更好的数学能力: 在标准数学测试中,新方法帮助机器人的得分比以前更高。例如,在一项测试中,与标准训练方法相比,新方法的得分提高了约 1.8%
  • 更少的幻觉: 最重要的是,机器人犯下那些“语境敏感型”错误的次数大幅减少。它们被自己故事搞混的次数显著下降。
  • 无需外部帮助: 不同于其他需要机器人查阅巨型百科全书(这既慢又贵)的方法,这种方法仅仅利用机器人自身的思维来进行自我检查。

研究人员在训练过程中还观察到了一个有趣的现象:随着机器人的学习,它们的“一致性”在提高。它们开始更频繁地达成共识,产生混乱、虚假步骤的数量也在减少。这就像是在观察一个学生从分心困惑变得专注且自信的过程。

为什么这很重要

这篇论文为解决 AI 最严重的问题之一提供了一种新思路:即那种“一本正经胡说八道”的倾向。通过意识到机器人往往知道答案,只是在故事中迷失了方向,作者找到了一种让它保持专注的方法。

他们不仅是猜测,更是进行了测量。他们证明了当隔离出错误时,知识确实存在。他们证明了这种新方法能减少这类特定类型的错误。虽然论文指出,这需要消耗更多的计算资源(因为机器人必须多次自我检查),但为了让 AI 变得更可靠,这种权衡是值得的。

简而言之,作者给了 AI 一个新工具:一面镜子。机器人不再仅仅盯着故事的下一步看,它现在学会了回头审视并询问自己:“这跟我之前说的一切吻合吗?”通过这样做,它停止了编造事实,开始讲述真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →