← 最新论文
🤖 AI

Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models

该论文提出了 DiScO,这是一个通过显式定义并优化多样化思维模式(包括推理转换和答案候选)来增强大语言模型推理能力的框架,该框架通过模式感知、强化学习和多样化推理这三个阶段的过程,使得在数学基准测试上的表现优于标准方法,并提升了错误恢复能力。

原作者: Xinyue Liang, Yizhe Yang, Yu Bai, Bin Xu, Jiawei Li, Yang Gao

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyue Liang, Yizhe Yang, Yu Bai, Bin Xu, Jiawei Li, Yang Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:不要只是一味地努力,要尝试“换个思路”

想象一下,你正在尝试破解一个非常复杂的迷宫。大多数 AI 模型(大型推理模型)就像是一个在迷宫中奔跑的单一跑者:他沿着一条路径跑下去,撞到了墙,然后转身,试图沿着同一条路径再次尝试,只是跑得稍微快了一点点。他们会陷入循环,或者因为过于专注于最初的想法而选择放弃。

这篇论文认为,要解决复杂问题,AI 不应该只是跑得更快,它需要成为一个更好的探索者。作者引入了一个概念,叫做**“思维图式”(Thinking Schemas)**。你可以把它理解为 AI 内部的“绘图”风格。

他们发现,当 AI 的绘图风格具有多样性时,表现最为出色。具体来说,他们观察了两个方面:

  1. 推理转换(Reasoning Transitions): AI 改变主意或切换策略的频率(例如:“等等,刚才那个数学方法行不通,让我们试试画图吧”)。
  2. 候选答案(Answer Candidates): 在最终确定最终答案之前,AI 在过程中考虑了多少种不同的可能答案。

该论文声称:AI 改变主意的次数越多、尝试的角度越多样,它找到正确答案的可能性就越大。


问题所在:“固执的跑者”

目前的 AI 模型经常陷入思维定式。如果它们开始以某种方式解决数学问题,即使在进行到一半时意识到自己错了,它们也倾向于继续那样做。它们可能会说:“我觉得答案是 12”,然后意识到 12 是错的,但它们并不会尝试一个完全不同的方法,而是仅仅微调这个 12,说:“好吧,也许是 12.1?”

它们缺乏这种能力——即能够说:“好吧,我错了。让我们把这整个想法扔进垃圾桶,从另一个角度重新开始。”

解决方案:DiScO(多样化图式策略优化)

作者创建了一种新的训练方法,叫做 DiScO。你可以把 DiScO 想象成一位教练,教导 AI 如何成为一名灵活的探索者。它分为三个步骤:

1. 教会 AI “为思想贴标签”(图式感知型 SFT)

首先,AI 被教导戴上一顶“思考帽”,帮助它观察自己的思维过程。它学习用特殊的标签来标记自己的推理过程:

  • \AnswerCandidate: “我觉得答案可能是 X。”
  • \ReasoningTransition: “等等,我现在正在改变策略。”

这就像是教学生在作业的边角处写下“我卡住了”或“让我们尝试另一种方法”一样。这让 AI 能够意识到自己是在“如何思考”,而不仅仅是“在思考什么”。

2. 奖励“改变主意”(面向多样性的强化学习)

接下来,AI 会参加一场游戏,它获得的积分不仅取决于是否得到了正确答案,还取决于其多样性

  • 如果 AI 用三种不同的方法解决了问题,它会获得加分。
  • 如果它从“做数学题”切换到了“画示意图”,它会获得加分。
  • 如果它只是不停地重复同一句话,它就拿不到分。

这就像是一位教练告诉跑者:“如果你只是跑同样的圈数,你只能得到 C。但如果你尝试穿过森林、穿过河流、再穿过山丘,你就能得到 A+。” AI 从而学到了探索不同的路径是有价值的。

3. “重新开始”的小技巧(推理时多样性)

最后,当 AI 真正进行测试(推理阶段)时,系统有一个安全网。如果 AI 开始胡言乱语或陷入循环(不断重复),系统会切断其思维过程的开头部分,并说:“好吧,忘掉你刚才说的头 20% 的内容。利用剩下的部分重新开始吧。”

这迫使 AI “重置”,并用全新的视角来看待问题,防止它陷入思维死胡同。


结果如何?(研究成果)

研究人员在困难的数学问题(如高水平竞赛中的题目)上对该方法进行了测试。

  • 更高的分数: 使用 DiScO 训练的 AI 比标准 AI 模型得分显著更高,尤其是在处理最难的问题时。
  • 更好的恢复能力: 当 AI 在早期犯错时,经过 DiScO 训练的模型能更好地意识到“噢不,我走错路了”,并切换到新路径来修正错误。而标准模型往往只会沿着错误的路径继续走下去。
  • 更多的选项: DiScO 模型不仅仅是猜一个答案;它们在确定最终答案之前,探索了许多不同的“候选答案”。

总结

论文得出结论:多样性是关键。正如人类在解决难题时,通过尝试不同策略、变换视角以及不固守第一个想法来获益一样,当 AI 被鼓励以多样化、灵活的方式思考时,它们的表现也会更好。

作者指出,AI 推理的未来不仅仅在于让模型变得更大或更快,而在于让它们成为更具多样性的思考者

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →