← 最新论文
💬 NLP

Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training

本文介绍了 Reasoning Core,这是一个包含 50 个具有语义评分器和难度控制的程序化生成器的综合集合,当用于完成监督的微调时,它在关键推理基准测试上的表现优于现有的程序化数据集,同时证明了若缺乏紧凑的目标和校准的难度,仅有语义有效性是不够的。

原作者: Damien Sileo, Valentin Lacombe, Dimitri Kachler

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Damien Sileo, Valentin Lacombe, Dimitri Kachler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何思考。长期以来,科学家们一直向这些机器人喂养大量的书籍、文章和对话,希望它们能通过“渗透”来学习推理。但有时,机器人只是记住了答案,却没有理解其中的逻辑。为了解决这个问题,研究人员开始构建“模拟世界”,让机器人在其中解决谜题、玩游戏或做数学题。在这些世界里,存在着明确的对错,就像电子游戏关卡一样,你要么打败了 Boss,要么没打败。这被称为程序化生成(procedural generation):与其雇佣人类去编写一百万道数学题,不如编写一个计算机程序,让它即时生成题目,并确保每一道题都是可解且可验证的。

研究人员提出的核心问题是:*我们该如何设计这些模拟世界,才能真正让机器人变得更聪明?*事实证明,仅仅拥有一个“可以被解决”的谜题是不够的。如果谜题太令人困惑、答案太长或者指令太复杂,机器人可能会感到挫败,或者学到错误的教训。这篇论文深入探讨了这些谜题的“配方”,探讨了编写指令和答案的方式是否与谜题本身同样重要。


逻辑厨房:REASONING CORE 简介

把训练一个聪明的 AI 比作为一个学生准备一场大考。你可以给他们一叠现实世界的教科书(这是大多数 AI 训练的形式),或者你可以给他们一本练习题册。本文的作者决定构建一本终极练习册,他们称之为 REASONING CORE

他们并没有随机堆砌问题。他们构建了一个巨大的厨房,拥有 50 个不同的“生成器”(可以将这些视为自动化的“厨师”)。每位厨师都擅长不同类型的逻辑:

  • 数学厨师:负责创建算术和几何问题。
  • 逻辑厨师:构建关于真理、谎言和因果关系的谜题。
  • 代码厨师:编写微型程序,并要求 AI 预测程序的运行结果。
  • 游戏厨师:设置棋盘游戏场景,让 AI 寻找获胜的招式。

其目标是观察:通过向 AI 定期喂食这些特定的、可验证的谜题,是否能让它比仅仅喂食随机文本更擅长推理。

大规模味觉测试

为了测试他们的新“REASONING CORE”食谱到底好不好,研究人员进行了一场大规模的味觉测试。他们选取了四种不同的 AI 模型(规模从小型到中型不等),并给它们喂入混合了常规文本和四种不同类型谜题集的资料:

  1. REASONING CORE(这个经过精心设计的全新集合)。
  2. PROCEDURAL WARMUP(一个较旧的抽象逻辑谜题集合)。
  3. REASONING GYM(一个流行的算法谜题集合)。
  4. SYNLOGIC(一个专注于逻辑游戏的集合)。

他们对模型进行了不同时长的训练,然后在标准的推理挑战(如阅读理解、逻辑谜题和数学问题)上对其进行测试。

结果:质量胜过数量

结果非常明确。当他们在 30 亿参数规模(AI 的中等规模大脑)上进行测试时,REASONING CORE 脱颖而出。它帮助 AI 在 DROPLogiQAARC-Challenge 等高难度测试中的得分,高于其他任何集合,甚至高于仅使用常规文本进行训练的结果。

但最有趣的部分在于:这不仅仅是关于拥有更多谜题的问题。 研究人员发现,谜题的“写法”至关重要。

  • “短答案”的秘密:他们发现,要求 AI 对如何解决问题进行长篇累牍的逐步解释,往往会让效果变差。相反,当谜题要求提供简洁、直接的答案(例如一个数字、一个特定的单词或一段简短的代码片段)时,AI 学习得最好。这就像是要求一名学生写一篇五页纸的论文来解释如何解出一道数学题,与仅仅要求给出最终数字之间的区别。论文分散了他们的注意力;而数字则让他们更加专注。
  • “难度”调节器:他们还了解到,谜题需要“恰到好处”。如果太容易,AI 会感到无聊;如果太难,AI 会感到困惑。最好的结果来自于那些具有挑战性但又可以被解决的谜题。
  • “审计”带来的惊喜:团队非常谨慎,他们不仅信任自己的工作。他们对其他谜题集(REASONING GYM 和 SYNLOGIC)进行了“安全审计”,并发现了其中一些隐蔽的错误。例如,在某个集合中,一个谜题的“正确”答案实际上是错误的,因为检查答案的计算机程序本身存在 Bug。这证明了仅仅因为一个谜题是由计算机生成的,并不意味着它是正确的。 你必须复核工作。

为什么这很重要

这篇论文表明,如果我们想要构建更聪明的 AI,我们不应该只是向它们投喂更多的数据。我们需要更聪明地对待我们给它们的数据。

把这想象成训练一项运动。如果你想提高篮球水平,你不会只是在健身房里漫无目的地乱跑。你会进行针对性的练习:投自由球、绕过锥形桶运球以及防守。REASONING CORE 就像是一套精心设计的训练动作。它表明,通过精心设计问题(训练动作)和答案(得分),我们可以帮助 AI 模型更有效地学习思考。

作者不仅说了“这行得通”,他们还进行了测量,在不同模型上进行了测试,甚至发现了他人工作的缺陷以证明自己的观点。他们证明了,训练数据的“设计”与数据本身同样重要。虽然他们还没有解开如何制造超级智能 AI 的谜团,但他们确实找到了一种更好的教学方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →