← 最新论文
💬 NLP

Teaching Language Models to Think in Code

本文介绍了 ThinC,这是一个将语言模型推理从自然语言与代码交织的模式转变为以代码为中心的范式的框架,在该范式中代码本身充当主要推理器,通过蒸馏代码轨迹并采用监督微调后接强化学习的方法,在竞赛级数学基准测试中实现了最先进的性能。

原作者: Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个非常棘手的数学谜题。你有两种方法可以做到:

  1. 旧方法(交错推理):你用英语自言自语,理清步骤。“好的,首先我需要将 500 乘以 0.12……"然后,你有点不确定,于是让计算器(代码工具)来检查你的工作。但这里有个陷阱:如果你在英语思考中犯了错(比如把 500 乘以 0.12 算成 50 而不是 60),你可能会不小心把这个错误的数字输入到计算器中。计算器只是按你说的去做;它并不知道你犯了错。它基于你错误的数字进行计算,最终得出错误的答案。
  2. 新方法(THINC):你花极短的时间用英语规划策略(“我需要计算这个形状的面积”),然后立即将整个任务交给机器人程序员。机器人编写代码、运行它、查看结果,并根据该结果编写更多代码,如此循环,直到答案出现。你不在头脑中或用英语句子做任何数学运算;机器人承担了所有繁重的工作。

本文介绍了THINC(用代码思考),这是一种训练 AI 模型解决数学问题的新方法,其核心是让代码本身成为思考者,而不仅仅是 AI 用来检查工作成果的工具。

旧方法的问题

作者指出,当前将英语思考与代码混合的 AI 模型(称为工具集成推理)存在三个主要缺陷,他们称之为“结构性局限”:

  • “事后”验证器:AI 通常先用英语写出完整解决方案,然后运行代码仅仅为了说“没错,就是这样”。代码实际上并没有参与思考;它只是最终的一个批准印章。
  • “静默错误”:如果 AI 在英语思考中犯了数学错误(例如将 500 的 12% 算成 50 而不是 60),它可能会将这个错误数字复制到代码中。随后代码基于错误数字进行计算,而 AI 从未意识到这一点。这种错误是“静默”的,因为代码只是照章执行。
  • “双重劳动”:AI 通常会用英语写出一长段关于如何解决问题的解释,然后再编写一段完全相同的代码。这就像先用英语写一份食谱,再用法语写一份完全相同的食谱,仅仅为了证明你懂得烹饪。这既冗余又令人困惑。

THINC 的解决方案

THINC 改变了游戏规则。AI 不再谈论数学,而是通过数学(即代码)来思考。

  • 规划:AI 首先用一句简短的英语设定策略(例如“我将循环遍历数字以找到答案”)。
  • 执行:在这句话之后,所有工作都在代码块中完成。AI 编写一段代码,运行它,查看输出,然后根据该输出编写下一段代码。
  • 结果:最终答案直接来自计算机的计算器(解释器),而非 AI 用英语猜测得出。

他们如何训练 AI

研究人员并非仅仅告诉 AI 这样做;他们通过三步流程进行了训练:

  1. 蒸馏(教师):他们使用一个非常聪明的大型 AI 模型,要求其用这种新的“代码优先”风格解决数学问题。他们收集了 12,200 个此类完美“代码优先”解决方案的示例。
  2. 监督微调(学生):他们训练两个较小的 AI 模型(一个拥有 17 亿“神经元”,另一个拥有 40 亿)去模仿这些示例。这教会了模型习惯用代码思考。
  3. 强化学习(教练):他们让模型在数千道数学问题上进行练习。如果模型得出正确答案,它就获得“奖励”;如果失败,它就学习尝试不同的代码策略。这使得模型变得更加聪明和可靠。

结果:小模型,大胜利

该论文在极具挑战性的竞赛级数学测试(如 AIME 和 HMMT)中测试了这些新模型。

  • 超越巨头:小型的 40 亿参数 THINC 模型平均得分达到78.1%。这一成绩优于 17 亿参数模型,优于其他“工具集成”模型,甚至优于一个仅用英语思考的庞大 2350 亿参数模型!
  • 可靠性:在 99.2% 的案例中,最终答案直接来自计算机的代码输出。AI 没有猜测;它进行了计算。
  • 自我修复:如果代码出错并崩溃(报错),THINC 模型在下一个代码块中修复它的表现令人惊讶地出色,无需通过“说话”来摆脱困境。其他混合英语与代码的模型在遇到代码错误时往往会崩溃。

结论

该论文声称,通过迫使 AI 停止“谈论”数学,转而用代码“执行”数学,模型变得更加准确,减少了愚蠢的算术错误,并更高效地解决难题。这就像从一个试图在头脑中进行长除法的人,转变为一个知道如何编程让计算器一步步代劳、且永远不会犯心算错误的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →