← 最新论文
💬 NLP

Exploring Extrinsic and Intrinsic Properties for Effective Reasoning with Code Interpreter

本文通过指出更强的模型表现出更高比例的关键标记以及验证和回溯等认知行为,系统地表征了使用代码解释器进行有效推理的过程,并证明在推理和训练阶段利用这些外在与内在属性可以显著增强推理性能,同时提高标记效率。

原作者: Patomporn Payoungkhamdee, Napat Laosaengpha, Jenta Wonglertsakul, Pittawat Taveekitworachai, Pume Tuchinda, Panjapong Poobanchuen, Ekapol Chuangsuwanich, Can Udomcharoenchaikit, Samuel Cahyawijaya, Pe
发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Patomporn Payoungkhamdee, Napat Laosaengpha, Jenta Wonglertsakul, Pittawat Taveekitworachai, Pume Tuchinda, Panjapong Poobanchuen, Ekapol Chuangsuwanich, Can Udomcharoenchaikit, Samuel Cahyawijaya, Peerat Limkonchotiwat, Sarana Nutanong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢但有时过于自信的学生(一个大语言模型,或称 LLM),他正试图解决一个复杂的数学谜题。通常情况下,这个学生试图在脑海中完成所有的繁重计算。有时他能做对,但经常会犯一些愚蠢的算术错误,或者迷失在自己思绪的迷宫中。

为了解决这个问题,这个学生被赋予了一个代码解释器(Code Interpreter)——本质上是一个超快速、无误差的计算器,以及一个可以编写代码来测试其想法的沙盒环境。这篇论文探讨了优秀的学霸与较弱的学生在使用这一工具时有何不同,以及我们如何能教导他们更好地使用它。

研究人员观察了两个主要方面:外在属性(Extrinsic Properties)(即学生大声说出的内容)和内在属性(Intrinsic Properties)(即学生内在的思考方式)。

1. “外在”线索:神奇的词汇

这可以理解为倾听学生的内心独白。研究人员发现,最聪明的学生不会直接跳到答案。他们会在思考过程中使用特定的“神奇词汇”或关键标记(crucial tokens)

  • 研究结果: 表现顶尖的模型频繁使用诸如 “设(let)”“检查(check)”“等等(wait)” 之类的词。
    • “设(let)” 就像是在说:“让我们尝试这种特定的方法。”
    • “检查(check)” 就像是停顿下来并说:“等等,让我验证一下这一步是否合理,然后再继续。”
    • “等等(wait)” 是一个信号,提示要慢下来,多思考一会儿。
  • 实验: 研究人员尝试在测试期间强制要求较弱的模型更多地使用这些词。
    • 结果: 这在数学、列表排序和优化问题方面效果显著。模型的表现有了大幅提升。然而,对于空间推理(想象形状)或逻辑谜题,仅仅添加这些词并没有什么帮助。这就像告诉一名跑步者要“呼吸”有助于他跑完马拉松,但这并不能帮他解开填字游戏一样。

2. “内在”习惯:脑力体操

这部分关注的是学生实际的思考习惯,而不仅仅是他们使用的词汇。研究人员识别出了优秀模型自然具备的四种“认知行为”(或称脑力体操):

  1. 验证(Verification): 检查自己的工作。“这段代码真的给出了正确的数字吗?”
  2. 回溯(Backtracking): 意识到路径错误,并返回尝试另一条路线。
  3. 子目标设定(Subgoal Setting): 将一个巨大的问题分解成微小、易于处理的步骤。
  4. 逆向链式思考(Backward Chaining): 从最终答案开始,反向推导需要哪些步骤才能到达那里。
  • 研究结果: 最好的模型一直在不断进行这些操作。有趣的是,虽然在常规思维中“回溯”(往回走)很常见,但在基于代码的推理中,子目标设定(分解问题)是最主要的习惯。
  • 实验: 研究人员采用了一种标准的训练框架,并在模型的学习阶段强制教授这些习惯。他们本质上创建了一个“脑力健身房”,让模型练习这些特定的动作。
    • 结果: 对于大多数模型(特别是 Qwen2.5 系列),这种训练使它们在数学方面变得聪明得多。它们学会了停止“过度思考”(在死胡同里徘徊),并且能更高效地使用它们的 Token(词汇)。
    • 代价: 对于一个特定的、已经非常先进的模型(Qwen3-8B),强制执行这些习惯反而让它变得更差了。为什么呢?因为训练不小心让模型停止使用它所需要的那些“神奇词汇”(外在属性)。这就像教一位名厨一种新的切菜方法,却在无意中让他忘记了如何正确握刀。新习惯与他们原有的风格发生了冲突。

大局观

论文总结道,利用代码解释器进行有效的推理,不仅仅是拥有一个强大的大脑或一个快速的计算器。它在于以下两者的共舞

  1. 说出正确的话(使用“检查”和“等等”来暂停并验证)。
  2. 以正确的方式思考(分解问题、检查工作,并知道何时回头)。

当你掌握了平衡,模型就会变成一个更加可靠的问题解决者。但如果你过度推动其中一方(比如在模型已经拥有完美节奏时强加新习惯),你可能会破坏整个系统。

简而言之: 为了让 AI 更好地通过代码解决问题,我们需要教导它们停顿、检查工作并分解问题——但我们必须小心,不要破坏我们正在训练的模型的独特“个性”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →