Training Continuous Chain of Thought Models: A Tale of Two Regimes
本文介绍了 C-MTP,一种用于训练连续思维链(Chain-of-Thought)模型的更快速的直接监督方法,该方法优于先前的直接方法,并在短推理轨迹上达到了与较慢的间接方法相当的性能,同时揭示了当前的连续思维链技术在应用于具有较长推理链的复杂任务时表现出显著的困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个超级聪明的机器人如何解开一个棘手的谜题。在过去,机器人只会脱口而出答案,因为它们往往没有经过思考,所以经常出错。后来,科学家们发现了一个魔术技巧:如果他们先让机器人“大声思考”,把推理的每一个微小步骤都写下来,机器人的解题能力就会大大提高。这被称为“思维链”(Chain-of-Thought)。这就像学生在数学考试中展示解题过程一样;写的步骤越多,得到正确答案的可能性就越大。
然而,这里有一个代价。写出每一个步骤需要耗费大量的时间和计算能力。这就像要求一名跑步者在每走一步之后都要停下来写一段日记一样。这会让他们的速度慢得像蜗牛爬。于是,研究人员开始思考:“我们能不能让机器人在一种秘密的、压缩过的语言中思考?它能否利用简短、密集的笔记在脑海中完成所有的思考,而不是使用长句子?”这个想法被称为“连续思维链”(Continuous Chain-of-Thought)。目标是保留聪明的思考能力,但丢掉那些缓慢、冗长的表达。但这里有一个大问题:我们真的能教会机器人使用这些秘密笔记进行思考,而不丢失它的聪明才智吗?
这篇题为《训练连续思维链模型:两种范式的寓言》(Training Continuous Chain of Thought Models: A Tale of Two Regimes)的论文深入探讨了这个问题。作者 Varun Yerram、He He 和 Eunsol Choi 扮演着侦探的角色,测试了两种教授机器人这种秘密语言的方法。他们将这两类方法称为“直接监督”(Direct Supervision)和“间接监督”(Indirect Supervision)。
把间接监督想象成一位老师,观察着学生在白板上一层层解决问题的过程。老师使用一种特殊的过程,让机器人自回归地预测中间思维(潜变量)。为了引导这种缓慢的、序列化的预测,老师模型(它已经通过完整文本解决了问题)会与学生机器人分享其内部的“大脑状态”(激活状态)。机器人学习模仿这些内部状态,从而生成自己的思维序列,一个接一个,就像一排多米诺骨牌依次倒下。这种方法很准确,但很慢。
直接监督——作者将其称为一种名为 C-MTP 的新方法——更像是老师递给学生一叠索引卡。每张卡片代表一段思考过程。老师说:“这是关于这一整块思考内容的答案;你只需要学习预测这张卡片上的词语即可。”这使得机器人可以同时学习许多步骤,就像阅读整页书而不是一个字母一个字母地读。这比间接方法更快、更高效。
研究人员在三个不同难度的水平上测试了这两种方法,就像攀登一座设有三个营地的山峰。
营地 1:简单、结构化的路径。
在那些思考过程短小且规整的简单数学问题上(例如“18 乘以 12 等于 216”),新的直接监督 (C-MTP) 方法表现得像个超级明星。它训练速度更快,学习所需的样本更少,而且与旧的、缓慢的间接方法相比,它在解决从未见过的题目时表现得更好。它就像一名短跑选手,虽然训练量较少,却能跑得和马拉松选手一样快。
营地 2:冗长、唠叨的路径。
当问题变得复杂一些,需要长篇大论、喋喋不休的解释(比如为每一个步骤编写完整的句子)时,情况发生了逆转。间接监督方法占据了上风。为什么呢?因为它被设计用于将长而杂乱的思考压缩成简短的笔记。直接法在这里遇到了困难,因为它试图预测长篇解释中的每一个单词,如果它犯了一个微小的错误,整个思维链就会崩溃。这就像试图通过猜测每个单词来抄写一个长故事;一个拼写错误就会毁掉整个段落。
营地 3:现实、混乱的顶峰。
最后,研究人员在最难、最真实的题目上测试了两种方法——即包含数百个推理单词的复杂数学谜题,就像人类写作那样。在这里,故事走向了悲剧。两种方法——快速的直接法和谨慎的间接法——都失败了。它们的表现相比于让机器人写出所有想法的标准方法下降了约 65%。
作者发现,在这些现实且漫长的任务中,两种方法都无法处理其中的复杂性。直接法不断产生微小的数学错误并不断累积,而间接法则无法足够准确地压缩长而杂乱的思考。事实证明,当前“连续思维链”的这种“秘密语言”还不具备应对现实世界的能力。论文指出,我们用来测试这些机器人的简单基准测试可能会误导我们,让它们在面对真实、混乱的问题时看起来比实际情况更聪明。
最终,这篇论文并没有宣布单一的赢家。相反,它告诉我们,虽然新的直接法是处理简单、结构化任务的极佳且快速的工具,但要让机器人能够用秘密代码处理复杂的现实世界问题,我们还有很长的路要走。实现一个既能快速思考又无需写出所有内容的机器人梦想,仍处于进行时。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。