SuperThoughts: Reasoning Tokens in Superposition
该论文介绍了 SuperThoughts,这是一种通过多 Token 预测模块将连续的思维链(Chain-of-Thought)Token 解码为单个潜在表示的方法,旨在实现推理长度减少 20–30% 并使推理吞吐量翻倍,同时在复杂的数学和推理基准测试中保持具有竞争力的准确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在尝试解决一个非常困难的数学问题。通常,一个聪明的计算机(被称为大语言模型)通过像人类写下一长串思路那样,一步步地进行自我对话来解决问题。这被称为“思维链”(Chain-of-Thought,简称 CoT)。
把这个思考过程中的每一步想象成计算机写下的一个单词。为了解决难题,它可能需要写下 500 个单词。它每写一个单词,计算机都必须停下来、思考并进行一次大规模的计算。这很准确,但速度很慢且消耗大量能量,就像开车时每走一米都要停下来重新启动引擎一样。
问题:太多的停顿
这项研究背后的研究人员问道:“为什么我们必须为每一个单词都停下来并重新启动?难道计算机不能同时思考两个单词吗?”
以往尝试让计算机进行“隐形”思考(而不是通过单词)的尝试都失败了,因为如果没有清晰的反馈,计算机会感到困惑并迷失方向。这就像尝试通过只在脑中思考而不开口说话来学习一门新语言;如果你在说出声之前不知道自己的想法是否正确,你可能会迷失方向。
解决方案:SuperThoughts
该论文介绍了一种名为 SuperThoughts 的新方法。它是如何工作的,我们可以使用一个简单的类比:
想象你是一位正在准备一顿饭的厨师。
- 旧方法(标准方式): 你切一个蔬菜,煮一下,尝一下,然后切下一个,煮一下,再尝一下。你是一个接一个进行的。这需要很长时间。
- SuperThoughts 方法: 你同时切两个蔬菜,并将它们放入一个特殊的“超级碗”中(这就是压缩器/Compressor)。然后你烹饪这个超级碗。当你把它取出来时,你得到的不仅仅是一个煮熟的蔬菜,而是两个完美烹饪好的蔬菜准备好上桌了(这是主模块/Main Module和 MTP 模块协同工作的结果)。
通过将两个想法捆绑成一个“超级想法”,计算机只需要进行一半的烹饪步骤(前向传递)就能得到相同的结果。这在理论上使速度翻了一倍。
安全网:“置信度检查”
这里有一个陷阱。有时,将两个想法捆绑在一起太难了。如果计算机正在尝试解决一个非常棘手的环节,它如果尝试同时进行两步,可能会感到困惑。
为了解决这个问题,研究人员添加了一个置信度检查(Confidence Check)。
- 把它想象成司机在检查路况。如果路况清晰且简单(一个“容易”的想法),司机就会加速,一次走两步。
- 但如果路面变得雾气昭昭或危险(一个“困难”的想法),司机就会减速,回到旧的方法:一次走一步。
这是自动发生的。如果计算机不能 100% sure 自己能正确预测接下来的两个单词,它会说:“没关系,我们现在先只做一个单词吧,”然后为下一个单词再次尝试。这确保了计算机不会为了追求速度而犯错。
他们的发现
研究人员在几个困难的数学和科学谜题(如 MATH500 和 OlympiadBench)上测试了它。结果如下:
- 速度: 计算机解决问题所需的步骤减少了约 20% 到 30%。这就像通过走捷径让一段漫长的公路旅行缩短了一半。
- 准确性: 令人惊讶的是,计算机并没有变得笨很多。与缓慢、谨慎的方法相比,它的准确率仅下降了极小的幅度(在 100 分中大约下降了 1 或 2 分)。
- 规模很重要: 更大的计算机(拥有更多“脑力”)比较小的计算机更能更好地处理这种“一次两个”的技巧。
总结
SuperThoughts 是一种让 AI 在不损失智力的前提下思考得更快的方法。与其一次只走一步,它尝试一次走两步。如果它感到不确定,它会自动减速,改为一次走一步,以确保它是正确的。这在保持答案基本正确的同时,节省了时间和计算能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。