Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts
本文挑战了推理链必须密集且按序排列的传统观点,通过证明语言模型能够从被严重打乱、剥离自然语言甚至掺入错误答案的推理轨迹中提取正确答案,揭示了其背后存在一个稀疏且对顺序不敏感的信息基底。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明的学生正在参加一场高难度的数学考试。在写下最终答案之前,这位学生会在一块草稿纸上写出一长串逐步的“思维过程”。这被称为“思维链”。
长期以来,我们对学生的工作方式有两个假设:
- 一切皆重要:他们写下的每一个字都至关重要。如果你擦掉一个字,答案可能会出错。
- 顺序为王:步骤必须严格按照书写的顺序阅读(第一步,然后第二步,然后第三步)。如果你打乱页面顺序,学生就会感到困惑。
这篇论文指出:“实际上,这两个假设都不成立。”
研究人员通过从三个不同的人工智能模型中提取“草稿纸”并对其进行各种操作——打乱顺序、删除词语、添加虚假答案——来测试这一观点。以下是他们的发现,用简单的类比来解释:
1. “打乱的拼图”类比(顺序无关紧要)
想象学生的思维过程是一幅拼图。我们曾认为,必须按特定顺序将拼图块拼合起来才能看到完整的画面。
研究人员将拼图块(文本行)扔进搅拌机,然后以随机顺序倒出来。
- 结果:学生几乎 100% 的情况下仍然得出了正确答案。
- 关键点:如果打乱单词内部的字母(例如将"math"变成"htam"),学生就会失败。但如果只是打乱句子或行的顺序,学生完全不在乎。
- 启示:人工智能不需要线性的故事。它只需要看到散落在桌面上的所有拼图块。它无需按顺序阅读就能找到解决方案。
2. “骨架与血肉”类比(稀疏性)
我们曾认为学生需要整个故事——解释的“血肉”——才能得出答案。研究人员通过剥离所有“血肉”(英语单词、解释、以及“因此”和“因为”等词)来测试这一点。
- 实验:他们移除了字母表中的所有字母,只留下数字、符号和最终答案。
- 结果:学生实际上在寻找答案时表现得更好了!“血肉”(散文)只是噪音。
- 骨架:唯一重要的是数字和数学符号。如果你移除了数字,学生就会得零分。如果你保留数字但移除单词,学生依然能成功。
- 启示:人工智能忽略了故事,只关注数学骨架。
3. “假新闻”类比(鲁棒性)
最后,研究人员问道:“如果我们欺骗学生怎么办?”他们取出了正确答案,并在页面上添加了虚假答案。他们将虚假答案“答案是 123"出现的频率设置为真实答案的三倍。
- 预期:你可能会认为学生会感到困惑,并选择出现频率最高的答案(即虚假答案)。
- 结果:学生完全忽略了噪音,每次都选择了正确答案。
- 启示:人工智能不仅仅是在计算某个答案出现的次数。它是在审视数字的逻辑和结构。虚假答案无法欺骗它,因为它们不符合数学“骨架”。
主要结论
这篇论文得出结论:这些人工智能模型实际上并不需要写出长篇、完美、按顺序的故事来解决问题。它们更像是在勘察犯罪现场的侦探:它们不在乎线索是整齐排列还是散落在地板上,也不在乎证人冗长、啰嗦的陈述。它们只需要找到能解决案件的具体数字和符号。
这为什么重要?
该论文表明,由于人工智能不需要“故事”或“顺序”,我们未来或许能让人工智能思考得更快。与其一步步地写出一篇漫长、缓慢的故事,我们或许可以一次性生成所有必要的“线索”(数字和符号),从而节省大量的计算能力和时间。
重要提示:这篇论文仅证明了人工智能可以从被打乱、被剥离的思维链中找到答案。它尚未证明我们可以以这种方式生成思维链,但它为这种可能性打开了大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。