Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve
该论文指出,随着大语言模型的改进,标准的少样本思维链(few-shot Chain-of-Thought)提示往往会通过引入干扰性的格式和风格约束来阻碍性能,使得简单的零样本(zero-shot)方法在推理任务中更为有效。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何解开谜题。在很长一段时间里,教导机器人的最佳方法是给它看许多示例,由人类写出思考过程中的每一个步骤,就像一份详尽的食谱。这种方法被称为“思维链”(Chain-of-Thought)提示词,它就像是给机器人一本训练手册,上面写着:“第一步,做这个;第二步,做那个;最后,这是答案。”对于那些容易直接猜答案、缺乏思考能力的旧型、简单型机器人来说,这种方法效果显著。
但现在,我们已经制造出了更聪明、更先进的机器人。这些新模型阅读了无数书籍,并独立解决了大量谜题,因此它们即使在没有指令的情况下,也能自然而然地开始循序渐进地思考。它们拥有内在的逻辑罗盘。科学家们现在面临的一个重大问题是:如果机器人已经知道如何思考,它还需要我们通过详细的食谱来牵着它的手吗?或者说,这份食谱是否反而会干扰它,让它因为过于纠结于如何书写思考过程而感到困惑?这篇论文深入探讨了这个问题,旨在观察我们旧有的教学方法是否正在阻碍我们最新的、最聪明的学生。
“过度引导”的机器人:当过度的帮助反而有害时
在这项研究中,研究人员决定测试一些目前最顶尖的数学解题机器人。他们想看看使用传统的展示示例法(few-shot prompting)是否仍然是获得优质答案的最佳方式,还是说这种方法实际上会让机器人的表现变差。
你可以这样理解:想象你是一位已经烹饪多年的顶级大厨。你完全知道如何在没有食谱的情况下做出完美的舒芙蕾。现在,想象有人递给你一张便签,上面写着:“首先,打碎鸡蛋。然后,搅拌它们。最后,以350度烘焙,”并坚持要求你严格遵守。你可能会感到烦躁,或者你可能会因为太专注于完美遵循便签上的指令,而忘记了自己的烹饪直觉。你甚至可能因为被这些指令分散了注意力,导致菜肴失败。
研究人员发现,这正是现代人工智能正在发生的情况。当他们要求这些先进的“推理专用型”模型使用标准方法——即向它们展示人类解决类似问题的几个示例——来解决数学问题时,模型的表现反而下降了。
例如,以一个名为 Mathstral 的模型为例。当研究人员让它在没有任何示例的情况下自主解决问题(即“零样本/zero-shot”方法)时,它的正确率约为 83.8%。但当他们给它那份标准的“训练手册”,即包含人类编写的示例时,它的得分降到了 74.2% 左右。这是一个巨大的差距!这就像机器人为了努力模仿示例的风格和格式,反而忘了去真正进行数学计算。
论文指出,这是因为标准示例强迫机器人去适应其写作风格。它必须担心格式、遵循特定的句子结构,并试图挤进一个并非为它量身定制的框架中。这产生了一种“引导-分心”的权衡(guidance-distraction trade-off)。引导(示例)本意是提供帮助,但对于这些超级聪明的模型来说,它变成了一个干扰项,将它们的注意力从核心任务——解决问题——上拉开了。
“让我们思考”的小技巧:依然有用,但不再神奇
研究人员还测试了一个更简单的技巧,叫做“零样本思维链”(Zero-Shot CoT)。在这种情况下,你不需要展示任何示例,只需在问题后面加上一句“让我们一步步思考”。
对于较旧的通用型机器人(如 Llama 模型),这个技巧仍然非常有效。它能显著提升它们的得分,像是一个温柔的提醒,唤醒它们的推理能力。然而,对于这些超级聪明的推理专用型模型,这个技巧带来的提升微乎其微。对于 Mathstral 来说,得分仅从 83.8% 提升到了 86.1%。
作者认为,这是因为这些模型本身就已经非常擅长循序渐进地思考了,所以它们不像以前那样需要这种提醒。他们将其比作计算机科学的早期阶段:当时工程师必须手动设计程序的每一个功能。最终,计算机变得足够聪明,能够自主学习这些功能,使得手动设计变得不再必要。论文指出,“让我们一步步思考”这句话正变得像那些旧的手动功能一样:它曾经至关重要,但现在只是一个改变不大的微小补充。
为什么旧的方法失效了
最令人惊讶的发现之一是,即使研究人员尝试通过使用模型自身生成的示例(从而使风格保持一致)来解决问题,对于最聪明的模型来说,这种方法仍然无法超越简单的“无示例”方法。
事实证明,问题不仅仅在于示例是否来自人类,而是在于示例的“结构”。通过强迫模型遵循特定的模式,你限制了它以最适合自己的方式解决问题的天然能力。论文明确指出,对于推理专用型模型,增加示例数量或挑选“更好”的示例并不能解决这个问题。事实上,他们发现,对于最先进的模型,你越试图用示例来引导它们,就越可能阻碍它们。
总结:信任机器人的直觉
那么,这意味着人工智能测试的未来是什么?作者建议我们需要改变衡量这些模型的方式。长期以来,标准测试是展示给模型几个示例,看它模仿得如何。但本文表明,对于最新的、最聪明的模型来说,这种测试是不公平的。这就像是通过让赛车手在学校区域内限速行驶来测试他们的水平;这无法展现他们的真实速度。
相反,研究人员主张我们应该直接向模型提问,不提供任何示例或特殊指令,看看它们自主能发挥出怎样的水平。这种“零样本”方法能更真实地反映模型的实际能力。
该论文并不认为思维链提示法会永远消失。对于较简单的模型,或者对于那些需要一点点帮助的特定任务,它可能仍然有用。但对于那些“重量级选手”——即专门为推理而设计的模型——旧的教学方式正在变成一种干扰。随着这些模型变得越来越聪明,它们需要的不再是引导,而是思考的自由。要看清它们到底有多聪明,最好的办法或许就是停止牵着它们的手,让它们用自己的方式去解开谜题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。