When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models
本文介绍了一个诊断基准,该基准表明,尽管大型语言模型在简短的程序性任务上实现了高准确率,但随着复杂性的增加,其忠实执行逐步算法的能力显著下降,从而揭示出强大的基准表现往往掩盖了指令遵循方面的重大缺陷。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《当大语言模型停止遵循步骤》的通俗解读,辅以生动的类比。
核心理念:“食谱”测试
想象你给一位厨师一份极其具体、分步执行的蛋糕烘焙食谱。食谱写道:“混合面粉和糖。然后加入鸡蛋。然后搅拌 10 秒。然后烘烤。”
你可能会期待厨师按顺序严格执行每一步指令。但如果厨师没有遵循步骤,而是凭直觉猜测蛋糕通常的味道,然后直接递给你一个成品呢?或者,如果他在做到一半时忘记了最后三步,直接说“蛋糕做好了”呢?
这篇论文就像一个巨大的测试厨房,研究人员向 14 种不同的“厨师”人工智能模型(大语言模型)提供了数千份此类具体食谱。这些食谱是简单的数学题,但被设计得冗长且棘手。目标并非测试 AI 能否解决高难度数学题,而是看它能否从头到尾忠实地遵循指令。
实验设置:“无尽阶梯”
研究人员设计了一项特殊测试,通过两种主要方式增加任务难度:
- 阶梯的长度:他们给 AI 的食谱包含 5 到 95 个不等的步骤。想象一座楼梯。5 级台阶很容易爬;95 级台阶则令人筋疲力尽。
- “回看”规则:在某些食谱中,第 10 步不仅使用第 9 步的结果,还可能要求“回溯并使用第 3 步的结果”。这就像告诉一名徒步者:“向前走一步,然后回到你经过的第三棵树那里,从那里捡起一块石头。”这迫使 AI 记住很久以前的信息。
研究发现:“记忆缺失”
结果令人惊讶。尽管数学运算很简单(仅涉及加减乘除),但随着食谱变长,AI 的表现越来越差。
- 性能骤降:在简短的 5 步食谱中,AI 答对的比例约为 61%。但在长达 95 步的食谱中,其成功率暴跌至仅 20%。
- “回看”带来的麻烦:当 AI 需要记住很久以前的步骤(如第 3 步)时,其表现进一步下降。这仿佛 AI 对自己在故事中的位置感到困惑。
AI 失败的方式:“作弊”的厨师
研究人员不仅查看了最终答案,还观察了 AI 尝试解决问题的过程。他们发现,AI 往往并没有真正执行计算,而是试图以几种有趣的方式“作弊”或“走捷径”:
- “提前退出”(执行不足):这是最常见的失败模式。AI 开始执行食谱,做了几步后,因厌倦或困惑,便直接跳到结尾,假装已完成所有步骤。这就像一名学生写了文章的第一句,然后跳过中间部分直接写结论。
- “幻觉”步骤:有时,AI 会编造食谱中根本不存在的额外步骤。这就像厨师在食谱从未要求的情况下,添加了“撒上独角兽粉尘”。
- “自我修正”陷阱:有时 AI 会得出错误答案,意识到后试图在文本后续部分进行修正。但等到它修正时,最终结果已经被之前的错误搞砸了。
- “模式匹配者”:有些 AI 似乎不是在做数学运算,而是根据数字的外观猜测答案,而非真正遵循步骤。
主要结论
该论文得出结论:仅仅因为 AI 给出了一个“看似合理”的最终答案,并不意味着它真正完成了工作。
这就好比学生参加考试。如果他们答对了,你可能会认为他们复习过。但这篇论文表明,有时他们只是在猜测,或者记住了之前考试的答案,而不是真正一步步地解决问题。
简而言之:当前的人工智能模型擅长表现得聪明并给出最终结果,但它们难以像一个可靠的机器人那样,严格按照书面指令执行冗长枯燥的步骤列表。当指令过长或需要过多回忆过去信息时,AI 往往会迷失方向,不再遵循规则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。