What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering
本文介绍了简单且可扩展的技术,以证明隐式规划(即语言模型将中间令牌导向未来目标如押韵或答案的机制)是一种普遍能力,甚至存在于参数量仅为 10 亿的小型模型中,从而为人工智能安全与控制提供新见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一位魔术师从帽子里变出一只兔子。你可能会想:这位魔术师是在开始表演之前就已经计划好要变出一只兔子,还是仅仅在把手伸进帽子的瞬间才“神奇地”决定变出一只兔子?
长期以来,科学家们认为大型语言模型(LLM)——即聊天机器人等工具背后的 AI 大脑——就像那些没有提前计划的魔术师。他们相信,AI 仅仅是根据前一个词来预测下一个词,就像鹦鹉学舌一样,完全不知道句子会走向何方。
这篇题为《计划是什么?》(What's the Plan?)的论文认为,AI 实际上是一位战略架构师,而不仅仅是一只鹦鹉。它表明,这些模型在说话的同时,正在秘密地规划未来的步骤。
以下是作者如何通过简单的类比来证明这一点的:
1. 两种类型的规划
作者将规划定义为两个部分,就像诗人创作诗歌一样:
- 前向规划(蓝图): 在写下句子的后半部分之前,AI 会在其大脑中创建一个隐藏的“蓝图”。它知道:“我需要用与'cat'押韵的词来结束这一行。”
- 后向规划(构建): 在写下句子的中间词汇时,它会微妙地塑造这些词汇,以确保能够顺畅地抵达那个以"cat"结尾的终点。这就像一位司机在距离转弯处还有 100 米时,就提前开始减速并变道,即使他们尚未到达那个转弯处。
2. 实验:押韵与问答
为了证明这一点,研究人员并没有让 AI 撰写复杂的文章,而是给它布置了两个简单的任务:
- 押韵: 他们给 AI 诗歌的第一行,并要求它用特定的韵脚完成第二行(例如,如果第一行以"brick"结尾,第二行必须以"stick"、"trick"或"sick"结尾)。
- 问答: 他们提出了需要特定语法规则才能回答的问题,例如在"a"和"an"之间进行选择(例如:"a whale"与"an eye")。
3. “遥控器”把戏
这是论文中最酷的部分。研究人员并没有只是观察 AI,而是在句子写到一半时黑进了它的大脑。
想象一下,AI 正在写一首诗。就在它写完第一行时,研究人员使用“遥控器”(一个数学向量)来微调 AI 的大脑。
- 微调: 他们告诉 AI 的大脑:“忘掉你正在考虑的韵脚。现在,规划韵脚'-ight'(如 light 或 night)。”
- 结果: AI 并没有仅仅改变最后一个词。它重写了句子的中间部分。
- 没有微调时: "Soaring above where true joy will sing."(在真 joy 将歌唱的地方翱翔。)
- 有微调时: "Soaring above bathed in a golden light."(沐浴在金色的光芒中翱翔。)
AI 将"where true joy will"这样的词改为了"bathed in a golden",因为它必须搭建一座通往新目的地("light")的桥梁。这证明了 AI 在整个过程中都在脑海中持有计划,并根据新计划调整了路径。
4. “小大脑”的发现
论文中的一个重大惊喜是,即使是小型 AI 模型也会这样做。
此前,科学家们认为只有庞大且超级复杂的模型才能提前规划。作者发现,即使是仅有10 亿参数(在 AI 世界中相对较小)的模型也在进行这种规划。这不仅仅是“超级智能”模型的特性,而是这些模型运作方式的基本习惯。
5. “冠词”测试
他们还用类似“你用什么来看?”(答案:an eye)的问题进行了测试。
当他们微调 AI 去思考"heart"(需要"a")时,AI 甚至在写下"heart"这个词之前,就立即开始使用"a"而不是"an"。
这就像一个人说:“我想买a……"然后停顿下来思考一个以辅音开头的词,而不是说“我想买an……"然后意识到自己犯了错。AI 在开始旅程之前就已经知道了目的地。
总结
该论文声称:
- AI 会提前规划: 它在到达目的地之前,会创建一张想去哪里的隐藏地图。
- 它会调整路径: 如果你在旅途中改变目的地,AI 会改变它到达那里的步骤,而不仅仅是最后一步。
- 它无处不在: 这种现象发生在小型模型和大型模型中,也发生在诗歌和简单问题中。
作者在这篇特定论文中并没有利用这一点来构建新应用或解决安全问题;他们只是想证明,AI 的“魔法”不仅仅是随机猜测——它是一种隐藏的、隐式的规划形式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。