Do Models Read What They Write? Causal Registers in Scratchpad Reasoning
本文证明了通过训练在草稿纸(scratchpad)中编写中间状态的大型语言模型,实际上是将这些编写的状态作为后续推理步骤的因果输入,而不仅仅是为了人类的可读性而生成它们。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是对论文《模型是否在读它所写的内容?》(Do Models Read What They Write?)的解释,采用了通俗易懂的语言和日常类比。
核心问题:模型是在“说话”,还是真的在“思考”?
想象你正在观察一名学生做数学考试。学生在纸上(即“草稿纸”)写下解题步骤,最后写出最终答案。
- 我们的期望: 我们希望这个学生是真的在利用那张纸进行数学运算。如果你能神奇地改变他们写下的某个数字,他们的最终答案应该随之改变,以匹配新的计算结果。
- 我们的担忧: 我们担心这个学生可能只是在“演戏”。他们可能已经在脑海中解出了题目,而那张纸只是他们为了显得聪明而编造的一个故事。如果改变了纸上的数字,他们的最终答案依然保持不变,因为他们从未真正通过看那张纸来进行计算。
这篇论文探讨的是:当 AI 模型写下其思考步骤时,它们是真的在利用这些步骤来推导下一步,还是仅仅在编造一个故事?
实验方法:“魔法橡皮擦”测试
为了找到答案,研究人员为 AI 设计了一个非常具体且简单的游戏。
游戏规则:
想象一个机器人在一个微小的 2x2 网格上移动。
- 机器人从一个位置开始(例如:左上角)。
- 它接收到一个指令进行移动(例如:“翻转第一个比特”)。
- 机器人写下它当前所在的位置。
- 它接收下一个指令,写下新位置,以此类推。
棘手之处在于,机器人有一个隐藏的“相位比特”(就像一个秘密开关),这个开关会根据移动的顺序而改变。两条不同的路径可能会结束在同一个可见位置,但其背后的秘密开关设置却不同。
测试方法(“魔法橡皮擦”):
研究人员让 AI 玩这个游戏并写下它的步骤。然后,他们进行了一次“外科手术式”的操作:
- 他们保持书面文本完全不变。纸上仍然显示:“我在 A 点,开关为 ON。”
- 他们悄悄改变了 AI 的内部大脑状态。尽管纸上写着“ON”,但他们在 AI 的记忆中将那个“秘密开关”翻转成了“OFF”。
- 他们要求 AI 进行下一次移动。
问题在于:
- 如果 AI 只是在编造故事,它会忽略内部的变化。它会看到纸上写着“开关为 ON”,因此会基于“开关为 ON”来计算下一步。
- 如果 AI 真的在利用状态,它会感受到内部的变化。它会意识到:“等等,我的内部开关实际上是 OFF。”于是它会基于“开关为 OFF”来计算下一步,即便纸面上写的并不是如此。
实验结果:谁通过了测试?
研究人员测试了三种类型的 AI 模型:
- 预训练模型(Pre-trained Model): 从互联网学习但未专门学习过这个游戏的模型。
- “最终答案”模型(Final Answer Model): 被教导解决这个游戏,但只写出最终结果,不写步骤的模型。
- “运行状态”模型(Running State Model): 被教导在每一步过程中都要写下当前状态的模型。
研究发现:
- “故事讲述者”(预训练模型与“最终答案”模型): 当研究人员秘密翻转内部开关时,这些模型并不在意。它们继续根据纸上写的内容来预测下一步。它们忽略了自己的内部现实。
- “真正的思考者”(“运行状态”模型): 当研究人员秘密翻转内部开关时,这些模型改变了它们的预测。它们根据新的内部开关进行计算,忽略了文本内容。
在“运行状态”模型中,书面文本不再仅仅是一个报告,它已经变成了一个工作变量。模型实际上是在阅读自己的笔记来进行数学运算。
“为什么这很重要”的类比
想象一个计算机程序。
- 糟糕的监控: 程序在屏幕上打印“我正在保存文件”,但在后台,它实际上正在删除文件。如果你把屏幕上的文字改为“我正在删除”,程序并不会在意,因为文字只是一个显示界面。
- 良好的监控: 程序有一个真实的变量叫做
file_status。如果你在代码中改变了这个变量,程序的行为会立即发生变化。
这篇论文证明了,通过训练 AI 写下中间步骤(即“运行状态”),我们可以将这些步骤转化为 AI 真正使用的实际变量。
“因果性”证明
研究人员并未止步于此。他们还进行了额外的测试,以确保 AI 不是在瞎猜或模仿其他例子。他们运行了:
- “移动交换”测试(The "Move Swap" Test): 他们在保持内部状态被编辑的同时,改变了指令(例如,将“向右移动”改为“向左移动”)。AI 根据新的指令正确地改变了答案,这证明了它能够结合状态与指令进行计算。
- “复读机”测试(The "Copycat" Test): 他们试图诱导 AI 从另一个例子中复制未来的答案。AI 没有复制,而是根据当前情况重新进行了计算。
结论
论文得出结论:为了实现 AI 安全性和监管,我们不能仅仅寄希望于 AI 会写下它的想法。我们需要以一种特定的方式进行训练,使这些书面想法成为其实际计算过程的一部分。
通过这种方式,当这种训练完成后,“草稿纸”就不再仅仅是一份记录(发生了什么的记录),而变成了一个控制面板(一个我们可以介入并改变 AI 思考方式的地方)。
简而言之: 论文表明,通过正确的训练,可以教会 AI 模型“读懂它所写的内容”,从而将其书面的推理过程转化为大脑中真实、可用的部分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。