What Iterated Self-Feeding Probes of Language Models Measure, and a test that separates the construction from the model
本文引入了一种严谨的测试,用于区分迭代自反馈语言模型实验中,由探针构建本身固有的伪影(如运动学损伤扩散)与真实的模型属性(如李雅普诺夫指数)之间的区别,从而揭示了以往关于相变的断言往往被错误地归因于模型而非方法论。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
侦探的困境:当工具本身成为线索
想象一下,你正试图弄清楚一种特定类型汽车引擎的工作原理。你无法将其拆解,因此,你建造了一个巨大的自动化测试赛道。你将汽车自身的废气重新引入其进气口,循环往复,观察引擎对自身废气的反应。这有点像科学家对待现代“大语言模型”(AI)的方式。这些 AI 系统就像是能够预测句子中下一个词的超级智能引擎。研究人员经常将 AI 的输出反馈给它自身,以观察它是否能修正自己的错误、进行更深层的思考或解决难题。这被称为“自我喂养”(self-feeding)或“迭代探测”(iterated probing)。
但棘手之处在于:当你建造一条测试赛道时,赛道本身是有规则的。也许赛道太颠簸,或者风向以特定方式吹袭,导致汽车摇晃。如果你看到汽车在摇晃,是因为引擎坏了,还是因为赛道太颠簸?在 AI 的世界里,科学家一直在测量诸如“AI 思维变化的速度”或“其答案的稳定性”等指标,并假设这些数字能告诉他们关于 AI 大脑的信息。这篇论文提出了一个简单而令人恐惧的问题:如果这些数字实际上只是在告诉我们关于我们建造的“测试赛道”的信息,而不是关于 AI 本身的信息呢?
大错混淆:是 AI 还是实验?
在这篇论文中,研究员 Nicolás Vera Zúñiga 设置了一个非常具体且略显古怪的实验来寻找答案。想象一个由 4096 颗珠子组成的巨大圆形项链,每颗珠子代表 AI 词汇表中的一个词(或“标记/token”)。AI 会观察特定位置周围的一小段珠子窗口,猜测该位置应该是什么珠子,然后用它的新猜测替换当前的珠子。它在项链上的每一个位置都进行这种操作,周而复始,且顺序随机。这创造了一个闭环,AI 根据自己之前的猜测不断重写自己的故事。
为了测试这一点,研究员创建了两个完全相同的项链。在第二个项链上,他在开始时仅翻转了其中一颗珠子。然后,他使用完全相同的随机数来决定替换过程,将这两个项链放入同一个模拟器中运行。如果 AI 的“大脑”具有敏感性,那么这颗被翻转的珠子应该会产生连锁反应,使两个项链随着时间的推移变得越来越不同。这被称为“损伤扩散”(damage spreading)。研究员测量了这种损伤扩散的速度(一个称为 的数值)以及其中保留了多少。
大惊喜:“相变”竟然不存在
研究员发现了一些令人震惊的事情。当他在极低“温度”下(这意味着强制 AI 表现得非常自信,且仅选择可能性最高的词)运行此实验时,系统突然崩溃了。项链停止了变化,并冻结在单个重复的词上(就像一台卡在“换行符”上的破旧唱片机)。这看起来像是一个剧烈的“相变”,类似于水瞬间变成冰。
研究员以极高的精度测量了这一转变,精确到了小数点后三位。这看起来像是关于 AI 模型行为的一个真实发现。然而,论文证明了这一转变属于实验本身,而非 AI。
以下是他们是如何知晓的:
- 对照测试: 他们在另一种构建方式不同的 AI 模型(“掩码语言模型”)上进行了完全相同的实验。这个第二模型即使在同样的低温度下也从未发生冻结。
- 机制分析: 他们意识到,冻结之所以发生,是因为第一个 AI 模型在挑选单词时存在一个特定的数学“陷阱”。这就像球滚入了一个深坑;一旦掉进去,就无法出来。这个坑的存在是因为实验规则(即强制 AI 更新珠子的特定方式),而不是因为 AI 有何特殊之处。
- 结论: 这个“相变”是一个“人为制造”的事件。它是测试赛道的属性,而不是汽车的属性。研究员承认,他们曾花了四个月时间以为自己发现了一项关于 AI 物理学的新定律,结果却发现自己只是发现了一个测量尺本身的奇特性质。
那么,实验到底测量了什么?
如果“相变”是假的,那么这个实验是否还传达了任何真实的信息?是的,但你必须非常小心地观察什么。论文引入了一个“判别器测试”(Discriminator Test)来区分噪声与信号:
- “构建”读数(噪声): 一些数值,例如损伤扩散的速度 (),是由实验的几何结构决定的。如果你改变窗口的大小或珠子的顺序,这些数值就会改变。如果你更换 AI 模型,这些数值基本保持不变。这些读数告诉你的关于实验,而不是 AI。
- “模型”读数(信号): 其他数值,例如“吸引子份额”(attractor share,即 AI 沉淀在某个特定词上的程度),在更换 AI 模型时确实会发生变化。如果你训练模型的时间更长,这个数值会移动。如果你切换到不同的 AI 架构,这个数值也会移动。这才是真正反映 AI 大脑的部分。
“陷阱”与撤回的结论
这篇论文也是一个关于统计学如何轻易误导自身的警示录。研究员列举了四次他们差点发表了错误的“发现”,原因在于他们没有正确检查数学逻辑:
- 他们曾使用一个规模过小、不足以成立的设置来测量“临界点”。
- 他们不小心在测试的不同部分使用了相同的随机数,使得结果看起来比实际更确定。
- 他们试图在一段实际上是平坦直线(零方差)的数据中寻找模式,这使得相关性看起来像是真实的,而实际上只是数据排序方式导致的巧合。
每一次,他们并不是通过同行评审,而是通过运行一个“已知答案”的测试(例如一个结果已知的模拟实验)并发现自己的工具给出了错误答案,才抓住了错误。
底线总结
这篇论文并没有赋予我们某种新的 AI 超能力。相反,它给了我们一副新的眼镜。它教导我们,当我们把 AI 的输出反馈给它自身时,我们将两种东西混合在了一起:AI 真正的智能和我们实验的人为规则。
核心启示是:我们不能仅仅看一个数字就假设它代表了 AI。我们必须玩一场“控制变量”的游戏:如果你改变 AI 而数字保持不变,那么这个数字属于实验;如果你改变实验而数字保持不变,那么这个数字属于 AI。论文证明,该领域一些最令人兴奋的“发现”,可能仅仅是我们举起的镜子所反射出的影像,而非我们正在观察的面孔。它是在呼吁科学家要保持谦逊,要检查自己的工具,并意识到有时,你发现的最有趣的东西,其实是你那把测量尺上的缺陷。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。