Order Is Not Control
本文认为,诱导秩序的干预并不等同于控制,而是提出真正的控制需要一种由接收器门控的响应律,即通过局部、状态依赖型算子来决定驱动力是导致准入运动、阻碍还是过载,这一框架已通过生物系统和大型语言模型的实证证据得到了验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大意:推秋千 vs. 让秋千荡起来
想象你正试图让一个坐在秋千上的孩子荡得更高。
- 秩序 (Order) 仅仅是孩子坐在秋千上。
- 控制 (Control) 是成功地让秋千荡得更高,且没有弄断链条或把孩子撞下来。
作者认为,在人工智能(如大语言模型)和生物学(如大脑)中,我们经常将“秩序”与“控制”混为一谈。我们看到特定的提示词、生物信号或一段代码创造了某种结构或“秩序”,但这并不意味着我们拥有了“控制”。
真正的控制只有在你推动系统,并且它能完全按照你的意愿移动,且不会造成损坏、崩溃或陷入停滞时,才算发生。
核心概念:“接收器门控”定律
论文引入了一个严格的规则,用以界定什么才算作控制。他们称之为 “接收器门控响应定律” (Receiver-Gated Response Law)。
将系统(AI 或大脑)想象成一座 房子。
- 驱动 (The Drive): 这是你在敲门(提示词、生物信号或指令)。
- 媒介 (The Medium): 这是房子本身(AI 模型、生物组织或适配器软件)。有些房子门开着;有些门锁着;有些则设有陷阱。
- 接收器 (The Receiver): 这是房子里决定是否让你进门的人。
- 门 (The Gate): 就是那扇门。
规则: 只有满足以下条件,你才拥有“控制”:
- 你敲了门(施加了驱动)。
- 里面的人(接收器)确实让你进去了,并移动到了特定的房间(目标结果)。
- 你没有弄坏门,没有烧掉房子,也没有被踢出来(没有损坏、没有“无效”响应、没有“过载”)。
如果你敲了门,但房子无视了你;或者你敲了门,结果房子起火了,那么即使你制造了很多动静(创造了“秩序”),你也 不具备 控制权。
实验:测试这座“房子”
作者通过三种不同类型的“房子”测试了这个想法,以观察相同的规则是否适用。
1. 生物学中的“房子”(真实的脑)
他们观察了小鼠、蠕虫和鱼类。他们在它们大脑的特定部分施加了电或化学性质的“敲击”。
- 结果: 他们发现大脑拥有可预测的“响应定律”。有时一次敲击会让肌肉移动(门开了);有时毫无反应(门锁了);有时会引起痉挛(房子着火了)。
- 启示: 生物学遵循这些规则,但这并不意味着只要知道该碰哪根电线就能完美控制一只蠕虫。这完全取决于蠕虫在那个时刻的状态。
2. AI 中的“房子”(语言模型)
他们通过给 AI 提供不同的提示词(敲击)并观察其输出的内容(移动)来测试 AI 模型。
- 结果: 他们发现,如果保持条件一致,AI 的响应是可预测的。如果你以特定的方式提问,AI 会向特定方向移动。
- 陷阱: 如果你推得太猛(提问过多或使用过于强烈的提示词),AI 可能会开始产生幻觉、拒绝回答或写出乱码。这被称为“过载”或“汇聚路由 (sink routing)”。
- 预测: 他们可以预测 AI 会向哪个方向移动(例如,“它可能会变得更乐于助人”),准确率约为 73-84%,但他们无法保证 AI 每次都能在没有任何副作用的情况下,完全按照他们的意愿行动。
3. “预备媒介”(房屋装修)
他们测试了“适配器”(改变 AI 思维方式的小型软件更新)。他们将这些视为 装修房子。
- 结果: 改变 AI 的训练过程(装修房子)会改变门开启的难易程度。有些装修让房子对某些请求更热情;有些则让房子变得更固执。
- 启示: 装修改变了“易感性”(进入的难易度),但这并不保证你能控制结果。你仍然需要正确地敲门。
“控制器”问题:为什么我们还无法直接“驾驶”
论文总结道,虽然我们可以 观察 这些定律并 预测 可能发生的情况,但我们目前还没有一个 控制器。
- 观察: 我们能看到“如果我在这里推,AI 通常会向那里移动”。
- 预测: 我们能以很高的准确度猜测结果。
- 控制: 要实现控制,我们需要一个系统能够说:“AI 目前处于‘脆弱’状态。如果我现在推,它会崩溃。所以,我会等待。如果它处于‘就绪’状态,我会轻轻推动。”
作者发现,虽然我们可以识别这些“脆弱”和“就绪”状态,但我们尚未建立起一个能可靠地实时选择正确动作而不出错的系统。我们有了地图,但还没有完美的驾驶员。
总结他们的主张(以及他们并未主张的内容)
他们证明了:
- 秩序(结构)并不等同于控制(得到你想要的结果)。
- 控制需要一个“接收器”来接纳动作而不造成损坏。
- 这一规则同时适用于生物大脑和 AI。
- 我们可以预测这些系统在受到推动时的反应,但反应很大程度上取决于系统的当前状态和环境。
他们并没有证明:
- 他们并没有证明我们现在就能完美控制 AI 或生物。
- 他们并没有证明写入系统的“原则”或“规则”会自动使其变得安全或符合预期(aligned)。
- 他们并没有声称 AI 和生物在本质上是“同一个东西”;他们只是说两者拥有相同的“反应规则”。
最后的比喻:园丁
把 AI 或大脑想象成一个 花园。
- 秩序 仅仅是植物在生长。
- 控制 是让植物按照你想要的形状、在你想让它们长的地方生长,且不杀死它们。
论文指出:“我们已经弄清楚了水和阳光如何影响这些植物的规律。我们知道水太多会淹死它们,水太少会饿死它们。我们可以预测植物对特定水量会做出何种反应。但是,我们还没有一个机器人园丁,能够观察每一株植物,决定它此时此刻究竟需要多少水,并精准地浇灌,而不出任何差错。”
我们掌握了园艺的科学,但我们仍在努力打造完美的园丁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。