An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models
本文表明,在连续代码世界模型中,仅凭采样验证来接受由大语言模型合成的规划器是极其危险且不足的,因为这种方式往往会遗漏关键的非连续模态,从而导致灾难性的规划失败,而这类失败只能通过针对性的干预而非随机采样来可靠地识别。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的世界里,一种流行的策略是让机器首先建立一个关于世界运作方式的心理地图——这种地图通常被称为“世界模型”(world model)。这个模型可以预测如果采取特定行动,接下来会发生什么。一旦机器拥有了这张地图,它就会使用规划算法来模拟成千上万种可能的未来,寻找能导致最佳结果的动作序列。长期以来的假设是,如果这个心理地图在它所见过的数据上足够准确,那么将其用于规划就是安全的。如果这张地图在千次测试运行中都能正确预测未来,它就被认为是一个可靠的指南。
然而,一项新的研究挑战了这一假设,该研究探讨了当世界包含机器在训练期间从未遇到过的罕见、突发事件时会发生什么。想象一辆学习在平坦道路上行驶的汽车,但从未见过墙壁。如果墙壁足够罕见,以至于汽车在训练期间从未撞到过它,那么机器的心理地图可能干脆会忽略墙壁的存在,假设道路会永远延伸下去。危险在于,当机器最终在现实世界中尝试驾驶时,它可能会规划一条直接冲向那面看不见的墙壁的路径,并相信自己可以穿过去。研究人员提出的问题是:一种标准的安全性检查(即通过随机采样世界样本来测试机器的地图)是否能在造成碰撞之前,捕捉到这种特定类型的盲点。
为了回答这个问题,研究人员设计了一系列受控实验,使用了简单的物理模拟,如沿轨道移动的小车或摆动的单摆。在这些模拟中,他们引入了一个“罕见规则”:一个硬性停止机制,例如墙壁或地板,如果物体触碰到它,就会立即停止物体的运动。他们让一个大语言模型编写机器心理地图的代码,但他们刻意在模型的训练数据中隐藏了这面墙的存在。模型只被展示了那些恰好避开了墙壁的随机移动的小车或单摆运动。因为墙壁很罕见,模型在训练过程中往往从未见过它。
结果是触目惊心的。当研究人员使用标准安全性检查(即通过运行数千个随机场景来观察模型是否与真实物理规律相符)来测试模型时,模型经常能够通过测试。它们被接受为“正确”的,因为在数千次随机测试中,从未触发过墙壁。然而,当这些经过“验证”的模型被交给规划器去控制系统时,规划器会自信地将小车或单摆直接驶向那面隐藏的墙壁。模型由于对墙壁没有概念,会预测物体可以从其位置直接穿过。规划器信任了这个错误的预测,从而驱动物体撞向墙壁,导致物体被卡住。此时,机器将无法达到目标,损失几乎所有的潜在成功率。研究发现,这种失败并非计算错误,而是一种根本性的知识差距:模型对一个存在但从未被采样到的规则视而不见。
研究人员发现,这种灾难发生的可能性遵循一个基于稀有度的精确数学模式。如果一个危险事件在一百次随机试验中发生一次,而安全性检查仅运行一百次,那么检查完全错过该事件的可能性是非常大的。如果检查运行一千次,错过该事件的概率会下降,但永远不会达到零。研究证明,只要训练数据不包含该罕见事件,任何巧妙的规划或模型优化都无法发现它。模型将保持盲目,而安全性检查由于其使用随机采样的本质,无法保证已经找到了这个盲点。
该研究还探讨了如果机器在训练期间被展示了墙壁,它是否能够学习该规则。在简单的、一维的任务中(如沿直线移动的小车),答案出人意料地积极。当模型看到哪怕几次小车撞击墙壁的例子时,大语言模型就能够写出停止小车的精确代码,有效地“修复”了它的心理地图。它完美地学习了这条规则。然而,研究人员随后将场景转移到了更复杂的二维环境,其中墙壁是平坦表面上的一个圆形区域。在这种情况下,即使模型看到了撞击该区域的过程,它也无法从证据中推断出正确的形状和位置。模型并没有学习到圆形的规则,而是发明了错误的形状,比如直线或正方形,或者只是简单地让物体原地冻结而无法理解原因。模型无法从看到的少量例子中概括出完整的障碍物形状。
这一发现凸显了这些系统学习过程中的一个关键局限性。研究表明,虽然机器在简单的语境下非常擅长翻译被明确告知或展示的规则,但在从零散证据中推断复杂规则的形状和位置方面却表现挣扎。机器“自我修复”的能力高度依赖于问题的几何特性。在简单的情况下,它有效;在复杂的二维情况下,它失效。研究人员测试了各种帮助模型的方法,例如给予更多示例、改变提问方式或提供关于障碍物形状的提示。没有任何一种干预措施奏效。模型始终无法推导出二维补丁的正确规则,通常会用一个更简单的错误形状来替代。
这项工作的意义对于任何依赖人工智能控制物理系统的人来说都至关重要。它表明,基于随机采样的安全性检查不足以捕捉罕见但具有毁灭性的故障。一个模型可以通过它接受的所有测试,却仍然对某个特定的、罕见的事件存在危险的误判。研究证明,只要危险事件足够罕见以至于会被采样过程错过,模型就会保持盲目,而规划器会利用这种盲目性导致失败。确保安全的唯一方法是保证训练数据覆盖了这些罕见事件的边界,或者使用另一种不依赖随机性的验证方式。研究结论指出,尽管人工智能在从数据中学习方面表现出色,但它无法学习它从未见过的事物,而在物理世界中,那些它从未见过的事物,往往正是造成最大破坏的原因。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。