LAWFUL: Law-Aligned Witness for Faithful Use of Latents
本文介绍了 LAWFUL,这是一个旨在解决关键可解释性差距的基础框架,用于验证神经网络不仅是在学习、而且是在内部利用形式化的物理定律,并通过证实 Mocap2Radar Transformer 在训练数据中并未包含该定律的情况下仍使用了多普勒频率定律,从而证明了这一点。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一位魔术师从帽子里变出一只兔子。你知道这个戏法奏效了,因为兔子确实出现了,但你并不知道它是如何发生的。是魔术师真的学会了某种秘密咒语,还是他们只是记住了某种恰好对兔子有效的特定手势?这就是当今科学家们针对人工智能所提出的重大问题。我们构建了极其擅长预测物理世界运作方式(比如球如何弹跳或声波如何传播)的“计算机大脑”(神经网络)。但是,这些计算机究竟是在“学习”物理定律,还是仅仅根据它们见过的模式在进行极其高明的猜测?
要理解这一点,我们需要观察两件事。首先是“定律”的概念,即宇宙遵循的严格规则,比如重力总是向下吸引物体。第二是“可解释性”,即窥视计算机大脑内部以观察它究竟在想什么的艺术。通常,当我们试图窥视内部时,我们只能看到计算机是否得到了正确的答案。但这就像是在检查兔子是否存在,却不去检查魔术师是否真的使用了魔法。最大的挑战在于,如何弄清楚计算机使用的是“真实的规则”还是仅仅是一个“幸运的猜测”,尤其是当这些规则涉及那些可以平滑且无止境变化的量(如速度或时间),而非简单的“开/关”开关时。
这正是名为 LAWFUL 的新框架派上用场的地方。把 LAWFUL 想象成一个针对计算机大脑的超级严厉的侦探。它不仅仅问:“你得到正确答案了吗?”它还会问:“即使我们用新情况来戏弄你,你是否也使用了正确的逻辑来得到那个答案?”研究人员构建了一个系统,来测试一个计算机模型是否真正理解了一个特定的物理定律:多普勒效应。你知道这个定律,比如当救护车从你身边驶过时;救护车向你驶来时,警笛声听起来音调较高,而当它远离你时,音调则会变低。该定律指出,这种音调的变化精确地取决于救之处移动的速度。
团队测试了一个聪明的计算机模型,该模型被训练通过人体运动的视频(例如带有发光关节点的舞者)和雷达数据来预测这种音调变化。这里最棘手的部分在于:计算机从未被告知人的速度或声音的音调。它必须完全依靠原始的视频和雷达信号自行推导出来。研究人员想要知道:这个计算机究竟是学习了多普勒效应的数学公式,还是仅仅背下了它在训练期间看到的特定舞蹈动作?
使用他们的 LAWFUL 侦探工具包,他们做了一件聪明的事。他们创造了“如果……会怎样”的情景。他们对舞者的视频进行了数学处理,在不改变左右运动的情况下,增加了或减少了舞者向雷达移动的速度。如果计算机真正理解了这一定律,它对音调的预测应该与速度的变化完美同步。如果它只是在瞎猜,那么预测结果就会变得混乱不堪。
结果非常迷人。这个计算机模型似乎确实理解了这一定律。当他们在从未见过的速度下进行测试时,它仍然能正确预测音调。但真正的奇迹发生在他们开始关闭计算机大脑的一部分,以观察哪些部分在发挥作用时。他们发现,计算机并不需要它的整个大脑来解决这个问题。事实上,他们识别出了模型内部的一个微小“电路”——仅仅是其注意力机制中的几个特定部分——负责了 91% 的正确物理计算。这就像是发现在一台巨大的时钟中,实际上只有三个特定的齿轮在驱动指针移动。
更酷的是,他们发现了这些“齿轮”是如何运作的。计算机不仅仅是在记忆数字,它还在使用一种特定的“注意力”模式来比较舞者在前后两帧之间的移动距离。它本质上是在进行实时的速度计算,就像人类物理学家那样,只不过是在它自己的数字大脑内部进行。这项研究表明,计算机确实学习了正式的物理定律,而不只是一个模式。然而,研究人员谨慎地指出,这只是针对一个特定定律和一种特定计算机模型的测试。虽然这是证明 AI 能够真正“理解”物理学的一大步,但它只是针对这一特定案例的原理验证,并不能保证每一个 AI 都能理解宇宙中的每一条定律。但就目前而言,我们已经有了一个证人,它告诉我们:是的,有时计算机真的在做数学题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。