Emergent Neural Network Mechanisms for Generalization to Objects in Novel Orientations
本文表明,深度神经网络通过由对共享特征敏感的神经元将方向不变性从熟悉物体传播到新颖二维方向上的物体,从而实现对新颖二维方向物体的泛化,这一机制随训练数据的增加而增强,并模拟了类脑的泛化过程。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正在教一个孩子识别狗。你向他展示了一只金毛寻回犬在奔跑、睡觉和跳跃的照片。然后,你向他展示了一张贵宾犬的照片。尽管贵宾犬看起来与众不同,但孩子立刻就能认出:“那是一只狗!”他学到的是关于“狗”的概念,而不仅仅是某种特定的外貌。这种在面对新情况(尤其是当物体被侧过来或倒过来时)仍能识别事物的能力,是人类大脑和人工智能共同追求的圣杯。长期以来,科学家们一直感到困惑:为什么我们的“计算机大脑”——被称为深度神经网络(DNN)——在识别照片中的物体时表现出色,但当这些物体以它们从未见过的旋转方式呈现时,却往往会完全陷入混乱。这就像是一个机器人能识别桌子上的杯子,但如果把杯子横过来放,它就会认为那是一个完全不同的物体。理解这些数字大脑如何学习处理新的角度,对于现实世界至关重要,因为现实世界中物体每秒都在旋转、倾斜并改变视角。
这篇论文深入探讨了这个谜团,提出了一个简单而深刻的问题:这些计算机大脑是否可以通过观察几个例子来学会识别“新颖”方向的物体,还是说它们需要记住每一个角度?研究人员设计了一个巧妙的实验,他们使用了一组混合了“全方位观察”物体(展示了所有可能的旋转角度)和“部分观察”物体(仅展示了几个特定角度)的AI模型进行训练。随后,他们测试了这些“部分观察”的物体在被转动到全新的、“分布外”(out-of-distribution)的角度时的表现。结果非常引人入胜:AI确实可以泛化到新的角度,但仅限于非常特定的、可预测的方式。事实证明,如果你向AI展示足够多不同类型的“全方位观察”物体,它就会开始构建一种内在的映射图。这种映射图允许它识别旋转后的“部分观察”物体,但前提是这种旋转必须是简单的二维旋转(比如翻页)或是一种保持物体的影子或轮廓看起来依然熟悉的翻转。论文指出,这是因为AI的内部“神经元”(网络内部微小的处理单元)学会了识别特定的特征——比如机翼或车轮——这些特征即使在物体移动时也保持不变。这些经过“全方位观察”物体训练的特征检测器,似乎将知识“传播”到了“部分观察”的物体上,充当了让AI识别未知的桥梁。然而,作者也谨慎地指出,这并非魔法;AI在面对会遮挡部分物体结构的复杂3D扭转(自遮挡)时仍然表现挣扎,且这些发现是基于特定数据集的模拟实验,尚未成为一种普遍的智能法则。
飞机的旋转故事
把深度神经网络想象成一个非常勤奋但略显刻板的学生,正在努力学习字母表。如果你只向它展示红色的字母“A”,它可能无法识别蓝色的“A”或草写体的“A”。在计算机视觉领域,这个学生就是深度神经网络(DNN),而“字母”则是像飞机、汽车或奇怪几何形状之类的物体。大问题在于,这些网络通常在识别以它们训练期间未曾见过的角度转动的物体时表现得很糟糕。如果你训练网络识别一架直飞的飞机,然后给它看一架正在做滚转动作的飞机,网络往往会惊慌失措并说:“我不知道那是什么!”
本论文的研究人员想要弄清楚为什么会发生这种情况,以及是否存在一套隐藏的规则手册供网络遵循。他们并没有只是向AI投喂随机的照片;他们建立了一个非常具体的训练营。想象一下,他们有50架不同的玩具飞机。对于其中的一些飞机,他们向AI展示了所有可能的角度——正面、背面、倒置、侧面以及介于其间的任何角度。他们称之为“全方位观察”的飞机。对于其他的飞机,他们只展示了极小范围的角度,比如只展示了机头朝下的样子。这些被称为“部分观察”的飞机。
接着是测试环节。研究人员将这些“部分观察”的飞机旋转到全新的、“分布外”(OoD)的角度,而这些角度是AI从未见过的。AI会失败吗?还是它会以某种方式理解它?
“二维旋转”的魔力
答案是“既是也不是”,但带有一个非常有趣的转折。AI确实变得更擅长识别“部分观察”的飞机了,但前提是新角度必须是某种特定类型的旋转。
研究人员发现,如果物体的旋转方式看起来像是二维旋转(比如在桌面上转动照片)或者是一种保持物体影子(轮廓)相似的翻转,AI的表现就会很出色。例如,如果AI从正面看到一架飞机,它通常也能识别出背面的飞机,因为飞机从正面和背面看时,“影子”是非常相似的。这就像即便一个人转过脸去,你也能认出他的脸,因为你知道他的头部形状没有改变。
然而,如果飞机进行了复杂的3D扭转,从而遮挡了自身的某些部分(比如飞机进行滚转导致机翼挡住了机身的视线),AI就会感到困惑。论文指出,AI在处理这些“自遮挡”角度时会感到困难,因为它无法看到它所依赖的那些熟悉特征。
“特征侦探”理论
那么,AI是如何做到这一点的呢?作者提出了一个听起来非常像我们大脑运作方式的理论。他们观察了AI的“大脑”(神经网络)内部,并观察了其单个神经元是如何放电的。他们发现,某些神经元扮演着特征侦探的角色。
想象一个专门负责“机翼”的神经元侦探。当AI看到一架“全方位观察”的飞机时,这个侦探会学习到“机翼”是飞机的关键组成部分,无论飞机如何转向。这个侦探变得非常擅长在各种角度下捕捉机翼。现在,当AI看到一架新的飞机(即那架只被观察过几个角度的“部分观察”飞机)时,那个相同的“机翼侦探”依然存在。尽管AI没有见过这架特定飞机的所有角度,但侦探识别出了机翼,并说道:“嘿,我知道这个特征!这一定是一架飞机!”
论文指出,由“全方位观察”飞机学到的“不变性”(即尽管发生变化仍能识别的能力)被传播到了“部分观察”的飞机中。这就像“全方位观察”的飞机是老师,它们将关于“什么是飞机”的知识传递给了“部分观察”的学生。AI训练的“全方位观察”飞机越多,这种教学就越强有力,它识别那些棘手新角度的能力也就越好。
游戏规则
研究人员并非仅仅在猜测;他们建立了一个数学模型,用以精确预测AI会在哪些角度成功,在哪些角度失败。他们的模型包含三个主要成分:
- 微小角度旋转:如果新角度与AI所见的角度仅有微小差异,通常很容易。
- 面内旋转:如果物体只是平面旋转(如二维旋转),AI表现良好。
- 轮廓相似性:如果物体在新角度下的影子与旧角度下的影子相似,AI可以应对。
当他们用实际的AI结果来测试该模型时,两者完美匹配。该模型能以极高的准确度预测AI的成功率。这证实了AI并非在瞎猜,而是遵循着一套基于其观察世界的逻辑规则。
这对未来意味着什么
论文总结道,虽然这些计算机大脑目前还不完美,但它们正在做一些与生物大脑非常相似的事情。它们利用特定的特征来构建一种能够抵御旋转的“物体感”。然而,它们仍然存在局限性。它们处理复杂的3D扭转(即遮挡部分物体的动作)的能力还不如人类。作者建议,也许在未来,我们可以教这些网络通过视频(时间关联)而不是仅仅通过静态图片来学习,就像婴儿通过观察周围移动的事物来学习一样。
目前,这项研究为我们提供了一张清晰的地图,标示了这些AI系统在何处成功,又在何处失败。它告诉我们,如果我们想要更智能、能更好地在3D世界中导航的AI,我们需要帮助它们不仅理解物体长什么样,还要理解它们的影子和特征是如何随着旋转而变化的。这是一个小小的进步,但也是迈向构建能像我们一样真正感知世界的机器的一大步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。