Approximate Equivariance via Projection-based Regularisation
本文提出了一种基于投影的正则化方法,该方法在算子层面针对整个群轨道上的非等变性施加惩罚,为训练近似等变神经网络提供了一种比现有基于样本的方法更高效、更有效的替代方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人识别物体。你希望机器人明白,无论咖啡杯是直立、倾斜还是侧躺,它仍然是一个咖啡杯。在机器学习领域,这种无论模式如何旋转或平移都能识别其规律的能力,被称为等变性。
很长一段时间里,科学家们通过“硬编码”规则来构建机器人,以确保这种对称性。这就像制造一辆汽车,其方向盘只能向左或向右转动,绝不允许驾驶员漂移。这让汽车在遵循规则时非常安全且高效,但有时又过于僵化。如果道路有轻微弯曲,无法完美契合这些规则,汽车就会举步维艰。
最近,工程师们开始制造没有这些硬性规则的汽车,让驾驶员(人工智能)自己去摸索。这些汽车速度更快、更灵活,但它们有时会对以前未曾见过的旋转感到困惑。
本文介绍了一种新的驾驶方式:基于投影正则化的近似等变性。
以下是他们所做工作的简要说明:
问题:“基于样本”的方法
以前,如果你想要一辆既灵活又能保持某种对称性的汽车,你会使用一种称为“采样”的方法。想象一下,你试图教机器人具备旋转感知能力。你会拍一张杯子的照片,将其随机旋转 10 个不同的角度,展示给机器人看,并说:“嘿,这仍然是一个杯子!”
问题出在哪里?这太慢了。这就像要求一名学生为了学习一个概念而参加 10 次测验。计算机必须为每一张图片执行大量额外的工作(前向传播),从而拖慢了整个进程。
解决方案:“投影”方法
作者提出了一种更聪明的方法。与其让机器人猜测 10 个不同角度的答案,不如给机器人一面数学镜子。
把机器人的大脑(神经网络)想象成一个巨大的、杂乱的房间,里面堆满了家具(数据和权重)。
- 旧方法:你在房间里走来走去,拿起一把椅子,旋转它,放下,再拿起,用不同的方式旋转,然后检查它看起来是否正确。这耗时极长。
- 新方法:你拥有一台神奇的投影仪。你一次性照亮整个房间。投影仪瞬间将房间分成两堆:
- A 堆:所有完美对称的东西(“好”家具)。
- B 堆:所有杂乱且不对称的东西(“坏”家具)。
本文的方法精确计算出"B 堆”长什么样,并轻轻推动机器人将其剔除。它不需要检查 10 个不同的角度;它只需进行一次精确的数学计算(即“投影”),就能看出机器人距离完美对称还有多远,并将其推回正轨。
为什么这很重要?
- 速度:因为他们不再逐个检查随机角度,机器人学习速度快得多。论文显示,在去除 CT 扫描中的金属伪影任务中(想象一下清理因金属植入物导致的模糊 X 光片),他们的方法比旧的采样方法快 50% 到 60%。
- 灵活性:机器人不必被强迫做到完美对称。有时,现实世界的数据并不完美(也许一只肾脏与其孪生兄弟略有不同)。该方法允许机器人“大部分”保持对称,但只需打破规则到足以适应怪异数据的程度。这就像一位舞蹈教练,告诉你保持节奏,但如果音乐变化,允许你即兴发挥一步。
- 通用性:这既适用于简单的旋转(如旋转正方形),也适用于复杂的连续旋转(如在三维空间中旋转球体)。
“魔法”数学
本文使用了一个称为傅里叶空间的概念(这就像将一首歌从歌词翻译成乐谱)。在这种数据的“乐谱”版本中,数学变得非常简单。作者表明,要让机器人具有对称性,你只需要将某些音符(杂乱的部分)归零,并对其他音符进行平均。这就像编辑一首歌,通过静音走调的音符并平滑其余部分,而不是将整首歌重新录制 10 次。
现实世界测试
团队在三个主要方面测试了这种方法:
- 玩具问题:他们让机器人学习识别略微晃动的形状。机器人学会了在适当的时候忽略晃动,但在晃动是实际线索时则予以关注。
- 烟雾模拟:他们预测了烟雾在房间内的运动。即使烟雾没有完美对称地移动(由于风或障碍物),他们的方法也比刚性模型更好地预测了未来。
- 医学成像:他们清理了带有金属植入物的 CT 扫描。他们的方法比之前的“采样”方法生成了更清晰的图像,并且速度快得多,允许一次性处理更大批次的图像。
结论
这篇论文为我们提供了一种新工具,用于构建足够聪明以知晓规则,又足够灵活以在必要时打破规则的人工智能,同时其运行速度比以往快得多。这就像将一个必须检查地图 10 次才能找到路线的机器人,升级为一个能瞬间看清整张地图并一眼选出最佳路径的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。