TESLA: Taylor Expansion of Sinusoidal Learnable Activations
本文介绍了 TESLA,一种基于可学习正弦组合的新型激活函数,该函数在理论上通过控制多项式阶数来增强泛化能力和鲁棒性,并在具有挑战性的 Parity 和 Forrelation 任务以及 ImageNet-100 等标准视觉基准测试中展示了卓越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
全局图景之谜
想象一下,你正在试图教一个机器人识别一张脸。你给它看一张照片,它先看鼻子,再看眼睛,然后看嘴巴。标准的计算机大脑(被称为神经网络)在处理这种“局部”侦探工作方面非常出色。它们使用简单的、阶梯式的开关(就像打开或关闭灯光一样)来识别微小的细节。这在识别照片中的猫或翻译句子时效果极佳,因为这类问题的答案取决于附近的线索。
然而,有些谜题更为棘手。想象一个游戏,有一排很长的电灯开关,而答案取决于整排开关的状态,例如:“开关开启的总数是奇数还是偶数?”要解决这个问题,机器人不能只看一个开关,甚至不能只看一小组开关;它必须同时计算所有的开关。这是一个“全局”问题。传统的机器人大脑在处理这类问题时表现挣扎,因为它们的结构被设计为首先观察微小的、局部的部分。它们经常会陷入困境,因为过于关注微小的细节而错失了宏观的全景。科学家们一直试图构建一种能够自然理解这些宏大、整体模式的机器人大脑,而无需将其规模做得极其庞大或深奥。这正是名为 TESLA 的新思路出现的地方。
音乐化激活的神奇之处
来自韩国航空宇宙研究院的研究人员提出了一个让这些机器人大脑进行“思考”的新方法。他们将这项发明称为 TESLA(泰勒展开的正弦可学习激活函数)。为了理解他们的做法,让我们来看看一个标准机器人神经元是如何工作的。通常,它接收一个输入,通过一个简单的、僵硬的开关,然后传递结果。这就像一扇门,只有当你用力推时才会打开,但它并不会真正地“歌唱”或改变它的曲调。
TESLA 用一个乐器取代了这个僵硬的开关。它不再是一个简单的开/关按钮,而是使用了正弦波和余弦波的组合——你可以把这些想象成像声音或海浪一样平滑、起伏的波浪。但神奇之处在于:TESLA 不仅仅使用一种波。它通过混合许多种不同的波来创作一首定制的歌曲,每种波都有自己的“音量旋钮”。机器人在训练过程中学会了如何调高或调低这些旋钮。
为什么这很重要?在数学世界中,这些波可以组合成看起来像复杂多项式(具有许多起伏的曲线)的形状。通过调节旋钮,机器人可以决定它的思维应该有多“扭曲”或多复杂。如果问题很简单,它就使用平滑的低频波;如果问题是一个棘手的全局谜题(比如那个奇偶开关游戏),它可以调高高频波,以捕捉那些标准机器人会错过的复杂的、整体性的模式。
破解“奇偶之谜”
团队在了一个著名的难题——**奇偶校验问题(parity problem)**上测试了这个想法。想象一串由 32 个开关组成的序列。机器人必须猜出开启的开关总数是奇数还是偶数。这对标准机器人来说是一场噩梦,因为答案取决于每一个开关与其他每一个开关之间的相互作用。
在实验中,研究人员使用 10 万个示例训练了这些搭载 TESLA 的机器人。尽管 32 个开关存在超过 40 亿种可能的组合(这意味着机器人看到的只是极小极小的一部分可能性),但 TESLA 机器人依然学得非常好。它在干净的数据上达到了近乎完美的准确率。更令人印象深刻的是,当研究人员开始干扰数据——通过故意翻转 3项 30% 的答案来“欺骗”机器人时——TESLA 机器人依然保持强韧,并能持续正确预测。
相比之下,使用传统开关(如 ReLU)甚至其他基于波形的机器人(如 SIREN)的“标准”机器人则完全放弃了。随着开关数量的增加,它们的准确率下降到了 约 50%,这并不比随机猜测“正反面”更好。然而,即使在数据嘈杂且混乱的情况下,TESLA 机器人依然能够洞察全局模式。
从数学谜题到现实世界的照片
研究人员并没有止步于数学谜题。他们想看看这种“音乐化”的思维是否也能帮助处理现实世界的任务,例如识别图像。他们在 ImageNet-100 数据集(包含 100 种不同类型的图像)上,利用 ResNet 和 Vision Transformer 等流行的机器人脑架构测试了 TESLA。
结果令人振奋。TESLA 机器人在识别图像方面的表现与标准机器人一样出色,但有一个关键区别:稳定性。当他们尝试在这些大型图像任务中使用其他基于波的方法(如 SIREN)时,机器人变得不稳定并无法学习。得益于对“音量旋钮”(作者称之为系数预算)的精心设计,TESLA 保持了冷静并能有效学习。它在实现这一目标时并未减慢机器人的速度,也没有显著增加其规模;其额外所需的工作量微乎其微,仅比通常情况多出约 1%。
这对未来意味着什么
论文指出,通过赋予机器人神经元调节自身“频率”和复杂性的能力,我们可以帮助它们解决需要观察全局而非局部的问题。作者证明了这种方法不仅是一个理论上的技巧,更是一个实用的工具,适用于从求解物理方程到识别面孔的各种领域。
虽然论文证明了 TESLA 在这些特定测试中表现异常出色,并表明它可以在许多领域作为标准开关的强大替代品,但研究人员也谨慎地指出,仍有更多值得探索的空间。他们计划研究如何让这些音乐化神经元在计算机芯片上运行得更快,以及它们如何帮助大型语言模型理解长篇且复杂的叙事。不过目前来看,TESLA 已成为一种聪明的全新方式,教机器去“聆听”数据的旋律,而不仅仅是计数音符。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。