Journey Operators for Structured Multi-Axis Composition
本文引入了一个用于结构化多轴数据组合的理论框架,该框架通过将旋转位置嵌入(Rotary Position Embeddings)推广到内容自适应设置中的“旅程算子”(journey operators)来实现,确立了交换性作为路径无关性的条件,并提出了 JoFormer 模型,以利用这些归纳偏置来提升在视觉、语言及长度泛化任务中的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图建造一座巨大的、神奇的图书馆,其中的每一本书都知道自己应该在书架上的确切位置。在人工智能的世界里,特别是那种能够阅读句子或观察图像的人工智能中,“书”就是像单词或像素这样的数据片段。长期以来,计算机一直非常擅长理解这些片段“是什么”(内容),但它们在理解这些片段彼此之间“在哪里”(相对位置)方面却一直有些吃力。这被称为“位置编码”(positional encoding)。你可以把它想象成数据的 GPS:如果没有它,计算机可能知道句子中有“狗”和“人”,但它无法知道是狗咬了人,还是人咬了狗。
为了解决这个问题,科学家们使用数学方法,根据数据所处的位置给每一个数据片段一个微小的、隐形的“旋转”。想象一下,每当你向右移动一步,指南针的指针就会轻微旋转一下;每当你向下移动一步,旋转的角度也会不同。如果你先向右移动再向下移动,指针最终停留的位置,应该与你先向下移动再向右移动的结果是一致的。这种通过移动空间并追踪方向的思想,正是我们要探讨的这篇论文的基础。它提出了一个简单但深刻的问题:我们能否让这些“旋转”完美地协同工作,从而让计算机理解世界的结构——无论是一行文本、一个像素网格,还是一个 3D 体积?
数据的旅程
这篇题为《用于结构化多轴组合的旅程算子》(Journey Operators for Structured Multi-Axis Composition)的论文,引入了一种看待数据在 AI 内部如何移动和混合的新方式。作者们(由 Mahesh Godavarti 领导)提出了一个框架,在这个框架中,每一 piece 数据不仅携带其内容(如“猫”这个词或红色的像素),还携带了一个针对其可以移动的每一个方向的微小“变换”或“旋转”。
让我们用一个有趣的类比:想象每一个数据点都是一名带着背包的旅行者。在标准的 AI 模型中,背包里只装着旅行者的物品。但在这种新框架下,每位旅行者还为他们可以行走的每一个方向(上、下、左、右)携带了一个特殊的“指南针”。当两名旅行者相遇并结合他们的故事时(这就是 AI 处理数据的方式),第一位旅行者会使用他们的指南针,在两人合并之前,先旋转第二位旅行者的背包。这种旋转会改变第二位旅行者讲述故事的方式,而这种方式取决于第一位旅行者站在哪里。
论文将这个过程称为“旅程”(journey)。如果你想知道位于 A 点的数据与位于 B 点的数据之间有何关系,你需要计算“旅程算子”——即如果你从 A 走到 B,所会经历的总旋转量。
重大发现:“平坦”世界 vs. “弯曲”世界
这篇论文中最令人兴奋的部分是发现了一个决定这些“旅程”是否合理的规则。作者发现,为了让 AI 理解“向右移动再向下移动”等同于“向下移动再向右移动”(这种性质称为路径无关性/path independence),这些指南针(旋转)必须是对易的(commute)。
用数学术语来说,“对易”意味着运算的顺序并不重要。如果你将一张纸向右旋转 90 度然后再向下旋转 90 度,这与先向下旋转再向右旋转的结果是不同的——除非你的旋转是特殊的。论文证明,如果旋转是“平坦的”(意味着它们作用于数据中相互独立、互不干扰的部分,比如独立旋转 X 轴和 Y 轴),那么旅程就是一致的。但如果旋转是“弯曲的”(即它们会互相干扰),那么旅程将取决于你所走的具体路径,这会让 AI 感到困惑。
论文建议,构建这些 AI 模型最好的方法是坚持在“平坦”机制下运行。这解释了为什么现有的方法如 RoPE(旋转位置嵌入)之所以如此有效:它们自然地使用了这些对易的、平坦的旋转。论文表明,如果你尝试使用更复杂的、“弯曲的”旋转(例如稠密且纠缠在一起的旋转),你会失去拥有一致方向感的能力,位置结构就会崩溃。
新模型:JoFormer
基于这一理论,作者设计了一个名为 JoFormer(基于旅程的 Transformer)的新模型。这里的核心创新在于,JoFormer 不仅仅使用这些旋转来帮助 AI 评分(即计算一个词应该在多大程度上关注另一个词,这是旧模型所做的);它还利用这些旋转在数据被组合之前对实际数据(即“数值”)进行变换。
可以这样理解:在旧模型中,AI 可能会说:“我对‘狗’这个词感兴趣,因为它靠近‘吠叫’。”而在 JoFormer 中,AI 会说:“我对‘狗’这个词感兴趣,并且我还会根据它距离我的远近来旋转‘狗’的含义,使其完美地融入我当前的句子中。”
论文在三种不同类型的任务上测试了 JoFormer:
- 视觉(图像): 他们在 CIFAR-100 和 ImageNet 上进行了测试。结果表明,添加这种“数值旋转”(旋转数据)有助于模型更好地观察。例如,在 CIFAR-100 上,特定版本的 JoFormer 比标准方法提高了约 2% 的准确率。在 ImageNet 上,它看到了较小但持续的增益(0.40%)。
- 语言(文本): 他们在维基百科语言模型上进行了测试。结果表明,新模型(特别是那种旋转取决于文本内容的“投影”版本)能更好地预测下一个词,其“困惑度”(衡量模型感到惊讶程度的指标)比标准模型更低。
- 长度泛化能力: 这是一个很酷的测试。他们用短句子(512 个词)训练模型,然后让它阅读长得多的句子(高达 4096 个词)。标准模型会变得非常混乱,性能大幅下降。然而,JoFormer 处理长文本的表现要好得多,其性能下降幅度极小(仅为 1.02 倍),而标准模型的性能下降则非常显著(6.29 倍)。
论文明确表示它 没有 做的事情
明确说明这篇论文 并非 在声称什么非常重要。作者非常谨慎地表示,这些结果是“单种子随机实验的合理性检查”(single-seed sanity checks)。这意味着他们只是通过一次特定的随机起点实验来验证该想法在原则上是否可行,而不是声称他们已经构建了世界上最顶尖的 AI。他们承认,目前的结果还不是“最先进的”(state-of-the-art)基准测试结论。
他们还排除了某些想法。例如,他们证明了如果你尝试使用一个完整的、复杂的旋转系统(全正交群 )而不是更简单的、平坦的旋转,AI 会失去所有的位置感。这就像是在一个每个路标都指向不同、混乱方向的城市中导航,模型会直接放弃对位置的感知。
总结
简单来说,这篇论文认为,让 AI 理解结构的秘诀不仅仅在于增加更多的数据或更大的计算机,而在于给数据一个一致的、数学上的“指南针”,无论你如何转向,这个指南针都能保持一致。通过确保这些指南针不会互相冲突(对易),并利用它们在网络中移动时实际旋转数据,作者创建了一个模型(JoFormer),该模型表明对于处理图像、文本和长序列,这是一种更稳健的方法。
虽然论文并不声称解决了所有问题,但它提供了一张强大的理论地图,展示了为什么某些方法有效,并为构建更聪明、更有结构的 AI 系统提供了一条充满希望的新路径。实验表明,这种方法具有真正的、可观察到的收益,尤其是在处理长输入或复杂视觉模式时,但探索其潜力的旅程才刚刚开始。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。