The Quantum Shortcut: Complex Phase-State Dynamics Reduce the Optimization Steps of Sequence Models
本文表明,通过将标准的实值隐状态基底替换为复值且受量子启发的替代方案,可以显著加速状态空间模型和基于注意力机制的序列模型的训练收敛,尽管长期的性能优势仅在状态空间架构中持续存在。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能,特别是那些编写文本、翻译语言以及预测句子中下一个词的系统,依赖于一种特定的数学引擎。这些引擎通过让信息在一系列层级中传输来处理信息,就像信号通过一根长导线一样。几十年来,构建这些引擎的标准方式是使用实数,即我们在日常生活中熟悉的计数数字和十进制小数。在标准的设置中,引擎通过保持其内部信号强度来记忆过去的信息。然而,随着信息在时间维度上向后回溯,这些信号自然会趋于减弱,就像在长廊中逐渐消逝的低语。当信号变得过小时,机器实际上会忘记句子开头的发生的事情,这使得它难以从长序列数据中学习。这种衰减是当前设计的根本局限性,迫使研究人员使用海量的数据和时间来教机器如何记忆。
一组研究人员发现了一种绕过这种衰减问题的方法,即改变机器思考时所使用的数字系统本身。他们没有仅仅依赖实数,而是构建了一个使用复数的语言模型版本。实数只有一个数值,而复数携带两个截然不同的信息:大小和方向(或角度)。研究人员发现,通过将重要的信息存储在角度而非大小中,机器可以传输得更远而不会丢失记忆。即使信号的大小在通过网络时缩小,角度依然能保持完美且清晰不变。这使得机器能够保留句子开头的上下文,直到句子的结尾,而信号永远不会因衰减而陷入沉默。
研究人员通过构建两种不同类型的语言模型来测试这种新方法,一种基于标准设计,另一种基于较新的、更高效的设计。他们为每种模型都创建了一个“复数”版本,将实数替换为复数,然后用三种不同的文本集对其进行训练,范围从 100 MB 的小型集合到 15 GB 的海量数据。结果令人震惊。在较新的、基于状态空间的模型设计上,复数模型仅用大约三分之一的训练步数就达到了与标准模型相同的准确度水平。在较旧的、传统的架构设计上,它则用了大约一半的步数达到相同水平。这意味着新模型在消耗显著更少的数据和时间的情况下,学习到了相同数量的信息。
这项发现之所以特别稳健,是因为这种优势在出现之初就显现了出来,但两种设计的行为随着训练的进行而产生了分歧。研究人员观察到,复数模型从训练的前一百步开始就取得了领先。至关重要的是,他们发现这种加速的性质在两种架构之间存在差异。在较新的设计(状态空间模型)中,复数模型与标准模型之间的差距随着训练的进行而不断扩大,这表明这种优势是新设计的永久特征,而非过程开始时的短暂现象。然而,对于较旧的设计(注意力机制模型),这种优势在开始时最为显著,随后逐渐减弱,并随着训练的推进趋向于零。尽管存在这种衰减,但早期的提升仍然非常可观,足以将该特定架构的训练时间缩短一半。
研究人员非常谨慎地确保这种加速并非仅仅由增加计算能力或改变模型规模所导致。他们精确地匹配了两个版本的模型,使其具有完全相同的可调节参数,差异不到百分之一。他们还使用了完全相同的训练计划和计算机硬件。这种严格的控制证实,速度的差异完全来自于向复数的转变以及机器处理它们的方式。研究也排除了复数模型仅仅是由于初始条件较好而获得成功的可能性;在不同规模的文本和不同模型架构下表现出的持续优势,指向了机器学习方式的一种根本性改进。
这项工作的最有趣之处之一在于它改变了机器处理冲突信息的方式。在标准模型中,如果机器不确定一段序列代表的是年份还是价格,它必须通过缩小内部信号使其消失来主动抑制其中一种可能性。而在复数模型中,机器可以旋转信号的角度。如果两种可能性存在冲突,机器可以通过一种被称为“干涉”的过程旋转它们,使它们相互抵消,类似于降噪耳机通过产生与噪声完全相反的声波来消除噪声。这使得机器能够在不丢失正确想法强度的前提下,丢弃错误的想法,这是标准模型无法实现的能力。
研究人员指出,虽然复数模型学习得更快,但也存在一些实际的权衡。目前用于这些任务的计算机芯片是针对实数优化的,因此运行复数模型在每一步都需要更多的处理能力。对于较新的模型设计,这种额外的成本意味着,尽管它需要的训练步数更少,但训练模型的总时长与标准版本大致相同。然而,复数模型在达到相同质量时消耗的数据量要少得多,这对于数据稀缺的专门化任务来说是一个巨大的优势。对于较旧的模型设计,研究人员还没有开发出优化后的标准模型版本进行对比,因此目前尚无法确定复数版本在现实世界的时钟时间内是否更快,但其数据效率的提升是显而易见的。
这项工作表明,选择什么样的数字系统与选择什么样的模型架构同样重要。多年来,研究人员一直专注于改变机器路由信息的方式,但这项研究表明,改变机器思考的“语言”可以产生更大的收益。复数模型不仅仅是学得快了一点,它们从根本上改变了学习的效率,以极小比例的数据达到了高性能水平。研究人员总结道,虽然他们目前的版本是一种放宽了理论严格数学规则的实践性改编,但这足以证明复数方法在大规模应用中的有效性。他们已经发布了所有的代码和训练日志,邀请他人验证结果,并探索这种新的思考方式将如何改进下一代人工智能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。