← 最新论文
🔬 materials science

Phase Space Attention:A Hairer Lift Circumvents the Single-Layer Induction Obstruction

本文提出了一种独特的、无参数的辛相空间注意力机制,该机制通过对查询流和键流应用 RoPE 后的上剪切变换,规避了单层归纳障碍,从而在实现高效归纳能力的同时保持极低的计算开销,并揭示了其最优性能对通道结构的至关重要的依赖性。

原作者: Kingsuk Maitra, Shagun Sood Morteza Hosseini, Suman Gunnala, Vikram Gupta

发布于 2026-09-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Kingsuk Maitra, Shagun Sood Morteza Hosseini, Suman Gunnala, Vikram Gupta

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,最强大的模型经常被比作巨大的图书馆,计算机在那里阅读一本巨著以寻找特定的答案。但为了让这些机器能够装进我们的口袋、戴在我们的手表上,或者运行在汽车和家电中的微型计算机内,它们必须足够小,能够容纳在单个芯片上。这便产生了一个根本性的问题:机器越小,它在当下通过少量示例进行学习就越困难。科学家们称之为“语境学习”(in-context learning)。这是指机器观察到一个模式(例如单词及其含义的列表),并能立即将该模式应用于新问题,而无需重新训练。多年来,研究人员认为,这些小型机器中的单层处理过程在数学上无法完成这项任务。这就像是机器的大脑存在一个硬性极限,一道无论喂入多少数据都无法逾越的高墙。这种局限性意味着,对于数十亿台设备而言,即时学习的能力是不可能的,迫使工程师们在“过于庞大而无法适配的智能设备”与“过于笨拙而无法学习的小型设备”之间做出选择。

高通(Qualcomm)的一组研究人员发现了一种绕过这道墙的方法,他们不是通过制造更大的机器,而是通过改变机器观察自身记忆的方式。他们发现,这些模型的标准信息连接方式缺失了一个至关重要的上下文要素:即时的过去。在典型的设置中,当模型试图将问题与之前的答案进行匹配时,它将答案视为一个静态的快照。它未能意识到这个答案是一个序列的一部分,是紧随其他内容之后而来的。研究人员意识到,通过添加一个简单的数学运算,强调当前信息与前一个信息之间的差异,模型突然就获得了观察模式的能力。他们将这种新方法称为“相空间注意力”(Phase Space Attention)。这是一种借鉴自物体运动物理学的技术,在其中,仅仅了解粒子的位置是不够的;你还必须知道它的动量,即它移动的速度和方向。通过将句子中词汇的流动视为具有动量的运动物体,模型终于能够仅凭单层处理就能完成复杂的归纳任务。

研究人员并非仅仅靠猜测来验证其有效性,而是通过严密的数学证明并在现实世界中进行了测试。他们证明了这种新方法允许单层模型解决此前需要两层才能解决的问题,从而在不增加额外内存或降低计算机速度的情况下,有效地将小型模型的处理能力翻倍。在针对包含 400 万到 9200 万个参数的模型进行的实验中,他们发现,当开启这种新的“动量”特性时,模型的归纳学习速度显著提升。在一项测试中,带有此特性的模型在大约 700 步内学会了该任务,而没有此特性的相同模型则需要近 2700 步,甚至有时完全无法学会。这是一个巨大的效率提升,表明新方法让机器能够更直接地找到解决方案。

然而,团队非常谨慎地区分了他们的理论预测与实际观察到的现象。他们开发了一个精确的数学公式,根据模型内部记忆的大小来预测该新方法何时会发挥作用。虽然他们的公式预测了一个特定的转折点,但实际训练出的模型在低于公式建议的设置下就开始表现出改进。这一差距告诉我们,虽然理论提供了一张可靠的地图,但这些学习机器的真实行为比纯数学描述的更加灵活。研究人员还测试了这种新方法是否会破坏现有的运行在手机及其他设备上的模型软件。他们证明了该方法不需要更多的内存来存储对话历史,不会降低处理速度,并且能完美兼容工程师用于压缩小型设备模型的标准工具。唯一的改动是在代码中进行微小的调整,添加几行代码来计算单词在被处理前的“动量”。

研究还揭示了一个关于如何构建最佳模型的惊人细节。研究人员测试了该新方法的不同版本。一个版本将动量计算对称地应用于问题流和答案流,创造了一个完美的对称系统。另一个版本则仅将其应用于答案流。直觉相反的是,对两个流进行不同处理的版本在学习示例的具体任务上表现得更好。对称版本虽然在数学上很优雅且有助于理解系统的底层结构,但在实践中的准确性略逊一筹。这一发现表明,对于构建高效小型设备的工程师来说,最有效的方法是将计算重点放在持有关键信息的系统部分,而不是试图实现完美的平衡。

这项工作之所以意义重大,是因为它为资源极其有限的设备上的真正智能助手打开了大门。多年来,人们一直认为语境学习需要一种无法装进手机或手表的庞大且复杂的架构。通过展示一个简单的、有数学依据的微调如何能在单层处理中解锁这种能力,研究人员为下一代边缘计算提供了蓝图。该方法不需要新的硬件或海量的数据;它只是改变了现有组件之间的交互方式。其结果是,模型不仅变得更聪明,而且更高效,能够在用户所在的设备上实时从少量示例中学习。研究人员已将其所有的实验和计算过程公开,以便他人查证,确保他们发现的路径对整个科学界都是开放的。

这一发现的影响超出了让手机变得更聪明本身。它挑战了该领域长期以来的一个假设,即某些任务对于单层模型来说在本质上是不可能完成的。通过证明障碍并非架构的硬性限制,而是模型处理数据时缺失的信息片段,研究人员将关注点从构建更大的模型转向了构建更聪明的模型。核心洞察在于,上下文不仅关乎“存在什么”,更关于“它是如何存在的”。通过关注数据的运动与变化,而非仅仅关注数据本身,模型获得了对试图学习的模式的更深层理解。这种基于运动物理学和对称数学的方法,提供了一种思考人工智能的新方式,它优先考虑效率与清晰度,而非单纯追求规模。

最后,论文针对一个阻碍了先进人工智能部署到日常设备上的问题,提出了一个清晰且可操作的解决方案。研究人员表明,通过将标准的注意力机制提升到动量至关重要的“相空间”,他们可以规避那些曾被认为无法逾越的理论极限。该方法在模拟中得到了证实,在训练模型中得到了验证,并确认了与现实世界硬件约束的兼容性。这是一个罕见的案例,即理论突破能直接转化为实际的工程优势,为即将需要自主学习与适应能力的数十亿台小型设备指明了道路。这项工作证明了用全新的视角看待旧问题的力量,即有时解决方案并不在于增加复杂度,而在于理解那些已经存在的简单动力学机制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →