A Coulomb Particle Model for Learning Kernel Attention in Transformers
本文提出了一种基于粒子的方法,通过利用库仑斥力正则化优化核-目标对齐,为 Transformer 注意力机制学习任务自适应的随机特征分布,从而在保持线性推理复杂度的同时,提高了准确性、校准度和鲁棒性。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教会一个机器人如何理解世界。为此,机器人需要一种衡量两个事物有多“相似”的方法。一张猫的照片是更像一张狗的照片,还是更像一张汽车的照片?在人工智能的世界里,这是通过一种被称为“核函数”(kernel)的东西来完成的。把核函数想象成一把测量相似度的特殊尺子。长期以来,科学家们必须在机器人看到任何数据之前就选定一把尺子并坚持使用它。这就像是用一把固定的尺子去测量房间,即使最后发现房间的形状是三角形而不是正方形,你也无法更换这把尺子。这往往会导致测量笨拙且结果不佳。
为了提高速度,研究人员发明了“随机特征”(random features)。他们不再使用一把完美但复杂的尺子,而是使用一袋许多简单的、随机的尺子。这让数学计算变得更快,就像从一个缓慢沉重的望远镜切换到一副轻便快捷的双筒望远镜。但问题在于:袋子里的尺子是随机选择的。有时你会得到一组很棒的尺子,但通常你会得到一堆完全不适合这项工作的尺子。大问题在于:我们能否教会机器人根据特定的任务,在不失去这种速度优势的前提下,挑选出属于它自己的最佳尺子组合?
这正是 eBay 团队在其论文《利用库仑粒子模型学习 Transformer 中的核注意力》中所试图解决的问题。他们将这个问题视为一场物理实验。想象一下,这些“尺子”(或随机特征)就像漂浮在水箱中的微小带电粒子。研究人员希望这些粒子能够排列成最完美的模式来解决问题。他们使用了两种相反的力量来引导它们。首先,一种“吸引力”将粒子拉向最能解释数据的形状(就像磁铁吸引铁屑形成特定的设计)。其次,他们加入了“排斥力”,类似于两个同极磁铁之间的相互排斥。这种排斥力防止了所有粒子聚集在一个点上,而是迫使它们分散开来,覆盖解空间的各个部分。
通过让这些粒子在这些力量的作用下翩翩起舞,该团队创建了一个能够自动学习任务最佳“尺子”的系统。他们在一种名为 Transformer 的 AI 上测试了这种方法,这种 AI 因理解语言而闻名。他们将该方法应用于“注意力机制”——即 AI 决定句子中哪些词语彼此重要的那个部分。结果令人鼓舞。在几项文本分类任务(例如将电影评论分为正面或负面)中,他们这种“学习型”注意力系统比使用固定随机尺子的系统更准确,并且在表达不确定性时表现得更好。
该论文表明,这种方法在不会减慢 AI 思维过程的情况下运作良好。虽然训练阶段(学习最佳粒子排列)需要多花一点时间,但实际使用过程依然保持快速,保留了使这些模型具有实用性的“线性”速度优势。作者展示了通过让 AI 利用这种粒子物理学方法学习自己的相似性规则,它可以成为一个更敏锐、更可靠的阅读者,在处理从合成谜题到现实世界句子分析的一切任务时,都能表现出更高的信心和准确度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。