← 最新论文
🤖 machine learning

TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling

本文介绍了一种名为 TANGO 的新型语言模型架构,该架构通过使用跨标记门控残差更新(cross-token gated residual update)取代标准的 Transformer 子层,从而在数学和教育数据集上实现了卓越的性能,同时其线性复杂度的变体 WANGO 也超越了现有的线性时间模型。

原作者: Joshua Nunley

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Joshua Nunley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,理解语言最强大的工具依赖于一种被称为“Transformer”的结构。想象一位读者正在扫描一篇长文档:为了理解一个特定的词,他们必须回顾出现在该词之前的词汇,以把握上下文语境。标准的AI模型通过两个截然不同的步骤来完成这一过程。首先,它们扫描整个文本的历史,以收集来自过去词汇的相关信息,这个过程类似于图书管理员快速定位出与某个主题相关的所有书籍。其次,它们将收集到的信息通过每一个位置上独立的、单独的过滤器进行处理,以精炼其含义。这种“两步舞步”在领域内一直表现良好,但计算量巨大,因为随着文本变得越来越长,模型在生成每个新词时都需要进行大量的计算。研究人员长期以来一直在寻求一种合并或简化这些步骤的方法,希望能够构建出既更聪明又更高效的模型,使其能够处理海量信息,而不会被处理这些信息所需的庞大数学运算所拖累。

印第安纳大学布鲁明顿分校的一位研究人员引入了一种全新的方法,从根本上重塑了这些模型与语言交互的方式。他们将这一创造物称为 TANGO,代表“标记聚合非线性门控算子”(Token-Aggregated Nonlinear Gating Operators)。TANGO 不再将信息收集和信息精炼这两个步骤分开,而是将它们合并为一个统一的动作。在这种新设计中,句子中的每一个词都充当了控制源。当模型阅读时,每个词都会生成一组特定的指令,即“门控”(gates),这些指令决定了在不同文本特征上投入多少权重。当模型读到一个新词时,它不仅仅是回顾过去以寻找最相关的词,它还会回顾那些过去的词准备好了什么样的指令。随后,它会对这些指令进行平均,并利用它们来缩放(或调整)当前词的特征,然后再将其添加到模型的记忆中。这意味着,过去一个词的影响力不仅在于它说了什么,还在于它如何告诉当前的词去如何解读自身。

研究人员开发了两个版本的系统,以测试准确性与速度之间的不同权衡。第一个版本是 TANGO,它会查看当前词之前出现的每一个词,无论这些词在文本中离得有多远。这种“全前缀”(full-prefix)方法允许模型汲取整个对话或文档的历史信息,从而实现对上下文的高度准确理解。然而,由于它必须将当前的词与之前每一个词进行比较,其工作量会随着文本变长而迅速增长。第二个版本被称为 WANGO,它针对极长文本采取了一种更务实的方法。它会密切关注最近出现的词,并以对待第一个模型那样详尽的全历史方式来处理它们。对于落在近期窗口之外的较旧词汇,WANGO 使用了一种更高效的方法来总结它们的影响力。它维护着一个由这些旧词生成的指令的运行总计,从而能够在不重新计算与每一个词的关系的情况下,吸收它们的智慧。这种修改使得 Wango 模型的负载随文本长度增加呈直线增长,而不是在复杂度上爆炸式增长,从而使其在处理长序列时更加快速。

为了观察这些新设计在现有技术面前的表现如何,研究人员使用完全相同的数据、相同数量的参数以及相同的训练计划训练了六个不同的模型。他们在三个非常不同的挑战任务上测试了这些模型:一个大规模的教育类网络文本集合、一个用名为 Lean 的编程语言编写的正式数学证明库,以及来自 DeepMind 的一系列数学问题。结果显示,拥有全历史视图的 T多少 TANGO 模型在所有三项测试中都实现了最高的准确度,在预测序列中的下一个词时表现出了最可靠的预测能力。它的表现优于所有其他模型,包括那些使用传统方法在层间共享参数的模型。Wango 模型同样表现出色,特别是在旨在追求效率的模型类别中。在那些能够处理长文本且计算成本不会失控的架构中,Wego 产生了最准确的结果。它甚至击败了一个计算量相近但依赖于较旧标准技术的模型。

这项研究强调了构建此类系统的一种重要转变。通过允许词汇通过这些聚合门控来控制其他词汇的处理,研究人员发现了一种创建既强大(在 Wango 的情况下也是高效)的模型的方法。TANGO 模型证明,即使在模型被迫进行更多数学运算的情况下,通过单一的、统一的步骤来收集和精炼信息,也能超越传统的两步处理过程。与此同时,Wango 模型证明了这种高水平的性能并不一定以牺牲速度为代价;通过智能地总结旧信息,它在保持高准确度的同时,使计算成本保持在可控范围内。研究人员谨慎地指出,这些发现是基于模型预测序列中下一个词的能力(这是衡量语言理解能力的标准指标),并不意味着这些模型一定能够完美地解决数学问题或编写证明。然而,结果表明,这种新的信息门控方式为构建能够以更高精度和效率理解复杂语言及长上下文的 AI 提供了一条充满前景的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →