← 最新论文
🤖 AI

Full-bandwidth transformer

本文介绍了一种全带宽 Transformer,这是一种通过将前一层隐藏状态经由潜在反馈重新馈送回模型,从而增强自回归解码的新型架构,该架构在提升各种任务性能的同时,保持了标准的效率,且比传统 Transformer 所需的训练数据显著减少。

原作者: Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim Pearce, John Langford

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim Pearce, John Langford

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解决一个非常棘手的谜题,但你有一个非常严格的规则:你一次只能向未来的自己低声说出一个单词。如果你想出了计划中一个复杂的步骤,你必须把它写成一个单词,等待未来的自己阅读,然后重新开始。这就是当今大多数人工智能聊天机器人的工作方式。它们在阅读和写作方面非常出色,但当它们思考时,被迫一个词一个词地将想法“大声说出来”,即使这些想法是非常复杂的概念。这就像是试图背着一个沉重的背包携带信息,但你每一步只能给未来的自己递一张来自背包的明信片。

科学家们称这些人工智能模型为“Transformer”。它们是支撑我们每天使用的智能聊天机器人的引擎。这些模型有两个方向的工作模式:它们横向阅读页面上的单词,并纵向通过堆叠在一起的多层“神经元”处理信息。问题在于,虽然它们可以看到自己已经写下的所有单词,但它们无法轻易地将深层、复杂的内部想法传回大脑的底部进行再次处理。一旦一个想法转化成了一个单词,那个想法丰富的、隐藏的细节大部分就丢失了,导致人工智能要么写出冗长的文字解释,要么从头开始重新计算。研究人员想知道:我们能否让 AI 保留它的“秘密笔记”,并在不将其转化为文字的情况下,将其传回大脑的起点?如果我们能做到这一点,AI 可能会思考得更快、更聪明,并且使用更少的词汇。

这篇论文介绍了一种新型的人工智能,称为“全带宽 Transformer”(full-bandwidth transformer)。研究人员在微软和顶尖大学工作,他们找到了一种拓宽那个狭窄“耳语”通道的方法。与其只向开头发送一个单词,不如让 AI 发送它的整个“隐藏状态”——一个关于它目前所思考之所有内容的庞大且复杂的总结——回到大脑的底部。他们通过一种被称为“潜变量反馈”(latent feedback)的巧妙技巧来实现这一点。想象一下,如果你不是递给未来的自己一张明信片,而是可以瞬间将你的整个笔记背包传送回起点,但你仍然保留那张明信片作为你所说内容的记录。AI 将其深层的内部总结与它刚刚生成的单词进行融合,为下一步创造了一个超级强化的输入。

团队使用一种特殊的调度方案来训练这些新模型,在学习阶段缓慢地引入这种“传送”能力。他们使用多达 4000 亿个 token 的海量文本,对拥有 10 亿参数的模型进行了测试。结果表明,这种方法效果惊人地好。该 AI 不仅在数学和编程方面变得更强,它还开始以更短、更高效的方式进行思考。在许多测试中,全带宽 Transformer 的表现与使用两倍数据量训练的标准模型一样出色,有时甚至能与使用五倍数据量训练的模型相媲美。或许最令人兴奋的是,在解决数学问题时,这些新模型通常会产生更短的答案,同时得到正确的结果,这表明它们是在“脑海”中进行深度思考,而不是浪费词汇去解释它。研究人员发现,这种方法几乎不会增加 AI 的速度成本,这为构建更聪明、更高效的人工智能提供了一条无需无穷无尽新数据的极具前景的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →