RecurrentGPT: Expressive Depth through Recurrent Modulation in Transformers
RecurrentGPT 引入了一种循环深度 Transformer 架构,通过迭代一个带有门控调制机制的单一共享核心层,通过有效地以参数量换取自适应深度复用,实现了比标准深度 Transformer 更高的准确率和内存效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能已经达到了这样一个阶段:提升模型的智能程度往往意味着增加其重量。为了理解一个句子或编写一个故事,这些系统依赖于庞大的数学连接网络,即被称为“参数”的概念。在标准设计中,思维过程的每一步都会使用一组独特的连接。这种方法效果很好,但也产生了一个沉重的负担:为了增加推理的深度,工程师必须增加内存,而这会迅速变得昂elly且难以在物理硬件上进行管理。在追求深层、复杂思考的渴望与计算机内存的物理极限之间,存在着日益增长的紧张关系。
几十年来,科学家们一直知道,通过不断重复同一个简单的过程可以解决极其复杂的问题。这一理念植根于艾伦·图灵的基础性工作,它表明,一个系统并不需要一个庞大的独特工具库来思考;它可以通过反复应用同一个精炼的工具来实现智能。虽然现代语言模型在很大程度上已不再采用这种重复风格,而是倾向于堆叠许多不同的层,但一种新的方法试图将重复的力量带回,不是通过减慢系统的速度,而是通过让这种重复变得更聪明。其目标是创建一个能够通过不需要存储更多独特部件就能进行更深层“思考”的模型。
开罗德国大学、慕尼黑工业大学以及 Cerebras Systems 的研究人员开发了一种名为 RecurrentGPT 的新架构,以解决这个问题。他们没有构建一条由许多独特层组成的长链,而是设计了一个可以被多次重复使用的、规模较小的固定层集。想象一下一条工厂组装线,一名技术精湛的工人完成一项任务后,将产品传回给自己进行精炼,然后再传回给自己,如此循环。在这个新系统中,“工人”是模型大脑的一个共享模块。它处理输入,然后将自己的输出作为输入再次进行处理,循环往复,直到达到设定的次数。这使得该模型能够完成比其规模大得多的系统的任务,而只需存储极小比例的独特部分。
然而,仅仅重复相同的过程会产生一个新的问题:如果工人每次都做完全相同的事情,那么产品就永远不会发生真正的变化。研究人员发现,如果没有一种使过程发生变化的机制,重复的步骤会坍缩为单一且无用的变换。为了解决这个问题,他们引入了一个动态门控——一种学习到的决策机制,用于控制有多少新信息可以替换旧信息。这个门控会观察模型的当前状态、原始输入以及少量的随机噪声,从而决定在每一步中究竟保留什么以及更新什么。这确保了即使反复使用相同的权重,模型在每一轮的表现也会有所不同,使其能够在思考过程中随着深度的增加而实现专业化。
这一方法的测试结果令人瞩目。在严格限制训练和运行模型所需的总计算量与标准大型模型相等的条件下,新系统表现得同样出色。在一项特定测试中,一个仅拥有三个独特权重层并重复十次的模型,达到了一个标准十二层模型的准确度。这意味着新设计在实现同等质量的同时,减少了 64% 的独特参数。当研究人员允许模型在思考过程中使用更多的计算能力,但保持存储的部件数量不变时,这种重复系统实际上超越了标准模型,这表明深度和重复是提升智能的一种强大方式,且无需增加内存成本。
该系统还自行发现了一个有用的副作用。由于模型在训练时被要求能够在重复循环中的任何一点停止,它学会了即使在提前停止的情况下也能产生高质量的答案。这使得该系统可以作为一个“速度与质量”之间的调节旋钮:它可以利用极短的时间给出一个快速、粗略的答案,也可以通过增加循环次数,将答案精炼成更精确的内容,而这一切都来自同一个经过训练的模型。这种灵活性在目前的系统中非常罕见,因为现有系统通常需要针对不同的速度使用不同的模型。
从实际应用的角度来看,这意味着一台内存有限的设备可以运行比目前能力更强的语言模型。研究人员测量到,其大规模版本在生成文本时的峰值内存需求比具有类似能力的标准模型减少了 59%。虽然由于重复步骤的存在,生成文本所需的时间略有增加,但对于内存成为瓶颈的环境来说,这种权衡是非常显著的。这项研究表明,高效人工智能的未来可能不在于构建更大、更重的“大脑”,而在于教导更小的“大脑”如何通过反复审视自己的想法来进行更深层的思考。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。