Forward Pass Domain Adaptation (Without Cross-Layer Backpropagation)
本文介绍了前向传递(Forward-Pass-Only, FPO)训练,这是一种针对大语言模型的领域自适应方法,它通过将单一的输出层误差信号直接应用于目标层而不进行反向传播,从而实现了显著更高的吞吐量和更低的内存占用,同时在领域内和领域外基准测试中均保持了与标准微调相当的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是当今许多最先进人工智能引擎背后的核心,它们能够进行写作、推理和解决问题,其流畅程度曾一度被认为机器无法企及。为了让这些模型适用于特定任务,例如诊断医学状况或分析法律文件,研究人员通常会对它们进行“微调”。这个过程涉及向模型展示大量的全新专业数据,并调整其内部设置,使其学习新世界的模式。然而,这种调整极其昂贵。它需要强大的计算机来运行模型的正向传播以获取答案,然后再进行反向传播,以精确计算出如何改变系统的每一个部分来获得更好的结果。这个反向步骤对内存的需求巨大,通常是仅运行模型所需内存的三倍,这使得在标准消费级计算机上或在对速度要求极高的场景下执行该操作变得不可能。
加州大学圣克鲁兹分校与墨尔本大学的研究团队发现了一种完全绕过这一昂贵反向步骤的方法。他们发现,对于大语言模型而言,学习新信息所需的最重要的调整主要发生在网络的最后几层,即处理链的末端。通过仅关注这些后层,并仅利用正向传播中可获得的信息来计算必要的变更,他们创造了一种名为“仅正向传播 MLP 训练”(Forward-Pass-Only MLP training)的新型训练方法。这种方法允许模型在无需回溯其自身结构的情况下学习新技能,将内存需求降低了约 40%,并使过程比标准方法快了近 3 倍。至关重要的是,这种速度和效率的提升并没有带来通常会出现的“遗忘原有知识”的问题;虽然传统方法在学习新专业领域时往往会降低模型的通用能力,但这项新技术能保持模型的原始知识完好无损。
这一发现的核心在于一个简单但深刻的观察:关于这些模型如何处理信息。在标准的训练过程中,计算机在模型输出的最末端计算一个误差信号,然后将该信号逐层向后传递,以调整网络内部的权重。研究人员意识到,对于模型最后四分之一的层,所需的调整方向几乎与仅利用输出和当前模型状态即可计算出的信号完全一致,而无需进行路径回溯。他们通过六个不同的公开模型(参数量从 30 亿到 80 亿不等)测试了这一想法,并发现,所需调整的真实方向与这种更简单的、仅靠正向传播的信号高度吻合。这种一致性足以投入实用,因为在近一半的情况下,信号指向的方向基本相同,且这种一致性在不同的模型架构中均保持稳定。
为了将这一理论付诸实践,团队开发了一个快速诊断工具,在单个计算机芯片上运行仅需约两分钟。该工具可以测量特定模型的简单正向信号与复杂反向信号之间的匹配程度。它就像一张地图,能精确指导研究人员在网络的哪些位置可以安全地跳过反向传播。一旦确定了这些“可行”的后层,训练过程就会发生根本性的变化。系统不再构建一个庞大且复杂的记录来保存模型执行的每一步以便稍后逆转,而是简单地运行模型正向传播,计算末端的误差,并直接对目标层进行修正。在此过程中,从未构建过反向传播,也没有浪费内存去存储计算的历史记录。这消除了阻碍许多人在自有硬件上进行大模型微调的主要瓶颈。
该方法在三个不同模型家族上的测试结果令人瞩目。在速度方面,这种新方法比标准微调快 2.7 到 3.2 倍,使研究人员能在相同时间内处理更多的数据。在内存受限的硬件(如单张高端显卡)上,该方法允许同时处理更大批次的数据,而标准方法则会因内存限制而崩溃。或许最重要的一点是,该方法保留了模型的通用智能。当研究人员在各种无关任务(如回答常识问题或解决逻辑谜题)上测试经过适配的模型时,这些模型的表现与训练前几乎完全一致。相比之下,使用标准方法训练的模型在这些通用任务上的表现往往会显著下降,这种现象被称为“灾难性遗忘”。新方法避免了这一陷阱,在学习新专业领域的同时,保持了其广泛能力的稳定性。
研究人员还探讨了为何能实现这种通用知识的保留。他们将自己的方法与一种混合方法进行了对比——在混合方法中,他们仅更新模型的后层,但仍使用标准的、缓慢的反向传播。他们发现,通用知识的保留并非源于这种新计算方法本身,而是由于将变更限制在了网络的后层。处理语言和推理基本构建模块的前层保持不变,从而防止了模型覆盖其核心理解。然而,新方法是实现这一目标的唯一可行途径,因为当仅限于少数几层时,标准的反向传播既太慢又太耗费内存,难以实际操作。新方法使得在这一“安全区”内进行操作成为可能,从而实现了高效学习并最大限度减少遗忘。
尽管该方法非常有效,但也存在局限性。使用该技术训练的模型在学习新领域的深度上不如使用完整、缓慢方法的模型;它们在所教特定任务上的提升幅度略低。这就是权衡之处:新方法牺牲了一小部分在特定任务上的最高性能,以换取在速度、内存效率以及通用知识保留方面的巨大提升。研究人员认为,对于许多现实应用场景,例如为特定用户定制模型或在消费级硬件上将其适配为专业行业工具,这种权衡是非常值得的。该方法开启了一扇门,让原本需要在数据中心才能完成的适配过程,现在可以在单台机器上运行,同时还能确保模型的原始智能不受过度专业化带来的损害。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。