← 最新论文
💻 computer science

Local Credit Assignment for CPU Transformers: Readout Consensus and the Cost of Predictive Coding

本文评估了针对基于 CPU 的 Transformer 的局部信用分配方法,发现虽然异步读出梯度共识提高了训练吞吐量,但它与预测编码方法都未能达到反向传播的质量,也未能建立起一种通用的、保持质量的加速替代方案。

原作者: Vikram Lex

发布于 2026-09-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Vikram Lex

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,最强大的系统被构建得如同深邃的逻辑高塔,每一层都在处理信息并将其传递给下一层。为了教导这些高塔进行思考,科学家们传统上使用一种被称为“反向传播”的方法。想象一位老师走遍整座建筑,从顶层一直走到地基,根据最终结果在每一步都进行纠正。这确保了整个结构能够正确学习,但这是一个缓慢且顺序执行的过程:老师必须完成当前楼层的教学,才能移动到下一层。这造成了一个瓶颈,尤其是在尝试将这些庞大的系统运行在标准计算机处理器上时,因为这些处理器旨在同时处理许多任务,而非处理一个漫长的链式事件。

研究人员长期以来一直在思考是否可以打破这一链条。如果高塔的每一层都能从自身的局部错误中学习,与其他楼层并行工作,而不需要等待老师走完全程,情况会怎样?这种被称为“局部学习”的想法,有望释放现代计算机芯片的全部速度。然而,这其中有一个代价。如果一层楼只关注自身的即时错误,它可能会忽略全局视角,即其工作如何影响最终结果。计算机科学家的核心问题在于,这种速度是否是以牺牲智能为代价,或者是否存在一种方法可以协调这些独立的劳动者,使它们依然能学到正确的教训。

Vikram Lex 在 KarLex AI 进行的一项近期研究,旨在在真实硬件上测试这种权衡。团队构建了一个拥有二十四层的数字高塔,并在配备了标准中央处理器的强大服务器上进行了实验。他们将传统的、缓慢的整体教学法与一种让不同部分同时学习的新方法进行了对比。为了实现这一点,他们引入了一个名为“读出梯度共识”(readout-gradient consensus)的系统。在这种设置下,高塔的每个部分都会计算其特定部分对最终输出的贡献程度,并将该信息发送给一个中央协调器。协调器随后对这些报告进行平均,以更新模型的最终决策部分。这使得高塔的不同部分可以并行运行,理论上能显著提高训练速度。

结果显示,这种并行方法确实运行得更快。新方法的处理速度大约是传统方法的 1.38 倍。然而,这种收益付出了沉重的代价。运行并行系统所需的内存增加了一倍多,从不足两个 GB 跃升至超过四个 GB。更重要的是,速度的提升并没有保证质量的对等。当研究人员在从未见过的数据上测试模型时,这种较快的方法未能达到严格的准确度标准。尽管性能差异在绝对数值上很小,但在统计学上已显著到足以使其无法直接取代传统的教学方法。研究发现,虽然并行系统可以学习,但它难以维持与那种更缓慢、更细致的方法相同的精确度。

研究人员还调查了是否可以通过添加一种将关于未来错误的信息传回早期层的机制来恢复损失的质量。他们尝试了一种称为“预测编码”(predictive-coding)的技术,该技术试图预测最终结果应该是怎样的,并将该预测向后发送,以引导早期层。在另一个针对十二层高塔进行的独立小型实验中,这种方法成功地非常接近了传统方法的质量水平。然而,它要求系统在学习的每一步都要进行多次“推理”或“思考”循环。这使得训练过程比标准方法慢了近三倍。研究结论认为,虽然找回丢失的准确性是可能的,但这样做所付出的计算成本目前过高,并不具备实际意义。

该研究的一个关键发现是,证明了仅仅了解系统的最终部分如何反应,并不足以完美地重建早期部分的学习路径。团队展示了两种不同的内部状态可能会产生完全相同的最终输出和最终误差,却需要对早期层进行完全不同的修正。这意味着,仅仅分享最终报告是不够的;系统需要对到达那里的路径有更深层、更复杂的理解。研究排除了这样一种设想,即通过简单的报告平均化,可以在不产生显著质量或速度成本的情况下,完全取代传统的、逐步教学的方法。

最终,这项工作为在标准计算机处理器上训练人工智能提供了一份清晰的现状图谱。它证实了虽然并行学习可以提供速度提升,但并非“免费的午餐”。速度的增益伴随着内存使用的实质性增加,以及无法轻易修复的准确度下降。研究表明,对于依赖标准计算机硬件的机构而言,最可靠的路径仍然是传统的顺序方法,或者是能够仔细平衡权衡的混合方法。这项研究并未提供一种能让训练既更快又更好的“魔法方案”,但它为实现这一目标所付出的成本提供了精确的测量。通过记录该方法在何处失效以及修复它需要付出多少代价,这项研究帮助工程师们在构建和训练下一代智能系统时做出明智的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →