← 最新论文
🤖 machine learning

Geometry-Guided Layerwise FFN Width Allocation in Transformers

本文提出了一种基于几何引导的方法,通过 Gromov-Wasserstein 失真和持续同调等几何指标,在 Transformer 层之间动态分配前馈网络(FFN)宽度,证明了这种数据驱动的调度方案与均匀或人工设计的宽度分配相比,能显著降低验证损失。

原作者: Timur Mudarisov, Mikhail Burtsev, Radu State

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Timur Mudarisov, Mikhail Burtsev, Radu State

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在建造一座巨大的、多层结构的图书馆,每一层都有一间专门用于整理特定类型信息的房间。在人工智能的世界里,这些“图书馆”被称为 Transformer(变换器),它们是现代聊天机器人和语言工具背后的“大脑”。在每个房间里,都有一支工作人员队伍(称为前馈网络,简称 FFN),他们的工作是接收传入的信息,对其进行思考,然后将其传递下去。长期以来,工程师们在建造这些图书馆时遵循着一条严格的规则:无论是在哪一层,每一个房间都必须配备完全相同数量的工作人员。这就像是给地下室的储藏室和顶层的豪华阅览室分配了完全一样的预算一样。

但如果这条规则很浪费呢?如果地下室需要的工人较少,因为那里的箱子很简单;而顶层则需要一支庞大的团队来处理复杂且抽象的概念,情况又会如何呢?这就是研究人员开始提出的问题。他们知道,随着信息在图书馆中穿行,它的形态会发生变化并变得更加复杂。核心问题在于:我们能否精确地测量每个房间正在进行的“工作量”,然后在不额外雇佣任何人的情况下,将工人重新分配到最需要的地方?这篇论文深入探讨了这个想法,利用几何学(研究形状与距离的学科)和数学来计算出每个房间完美的用人计划。

这篇论文的作者 Timur Mudarisov、Mikhail Burtsev 和 Radu State 决定停止猜测,开始测量。他们将流经 AI 的信息视为一种“点云”(想象成一群在房间里移动的萤火虫)。当这些萤火虫从一个房间移动到下一个房间时,它们会发生位移、拉伸和扭曲。团队开发了一种方法,可以精确测量每个房间中发生了多少“几何工作量”。他们使用了三种不同的方式来进行测量:观察萤火虫移动了多远(位移)、它们之间的距离如何变化(Gromov-Wasserstein),以及它们的形成结构中的环路和空洞如何变化(拓扑学)。

这里有一个转折:测量方式的不同会导致结果的不同。如果你仅仅观察原始距离,后期的房间似乎做了最多的工作,但这通常只是因为萤火虫变得越来越大了(这是一个规模问题)。然而,当他们对数据进行归一化处理——即观察运动的“形状”而非仅仅是“大小”时——他们发现了不同的模式。实际上的“工作量”在图书馆的最开始阶段最高,并随着向深处移动而逐渐递减。这表明,早期的房间需要更多的脑力,而后期的房间则可以由较少的工人来维持。

为了测试这一点,他们根据这些测量结果创建了一套新的“用人计划”。他们没有给每个房间分配相同数量的工人,而是给了早期房间更多,后期房间更少,同时保持总人数与旧的统一模型完全一致。他们在多个不同的 AI 模型上进行了测试,其规模从小型(1.28 亿参数)到较大的模型(4.4 亿参数)不等。

结果非常令人振奋。在实验中,使用这种“几何引导型”用人计划的模型,其表现优于那种每个房间都平等的标准模型。事实上,当他们将这种新方法与一种流行的、人工设计的计划(称为“余弦渐减法”,该方法仅仅假设工作量像滑梯一样平滑下降)进行比较时,他们的数据驱动方法表现得更为出色。在 4.4 亿参数的规模下,他们基于几何的方法比余弦计划更显著地降低了模型的误差。

然而,作者也谨慎地表示,他们并不声称已经永久解决了这个问题。他们指出,他们的方法依赖于测量一个“参考”模型,然后将这些规则应用于一个新的模型。虽然结果表明将容量转移到早期层是一个获胜策略,但他们承认,还需要更多的测试才能百分之百确定哪种具体的测量工具(拓扑学 vs 几何学)才是最好的。他们还提到,他们的“反拓扑”对照组(一个故意采取与数据建议相反方案的计划)表现得比标准模型还要差,这证实了他们新计划的方向确实是正确的。

简而言之,这篇论文表明,AI 模型并不一定非要以相等的房间来构建。通过利用几何学来测量真实的“工作”发生在哪里,我们可以重新排列工作人员,使整个图书馆变得更聪明,而无需多花一分钱去雇人。这是一种巧妙的、数据驱动的方法,旨在从同样的计算能力中榨取更高的性能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →