← 最新论文
💻 computer science

HASTE: Hardware-Aware Dynamic Sparse Training for Large Output Spaces

本文介绍了 HASTE,这是一个针对极端多标签分类任务的硬件感知动态稀疏训练框架,该框架采用组共享固定入度稀疏性(group-shared fixed fan-in sparsity)和混合稠密-稀疏架构,以克服内存瓶颈和不规则访问模式,在保持或提高与稠密及先前稀疏基准模型相比的预测准确性的同时,实现了前向和反向传播过程中的显著加速。

原作者: Nasib Ullah, Jinbin Zhang, Jean Lucien Randrianantenaina, Erik Schultheis, Rohit Babbar

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Nasib Ullah, Jinbin Zhang, Jean Lucien Randrianantenaina, Erik Schultheis, Rohit Babbar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在经营着一座拥有数百万本书籍(标签)的巨型图书馆。你的任务是根据访客写的一段简短笔记(输入),向他们推荐合适的书籍。

在人工智能领域,这被称为极大规模多标签分类(Extreme Multi-Label Classification, XMC)。问题在于,当你拥有数百万本书时,检查每一本书来寻找最佳匹配会极其缓慢且需要巨大的内存。这就像为了找到一个推荐,而试图读完整个图书馆的所有书一样。

为了提高速度,研究人员尝试使用稀疏性(Sparsity)。把稀疏性想象成一条规则:“不要检查每一本书;只检查其中特定的几本。”然而,旧的方法非常混乱。它就像一名图书管理员在随机、分散的书架之间来回奔跑去取几本书。尽管他们检查的书变少了,但这种来回奔跑(内存访问)非常混乱,导致计算机陷入等待,速度并没有得到实质性的提升。

HASTE 登场了: 这篇论文介绍了一种名为 HASTE(硬件感知动态稀疏训练)的新方法。它是如何运作的呢?让我们用简单的类比来说明:

1. “分组书架”策略 (Group-Shared Fixed Fan-in)

与其让每一本书都拥有自己的一套随机书架,不如将相似的书籍组合在一起。

  • 旧的方法: 书籍 A 检查书架 1、50 和 99。书籍 B 检查书架 2、44 和 88。图书管理员必须在图书馆里到处乱跑。
  • HASTE 的方法: 我们将相似的书籍(例如“科幻小说”)归为一组。所有的科幻小说都共享同一组书架(例如书架 10 到 20)。
  • 优势: 图书管理员只需要走到图书馆的一个区域,一次性拿走一叠书,然后交给所有的科幻小说爱好者。这要快得多,因为图书管理员不需要来回奔跑。在计算机术语中,这使得硬件(特别是现代 GPU)能够以一种平滑、有序的方式工作,将“更少的计算量”转化为“实际的速度”。

2. “VIP 区”与“长尾” (Head-Tail Split)

在任何图书馆中,都有少数几本书超级受欢迎(像畅销书一样),而大多数书很少被挑选(即“长尾”部分)。

  • 问题: 在训练 AI 时,那些稀有的书籍提供的“线索”(梯度)不足以帮助系统学习,导致训练不稳定。
  • HASTE 的解决方案: 系统将图书馆分为两个区域:
    • VIP 区 (Head): 最受欢迎的书籍拥有专门的高速、“稠密”检查机制。它们会得到充分的关注。
    • 长廊 (Tail): 数百万本稀有书籍则使用上述高效的“分组书架”策略。
  • 结果: 系统保持了稳定性,因为它能从热门书籍中获得强烈的信号,同时仍能高效处理数百万本稀有书籍,而不会耗尽内存。

3. 实验结果

作者在包含高达 860 万个标签(书籍)的海量数据集上测试了该方法。

  • 速度: HASTE 比以往的方法显著更快。在某些测试中,在更新模型内存(“反向传播”)时,它比旧的稀疏方法快了高达 25 倍
  • 准确性: 它不仅变快了,而且变得更聪明了,能更好地推荐正确的书籍。它达到了甚至超过了以往“稀疏”方法的性能,并缩小了与那些检查所有内容的缓慢、沉重的“稠密”方法之间的差距。
  • 效率: 它使用的计算机内存要少得多,这使得这些庞大的模型可以在普通研究人员也能负担得起的标准显卡(GPU)上运行,而不需要超级计算机。

总结: HASTE 将数百万种选项的混乱状态组织成了整齐、共享的组。这让计算机硬件能够高效工作,使得在不损失准确性的情况下,能够更快、以更少的内存训练大规模 AI 模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →