← 最新论文
🤖 AI

DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training

本文介绍了 DTop-p,这是一种稀疏性可控的动态路由机制,它通过自适应学习 Top-p 阈值并执行全局稀疏性约束,在保持基础模型预训练计算效率的同时,超越了标准的 Top-k 和固定 Top-p MoE 基准。

原作者: Can Jin, Hongwu Peng, Mingcan Xiang, Qixin Zhang, Xiangchi Yuan, Amit Hasan, Ohiremen Dibua, Yifan Gong, Yan Kang, Dimitris N. Metaxas

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Can Jin, Hongwu Peng, Mingcan Xiang, Qixin Zhang, Xiangchi Yuan, Amit Hasan, Ohiremen Dibua, Yifan Gong, Yan Kang, Dimitris N. Metaxas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营着一家规模宏大、高科技的呼叫中心(即 AI 模型),旨在回答数百万个问题。为了处理这些工作量,你雇佣了数千名专业人员(称为“专家”)。

在旧的处理方式中(Top-k),你有一条严格的规则:无论来电者问什么,每通电话都必须分配恰好 3 名专家

  • 如果有人问“2+2 等于几?”,你仍然会派 3 名专家去。这是一种能量浪费。
  • 如果有人问一个极其复杂、多层次的法律问题,你仍然只派 3 名专家。他们可能会应接不暇,从而给出糟糕的答案。

研究人员尝试了一个新想法,叫做 Top-p。这就像是在说:“派人直到你觉得有足够的帮助为止。”

  • 对于“2+2”,系统可能会说:“我有 99% 的把握,所以我只派 1 名专家。”
  • 对于那个复杂的法律问题,它可能会说:“我还不确定,所以我继续增加人手,直到我觉得足够自信为止。”

问题在于: 旧的 “Top-p” 方法就像是一个油门失灵的司机。它太敏感了。有时它会只派 1 名专家,下一秒又会惊慌失措地派出 20 名专家。这使得你的呼叫中心的能源账单(计算成本)变得难以预测且混乱不堪。你无法预先规划预算。

解决方案:DTOP-p(智能定速巡航)

作者们构建了 DTOP-p,它就像是为你呼叫中心设计的智能定速巡航系统。它结合了两个主要工具来解决这种混乱:

1. “速度计”(PI 控制器)

假设你希望你的呼叫中心平均每通电话恰好使用 8 名专家

  • PI 控制器 是一个聪明的经理,他会不断检查速度计。
  • 如果团队使用的专家过多(速度过快),经理会轻轻地调低“概率阈值”,告诉系统:“你已经足够自信了,停止增加更多人手。”
  • 如果团队使用的专家过少(速度过慢),经理会调高阈值:“这个问题很棘手,请引入更多帮助。”
  • 结果: 系统会自动调整自身,以确保无论问题难易如何,都能精准维持在目标预算内。它既不会耗尽燃料(内存),也不会浪费燃料。

2. “楼层经理”(动态路由归一化)

在一个大型呼叫中心,前台(早期层)和法律部门(深层)的需求是不同的。

  • 前台处理简单的问候(需要较少的专家)。
  • 法律部门处理复杂的案件(需要更多的专家)。
  • 旧的方法对每个楼层一视同仁。
  • DTOP-p 为每个楼层都配备了自己的“音量旋钮”。它允许前台保持安静且高效,同时让法律部门可以调高音量并召唤更多专家,而整个建筑的总能耗仍保持在限制范围内。

他们的发现(实验结果)

研究人员在两类 AI 上测试了该方法:一种是处理文本(自然语言处理,NLP)的,另一种是理解图像(计算机视觉)的。

  • 更好的答案: DTOP-p 的表现始终优于旧的“固定 3 名专家”规则和混乱的 “Top-p” 规则。它更聪明,知道何时该寻求帮助。
  • 稳定的预算: 与旧的 Top-p 方法(其成本会随机飙升)不同,DTOP-p 能够完美地坚守预算。它使用的计算能力与旧方法相同,但获得了更好的结果。
  • 可扩展性: 他们在小型模型和大模型、小型数据集和海量数据集上都进行了测试。在所有情况下,“智能定速巡航”的效果都优于旧的僵化规则。

核心结论

这篇论文介绍了一种让 AI 模型更聪明、更高效的方法。DTOP-p 不再强迫每一项任务都使用相同程度的脑力,而是让 AI 动态地决定它需要多少帮助,同时通过一个智能控制器确保它绝不会浪费资源或超出预算。这就像是从一条僵化的流水线升级到了一个灵活的、能够自我调节的团队,该团队知道如何为每一项任务投入恰到好处的精力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →