← 最新论文
🤖 machine learning

Mixture of Channel Experts: Static Sparse Supports with Input-Adaptive Mixing for Pointwise Projections

本文介绍了混合通道专家(Mixture of Channel Experts, MoCE),这是一种结构化稀疏通道混合层,它通过将输入路由至具有学习到的稀疏通道支持和输入自适应聚合的专家,来取代稠密逐点投影,在实现显著降低计算成本和延迟的同时,达到了匹配或超过稠密基准模型的准确率。

原作者: Elian Iluk, Gil Ben-Artzi

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Elian Iluk, Gil Ben-Artzi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代能够识别图像、翻译语言或诊断疾病的计算机,依赖于庞大的类人工智能神经元网络。这些网络构建得像多层工厂,原始数据从底层进入,逐层处理,直到最终答案浮现。这种处理过程的一个关键环节发生在“混合”站,在这里,系统会组合不同的信息流。在许多这类工厂中,混合是通过一种密集且笨重的方式完成的:在每一步中,每一条信息流都会与其它所有信息流进行组合。这确保了系统能看到所有的可能性,但代价极其高昂。随着系统拥有的信息流越来越多,它必须进行的计算就越多,存储这些计算指令所需的内存也越多。当这些系统为了变得更聪明而规模扩大时,这种持续且全覆盖式的混合成本成为了一个瓶颈,减慢了机器的速度并增加了运行成本。

以色列艾里尔大学(Ariel University)的研究人员提出了一种运行这些混合站的不同方式,这种方式模仿了专业化劳动力的高效,同时又不牺牲输出质量。他们将这种方法称为“通道专家混合”(Mixture of Channel Experts)。其核心思想很简单:与其强迫系统的每个部分始终与所有其他部分进行交流,不如让每个输出通道只监听一小部分经过精心挑选的输入通道。想象一个大型办公室,每个员工通常都必须阅读来自每个部门的所有报告,然后才能撰写自己的备忘录。这种新方法建议,每个员工只需要阅读与其特定任务最相关的三到四份报告,同时由一个独立的轻量级系统确保没有任何一份重要的报告被完全忽略。这种从“每个人都与每个人交谈”到“每个人只与特定的专家交谈”的转变,大幅减少了所需的计算量。

研究人员发现,简单地复制语言模型中一种流行的策略——即通过复制不同的专家并让系统选择使用哪一个——在图像处理领域效果并不理想。当他们尝试创建多个并行的混合单元,且这些单元都读取完全相同的输入集时,这些单元很快就学会了做完全相同的事情。它们变成了彼此的冗余副本,在没有增加任何新见解的情况下浪费了空间。为了解决这个问题,团队将专业化过程从操作者本身转移到了它们之间的连接上。在他们的新设计中,每个输出通道都由一个“专家”处理,这个专家不是一个独立的网络,而是输入通道的一种特定的、经过学习的选择。每个专家挑选一小组输入(例如,从一百个中挑选八个)并进行组合。至关重要的是,这种选择是静态的;一旦系统训练完成,专家将始终观察相同的八个通道。这使得计算机可以提前规划工作,从而避免了因试图在运行时即时决定读取哪些通道而带来的混乱且不可预测的延迟。

然而,研究人员发现,虽然通道的“选择”应该是固定的,但它们的“组合方式”仍应保持灵活性。他们添加了一个小型且智能的机制,根据正在处理的具体图像来调整每个被选定通道的权重。如果图像明亮清晰,系统可能会侧重于其中一个特定通道;如果图像模糊,它可能会更均匀地分配注意力。这种调整的计算成本极低,每张图像仅需计算一个数字。该系统还包含一个安全网:一个残差摘要(residual summary),用于收集任何未被专家选中的输入通道,从而确保信息不会丢失。这种固定且高效的选择与微小自适应灵活性的结合,被证明是最佳平衡点。

在标准的图像识别任务测试中,这种新方法提供的结果与传统的、重型系统相比,表现持平甚至略有超越。在一个名为 ImageNet 的主要数据集上,新方法减少了约 17% 的计算量,同时显著降低了存储模型的内存需求。在某些情况下,该系统在实际应用中变得更快,缩短了处理图像所需的时间。研究人员还测试了一个更复杂的版本,在该版本中,系统尝试为每一张图像选择不同的通道,类似于人类根据所见内容观察场景的不同部分。他们发现,这种额外的灵活性并没有提高准确性,反而使系统变慢了近七倍。这是一个决定性的发现:当系统坚持使用可靠、预先计划好的连接,并仅利用其有限的能量来微调这些连接的权重时,其表现最为出色。

这项研究表明,高效人工智能的未来可能不在于构建更大、更复杂的网络,而在于使其中的连接变得更聪明、更有纪律。通过学习哪些特定的输入对每个输出最为重要并冻结这些选择,系统可以在不损失理解世界能力的前提下,运行得更快、成本更低。研究人员展示了,当一个僵化的、组织良好的结构与极少量的适应性相结合时,其表现可以优于一个试图对所有人提供一切服务的系统。这种方法为构建能够在日常硬件上运行的强大人工智能提供了一条清晰的路径,证明了有时,明确知道该忽略什么,与知道该关注什么同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →