← 最新论文
🤖 machine learning

Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA

该论文介绍了 CARE,一种用于混合专家(Mixture-of-Experts)LoRA 的无参数、即插即用路由机制,它根据路由器的置信度和分歧信号动态调整每个 token 的激活专家数量,以在优化计算效率的同时,达到或超过固定 k 值基准模型的性能。

原作者: Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel Whitmore

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel Whitmore

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位由数千名微型乐手组成的庞大、超级智能管弦乐团的指挥。这个管弦乐团是一个“大语言模型”(LLM),一种能像人类一样阅读和写作的计算机大脑。为了让这个大脑擅长特定的任务——比如解决数学问题或编写代码——我们并不需要教整个管弦乐团演奏新曲目;相反,我们添加了一个小巧的、专门的“专家”乐手部分,他们精准地知道该做什么。这被称为 LoRA(低秩自适应)。它就像是在一个巨大的合唱团中插入几位顶尖的独奏家,无需重写整个乐谱就能修正某一首特定的歌曲。

现在,想象一下这些独奏家被组织成一个 混合专家(Mixture-of-Experts, MoE)系统。当管弦乐团演奏一个音符(或一个单词)时,一个“路由”(router)会决定哪些独奏家应该演奏。旧的方法是非常僵化的:路由会对每一个音符都选择完全相同数量的独奏家(例如四个),无论这个音符是简单还是困难。这就像是为一碗简单的麦片聘请四位世界级大厨,但对于一场复杂的五道菜盛宴却只聘请两位大厨。这在处理简单任务时浪费了能量,而在处理困难任务时又投入不足。核心问题在于,研究人员一直在思考:我们能否让这个路由变得更聪明?它能否观察到一个音符,意识到这是一个难点,然后说:“嘿,这个音符我们需要更多的厨师!”而不拖慢整个管弦乐团的节奏?

这篇论文引入了一个巧妙的新规则,叫做 CARE(置信度自适应专家路由),正是为了解决这个问题。作者发现,路由在其决策过程中已经隐藏了一个秘密信号。当路由对一个单词非常有把握时,它会以极高的置信度选择一两个专家。当它感到困惑时,它会将选票分散给许多专家。CARE 利用这个“置信度信号”来决定为每个单词雇佣多少专家。如果路由很有信心,CARE 就只雇佣少数专家;如果路由不确定,或者受雇的专家们开始产生分歧,CARE 就会雇佣更多专家。

研究人员在两个强大的计算机大脑(LLaMA-3.1-8B 和 Qwen2.5-7B)上,针对包括常识、数学、编程和通用知识在内的八种不同挑战进行了测试。他们发现 CARE 是一个提升效率的魔术。通过仅在需要的地方投入更多“脑力”,CARE 在提高困难任务准确性的同时,使用的总计算能力与旧的僵化方法持平。事实上,为了达到与旧方法相同的准确度水平,CARE 平均减少了 12% 的专家使用量。这就像是在获得同样美味佳肴的同时,浪费更少的食物。

此外,CARE 不仅仅是节省成本,它还充当了一个内置的测谎仪。因为它知道路由何时感到困惑,或者专家们何时产生分歧,所以它可以标记出计算机何时面临它无法理解的问题(即“分布外”事件)。论文表明,相比于其他需要让计算机多次运行同一个问题来检查其工作的辅助方法,CARE 能更好地识别这些令人困惑的时刻。CARE 在单次运行中即可完成这一切,无需额外的训练,只需改变雇佣专家的规则即可。它将一个僵化的、一刀切的系统变成了一个灵活的、聪明的系统,能够准确知道何时该投入精力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →