想象一下,你正带领一支由四位专业向导(即“专家”)组成的团队,穿越一片巨大且不断变化的地貌。你的任务是为旅程的每一步挑选合适的向导。
在当前的混合专家(Mixture-of-Experts,简称 MoE)人工智能系统中,负责挑选向导的人就像一位没有地图、没有指南针、也没有记忆的游客。他们仅凭脚下此刻的土地来决定雇佣谁。
该论文指出,这是一个致命的缺陷。如果你正在穿越一片森林,而地形即将转变为沙漠,那么一个只盯着脚下当前树木的向导会继续雇佣“森林向导”。直到为时已晚,他们才会意识到转变即将发生。
作者 Russell Wong 提出,我们需要借鉴大脑的工作原理(特别是自由能原理),通过三个简单的技巧来升级这位“招聘经理”。以下是该论文如何用日常类比来解释这些升级:
1. 问题:“失忆的游客”
当前的人工智能路由是无状态的。它会忘记过去 100 步中发生的一切。
- 结果: 当人工智能从谈论“猫”切换到“汽车”时,它往往无法立即切换专家。在论文的实验中发现,在切换发生的精确时刻,人工智能分配给正确专家的概率仅为0.6%。它几乎完全错了。
- 类比: 这就像一位厨师只品尝嘴里此刻的一勺汤,却忽略了他刚刚倒进去整整一桶盐的事实。直到汤已经毁掉,他才无法预测汤会变得太咸。
2. 解决方案:招聘经理的三种新工具
该论文提出了三种轻量级的修改来解决这个问题。
A. 时间记忆(“背包”)
- 是什么: 系统不再仅观察当前步骤,而是携带一个“背包”(称为膜电位),其中包含对过去几步的加权记忆。
- 类比: 想象招聘经理现在背着一个背包。如果他们已经在这片森林里走了 30 分钟,背包就会因积聚了“森林尘埃”而变得沉重。即使脚下的土地看起来仍像森林,沉重的背包也会告诉他们:“我们在这里待了很久;我们很可能即将离开。”
- 结果: 人工智能学会了以恰到好处的速度“遗忘”旧信息。如果地形变化迅速,背包会迅速清空;如果地形稳定,记忆则会保持更久。仅凭这一点,人工智能捕捉切换的能力就从 0.6% 提升到了30%。
B. 精度加权门控(“信任评分”)
- 是什么: 系统追踪每位专家近期的可靠性。如果某位专家不断犯错,系统就会降低他们的“信任评分”(精度),并停止听取他们的意见,即使他们看起来非常适合当前的词汇。
- 类比: 想象你有四位向导。向导 A 擅长森林但极不擅长沙漠。向导 B 则相反。当前系统仅仅因为向导 A 站在森林里就雇佣了他。而新系统会说:“等等,向导 A 在五分钟前我们靠近沙漠时犯了一个大错。我正在降低他们的信任评分。除非他们 100% 确定,否则我不会雇佣他们。”
- 结果: 这有助于人工智能在专家变得不可靠时进行适应。它在系统对可靠专家的信任度与对不可靠专家的信任度之间,创造了31 倍的差异。
C. 预期路由(“水晶球”)
- 是什么: 系统试图预测下一步会是什么样子,并为那一步雇佣专家,而不是为当前步骤。
- 类比: 普通游客会为现在所在的路径雇佣向导。而具有预期能力的游客会观察前方的路径,并为下一个转弯雇佣向导。
- 陷阱: 论文发现了一个秘密要素。如果游客没有记忆,“水晶球”就无效。如果你试图在不记住过去的情况下预测未来,你就无法判断何时会有转变。
- 神奇组合: 当你将**背包(记忆)与水晶球(预测)**结合起来时,系统变得超人类。背包里装满了“森林尘埃”,水晶球读取这种饱和状态并说:“我们充满了森林尘埃;下一个就是沙漠!”
- 结果: 这种组合具有超加性效果。
- 仅背包:提升 30%。
- 仅水晶球:提升 0%(它是盲目的)。
- 背包 + 水晶球:提升 74%。
- 两者结合,填补了人工智能与完美“神谕”(完美的向导)之间 75% 的差距。
3. 为何这很重要(“导航”隐喻)
该论文总结道,当前的人工智能只是在反应当下。它是一台会说“这个词看起来像猫,所以我使用猫专家”的机器。
新系统则是在导航。它说:
- 我去过哪里?(背包/记忆:“我在森林里待了很长时间。”)
- 我可以信任谁?(信任评分:“沙漠向导很可靠;森林向导累了。”)
- 我要去哪里?(水晶球:“地形接下来将转变为沙漠。”)
核心结论
该论文声称,通过添加这三种简单、低成本的机制(记忆、信任和预测),我们可以防止人工智能在最关键的时刻——即主题发生转变时——“迷路”。
在他们的测试中,这项升级将完成任务所需的专家数量从不可行的数量(数百个)减少到了一个微小且可管理的数量(3 或 4 个)。它将一个困惑的游客变成了一位熟练的导航员。
注意: 该论文并未声称这解决了所有人工智能问题或适用于医疗诊断。它严格专注于使语言生成过程中的“路由”(即决定使用人工智能的哪一部分)变得更加智能。
以下是 Man Yung (Russell) Wong 的论文《亲和力不足:在混合专家模型中恢复自由能原理》的详细技术总结。
1. 问题陈述
稀疏混合专家(MoE)模型(例如 DeepSeek-V3、Mixtral)目前依赖于无状态的基于亲和力的路由。路由门根据当前令牌嵌入(xt)选择专家,忽略了时间上下文、专家可靠性历史以及未来需求。
该论文识别出一种关键的失效模式:领域转换。当序列从一个分布(领域 A)切换到另一个分布(领域 B)时,转换步骤(t)的令牌仍属于领域 A,但下一步(t+1)的最佳专家属于领域 B。
- 问题所在:标准路由器仅看到 xt,在转换步骤中分配给正确专家的概率接近于零。
- 实证证据:在受控实验中,标准路由在转换步骤中分配给正确专家的概率质量仅为 0.006 ± 0.001。
- 后果:要在如此低的置信度下实现 99% 的路由覆盖率,模型将需要数量大得不可行的专家(K≈765),从而抵消了 MoE 的效率优势。
2. 方法论:自由能原理(FEP)框架
作者提出,MoE 路由应通过Friston 的自由能原理进行重构,该原理规定不确定性下的最优系统必须:
- 递归更新状态(而非从头开始)。
- 按精度加权信号(误差的逆方差)。
- 最小化预期的未来自由能(基于预测行动,而不仅仅是当前观测)。
为了实现这一点,论文引入了三种轻量级修改,应用于标准路由门,并基于**脉冲神经网络(SNN)**动力学(具体为漏积分发放,LIF):
A. 时间路由记忆(β)
- 机制:用通过 LIF 动力学更新的隐藏状态 ht 替换无状态输入 xt:
ht=β⊙ht−1+xt
其中 β 是可学习的衰减向量(初始化为 0.9)。
- 功能:跨令牌积累上下文。它允许路由器“记住”系统已在领域 A 中运行了很长时间,产生一个“饱和”信号,表明即将发生切换,甚至在切换令牌出现之前。
- 时间尺度:每令牌(快)。
B. 精度加权门控(Π)
- 机制:维护每个专家的在线、非参数化均方误差(MSE)跟踪器。路由门受这些误差的逆方差(精度)调节:
gt=softmax(W⋅xt⊙Πt)
其中 Πi=1/(σ^i2+ϵ)。
- 功能:动态降低当前不可靠(高误差)专家的权重,并增加可靠专家的权重。与跟踪频率的标准负载均衡不同,此方法跟踪准确性。
- 时间尺度:每批次(中)。
C. 预期路由
- 机制:使用预测网络 f(xt,ht) 估计下一个令牌嵌入 x^t+1。路由决策基于此预测:
gt=softmax(W⋅ht+Wpred⋅x^t+1)
- 功能:基于预测的未来状态而非当前状态进行路由。这使得路由器能够在新的领域令牌出现在输入中之前,就切换到新领域的专家。
- 关键洞察:无状态预测器(f(xt))会失败,因为转换前的令牌在分布上是相同的。预测器必须基于 β 累积的状态 ht 进行条件化,以检测指示转换的饱和信号。
3. 主要贡献
- 理论统一:将 MoE 路由与自由能原理联系起来,证明标准 MoE 缺乏递归状态估计、精度加权和未来状态最小化。
- 三种轻量级机制:提出 β(记忆)、Π(精度)和预期(预测)为必要组件,实现所需的参数开销极小(总计约 200 行代码)。
- 超加性发现:论文最重要的发现是 β×Ant 交互。
- 仅 β:+0.295 增益。
- 仅预期:+0.000 增益(无记忆时失败)。
- 组合:+0.741 增益。
- 交互效应:组合增益超过各部分之和 +0.446,证明记忆是预期的先决条件。
- DeepSeek-V3 的结构解释:解释了为什么 DeepSeek-V3 在推理时丢弃其多令牌预测(MTP)模块:无状态的 MTP 头无法检测领域转换。论文认为,如果基于时间记忆(β)进行条件化,MTP 应被保留。
4. 实验结果
实验在受控领域切换任务和字符级 MoE 语言模型(5 个种子)上进行。
| 指标 |
标准 MoE |
β-MoE |
β + Ant MoE |
神谕 (Oracle) |
| 转换准确率 |
0.006 |
0.301 |
0.748 |
0.994 |
| 转换时的 BPC |
6.56 |
4.01 |
4.19 |
N/A |
| 99% 覆盖率所需的专家数 (K) |
~765 (不可行) |
~6.0 |
2.4 |
N/A |
- 转换准确率:组合机制将转换步骤中选择正确专家的概率从 0.6% 提高到 74.8%,填补了与神谕之间 75% 的差距。
- 效率:在转换步骤实现 99% 覆盖率所需的专家数量(K)从不可行的 ~765 降至一个小常数(2.4)。
- 语言模型验证:在字符级 LM 中,β 路由将转换步骤的每字符比特数(BPC)从 6.56 降低到 4.01。添加预期稳定了路由决策(降低了方差),但在这一小规模下并未进一步降低 BPC,表明主要收益在于路由稳定性和通过预取实现的延迟降低。
5. 意义与启示
- 导航与分类:该论文将路由从静态分类问题(“哪个专家适合这个令牌?”)重构为动态导航问题(“系统要去哪里,哪条路径是可靠的?”)。
- 延迟降低:通过提前一步预测领域切换,系统可以在当前步骤执行的同时,将专家权重从内存(HBM)预取到计算单元(SRAM),从而消除关键转换点的内存延迟停顿。
- 重新评估 MTP:这项工作表明,DeepSeek-V3 等模型中的多令牌预测模块未被充分利用。如果基于时间状态进行条件化,它们可以作为强大的预期路由机制,而不仅仅是训练辅助工具。
- 生物合理性:这些机制反映了生物过程(LIF 神经元、预测编码中的精度加权、主动推断),表明当前的 MoE 架构缺失了智能资源分配的基本原理。
总之,该论文证明亲和力不足以实现鲁棒的 MoE 路由。通过整合时间记忆、精度加权和预期,MoE 模型可以在领域转换时实现接近神谕的路由性能,大幅降低维持高准确性的计算成本。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。