← 最新论文
🤖 machine learning

Affinity Is Not Enough: Recovering the Free Energy Principle in Mixture-of-Experts

本文提出,混合专家模型中基于亲和度的标准路由在领域转换时失效,并证明整合受自由能原理启发的机制——特别是时间记忆、精度加权门控和预期路由——能够通过使模型在分布偏移发生之前检测并为其做好准备,从而显著提高专家选择准确性和预测性能。

原作者: Man Yung Wong (Russell)

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Man Yung Wong (Russell)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正带领一支由四位专业向导(即“专家”)组成的团队,穿越一片巨大且不断变化的地貌。你的任务是为旅程的每一步挑选合适的向导。

在当前的混合专家(Mixture-of-Experts,简称 MoE)人工智能系统中,负责挑选向导的人就像一位没有地图、没有指南针、也没有记忆的游客。他们仅凭脚下此刻的土地来决定雇佣谁。

该论文指出,这是一个致命的缺陷。如果你正在穿越一片森林,而地形即将转变为沙漠,那么一个只盯着脚下当前树木的向导会继续雇佣“森林向导”。直到为时已晚,他们才会意识到转变即将发生。

作者 Russell Wong 提出,我们需要借鉴大脑的工作原理(特别是自由能原理),通过三个简单的技巧来升级这位“招聘经理”。以下是该论文如何用日常类比来解释这些升级:

1. 问题:“失忆的游客”

当前的人工智能路由是无状态的。它会忘记过去 100 步中发生的一切。

  • 结果: 当人工智能从谈论“猫”切换到“汽车”时,它往往无法立即切换专家。在论文的实验中发现,在切换发生的精确时刻,人工智能分配给正确专家的概率仅为0.6%。它几乎完全错了。
  • 类比: 这就像一位厨师只品尝嘴里此刻的一勺汤,却忽略了他刚刚倒进去整整一桶盐的事实。直到汤已经毁掉,他才无法预测汤会变得太咸。

2. 解决方案:招聘经理的三种新工具

该论文提出了三种轻量级的修改来解决这个问题。

A. 时间记忆(“背包”)

  • 是什么: 系统不再仅观察当前步骤,而是携带一个“背包”(称为膜电位),其中包含对过去几步的加权记忆。
  • 类比: 想象招聘经理现在背着一个背包。如果他们已经在这片森林里走了 30 分钟,背包就会因积聚了“森林尘埃”而变得沉重。即使脚下的土地看起来仍像森林,沉重的背包也会告诉他们:“我们在这里待了很久;我们很可能即将离开。”
  • 结果: 人工智能学会了以恰到好处的速度“遗忘”旧信息。如果地形变化迅速,背包会迅速清空;如果地形稳定,记忆则会保持更久。仅凭这一点,人工智能捕捉切换的能力就从 0.6% 提升到了30%

B. 精度加权门控(“信任评分”)

  • 是什么: 系统追踪每位专家近期的可靠性。如果某位专家不断犯错,系统就会降低他们的“信任评分”(精度),并停止听取他们的意见,即使他们看起来非常适合当前的词汇。
  • 类比: 想象你有四位向导。向导 A 擅长森林但极不擅长沙漠。向导 B 则相反。当前系统仅仅因为向导 A 站在森林里就雇佣了他。而新系统会说:“等等,向导 A 在五分钟前我们靠近沙漠时犯了一个大错。我正在降低他们的信任评分。除非他们 100% 确定,否则我不会雇佣他们。”
  • 结果: 这有助于人工智能在专家变得不可靠时进行适应。它在系统对可靠专家的信任度与对不可靠专家的信任度之间,创造了31 倍的差异。

C. 预期路由(“水晶球”)

  • 是什么: 系统试图预测下一步会是什么样子,并为那一步雇佣专家,而不是为当前步骤。
  • 类比: 普通游客会为现在所在的路径雇佣向导。而具有预期能力的游客会观察前方的路径,并为下一个转弯雇佣向导。
  • 陷阱: 论文发现了一个秘密要素。如果游客没有记忆,“水晶球”就无效。如果你试图在不记住过去的情况下预测未来,你就无法判断何时会有转变。
  • 神奇组合: 当你将**背包(记忆)水晶球(预测)**结合起来时,系统变得超人类。背包里装满了“森林尘埃”,水晶球读取这种饱和状态并说:“我们充满了森林尘埃;下一个就是沙漠!”
  • 结果: 这种组合具有超加性效果。
    • 仅背包:提升 30%。
    • 仅水晶球:提升 0%(它是盲目的)。
    • 背包 + 水晶球:提升 74%。
    • 两者结合,填补了人工智能与完美“神谕”(完美的向导)之间 75% 的差距。

3. 为何这很重要(“导航”隐喻)

该论文总结道,当前的人工智能只是在反应当下。它是一台会说“这个词看起来像猫,所以我使用猫专家”的机器。

新系统则是在导航。它说:

  1. 我去过哪里?(背包/记忆:“我在森林里待了很长时间。”)
  2. 我可以信任谁?(信任评分:“沙漠向导很可靠;森林向导累了。”)
  3. 我要去哪里?(水晶球:“地形接下来将转变为沙漠。”)

核心结论

该论文声称,通过添加这三种简单、低成本的机制(记忆、信任和预测),我们可以防止人工智能在最关键的时刻——即主题发生转变时——“迷路”。

在他们的测试中,这项升级将完成任务所需的专家数量从不可行的数量(数百个)减少到了一个微小且可管理的数量(3 或 4 个)。它将一个困惑的游客变成了一位熟练的导航员。

注意: 该论文并未声称这解决了所有人工智能问题或适用于医疗诊断。它严格专注于使语言生成过程中的“路由”(即决定使用人工智能的哪一部分)变得更加智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →