← 最新论文
💻 computer science

A Patch-Routed Mixture-of-Experts for Continual MOBA Draft Recommendation

本文提出了一种用于持续性 MOBA 阵容推荐的补丁路由混合专家架构,该架构利用版本化的补丁标识来隔离适应过程,从而实现了零遗忘,并且与独立模型相比,在减少存储的同时显著加快了收敛速度,尽管其速度优势会随着补丁流的增长而减弱。

原作者: Mohammadreza Mohammadnejad, Morteza Dorrigiv, Farzin Yaghmaee

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammadreza Mohammadnejad, Morteza Dorrigiv, Farzin Yaghmaee

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在竞技电子游戏的领域中,最关键的决策往往发生在第一枪开火之前。在像《Dota 2》这样的游戏中,两支队伍轮流禁用和选择角色(被称为英雄),以构建他们的阵容。这个选人阶段是一个高风险的谜题,其中的每一个选择都会限制未来的选项,并为胜利奠定基础。由于游戏不断被开发者更新以保持新鲜感,规则也会频繁变化。这些被称为“补丁”的更新会调整角色的强度、道具的成本以及技能之间的交互方式。今天看起来完美的策略,明天可能就会变得毫无用处。这为人工智能创造了一个独特的挑战:当“好”的定义本身就在不断变化时,计算机如何学习做出优秀的推荐?

这就是持续学习的问题。想象一名学生必须每月掌握一门新学科,但前几个月的教科书仍然有效且不能被遗忘。如果学生试图通过简单地覆盖旧笔记来学习新材料,他们就会失去应对过去考试所需的知识。这种学习新事物与记住旧事物之间的张力是人工智能的一个基本障碍。研究人员长期以来一直在寻找帮助机器适应新数据而不抹除已学知识的方法,这种挣扎被称为“稳定性-塑性权衡”(stability-plasticity trade-off)。在视频游戏背景下,补丁按固定周期发布且其身份是预先已知的,这个问题提供了一个测试特定解决方案的罕见机会。

来自塞姆南大学(Semnan University)的一个研究小组通过为《Dota 2》的选人过程构建一种新型推荐系统解决了这一问题。他们并没有试图强迫一个单一且灵活的大脑同时记住游戏的所有版本,而是设计了一个系统,该系统保留了一个共享的核心知识库,同时为每一次游戏更新分配一个专门的专家。他们的方法被称为 PatchExpertFFN,它将游戏的版本号视为一个清晰的钥匙,用以解锁正确的工具集,而不是一个需要去猜测的谜团。当游戏更新时,系统准确知道当前处于哪个版本,并将决策路由到为该时代训练的特定专家模块,从而让旧的专家不受影响。

研究人员使用涵盖五个不同游戏版本的海量职业比赛数据集对这一想法进行了测试。他们将新系统与另外两种方法进行了对比:一种是尝试在一个连续流中学习一切的标准方法;另一种是“模型动物园”(model zoo),即为每一个补丁都保存一个完全独立的、全尺寸的 AI。标准方法表现得非常吃力;随着它学习新的补丁,它会忘记如何玩旧的版本,这种现象被称为“灾难性遗忘”。而“模型动物园”则从未遗忘任何东西,因为它为每个过去的版本都保留了完美的副本,但它需要存储海量的数据,本质上是为每一次更新都保留了一座完整的“大脑图书馆”。

新系统达到了一个卓越的平衡。通过使用一个仅在第一个补丁上进行训练并随后冻结的共享骨干网络,然后为后续每个补丁附加一个较小的专门专家,研究人员实现了一个几乎与“模型动物园”一样好的结果,但效率更高。该系统保留了为早期补丁做出准确推荐的能力,且零记忆损失,达到了与独立模型相当的性能。同时,它仅需“模型动物园”所需存储空间的 63% 左右。这种效率源于该系统不需要为每个版本存储整个大脑,而只需存储发生变化的特定部分。

研究还揭示了该系统的适应速度。当新补丁到来时,新的专家学习必要调整的速度比标准方法快得多,大约只需一半数量的训练样本即可达到巅峰性能。然而,这种速度优势也有极限。随着补丁流的增长,固定的共享核心变得不再足以应对最新的版本,系统的性能开始略微落后于完全独立的模型。研究人员发现,当更新流相对于初始共享核心的有效寿命相对较短时,该系统效果最好。如果游戏改变的次数过多,最初的冻结基础最终会变得与当前的现实过于脱节,从而需要定期刷新核心本身。

这项发现之所以特别重要,在于其背后的机制。系统不需要猜测正在进行的是哪个版本的游戏;游戏客户端会直接告知它。这使得系统能够将游戏版本与正确的专家进行硬连线连接,确保为新版本进行的学习永远不会意外覆盖旧版本的知识。研究人员通过检查系统的内部权重验证了这一点,确认了过去补丁的记忆保持原样,未受新版本训练的影响。这种结构性的“零遗忘”保证是其他依赖复杂数学平衡技巧的方法只能近似实现的目标。

研究结果表明,对于必须在具有明确、标记化变化的运行环境中运行的 AI 系统,这提供了一条实用的路径。无论是软件更新、季节性目录变更还是不断变化的市场状况,如果变化的身份是已知的,就可以构建一个隔离适应过程而不牺牲记忆的系统。研究人员指出,虽然他们的方法非常高效,但它并不是针对无尽变化流的永久解决方案。该系统是为那些相对于初始共享知识寿命而言较短的流而设计的。对于长期应用,策略应包括一项定期维护政策,即重新训练共享核心以追赶当前的世界状态,从而重置专家链。

最后,这项工作证明了解决遗忘问题的方案并不总是需要更复杂的算法或更大的记忆。有时,答案在于系统的组织方式。通过尊重变化的边界,并将特定的角色分配给特定的时代,研究人员创建了一个学习迅速、记忆完美,且存储成本仅为以往解决方案一小部分的系统。它提醒我们,面对不断的变革,明确了解究竟发生了什么变化,本身就是最强大的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →