Scalable Knowledge Editing for Mixture-of-Experts LLMs via Tensor-Structured Updates
本文提出了一种面向混合专家大语言模型的可扩展闭式知识编辑框架,该框架利用张量结构与伍德伯里矩阵恒等式实现每专家更新,在保持与稠密层基线相当的编辑质量的同时,最高可实现 6 倍的加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《通过张量结构化更新实现混合专家大语言模型的可扩展知识编辑》(MoTE)的通俗解读,采用简单概念与类比进行拆解。
核心难题:更新一座巨型图书馆
想象大语言模型(LLM)是一位博学多才、近乎全知的超级图书管理员。然而,一旦管理员完成训练,其知识便处于“冻结”状态。若世界发生变化(例如新总统当选,或科学事实被修正),这位管理员仍会给出过时且错误的回答。
通常,要解决这一问题,必须让管理员重返学校,进行漫长且昂贵的再训练。这不仅耗时,耗费巨大的算力成本,还可能导致管理员遗忘其原本掌握的其他知识。
知识编辑提供了一种捷径。与其重新训练整个管理员,不如直接深入其记忆库,替换特定的文件。以往的方法在“稠密”模型(即大脑的每一部分都处于激活状态)上表现优异,但在面对现代模型时却显得力不从心。
新挑战:“专家”团队
现代人工智能模型(如 OpenAI 或 DeepSeek 所使用的模型)并非依赖单一的巨型大脑,而是采用**混合专家(MoE)**架构。
- 类比:想象你拥有的不是一位巨型管理员,而是一个由 100 位专业专家组成的团队(包括历史学家、程序员、厨师、医生等)。
- 运作方式:当你提出问题时,一位“路由器”(即管理者)会审视问题,仅唤醒 4 到 8 位相关的专家,其余专家则保持休眠。
- 问题所在:如果你想更新一条事实(例如“法国首都是巴黎”),旧有的编辑工具不知如何与这个特定团队沟通。它们试图将整个团队视为一个巨大的整体进行处理,既低效又混乱。现有的修复方法(称为 MoE-Edit)则像是试图按顺序逐一更新专家,排着长队逐一操作,耗时极长。
解决方案:MoTE(智能团队管理者)
作者提出了一种名为MoTE(混合专家 Tucker 编辑器)的新方法。他们通过两项主要技巧解决了上述问题:
1. “捷径”数学(Woodbury 恒等式)
以往更新专家的方法需要求解一个庞大且复杂的数学谜题,涉及对巨大矩阵(数字网格)求逆。这就像试图解一个拥有百万个方格的数独。
作者利用了一种名为Woodbury 恒等式的数学技巧。
- 类比:与其去解那个百万方格的谜题,他们意识到只需解一个代表“所需变更”的微小 50 方格谜题即可。
- 结果:这将原本需要数小时的任务缩短至几分钟。他们可以在无需“唤醒”或一次性计算每一位专家完整权重的情况下更新知识。
2. 尊重团队结构(张量分解)
第二项技巧在于认识到专家并非随机存在,而是相互关联的。它们是在共同训练中形成的,因此其知识以一种特定的三维形状相互连接(就像一块奶酪,而非一张扁平的纸)。
- 类比:想象专家们是一个合唱团。如果你想改变歌曲的音高,你不会只对着一个人喊叫,而是调整整个群体的和声。
- 方法:作者使用了Tucker 分解。这是一种将“奶酪块”(专家权重)压缩为一个更小的核心形状的方法,该形状捕捉了群体的本质。
- 优势:通过编辑这个更小的“核心”形状,他们能够以一种尊重专家间关系的方式自动更新所有专家。这防止了模型产生混淆或“遗忘”其他内容。
结果:快速且精准
该论文在多个现代 AI 模型(如 Qwen 和 GPT-OSS)上测试了 MoTE,并将其与之前的最佳方法(MoE-Edit)及标准再训练进行了对比。
- 速度:MoTE 比之前的最佳方法快达6 倍。它能在极短的时间内编辑 1,000 条事实。
- 质量:在修正事实的有效性(Efficacy)以及不破坏模型其他部分的能力(Specificity)方面,它与那些较慢的方法表现相当。
- 效率:其高效性源于仅在流程的最后阶段进行一次繁重的数学计算,然后将该结果扩散到其他层,而非为每一层重新计算。
总结
该论文介绍了MoTE,这是一种工具,使我们能够快速、准确地更新现代“基于专家”的 AI 模型。其实现方式如下:
- 利用数学捷径避免不必要的繁重计算。
- 尊重专家的团队结构,确保更新合乎逻辑。
这意味着我们可以在无需从头再训练的情况下,使 AI 模型与现实世界保持同步,从而节省大量的时间和能源。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。