← 最新论文
🤖 AI

Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning

本文介绍了 FLEX,这是一个具有挑战性的 34 任务基准测试,它通过消除文本指纹和扩展任务视野,揭示了当前多模态持续指令微调中专家路由的局限性,同时提出了一种原则性的类增量学习框架,显著提高了路由准确性和整体性能。

原作者: Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人依次学习许多不同的技能。首先,你教它识别猫和狗;接着,你教它解决数学问题;然后,你教它阅读医学 X 光片。这被称为持续学习(Continual Learning)。棘手之处在于,随着机器人学习新技能,它往往会忘记旧的技能,或者在当你向它提问时,它会对该使用哪种技能感到困惑。

为了解决这个问题,科学家们给了机器人一个专门的“工具箱”,称为 LoRA 专家(LoRA experts)。把这些专家想象成大型厨房里不同的厨师:一位厨师擅长烘焙,另一位擅长烧烤,还有一位擅长做寿司。当你点餐时,你需要一个路由(Router)——也就是一位聪明的服务员——来查看你的订单,并将订单发送给正确的厨师。如果服务员把一份寿司订单发给了烧烤厨师,那这顿饭就会变成一场灾难。目前这个领域的大问题是:我们的服务员能否变得更聪明,能够精准地知道该挑选哪位厨师,尤其是当餐厅增加到拥有数十位厨师,且订单看起来非常相似的时候?


问题所在:服务员在依赖捷径(但这仅仅是因为菜单太简单了)

来自南京大学的一个研究小组决定调查这些“服务员”(路由)究竟表现如何。他们研究了用于训练这些机器人的标准测试,并发现了一些可疑之处:服务员拿到了满分,但他们是在利用捷径。

在现有的测试中,“菜单”(给机器人的指令)带有明显的线索。例如,一个数学题可能会总是以“计算总和……”这样的短语开头,而一张图片描述可能会总是以“描述图像……”开头。服务员不需要看图片或理解数学,它只需要阅读指令的前几个词,就能知道该选哪位厨师。研究人员称这些线索为**“文本指纹”(textual fingerprints)**。

因为现有的测试任务较少(比如只有 6 到 10 位厨师),且菜单非常直观,所以路由问题处于“饱和”状态。这就像是一个只有三张桌子的小餐厅里的服务员;他们可以记住桌号,而无需真正了解顾客的名字。研究人员意识到,如果我们想要构建一个能在很长时间内学习数百种技能的机器人,我们需要一个更难的测试,让菜单看起来都一样,从而迫使服务员真正理解内容。

解决方案:一个全新的、更难的餐厅(FLEX)

为了解决这个问题,该团队创建了一个名为 FLEX(指纹缩减的长程专家检验,Fingerprint-reduced Long-horizon Expert eXamination)的新基准测试。

把 FLEX 想象成一家规模宏大、混乱的餐厅,这里有 34 位不同的厨师(任务),而不是只有寥寥数位。在这家餐厅里,每位厨师都使用完全相同的菜单模板。无论你是点一道数学题、一项医学诊断,还是一段关于日落的描述,指令看起来都是完全一样的。想要知道该选哪位厨师,唯一的办法就是实际观察图片并理解上下文。

研究人员还移除了这些“捷径”线索。他们确保了化学问题的指令看起来不会与艺术史问题的指令有所不同。这迫使路由系统停止依赖捷径,开始进行真正的硬核工作——弄清楚任务到底是什么。

核心理念:服务员本质上就是一个分类器

这是论文引入的一个巧妙转折。研究人员意识到,服务员(路由)的工作实际上与一个经典的机器学习问题——**类增量学习(Class-Incremental Learning, CIL)**是相同的。

在 CIL 中,你教计算机识别新的类别(比如先是“猫”,然后是“狗”,接着是“鸟”),而不会忘记旧的类别。研究人员表明,挑选正确的 LoRA 专家与挑选正确的类别完全相同:

  • 任务 1(数学)= 类别 1
  • 任务 2(艺术)= 类别 2
  • 任务 34(医学)= 类别 34

通过这种方式看待问题,他们可以借鉴已经在 CIL 领域发明出的强大“服务员训练”技术。他们提取了四种不同的方法(HC、HC-SOINN、RanPAC 和 DDAS),并将它们接入到现有机器人的路由系统中。

结果:更聪明的一位服务员

当他们在困难的 FLEX 餐厅上测试这些新的“插件式”服务员时,结果令人印象深刻:

  • 更高的准确度: 新的路由比旧的路由在识别正确厨师方面的准确率高出了高达 16.3 个百分点
  • 更好的性能: 机器人的整体性能(称为 MacroScore)提升了高达 4.6 分
  • 缩小差距: 新的路由成功弥补了当前性能与“完美”性能(即机器人永远能选对厨师)之间 28% 到 50% 的差距。

然而,论文也发现并非所有的机器人都能同等程度地受益。一些现有的系统(如 HiDe-LLaVA)其设计初衷使得即使是完美的路由也无法显著提升最终的“菜肴”,因为问题实际上出在厨师如何烹饪,而不是服务员如何下单。但对于那些高度依赖路由的系统(如 DISCO 和 SAME),提升是非常巨大的。

为什么这很重要

这篇论文表明,要让机器人真正实现长期的持续学习,我们不能只给它带有明显线索的简单测试。我们需要构建这样的环境:在这种环境下,机器人必须真正理解任务,而不仅仅是阅读标签。通过将“我该找谁?”的问题转化为“这是什么类别?”的问题,我们可以利用现有的强大工具,让我们的 AI 变得更加可靠。

研究人员不仅提出了这一建议,他们还构建了新的测试(FLEX),证明了旧的测试过于简单,并展示了更换这些新的路由方法确实有效。他们并没有声称解决了所有问题——与完美的差距依然存在——但他们展示了一条清晰且有原则的路径,通往能够真正持续学习而不产生困惑的多模态 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →