← 最新论文
💻 computer science

Beyond Routing: Characterising Expert Tuning and Representation in Vision Mixture-of-Experts

本文表明,视觉混合专家模型中的专家专业化不仅限于简单的类别路由,还涵盖了对连续视觉和语义维度的更广泛、稳定的调整,而这一现象通过细粒度的专家级分析而非仅凭门控统计量才能得到最佳理解。

原作者: Gene Tangtartharakul, Katherine R. Storrs

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Gene Tangtartharakul, Katherine R. Storrs

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一间巨型高科技厨房,里面有一位主厨(“门控网络”)和一支由专业副厨(“专家”)组成的团队。当顾客点了一道菜(一张图像)时,主厨会迅速决定由哪些副厨来负责制作。

长期以来,研究这些"AI 厨房”的学者只关注“点单 slips"。他们会说:“啊,主厨把所有‘狗’的订单都派给了副厨 A,把所有‘汽车’的订单都派给了副厨 B。”他们假设,既然订单是按类别分拣的,那么这些厨师本身也仅仅是特定类别的专家。

然而,这篇论文决定走进厨房,亲眼观察厨师们实际上是如何“烹饪”的。作者 Gene Tangtartharakul 和 Katherine Storrs 构建了一个视觉 AI 模型,并利用人类脑科学的工具,来探究这些“副厨”究竟在做什么。

以下是他们发现的简要说明:

1. 点单 slips 会撒谎(路由 vs. 现实)

主厨的决策(路由)看起来确实像是在按简单类别进行分拣。如果你查看数据,似乎一位厨师只处理“动物”,而另一位只处理“机器”。

但当研究人员观察厨师们反应最强烈的内容(“最兴奋的输入”)时,故事就变了。

  • 类比:想象一位厨师被分配了所有“鹿”的订单。你可能会认为他是“鹿专家”。但当你观察什么能让他烹饪得最快、最好时,你会发现他实际上并不是在思考“鹿”。他痴迷于颗粒状纹理高对比度图案。碰巧的是,训练数据中鹿的图片包含大量颗粒状纹理。
  • 结论:主厨按宽泛类别进行分拣,但个体厨师实际上是对特定的视觉特征(如纹理、形状、颜色和“尖锐度”)进行调优,这些特征跨越了许多不同的类别。

2. “有生命”与“无生命”的分野

尽管厨师们有不同的具体偏好(一位喜欢“金属”物体,另一位喜欢“毛茸茸”的物体),但研究人员在整个厨房中发现了一个巨大且一致的模式。

无论他们雇佣了多少厨师(4 名、8 名或 16 名),也无论他们如何开始训练,团队总是将世界划分为两个大类:

  1. “有生命”团队:那些对有机、不规则、运动或生物性物体反应最佳的专家。
  2. “无生命”团队:那些对人工、几何、静态或制造物体反应最佳的专家。

这有点像人类大脑中有一个特定区域对人脸产生反应,而另一个区域对地点产生反应。AI 自然地发现了这种“有生命”与“无生命”的划分,尽管没有人告诉它去寻找这一点。这是划分视觉世界最根本的方式。

3. “口味”不同,但“菜单”相同

这里有一个令人惊讶的反转。尽管厨师们针对不同的具体特征进行了调优(一位热爱“金属”,另一位热爱“皮毛”),但他们在如何组织菜单上达成了一致。

如果你问任何一位厨师:“猫更像狗还是更像烤面包机?”他们都会回答“狗”。尽管他们使用了不同的感官工具得出了这个结论,但他们都构建了相同的世界心理地图。这表明,虽然专家使用的工具是独特的,但他们理解的结构是共享且稳定的。

4. 为什么这很重要

这篇论文认为,我们看待这些 AI 模型的方式错了。我们过于关注“谁接到了哪个订单”(路由),而不够关注“专家实际上尝到了什么”(调优)。

通过使用借自神经科学的工具(例如观察哪些刺激能让脑细胞最强烈地放电),作者表明这些 AI 专家不仅仅是简单的类别文件夹。它们是复杂的、细微的探测器,用于检测诸如“光泽度”、“圆润度”或“有机性”等连续特征。

简而言之:AI 不仅仅是将图片归类为“动物”和“汽车”。它将它们归类为丰富的、连续的视觉特征谱系,并在有生命和无生命的事物之间存在深刻的自然划分。“点单 slips"(路由)只是一幅粗略的草图;真正的杰作在于详细的烹饪过程(专家调优)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →