← 最新论文
🤖 machine learning

Representational Alignment Across Model Layers and Brain Regions with Multi-Level Optimal Transport

该论文提出了一种名为多级别最优传输(MOT)的统一框架,通过联合推断全局一致的软层间耦合与神经元级传输计划,克服了传统方法在深度不匹配网络对齐中的局限,实现了跨模型层级、脑区及训练轨迹的更丰富、可解释且结构化的表征对齐。

原作者: Shaan Shah, Meenakshi Khosla

发布于 2026-04-23
📖 2 分钟阅读☕ 轻松阅读

原作者: Shaan Shah, Meenakshi Khosla

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为**“多层级最优传输”(Multi-Level Optimal Transport, 简称 MOT)**的新方法,用来比较不同的人工智能模型,甚至比较人工智能和人类大脑。

为了让你轻松理解,我们可以把这项技术想象成**“给不同的图书馆做图书分类和匹配”**。

1. 以前的做法:笨拙的“一对一”配对

想象你有两个图书馆:

  • 图书馆 A 有 5 层楼(代表一个较浅的 AI 模型)。
  • 图书馆 B 有 10 层楼(代表一个较深的 AI 模型)。

以前的研究方法(比如“成对匹配”)就像是一个死板的图书管理员。他的规则是:

“我必须把 A 的第 1 层楼,强行对应到 B 的某一层楼。A 的第 2 层对应 B 的另一层……以此类推。”

这种做法的问题:

  • 太死板: 如果 A 的第 1 层楼里的书(知识),其实分散在 B 的第 1、2、3 层楼里呢?旧方法只能强行选一层,导致匹配不准。
  • 顾此失彼: 管理员可能发现 B 的第 5 层楼特别像 A 的第 1 层,于是把 A 的第 1 层全配给 B 的第 5 层。结果 B 的第 1-4 层被忽略了,而 A 的第 2 层又被迫去配 B 的第 5 层,造成混乱。
  • 没有全局观: 他只看局部,不知道整个图书馆的布局结构。

2. 新方法的突破:灵活的“物流运输”

这篇论文提出的 MOT 方法,就像是一个聪明的物流调度系统。它不再强迫“一层对一层”,而是允许**“一层对多层”**的灵活分配。

核心比喻:运送“知识货物”

想象每个图书馆的每一层楼都装满了“知识货物”(神经元激活数据)。

  • 旧方法:试图把 A 的一整箱货物,直接塞进 B 的一个特定房间里。
  • MOT 方法:把货物拆散。A 的第 1 层楼的货物,可以同时运送到 B 的第 1、2、3 层楼。
    • 如果 B 的第 1 层接收了 30% 的货物,第 2 层接收了 50%,第 3 层接收了 20%,系统会记录这种**“软性连接”**。
    • 同时,系统保证**“守恒定律”**:A 的所有货物必须全部运走(不能丢),B 的所有房间也必须被合理填满(不能有的房间空着,有的塞爆)。

3. 这个方法解决了什么大问题?

A. 处理“身高不同”的模型(深度不匹配)

就像上面说的,一个 5 层的模型和一个 10 层的模型怎么比?

  • 旧方法:很头疼,强行配对会出错。
  • MOT 方法:它发现,浅层模型的一个“大房间”(一层),其实包含了深层模型中几个“小房间”(几层)的功能。于是,它把浅层的一层货物,均匀地分发给深层的几层。这就完美解释了为什么深层模型更“聪明”——因为它把原本压缩在一层里的复杂计算,拆解成了多个步骤。

B. 发现“隐藏的结构”

当你用 MOT 比较两个模型(或者一个人脑和一个 AI)时,它不仅能算出一个总分(这两个系统有多像),还能画出一张**“热力图”**。

  • 这张图会显示:A 的早期层(处理简单线条)自然地对应 B 的早期层;A 的深层(处理复杂物体)对应 B 的深层。
  • 这种**“层级对应关系”**是自动浮现的,不需要人为规定。而旧方法往往只能看到乱糟糟的连线,看不出这种清晰的层级结构。

C. 旋转不变性(给地图换个方向也能认出来)

有时候,两个模型虽然处理逻辑一样,但内部数据的“方向”不同(就像一张地图被旋转了 90 度)。

  • 旧方法可能会说:“这两个地图不一样!”
  • 论文还提出了一种**“旋转增强版”(MOT+R),它像是一个拿着指南针的导航员**。即使地图被旋转了,它也能识别出:“哦,虽然方向变了,但‘山’还是对应‘山’,‘河’还是对应‘河’。”这在比较视觉模型(如识别图片的 AI)时特别重要。

4. 实验结果:真的有用吗?

作者用这个方法做了三件事,效果都很棒:

  1. 比较不同的 AI 模型(比如 LLaMA 和 Qwen):发现它们虽然名字不同、大小不同,但内部的学习路径惊人地相似,且 MOT 能更准确地捕捉这种相似性。
  2. 比较不同的人脑(通过 fMRI 扫描):发现不同人的大脑视觉皮层(V1, V2 等区域)在功能上有着非常清晰的对应关系,而旧方法很难发现这种规律。
  3. 比较 AI 和人脑:发现 AI 的早期层确实像人脑的早期视觉区,深层像高级认知区。

总结

这篇论文的核心思想就是:不要死板地“一对一”硬凑,要学会“多对多”的灵活分配。

就像比较两个不同规模的团队时,不要强行把小团队的一个成员对应到大团队的一个成员,而应该看小团队的一个职能是如何在大团队的多个岗位中体现出来的。MOT 就是那个能看清这种复杂、全局、灵活对应关系的“超级显微镜”。

它让我们能更公平、更深刻地理解:无论是不同的人工智能,还是人类的大脑,它们是如何一步步构建起复杂的智能的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →