← 最新论文
🤖 machine learning

Learning Coherent Representations: A Topological Approach to Interpretability

本文引入了“相干性”(coherence),这是一种受神经编码启发的几何属性,通过强制特征与样本之间的连续关系来保证数据与特征之间具有兼容的拓扑结构,从而通过一种称为 Coh 的新型可微目标函数来实现可解释的表示。

原作者: Sigurd Gaukstad, Melvin Vaupel, Valdemar Kargård Olsen, Erik Hermansen, Benjamin Dunn

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Sigurd Gaukstad, Melvin Vaupel, Valdemar Kargård Olsen, Erik Hermansen, Benjamin Dunn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题: “零散”的大脑

想象你有一个超级聪明的机器人(深度神经网络),它正在学习识别事物。通常,当这个机器人学习时,它会建立一个关于世界的内部隐藏地图。问题在于,这张地图往往是混乱的。

在标准的机器人中,单个“神经元”(机器人内部的一个微小开关)可能会同时为猫、汽车和香蕉而亮起,但仅针对这些事物的非常特定且随机的样本。这就像如果你的大脑中有一个神经元,只有当你看到“周二的红苹果”时才会放电,但看到“绿苹果”或“周三的红苹果”时却不会一样。这使得人类无法理解机器人到底在想什么。这些特征是“不连贯的”——它们是零散的,不符合几何逻辑。

灵感来源:大脑的 GPS

作者研究了真实动物大脑的工作方式。他们研究了两种类型的细胞:

  1. 网格细胞 (Grid Cells): 它们充当 GPS 网格。当动物处于特定的、连续的空间区域(如地板上的一个瓷砖)时,这些细胞就会放电。
  2. 头向细胞 (Head Direction Cells): 当动物面向特定方向(如北方)时,这些细胞会放电。如果你稍微转动一下,同一个细胞仍会放电。它覆盖了一个平滑且连续的弧形。

这些生物细胞是连贯的 (Coherent)。它们不会随机放电;它们覆盖了世界中整洁、相连的区块。如果你知道哪些细胞正在放电,你就能立刻知道动物在哪里,或者它正在看向哪里。

解决方案:“连贯性”

这篇论文提出了一个问题:我们能否教会人工机器人像生物大脑那样组织它们的内部地图?

他们引入了连贯性 (Coherence) 的概念。

  • 类比: 想象一个图书馆。
    • 不连贯(当前的 AI): 一本关于“烹饪”的书既在烹饪区,也在“20 世纪 90 年代历史”区,还在“园艺”区,零散地分布着。如果你看“烹饪”书架,你会发现烹饪书,但也会发现随机的历史书。这是混乱的。
    • 连贯(新方法): 图书馆组织得非常好,以至于每一本“烹饪”书都整齐地排列在一个连续的行中。此外,图书馆中的每一本书都在其合理的行中被找到。“烹饪”行是一个完整的块,“历史”行也是一个完整的块。

在技术层面,论文将一个矩阵(机器人的内部地图)定义为连贯的,如果满足以下条件:

  1. 局部性 (Locality): 每个样本(如一张猫的照片)激活的特征都是彼此的“邻居”,而不是零散的特征。
  2. 覆盖性 (Covering): 每个特征都被某些样本所需要,且每个样本都能被某些特征很好地描述。既没有遗漏,也没有浪费。

魔法工具:拓扑学

他们如何衡量地图是否“整洁”?他们使用了数学的一个分支——拓扑学 (Topology)(研究形状的学科)。

  • 类比: 想象机器人的数据是一块面团。
    • 如果数据形成一个圆圈(如一个环),机器人的内部特征也应该形成一个圆圈
    • 如果数据形成两个独立的岛屿,那么特征也应该形成两个独立的岛屿

作者证明了,如果机器人的地图是“连贯的”,那么数据的形状和特征的形状将会完美匹配。如果数据是一个圆圈,特征就必须将那个圆圈铺设成整齐、连续的弧线。它们不能是零散的。这保证了特征是可解释的,因为它们遵循与现实世界相同的“形状”。

新规则:COH

为了强迫机器人以这种方式学习,作者创建了一个新的规则(损失函数),称为 COH

  • 旧规则(稀疏性/Sparsity): “只开启少数几个开关。” 这就像是在说,“只使用图书馆里的几本书。” 但你仍然可以将这几本书放在随机、零散的地方。
  • 新规则(连贯性/Coherence): “你开启的开关必须是邻居。” 这强迫机器人将相关的事物组合在一起。这不仅仅是关于激活了“多少”个东西,更是关于“哪些”东西被激活。它们必须在几何上是相互连接的。

他们测试了什么

他们在三项内容上进行了测试:

  1. 合成圆圈 (Synthetic Circles): 他们给了机器人形状如圆圈的数据。使用新规则的机器人学习到的特征也是完美的圆圈。使用旧规则的机器人学习到的特征则是零散的混乱。
  2. 旋转数字 (MNIST): 他们向机器人展示了不同角度旋转的数字(如“6”)。新规则让机器人学习到了与特定角度相对应的特征(例如,一个特征代表“正立”,一个特征代表“向左倾斜”)。旧规则的机器人无法清晰地做到这一点。
  3. 语言 (BERT): 他们将此应用于语言模型。新规则并没有仅仅寻找随机的单词,而是找到了按清晰类别对单词进行分组的特征:一个特征对应“年份”(1990, 2005),一个对应“家庭成员”(母亲, 兄弟),一个对应“方向”(北, 南)。

总结

这篇论文不仅让机器人变得更聪明,还让机器人的“思维过程”变得可读。通过强迫机器人像组织邻居一样组织其内部地图(连贯性),我们得到了一个可以让我们观察一个特征并说:“啊,这个特征代表‘年份’或‘旋转角度’”的系统。

它将机器人的“黑盒”变成了一个图书馆,在这里,每本书都在正确的货架上,而且货架本身的几何逻辑也是通顺的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →