← 最新论文
🤖 machine learning

Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory

本文介绍了 Transformer 几何观测器(TGO-IV),这是一个利用持续同调(Persistent Homology)和 Vietoris–Rips 单纯复形来全面分析 Transformer 表示在各层之间拓扑演变的创新框架,从而为原始输入如何转化为任务相关特征提供更深层的见解。

原作者: Kaustubh Kapil, Kishor P. Upla

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaustubh Kapil, Kishor P. Upla

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

思维的形状:AI 如何构建其世界

想象一下,你正试图理解一个巨大的数字大脑是如何学习识别一只猫的。长期以来,科学家们一直将这些“Transformer”——即你最喜欢的聊天机器人和图像生成器背后的强大 AI 模型——视为神秘的“黑盒”。我们知道它们运行得非常出色,但并不真正了解它们是如何学习的。为了窥探其内部,研究人员开始观察 AI 创建的“表示”(representations)。可以将这些表示想象成漂浮在高维空间中的一团发光的点。每个点都是图像的一部分(比如一簇毛发或一只耳朵),而这些点的排列方式则告诉了 AI 它正在看到什么。

此前,科学家通过测量这些“云团”的“谱”(即点分布得有多散)或其“几何结构”(即点如何聚集在一起)来研究它们。他们发现,随着 AI 的学习,云团会不断扩张并自我组织成有意义的形状。但其中还缺少一块拼图:拓扑学(topology)。简单来说,拓扑学是研究那些不在乎拉伸或弯曲、但却在乎“孔洞”和“连接”的形状的学科。这团云是一个巨大的实心块?是一个中间有孔的圆环?还是许多互不相连的孤岛?理解这些云团的“形状”有助于我们判断 AI 是真的理解了世界的结构,还是仅仅在记忆模式。这正是新研究 TGO-IV 旨在回答的问题。


论文:TGO-IV,拓扑侦探

在这项名为 TGO-IV: 开发拓扑观测站(TGO-IV: Developmental Topology Observatory) 的新研究中,来自印度 SVNIT 的研究人员 Kaustubh Kapil 和 Kishor P. Upla 正拿着放大镜,观察视觉 Transformer(一种能够“看”图像的 AI 类型)学习过程中的“形状”。他们是名为“神经形态智能研究集体”(Neuromeric Intelligence Research Collective)的大型团队的一部分,这也是他们“Transformer 几何观测站”系列中的第四部分。前几部分研究了 AI 扩散的数学特性及其语义含义,而 TGO-IV 则提出了一个更深层的问题:AI 的全局形状在学习过程中是会发生变化,还是保持不变?

为了回答这个问题,团队不仅观察了这些点,还围绕它们构建了一个数字“脚手架”。想象一下,你有一团由 197 个发光点(代表图像的各个部分)组成的云,漂浮在 384 维的空间中。仅凭观察这些点,你无法看出其形状。因此,研究人员使用了一种被称为 Vietoris–Rips 单纯复形(Vietoris–Rips simplicial complex) 的数学技巧。可以将其想象成一场“连点成线”的游戏。他们首先在距离非常近的两个点之间画一条线。然后,他们慢慢增加“连接半径”的大小。随着半径的增长,线条连接了更多的点,三个相连的点之间形成了三角形,最终会出现三维形状(如四面体)。这创建了一个近似于数据云形状的网格。

通过观察这个网格如何随半径增长而变化,他们可以追踪“持续同调”(persistent homology)。这是一种记录孔洞和连接“生命故事”的高级方法:

  • 诞生(Birth): 一个新的连接形成,或者出现了一个环。
  • 死亡(Death): 连接变得太大,导致孔洞被填满,或者环路闭合。

研究人员追踪了这些“诞生”与“死亡”,以观察 AI 如何处理图像并穿过其 12 个层级,并在 1,000 张 ImageNet-100 数据集的图像上进行了为期 100 天的训练。他们使用的是特定的模型 ViT-Small/16,该模型通过将图像分解为 16x16 的补丁(patches)来处理图像,从而产生每张图像 197 个标记(tokens,即点)。

他们的发现:伟大的整合

研究揭示了一个关于 AI 内部世界如何趋于稳定的迷人故事。以下是“拓扑观测站”所看到的景象:

1. 孤岛合并为大陆
在训练的最开始(第 1 轮迭代/Epoch 1),AI 的表示云团是一个零散的群岛。点与点之间距离很远,形成了许多孤立的岛屿。随着训练的进行,研究人员注意到 贝蒂曲线(Betti curves,一种统计连接件数量的图表) 发生了巨大变化。计算分离岛屿数量的“零阶贝蒂数”(β0\beta_0)急剧下降。点开始在过程的早期阶段就合并成更少、更大的群体。到训练结束时(第 100 轮迭代),云团已变成了一块单一且具有凝聚力的陆地。AI 不仅仅是在看局部,它是在将整个画面作为一个连接的整体来看待。

2. 环路留存,孔洞消逝
研究人员还寻找了“环路”(点的圆环)和“空腔”(三维气泡)。他们发现,虽然 AI 创造了一些环路(β1\beta_1),但这些环路始终寥寥无几。更有趣的是,三维气泡(β2\beta_2)几乎完全不存在。这表明 AI 的思维并不会形成复杂的多层信息气泡。相反,它专注于将点连接成一个坚实、扁平(或近似扁平)的结构。

3. 层级间趋于一致
一个令人惊讶的发现是关于层级之间距离的研究。研究人员使用两种工具——瓶颈距离(Bottleneck Distance)Wasserstein 距离——来衡量数据形状在不同层级之间的差异。

  • 训练初期: 各个层级之间差异很大。当数据从第一层移动到第二层,再到第三层时,其形状发生了剧烈的变化。
  • 训练后期: 随着 AI 的学习,各层级看起来越来越相似。连续层级之间形状的“距离”缩小了。这就像是 AI 不再在每一步都重新发明轮子,而是开始精炼同一个稳定的结构。

然而,他们确实注意到了一些形状发生显著变化的“峰值”,特别是在 第 3、10 和 12 层 附近。即使在 AI “学会”之后,这些特定层级仍在进行繁重的任务,以显著的方式重新组织数据。

核心理念:渐进式拓扑稳定化

基于这些观察,作者提出了一个新概念,称为 渐进式拓扑稳定化假设(Progressive Topological Stabilization Hypothesis)

他们认为,学习并不是指 AI 的内部世界坍缩成一个无聊、无特征的色块。相反,这是一个精炼的过程。

  • 隐喻: 想象一场音乐节上混乱的人群。起初,每个人都是分散的、大声叫喊且彼此脱节的(高 β0\beta_0,许多孤岛)。随着音乐响起,歌曲进入高潮,人们开始手拉手,形成小团体,最终整个人群作为一个巨大的、凝聚的浪潮在移动。人群的“形状”变得稳定且连贯,但它并没有消失。
  • 研究结果: AI 的表示变得“日益紧凑”(点靠得更近),同时保持其“非平凡的几何组织性”(结构依然有趣且有用)。AI 不仅仅是在记忆;它在构建一张稳定、连贯的世界地图。

这意味着什么(以及并不意味着什么)

作者谨慎地指出,他们并不是在声称看到了 AI 大脑的精确形状。由于他们在巨大的 384 维空间中只有 197 个点可以操作,因此他们的“网格”是一种近似,而非完美的重建。他们承认,由于点数较少,他们看到的“形状”是一种拓扑近似,而非本质真相。然而,他们观察到的趋势是一致且具有意义的。

他们明确排除了 AI 仅仅是坍缩成一个平凡、无用的点的观点。由于某些环路(β1\beta_1)在整个训练过程中得以幸存,这证明了结构的复杂性依然存在。他们也排除了 AI 是通过一次性突然跳跃来学习的观点;相反,变化是连续的,随着训练成熟,各层级之间的相似度不断提高。

前景展望

这篇论文只是漫长旅程中的第四站。研究人员已经制定了未来的计划:

  • TGO-V(计算几何): 他们想知道 AI 的数学机制(点积和注意力机制)究竟是如何创造这些形状的。
  • TGO-VI(优化动力学): 他们想要理解学习过程的“物理学”——即训练算法的数学(梯度和损失景观)是如何迫使 AI 进入这些稳定形状的。

简而言之,TGO-IV 为我们提供了一副新的眼镜。我们不再仅仅将 AI 的数据视为一团数字云,现在我们可以将其视为一个活生生的、呼吸着的形状——它始于零散的群岛,最终成长为一片稳定、连贯的大陆。这表明,当 Transformer 进行学习时,它不仅仅是在记忆,它还在为自己的知识构建一个稳定的、拓扑意义上的家园。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →