Transformer Geometry Observatory TGO-III: Semantic Geometry Observatory
本文介绍了 TGO-III,这是一个通过分析 ViT-Small/16 表示在训练层中的演变过程来证明类别可分性和判别性语义结构随流形扩张逐步显现的框架,从而支持了语义扩张假设。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人如何识别动物。你给它看了成千上万张猫、狗和鸟的照片。起初,机器人的大脑是一团混乱的数字;它看到猫和狗时,只觉得是一堆毫无区别的像素碎片。但随着它不断学习,它的数字大脑内部发生了一些神奇的变化。数字开始变得有序。代表“猫”的数字逐渐远离“狗”的数字,在浩瀚的数据海洋中形成了整齐、独立的岛屿。这个研究领域被称为机器学习,特别是它在观察“视觉 Transformer”(一种看图能力超强的 AI)如何改变其内部思维模式。科学家们之所以关注这一点,是因为如果我们理解了这些机器人是如何组织它们的思想的,我们就能构建出更好、更可靠的 AI,让它不仅仅是在猜测,而是真正理解这个世界。
你即将阅读的这篇论文,题为《TGO-III:语义几何观测站》(TGO-III: Semantic Geometry Observatory),就像是这个数字大脑的高科技显微镜。作者 Kaustubh Kapil 和 Kishor Upla 想要回答一个大问题:随着 AI 的学习,它是变得更加随机和复杂,还是真的开始按意义进行分类整理?他们使用了一套全新的工具,来观察一个名为 ViT-Small/16 的模型在 100 天(epochs)内,针对 100 种不同类型的图像(来自 ImageNet-100 数据集)进行训练时的“大脑”变化。
以下是他们发现的故事,通过一座不断成长中的城市的视角来讲述。
思想之城
把 AI 的内心世界想象成一座巨大的、空旷的城市。当训练开始时,这座城市是一片平坦、泥泞的平原。所有的想法(比如“猫”、“狗”、“汽车”)都挤在同一个地方。AI 无法分辨它们。
随着 AI 开始训练,这座城市开始扩张。在之前的研究(TGO-I 和 TGO-II)中,科学家们注意到这座城市正在变得更大、更复杂,就像一座城市正在长出新的摩天大楼和蜿蜒的道路。他们称之为“流形扩张”(Manifold Expansion)。但他们并不知道这座城市为什么在生长。它只是变得越来越乱了吗?还是它正在建立一个更好的社区规划?
TGO-III 是这位新的城市规划师,他介入并回答了那个问题。他们不仅观察了城市的大小,还观察了不同的社区(语义类别)是如何排列组合的。
观测站的四件工具
为了理解城市的布局,作者使用了四种特殊的测量工具:
- 线性探测器(简单测试): 想象你问一个非常简单的机器人:“这是猫还是狗?”如果 AI 的大脑很混乱,这个简单的机器人会经常猜错。但如果 AI 的思想组织得很好,这个简单的机器人就可以在地图上画一条直线,然后说:“左边的一切都是猫,右,边的一切都是狗。”作者发现,随着训练的进行,这个简单的机器人变得越来越出色。这意味着 AI 正在让它的想法变得更容易区分。
- 费舍尔比率(人群计数器): 这个工具衡量的是一群朋友(比如所有的“猫”)结合得有多紧密,以及它们距离其他群体(比如“狗”)有多远。高分意味着猫群紧紧地聚在一起,而且这个圆圈离狗群很远。作者观察到这个分数上升了,这意味着群体变得更紧凑,且彼此之间的距离更远了。
- 质心距离(地图漫步): 这衡量的是每个群体“重心”之间的距离。如果你站在猫社区的中心,走到狗社区的中心,要走多远?作者发现,随着训练的推进,这些社区移动得越来越远,创造出了一个巨大的、开阔的城市,没有任何两个群体会产生混淆。
- 局部 PCA 秩(房间大小): 这是最有趣的一个。它问道:“一个特定的社区需要多少个维度才能存在?”在开始时,“猫”的社区是一个混乱、蔓延的混乱状态,需要一个巨大的、三维的仓库来容纳它的所有变化。但随着 AI 的学习,“猫”的社区变得更加有序。它不再需要一个巨大的仓库了;它可以容纳在一个整洁、紧凑的房间里。作者发现,虽然整个“城市”变大了,但单个“社区”却变得更小、更高效了。
重大发现:语义扩张
作者发现的最令人兴奋的事情是他们所称的语义扩张假设。
在这篇论文之前,有些人认为 AI 在学习过程中只是变得更加随机和复杂。但 TGO-III 表明,这其实更有目的性。AI 不仅仅是在制造更大的混乱;它正在积极地绘制一张更好的地图。
可以这样想:当你刚开始学习画画时,你的素描本里全是涂鸦。随着练习,你不仅仅是画了更多的涂鸦,你开始画出清晰的形状。你学会了圆圈是用来画头部的,线条是用来画身体的。那些“涂鸦”(额外的复杂性)实际上被用来创造更清晰、更鲜明的类别。
作者观察到,随着 AI 的训练,“猫”的想法和“狗”的想法并不仅仅是随机漂移。它们将自己组织成了一种结构,使得它们易于区分。这个“城市”扩张了,是为了给这些新的、清晰的区别腾出空间。
“过渡区”的惊喜
论文还观察了这种组织过程发生在 AI 大脑中的哪个位置。AI 的结构像一叠层叠的结构,就像一栋多层建筑。作者发现,底层(早期层)仍然有些混乱。真正的魔法发生在顶层。
他们证实了一个被称为过渡区假设的理论,但带有一个转折。他们发现,“中间层”是几何结构开始发生变化的地方,但最终的楼层才是真正进行分类整理的地方。顶层才是“猫”和“狗”真正分离并变得清晰透明的地方。这就像底层是建筑工地,而顶层则是装修精美、住户安居乐业的公寓。
这意味着什么(以及不意味着什么)
作者谨慎地表示,他们只是观察到了这种行为,并且证据支持了他们的观点。他们并没有“解决”AI 的谜团,但他们提供了一张关于其运作方式的非常强大的地图。
他们排除了 AI 只是在变得更加随机或者仅仅是以混乱的方式记忆图像的可能性。相反,他们表明 AI 正在积极地将其知识组织成整齐、分离且高效的群体。
最后,TGO-III 告诉我们,当一个视觉 Transformer 进行学习时,它不仅仅是在变大,它还在变得更聪明。它将一片混乱的数据云转化为一座组织有序的城市,在这里,每一个想法都有属于自己的位置,远离他人,随时准备被瞬间识别。这是秩序从混沌中诞生的一个美丽的例子,即使是在机器内部也是如此。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。