Classification Fields: Arbitrarily Fine Recursive Hierarchical Clustering From Few Examples
本文介绍了“分类场”,这是一种通过推断局部父到子细化规则从有限示例中学习无限深度层次聚类结构的框架,并证明了这些规则可被神经网络有效近似以生成具有深度且几何一致的层次结构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在看一棵家谱树。通常,当我们进行“聚类”(将事物分组)时,我们只是为眼前现有的特定对象画一棵树。如果我们有 100 张照片,我们就画一棵有 100 片叶子的树。仅此而已。树就停在那里。
但如果世界不仅仅是一个固定的 100 张照片的列表呢?如果世界像一个分形呢?想象一下蕨类植物的叶子:你看到大叶子,然后放大看到更小的叶子,再看到更小的叶子,理论上,你可以无限放大,图案会不断重复。
这篇论文提出了一个重大问题:如果我们只看到一棵巨大且无限的家谱树的前几层分支,我们能否推导出生成其余部分的“规则”?
以下是他们想法的分解,使用简单的类比:
1. 问题:“有限”与“无限”
大多数用于数据聚类的计算机程序,就像摄影师给人群拍照并画线将它们分组一样。一旦照片拍完,工作就结束了。它们不知道如果再多出现 1000 个人,该如何想象人群。
作者说:“等等,如果分组规则实际上是一个食谱呢?”
与其仅仅死记硬背我们看到的 100 个人,我们不如学习说明书,它告诉我们如何创建下一层分组,以及再下一层,以此类推,永无止境。
2. 解决方案:“分类场”
他们发明了一个新概念,称为分类场。
- 类比:想象一个魔法印章。你把它按在一张纸上(一个“父”组),它不仅仅制造一个副本;它会生成三个特定的、更小的印章图案(“子”组)。
- 规则:关键在于这个印章有一个规则:“无论你把我按在哪里,我都会在距离原始印章特定形状和距离处,始终生成三个新印章。”
- 目标:计算机的任务是观察前几层印章(我们拥有的数据),并确切弄清楚那个魔法印章长什么样。一旦它学会了这个印章,就可以反复按压它,生成它从未见过的层层分组。
3. 他们是如何做到的:“递归展开”
作者构建了一种特殊类型的 AI(神经网络)来充当这个“印章”。
- 训练:他们向 AI 展示了一棵小树(比如 3 层深)。
- 学习:AI 试图猜测规则:“如果我在这里有一个组,那三个新组应该放在哪里?”
- 测试:他们让 AI 继续按压它的“印章”,生成第 4、5、6 层,一直到第 9 层,而不向它展示答案。
- 结果:AI 并非随机猜测。它保持了模式的一致性。它创建的新组在几何上是正确的,并遵循与原始数据相同的“家谱树”结构。
4. 三项测试
为了证明这行得通,他们在三种不同的场景中进行了测试:
- “完美”测试(CFG):他们创造了一个规则在数学上完美的假想世界。AI 瞬间学会了规则,并无限期地生成完美的树。这证明了数学是成立的。
- “分形”测试(IFS):他们使用了著名的分形形状(如谢尔宾斯基三角形)。这些形状是由重复规则生成的,但这些规则与 AI 训练时所用的规则略有不同。AI 仍然推断出了规则的“精髓”,并正确地绘制了分形,即使它从未见过那个特定的分形。
- “混乱”测试(图像):他们使用了真实的猫和狗的照片(来自 CIFAR 数据集)。他们将照片分组为簇。现实生活是混乱的;这些组并非完美的分形。然而,AI 仍然学习到了一个“局部规则”,可以预测如果进一步划分,这些组将如何分裂。它不仅仅是死记硬背照片;它学习了照片之间关系的几何结构。
5. 为什么这很重要(根据论文)
论文声称,有限的观察可以揭示无限的规则。
如果你向计算机展示图案的一小部分,它可以学习“局部细化规则”(即那个印章),并利用它构建比原始数据所给定的更深、更详细的结构。
简而言之:这种方法不是教计算机仅仅整理桌上的一堆石头,而是教它这些石头的“重力定律”,这样它就能预测如果你有一百万块石头,这堆石头会是什么样子。
他们不声称的内容
- 他们不声称这将治愈疾病或预测股市。
- 他们不声称这适用于所有类型的混乱数据(如果数据过于混乱或分组不遵循模式,该方法可能会失败)。
- 他们严格专注于学习“递归细化规则”并生成更深层次分层的数学能力,而不是像医疗诊断这样的具体现实世界应用。
核心收获是视角的转变:不要只学习数据;要学习生成数据的规则,这样你就能想象出树的其余部分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。