← 最新论文
📊 statistics

Iterative Erasure Count Is Not an Affine-Invariant Concept Dimension

本文表明,用于估计概念维度的迭代擦除计数并不具有仿射不变性,因此取决于特定的测量程序和表示几何结构,而非反映神经表示的一种内在语义属性。

原作者: Tingan Jin, Shuhang Dong, Haosong Li, Chung-Hsien Chou

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Tingan Jin, Shuhang Dong, Haosong Li, Chung-Hsien Chou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

统计神经“方向”中的隐藏陷阱

想象一下,你正试图理解一个超级聪明的机器人是如何观察世界的。你可能会想:“如果我能向机器人提问并得到答案,那么这个信息一定存储在其大脑中的某个特定方向里。”科学家们开发了一种被称为“迭代擦除”(iterative erasure)的巧妙技巧来统计这些方向。其原理如下:你找到机器人用来回答问题的那个方向,然后从数学上“擦除”那个方向,再重新提问。如果机器人仍然知道答案,你就擦除另一个方向。你不断计数,直到机器人最终说:“我不知道。”你所执行的擦除次数被认为是一个概念的真实“维度”——就像在统计混合出特定紫色时,用了多少种不同的颜色。

但问题在于:如果机器人的大脑不是一个固定、僵硬的盒子,而是一个具有拉伸性的、变形的形状如气球呢?如果你挤压或拉伸这个气球(这在数学上称为“重参数化”,reparameterization),内部的方向会改变其角度和长度,尽管机器人掌握的知识完全没有变化。这篇论文深入研究了人工智能的一个领域——“表示学习”(representation learning),研究人员通过这个领域来研究 AI 模型如何组织信息。核心问题是:当我们通过计算需要擦除多少次方向才能让 AI 忘记一个概念时,我们统计的是一个真实的、不可改变的概念特征,还是仅仅在统计气球在那个瞬间恰好被拉伸成了什么样子?

大气球拉伸实验

这篇论文揭开了用于测量 AI 概念的一种流行方法的面纱,揭示了一个令人惊讶且带有某种“恶作剧”色彩的真相:你得到的计数完全取决于你如何拉伸数据,而不是取决于概念本身。

作者 Tingan Jin、Shuhang Dong、Haosong Li 和 Chung-Hsien Chou 指出,“迭代擦除计数”——即你需要删除多少个方向才能让 AI 忘记一个概念——并不是 AI 知识的一个固定、内在的属性。相反,它是一个“相对于过程”(procedure-relative)的数字,这意味着它会根据你进行计数的特定数学工具和规则而改变。

为了证明这一点,他们建立了一个可以控制每一个变量的数学“实验室”。他们创造了一个场景,其中一个概念(比如一个简单的“是/否”信号)仅由一个隐藏源生成。在现实世界中,这就像一个电灯开关打开了一盏灯。然而,他们随后对数据应用了一个数学上的“剪切”(shear,一种倾斜的拉伸),将这个单一的开关与一些随机噪声混合在一起。尽管该概念仍然由一个源生成,且 AI 仍然可以通过移除一个方向来被“防御”(使其忘记),但擦除计数游戏却给出了不同的答案。

当他们使用标准的、直线型的(欧几里得)计数方法时:

  • 如果数据是完美的直线(没有拉伸),计数器会在 1 处停止。
  • 如果他们应用了哪怕极其微小的拉伸(剪切因子仅为 0.52),计数器会突然跳到 2

这就像你有一个电灯开关,但如果你从一个倾斜的角度观察房间,你突然会觉得需要拔掉两根不同的电线才能关掉灯。论文从数学上证明了,对于特定类型的 AI 探针,仅仅通过改变坐标系,计数就可以从 1 跳到 2(或者在更复杂的设置中从 2 跳到 4),即便底层的“概念维度”从未改变。

对真实机器人的“压力测试”

作者不仅停留在数学层面;他们还在分析视频和图像的真实冻结 AI 模型(具体为 V-JEPA2 和 DINOv2)上进行了测试。他们观察了一个名为“手部-物体接触”(hand-object contact)的概念——基本上就是:手是否正在触摸物体?

他们提取了 AI 的内部特征(其“大脑”状态),并对这些特征应用了不同的数学拉伸(称为“稠密映射”,dense maps)。然后,他们再次运行了擦除计数游戏。

  • 结果: 当他们使用标准的、未拉伸的视角时,AI 似乎需要一定数量的擦除才能忘记接触。但当他们拉伸数据(使用 23510 等因子)时,使 AI “忘记”所需的擦除次数发生了显著变化。
  • 证据: 在一个包含 4,000 个样本的实验中,标准(单位矩阵)设置在所有 20 次运行中都在 1 次更新后停止。但当他们应用拉伸(剪切因子为 1)时,所有 20 次运行都至少接受了 2 次更新,有些甚至高达 8 次。

这表明,“计数”并不是一个关于涉及多少个“物理变量”的稳定度量。它是数学如何与数据的特定形状进行交互的一种度量。

一线生机:一种新的计数方式

论文并没有仅仅说“这个方法失效了”;它提供了一种修复数学的方法,使其能够奏效,但前提是必须遵循严格的规则。他们证明,如果你带着你的“尺子”(度量,metric)一起随之拉伸,计数就会保持不变。这被称为“仿射等变性”(affine equivariance)。

可以这样理解:如果你拉伸一张印有图案的橡胶片,图案会发生扭曲。如果你使用的尺子也随着橡胶一起拉伸,你的测量就会保持准确。如果你使用一把刚性的金属尺,你的测量就会出错。作者指出,如果你使用“正确的”尺子(传输度量,transported metric)并遵循正确的步骤,计数就会变得稳定。然而,他们强调,目前该领域流行的许多方法使用的是“刚性金属尺”,这会导致误导性的计数。

这对你意味着什么

本文的主要启示是对任何试图统计 AI 思维“维度”的人提出的警告。如果你看到一篇论文声称某个概念使用了“数十个方向”,因为某个擦除算法统计出了这么多,你应该保持怀疑。那个数字可能仅仅是由于数据被拉伸或算法设置方式而产生的伪影。

作者总结道,“迭代擦除计数”并不是关于 AI 心智的一个神奇的、与坐标无关的真理。它是一个由表示的几何结构和完整的测量过程共同决定的结果。要得到一个真实的答案,你必须预先声明你的规则、你的尺子以及你的停止点。如果没有这些承诺,你得到的数字仅仅是你自己的数学逻辑的反映,而不是 AI 的秘密。

简而言之:除非你知道气球是如何被拉伸的,否则不要相信那个计数。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →