← 最新论文
📊 statistics

Maximum Mean Discrepancy with Unequal Sample Sizes via Generalized U-Statistics

本文通过利用广义U-统计量,将最大均值差异(MMD)两样本检验扩展至不等样本量情况,从而消除了丢弃数据的必要性,并提供了新的渐近特征描述与功效优化准则,同时阐明了退化估计量与非零MMD值之间的关系。

原作者: Aaron Wei, Milad Jalali, Danica J. Sutherland

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Aaron Wei, Milad Jalali, Danica J. Sutherland

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探:这两堆数据是真的不同,还是仅仅来自同一个源头的随机噪声?

在机器学习的世界里,这被称为“双样本检验”(two-sample test)。你有一堆来自对照组的照片(我们称之为堆 A)和一堆来自实验组的照片(堆 B)。你的任务是判断治疗是否改变了某些东西。为了做到这一点,侦探们使用了一个工具——最大均差异(Maximum Mean Discrepancy, MMD)。把 MMD 想象成一个超级灵敏的秤,用来称量“数据云”的“形状”。如果云朵看起来不同,秤就会倾斜,你就知道存在差异。

旧有的问题:“等边”规则

长期以来,这个秤有一个奇怪且令人恼火的规则:只有当你拥有 A 堆和 B 堆完全相同数量的照片时,它才有效。

在现实世界中,这简直是一场噩梦。也许你有 1,000 张来自罕见疾病的照片(堆 A),但有 10,000 张健康照片(堆 B)。旧方法会说:“噢不,我们不能用这个!我们必须扔掉你 9,000 张健康的照片,让两堆的大小相等。”这就像仅仅因为箱子大小不匹配,就扔掉了 90% 的证据。这既浪费了数据,也削弱了你的测试能力。

新的解决方案:“广义化”的秤

这篇论文介绍了一种使用 MMD 秤的新方法,它不在乎两堆的大小是否相等。作者 Aaron Wei、Milad Jalali 和 Danica J. Sutherland 找到了让数学逻辑在其中一堆极小而另一堆极大时依然成立的方法。

他们通过将数学模型从标准的“U-统计量”(需要等边)升级为**“广义 U-统计量”**来实现这一点。

这里是他们发现的魔术技巧:
与其根据照片的总数来缩放结果(当规模不同时会变得非常混乱),他们发现你应该根据较小的那一堆来进行缩放。

  • 旧方法:nA+nBn_A + n_B 进行缩放。
  • 新方法:min(nA,nB)\min(n_A, n_B) 进行缩放。

他们从数学上证明了,如果你使用较小那一堆的大小作为你的“尺子”,那么无论你的数据多么不对称,结果都会保持稳定且准确。他们甚至展示了,如果你有一个只有 100 个项目的微型堆和一个拥有 10,000 个项目的巨型堆,通过将 100 作为你的锚点,你仍然可以获得非常精确的答案。

一个令人惊讶的转折:“退化”之谜

在解决规模问题的同时,作者发现了一些可能会让该领域其他专家感到惊讶的现象,即 MMD 分数与数学中的“退化性”(degeneracy)之间的关系。

通常,人们认为:“如果 MMD 分数为零,则两堆数据是完全相同的,且数学会变得‘退化’(意味着方差为零)。”
但作者证明了反向情况并不总是成立。 他们表明,有时即使在 MMD 不为零的情况下,也可能出现退化估计量(方差为零)。

换句话说,你可以遇到这样一种情况:两堆数据实际上是不同的(因此 MMD 不为零),但数学表现却呈现出一种通常只在两堆完全一致时才会出现的“退化”状态。他们构建了一个特定的案例,其中两堆数据虽然不同,但估计量却是退化的。然而,他们也证明了在大多数常见的现实场景中(例如使用标准的高斯核处理具有重叠形状的数据),这种奇怪的“退化但非零 MMD”情况并不会发生。因此,从实际操作的角度来看,你不需要惊慌,但现在的数学对于这些极端情况描述得更加诚实了。

“威力升级”:利用你所有的数据

这个新方法最好的部分在于,它能让你利用手中的每一件数据

  • 旧方法: 如果你有 1,000 个罕见病例和 10,000 个常见病例,你会扔掉 9,000 个常见病例以进行公平竞争。
  • 新方法: 你保留了全部 11,000 个。

作者使用真实图像数据(CIFAR-10 和 CIFAR-10.1)进行了模拟实验。他们设置了一个测试,其中一组有 1,000 张图像,另一组有 r×1,000r \times 1,000 张图像(其中 rr 为 1、2、4 或 8)。

  • 当他们使用旧方法(扔掉数据)时,测试效力尚可。
  • 当他们使用新方法(保留所有数据)时,测试的效力显著增强
  • 在实验中,当比例为 8 比 1 时,新方法检测出差异的成功率高达 99.9%,而旧方法仅为 82.1%。

他们没有做的事情(以及他们排除了什么)

了解这篇论文没有声称的内容很重要:

  • 他们并没有发明一种选择最佳核函数(即你观察数据的“镜头”)的新方法。他们只是展示了如何在样本量不等的情况下使用现有的最佳核函数方法。
  • 他们并没有说这适用于所有可能的数学怪现象。他们证明了这适用于“常见情况”(如具有重叠数据的连续核函数)。如果数据处于两个完全分离、互不相交的世界(例如数据从未接触过),数学会变得复杂,他们承认尚未完全解决这个特定的边缘情况。
  • 他们并没有声称解决了“置换检验”(permutation testing,一种设定测试合格标准的方法)的问题。他们仍然使用置换检验来设定阈值,但现在他们可以在两堆大小不等的情况下进行。

核心结论

作者搭建了一座桥梁。以前,如果你的数据堆大小不同,你必须切掉多余的部分并听天由命。现在,你可以将整个、杂乱且不对称的数据堆投入 MMD 秤中。数学依然成立,测试变得更强,你也不必再扔掉任何珍贵的证据。

他们通过严谨的数学(关于渐近分布的定理)证明了这一点,并通过真实图像数据集的模拟实验验证了结论。对于任何想要比较两个规模不等的数据组的人来说,这是一个扎实且实用的升级。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →