← 最新论文
📊 statistics

Gibbs randomness-compression proposition

本文提出了并实验验证了“吉布斯随机性-压缩命题”,该命题通过证明学习性能与压缩深度学习模型剩余权重所测得的吉布斯熵之间存在高度相关性,建立了模型压缩与定向随机性之间可计算的联系。

原作者: M. Süzen

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: M. Süzen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一座庞大且混乱的图书馆塞进一个极小的背包里。你必须扔掉一些书,但你又想保留那些最重要的故事,以便日后仍能讲述一个精彩的故事。这就是数据压缩的核心:在不丢失魔力的前提下,让体积变小。几十年来,科学家们一直在思考关于这种“打包”过程与随机性之间一种奇特的联系。通常,我们认为随机性是纯粹的混沌——就像旧电视上的静电或骰子不可预测的滚动。但在数学和物理学领域,有一个深刻的思想:我们组织信息的方式(压缩)与事物表现出随机性的方式,实际上是同一枚硬币的两面。这篇论文步入了那场对话,提出了一个具体的问题:如果我们为了缩小体积而挤压一个聪明的计算机大脑(神经网络),它内部的“随机性”是否会以一种可预测的方式发生变化?我们能否利用这种变化来告诉我们,它的工作表现将会如何?

由 M. Süzen 领导的作者们提出了一种名为**吉布斯随机性-压缩命题(Gibbs randomness-compression proposition)**的新想法。把神经网络想象成一个巨大且错综复杂的连接网络,就像一座拥有数百万条道路的城市。为了让这座城市变小(压缩),他们使用了一种特殊的方法——双重断层扫描压缩法(Dual Tomographic Compression, DTC)。这有点像从两个不同的角度同时对城市进行 3D 扫描,找出哪些道路几乎无人使用,然后在城市运行的同时小心地移除它们。他们反复进行这个过程,一步步地缩小城市。

这是重大的发现:在他们缩小网络的过程中,他们测量了两件事。首先,他们检查网络是否仍能很好地完成任务(比如识别数字图片)。其次,他们测量了“吉布斯熵(Gibbs entropy)”,这是一种衡量剩余连接看起来多么“随机”或“无序”的高级数学方法。论文指出一个令人惊讶的规则:这两者以一种高度同步的方式共同运动。随着网络的缩小以及“随机性”(熵)的下降,性能也会以一种非常可预测、同步的舞步下降。

作者们在经典的计算机视觉任务上测试了这一方法:教计算机识别来自 MNIST 数据集的手写数字。他们将这种高级的 DTC 方法与两种更简单的缩小网络的方法进行了对比:仅仅是随机切断道路(随机剪枝)以及切断最小、最弱的道路(量级剪枝)。结果显示,他们的这种方法表现得非常好,即使在网络被显著缩小的情况下,也能保持计算机的聪明程度。

最重要的是,他们发现所测量的“随机性”与计算机性能之间存在极强的联系。事实上,这种相关性非常高——具体而言,DTC 方法为 0.9174,而随机剪枝为 0.9412——这表明存在一种深刻的数学联系:有损压缩过程(即丢弃部分信息的处理过程)本质上是一种“定向随机性”。它不仅仅是随机的混沌;它是一个受引导的过程,其中随机性的程度准确地告诉你模型的学习能力发生了多少改变。论文提供了逻辑证明和实验证据,表明随机性和压缩在特定的数学界限内是紧密结合且具有高度相关性的。通过将神经网络的缩小视为一系列精确测量随机性的步骤,作者展示了我们仅通过观察其熵值,就能预测模型的行为。这就像是意识到,如果你确切知道你的背包里的“凌乱程度”发生了多少变化,你就能准确预测你还能从中读多少本书。这个想法架起了熵的物理学与使 AI 更小、更快这一实际应用领域之间的桥梁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →