← 最新论文
🤖 machine learning

Optimal Representation Size: High-Dimensional Analysis of Pretraining and Linear Probing

本文提出了一个预训练与线性探测的分析性高维模型,该模型推导出精确的泛化误差表达式以识别最优表示规模,揭示出当预训练数据丰富但下游数据稀缺时,最大压缩的表示效果最佳,而在预训练数据有限时,更高维度的表示表现更佳。

原作者: Valentina Njaradi, Clémentine Dominé, Rachel Swanson, Marco Mondelli, Andrew Saxe

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Valentina Njaradi, Clémentine Dominé, Rachel Swanson, Marco Mondelli, Andrew Saxe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在学习一项新技能,比如在钢琴上演奏一首特定的曲子。你拥有两类资源:

  1. 海量的乐谱库(无标签数据),你可以通读它们来理解音乐的一般运作原理,但你还不知道构成那首特定曲子的具体音符。
  2. 几次练习课(有标签数据),老师会确切地告诉你为这首曲子应该弹奏哪些音符。

本文探讨了一种现代策略,计算机和(可能)大脑都在使用:预训练后接微调。首先,你研读乐谱库以建立对音乐的普遍理解(预训练)。然后,利用这种理解,通过极少的练习课快速学会你的特定曲目(微调)。

作者提出的核心问题是:你实际上应该在脑海中保留多少那部分通用乐谱库的内容?

你是应该尝试记住乐谱库中的每一个音符和规则(一个庞大而复杂的记忆),还是应该将其提炼为最核心的和弦与节奏(一个压缩、简化的记忆)?

核心发现:这取决于你拥有多少练习时间

作者构建了一个数学模型来回答这个问题。他们发现,需要保留的“完美”记忆量完全取决于乐谱库大小与练习时间之间的平衡。

情境 A:你拥有巨大的乐谱库,但练习时间非常少。

  • 结果: 你应该压缩你的记忆。
  • 类比: 想象你读了 10,000 本书,但只有 10 分钟准备测验。如果你试图记住每本书的每一个细节,你的大脑会感到困惑并混淆内容。相反,最好将这 10,000 本书提炼为适用于几乎所有情况的“十大规则”。这种“压缩”版本具有鲁棒性,能防止你在没有时间深入思考时犯错。
  • 论文主张: 当预训练数据丰富但下游(任务)数据稀缺时,最大程度的压缩表示是最优的。

情境 B:你拥有小型的乐谱库,但练习时间很多。

  • 结果: 你应该保留更多细节(更高维度)。
  • 类比: 想象你只读了 5 本书,但有 50 小时练习时间。如果你试图将这 5 本书提炼为仅“十大规则”,你可能会丢弃实际需要的具体细节。由于你有充足的练习时间,你可以负担得起保留关于这 5 本书的更详细、更高维度的记忆,以准确掌握细微差别。
  • 论文主张: 当预训练数据有限时,更高维度的表示具有更好的泛化能力。

“泄露”问题:为什么压缩有帮助

本文解释了一种棘手的现象,称为“泄露”。

想象你的乐谱库中隐藏着一个模式(一个“尖峰”)——也许 90% 的书是关于爵士乐的,只有 10% 是关于摇滚乐的。

  • 如果你保留所有内容(不压缩),你的大脑会试图同时学习爵士乐和摇滚乐。但由于爵士乐数据太多,你的大脑会“困惑”,误以为爵士乐的规则也适用于你的摇滚乐曲。这是一种导致错误的信息“泄露”。
  • 如果你进行压缩(仅保留顶级模式),你迫使大脑专注于最强、最可靠的模式(爵士乐)并忽略噪声。这实际上有助于你在新的任务上表现得更好,即使该任务与爵士乐并不完全相关,因为它阻止了混淆。

数据的“货币”

作者还计算了一个有趣的权衡:多少无标签数据抵得过一个有标签样本?

他们发现,在某些情况下(乐谱库很大,练习很少),在乐谱库中增加更多页面实际上比让老师多指导一分钟更有价值。“无标签”数据充当了“有标签”数据的强力替代品,但前提是你必须知道如何正确地压缩它。

现实世界的验证

作者并未止步于数学。他们在以下方面测试了这些想法:

  1. 自编码器: 专为压缩数据而设计的简单神经网络。他们发现,当这些网络拥有足够的数据进行学习时,它们自然地开始表现出数学预测的那种“压缩”行为。
  2. 大型语言模型(LLMs): 他们观察了真实的 AI 模型(如 Pythia)。当他们提取 AI 的“大脑”(其内部表示)并尝试将其用于新任务(情感分析)时,他们发现剪枝(移除)AI 的一些内部维度实际上使其在新任务上表现更好,但这仅发生在新任务数据非常少的情况下。

一句话总结

如果你拥有海量的通用知识但缺乏具体的练习,最明智的做法是简化和压缩你的知识以避免混淆;但如果你拥有的通用知识有限却拥有大量练习时间,你就应该保留细节以充分利用你的训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →