← 最新论文
🤖 machine learning

Uncovering the Latent Potential of Deep Intermediate Representations

本文介绍了逐层最优嵌入选择(LOES)和几何正则化损失(GeoReg),以证明深度基础模型中与任务相关的信息在各层间呈非单调分布,并表明显式识别并几何对齐任务判别性中间表示显著优于标准迁移学习方法。

原作者: Arnesh Batra, Arush Gumber, Aniket Khandelwal, Jashn Khemani, Anubha Gupta

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Arnesh Batra, Arush Gumber, Aniket Khandelwal, Jashn Khemani, Anubha Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一座巨大的、多层的图书馆(即“基础模型”),它几乎阅读了世界上所有的内容。当你向它提问时,它不会只给你一个答案;而是通过其大脑中许多不同的楼层,或者说“层”,来处理你的请求。

长期以来,科学家们一直认为顶层(即最后一层)是唯一存放聪明且有用答案的地方。他们假设信息在向上攀爬的过程中会变得越来越好,因此他们只关注最顶层。

本文认为这种假设是错误的。这就像假设你只需要从顶层公寓的视野来理解一座城市,而忽略了底层的喧闹市场或中间楼层的安静图书馆。有时,针对特定任务最有用的信息隐藏在中间,或者分散在不同的几层楼中。

以下是作者如何利用简单的类比来解决这个问题:

1. 问题:“顶层公寓”陷阱

作者发现,如果只使用最后一层,你往往会错过关键细节。

  • 类比:想象试图识别一种特定类型的鸟。图书馆的顶层可能只知道“它是一只鸟”。但第 5 层可能知道“它有红色的喙”,而第 3 层可能知道“它在黎明时鸣叫”。如果你只看顶层,你就会错过那些真正帮助你识别鸟类的线索。
  • 现实:在许多人工智能模型中,最后一层变得过于专注于其原始训练任务(例如预测句子中的下一个词),从而忘记了新任务所需的具体细节。

2. 解决方案:LOES(智能图书管理员)

作者创造了一种名为LOES(逐层最优嵌入选择)的新方法。将 LOES 想象成一位超级聪明的图书管理员,她不会只去顶层。相反,她会走遍整座建筑,寻找恰好包含你所需要线索的楼层组合。

  • 工作原理
    • 搜索:图书管理员查看每一层楼。她不只是挑选“最好”的一层;而是挑选一组能够协同工作且不重复相同信息的楼层组合。
    • 几何检查:她会检查某一层的信息是否“组织良好”。她会避开那些信息杂乱无章或挤在狭小角落的楼层(她称之为“各向异性”)。她更喜欢信息均匀分布的楼层(她称之为“各向同性”),就像整齐排列的书架,而不是一堆乱书。
    • 结果:她将选定的这些楼层融合在一起,为你的特定任务创建一个定制的“超级层”。

3. 安全网:GeoReg(稳定器)

一旦图书管理员选定了正确的楼层,就存在一种风险:当你开始在 AI 上训练新任务时,整座建筑可能会受到震动,信息可能会重新坍塌成一团乱麻。

  • 类比:想象你用来自不同楼层的最佳积木搭建了一座塔。如果你开始摇晃桌子(即训练模型),塔可能会倒塌。
  • 修正:作者添加了第二个工具,称为GeoReg。它就像胶水或稳定器。它温和地将积木固定在原位,确保在你构建新结构的过程中,塔保持高耸且有序。它防止“聪明”的信息坍塌成无用的混乱。

4. 他们的发现

该论文在多种不同类型的人工智能(用于图像识别、文本阅读和语音听写)上测试了这种方法,发现:

  • 深度很重要:图书馆越深(模型的层数越多),使用这种“多层”方法就越重要。随着模型变得更大,收益也会增加。
  • 训练风格改变地图
    • 如果模型是在巨大且多样化的数据混合上训练的(例如 CLIP,它看到了数百万张图像和文本),有用的线索会均匀地分布在中间楼层。
    • 如果模型是在狭窄的数据集上训练的(例如仅包含猫和狗的图片),有用的线索大多集中在最顶层。
  • 语言很重要:对于在训练数据中罕见或代表性不足的语言,这种方法帮助最大。这就像给翻译提供一本词典,其中不仅包含最终的翻译,还包含来自中间楼层的语法规则和文化背景,而这些内容往往在最终输出中丢失。

总结

该论文声称,人工智能模型就像深邃的图书馆,其中最好的答案往往分散在许多楼层,而不仅仅是在顶层

通过使用LOES,我们可以自动找到正确的楼层组合,为特定任务构建更好、更准确的人工智能。通过使用GeoReg,我们确保这种新构建的定制人工智能保持稳定,不会在我们教它新事物时分崩离析。这使得人工智能更聪明、更高效,也更容易理解,而无需从头重建整座图书馆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →