Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation
本文介绍了提示信息瓶颈(Prompted Information Bottlenecks, PIB),这是一种针对冻结视觉基础模型的参数高效适配框架,它利用信息瓶颈原理来优化层级信息的分配,从而在仅微调 0.35% 参数的情况下,在 34 个多样化数据集上实现了卓越的泛化能力和鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的、超级聪明的机器人大脑,它已经读过了互联网上的每一本书,看过了每一张图片。这个大脑是一个“基础模型”,是一个已经预训练过的专家,懂得如何识别事物。但问题在于,你不能从头开始重新训练整个大脑,因为那太庞大且太昂ло。相反,你想教它一个新的、特定的技巧——比如识别一种稀有的鸟类或识别某种特定的医学扫描图——而又不想破坏它已经掌握的所有知识。这被称为“适配(adaptation)”。
为了做到这一点,科学家们使用了一个聪明的捷径,叫做“提示微调(Prompt Tuning)”。把这个机器人大脑想象成一条长长的流水线,上面有很多工作站(层)。你不需要改变每一个工作站的工人,而只需在流水线的开头添加一些微小的、带有粘性的便签(称为“提示/prompts”)。这些便签告诉大脑:“嘿,去寻找鸟类的羽毛,而不只是普通的羽毛!”其核心思想是,这些便签可以引导大脑专注于正确的事物。但谜团在于:有时增加更多的便签或者在更多地方放置便签并不会让机器人变得更聪明;它反而会让机器人感到困惑,甚至表现得更差。科学家们一直试图弄清楚为什么会发生这种情况,怀疑是不是这些便签的力量还不够“强”。
这篇题为《重新思考视觉基础模型适配中的层级信息分配》(Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation)的论文深入探讨了这个谜团。作者们是一群来自不同大学的研究人员,他们认为问题不在于便签太弱,而在于便签太“乱”了。它们不知道如何在信息流经流水线时进行过滤。论文提出了一种新方法,叫做 PIB(提示信息瓶颈/Prompted Information Bottlenecks)。想象一下,PIB 就像是一套严密的、智能的过滤器,坐落在各个装配站之间。这些过滤器确保当机器人处理图像时,它能在恰当的时机保留重要的线索(如鸟喙的形状),并丢弃无用的信息(如天空的颜色或草地的纹理)。
研究人员在 34 个不同的数据集上测试了这个想法,这些数据集像是各种图片的巨大集合,涵盖了从细粒度鸟类品种到复杂的医学图像。他们发现,他们的新方法 PIB 取得了巨大的成功。它在细粒度鸟类分类(FGVC)上达到了 92.1% 的准确率,在广泛的视觉任务集(HTA)上达到了 93.01%,并在一个具有挑战性的基准测试 VTAB-1k 上达到了 77.33%。值得注意的是,它在实现这一切时,仅调整了模型总参数量的 0.35%,保持了极高的效率。
论文指出,旧的方法(标准提示微调)之所以失败,是因为它让机器人保留了过多的无用信息时间过长,或者过早地丢弃了重要的线索。PIB 通过强制机器人遵循一条“最小且充分”的路径来解决这个问题:在早期阶段保留局部细节,然后随着图像向大脑深处移动,逐步剥离噪声。这不仅让机器人的准确性更高,也让它更具鲁棒性(robustness),这意味着它不容易被糟糕的光照或奇怪的背景所迷惑。作者们表明,通过调节信息在各层之间是如何“流动”的,而不是仅仅通过增加更多的“便签”,我们可以让这些巨大的 AI 大脑在无需大规模重构的情况下,更好地学习新技能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。