← 最新论文
💻 computer science

Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training

本文介绍了 DynamiCS,一种动态基于簇的采样方法,该方法通过在每个 epoch 对大簇进行降采样并对小簇进行升采样来平衡语义数据分布,从而在显著提高视觉语言模型在长尾概念上性能的同时,降低计算成本。

原作者: Mingliang Liang, Zhuoran Liu, Arjen P. de Vries, Martha Larson

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingliang Liang, Zhuoran Liu, Arjen P. de Vries, Martha Larson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向一个机器人展示数百万张图片及其描述来教它理解世界。这就是“视觉-语言模型”(VLMs)的学习方式。然而,互联网是一个混乱的地方。如果你只是随机抓取一堆照片,你会得到成千上万张关于“狗”和“汽车”的照片(这些是热门内容),但只有极少数关于“树懒”或“稀有甲虫”的照片(这些是稀有内容)。

如果你用这堆混乱的数据来训练你的机器人,它会成为识别狗的专家,但在识别树懒方面表现糟糕。这就像一个学生只学习教科书中最热门的章节,结果因为考试考到了那些冷门知识而挂科了。

这篇论文介绍了一种名为 DynamiCS 的新方法来解决这个问题,同时还能节省大量的资金和计算能力。以下是它的工作原理,我们使用一些简单的类比:

1. 问题所在:“肥胖的头部”与“长尾效应”

把机器人学习的数据想象成一群人。

  • 肥胖的头部: 一大群穿着相同热门 T 恤的人(例如“狗”)。
  • 长尾效应: 少数穿着独特、稀有服饰的零散个体(例如“树懒”)。

之前的方法试图通过简单地“切掉肥胖的头部”来解决问题。它们告诉机器人:“忽略那些热门的狗;我们只看稀有的东西,这样每个人都能得到平等的关注。”问题在于,这样做丢弃了太多关于热门事物的有用信息,而且机器人仍然在处理稀有事物时感到吃力,因为它练习得不够多。

2. 解决方案:“聪明的图书管理员”(聚类缩放)

DynamiCS 就像一位非常聪明的图书管理员,负责将书籍按“聚类”(相似主题组)进行整理。

  • 旧方法: 图书管理员会不管书架有多大,都从每个书架上取相同数量的书。
  • DynamiCS 的方法: 图书管理员观察书架并说:
    • “这个‘狗’的书架非常大。我会从中抽取一个较小的、具有代表性的样本,这样我们就不会在重复阅读同样内容上浪费时间。”
    • “这个‘树懒’的书架很小。我要把我们现有的几本书复制出来,让机器人更频繁地学习它们!”

这就是**“聚类缩放”(Cluster Scaling)。它并不试图让每个主题都完全相等(那是浪费),而是试图让机器人变得有用**,确保它能看到足够多的稀有话题以进行学习,同时又不会完全忽略热门话题。

3. 秘密武器:“动态采样”(洗牌)

这是第二个聪明的技巧。想象你在为考试复习。

  • 静态采样: 你挑选了一套特定的闪卡,并且整个星期都学习这些卡片。你记住了它们,但也错过了卡片中的其他部分。
  • 动态采样 (DynamiCS): 每天你都会重新洗牌,并挑选一套不同的随机卡片来学习。即使你今天正在学习稀有的“树懒”卡片,你看到的树懒图片也可能与昨天看到的不同。

通过在机器人每次训练(每个“轮次/epoch”)时都对数据进行洗牌,DynamiCS 确保机器人能看到更多样化的例子。这使得“复制”稀有数据(上采样)能够真正发挥作用,因为机器人不仅仅是在反复死记硬背那几张稀有的图像;它看到的是它们的各种不同变体。

4. 结果:更快、更便宜、更聪明

论文表明,这种方法是一个双赢的选择:

  • 更便宜: 机器人的学习速度大大加快。作者声称,DynamiCS 仅使用大约 3% 的计算能力(GPU 小时),就能达到与大规模、昂贵的训练运行相媲美的结果。
  • 更好地处理稀有事物: 由于他们特意“上采样”了稀有概念,机器人识别长尾项目(如论文中的“Let It Wag!”测试集)的能力比其他仅试图降低成本的方法要强得多。
  • 依然擅长热门事物: 它并不会丧失识别常见事物(如狗或汽车)的能力;事实上,由于学习效率更高,它在这些方面通常也会变得更好。

总结

把 DynamiCS 想象成一份智能学习指南,专门用于 AI。它不是强迫 AI 阅读每一本庞大百科全书的每一页(这既耗时又极其昂贵),而是为它创建了一份定制的课程表。它快速略读热门章节,但会对稀有且困难的章节投入额外的时间进行复习,并且每天都会打乱页面顺序以保持学习的新鲜感。其结果是一个更聪明的 AI,它能以极短的时间和极低的成本学到同等量的知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →