← 最新论文
🤖 machine learning

Data Selection Through Iterative Self-Filtering for Vision-Language Settings

本文提出了一种名为“自过滤”(Self-Filtering)的新型自助式方法,该方法通过在一个平衡了高概率清洁样本与多样化数据的演进数据集上迭代训练 CLIP 模型,从而在不需要额外数据或预训练模型的情况下,提升下游视觉-语言任务的性能。

原作者: Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人通过看数百万张图片及其描述来理解世界。问题在于,互联网是一个混乱的地方。如果你只是把在网上找到的所有数据都塞进机器人的大脑,你也同时喂给了它垃圾:模糊的照片、与图片不符的说明,或者毫无意义的文本。这些“噪声”会让机器人感到困惑,导致它学习变慢或出错。

通常,为了解决这个问题,科学家们会使用一种“智能过滤器”——一个已经学到了所有知识的、预训练好的超级智能机器人。他们会询问这个专家机器人:“嘿,这些图片里哪些是好的?”然后把剩下的扔掉。但这篇文章提出了一个不同的问题:如果我们还没有一个超级智能的过滤器呢?我们能不能在学习的过程中自己构建一个?

作者提出了一种名为**自我过滤(Self-Filtering)**的方法。以下是它的工作原理,使用了日常生活的类比:

“学生老师”类比

不要把你的 AI 模型看作一个完成态的专家,而要把它看作一名学生老师

  1. 混乱的教室(数据集): 你有一个巨大的教室,里面坐满了学生(数据点)。有些学生非常聪明且守纪律(干净的数据),但许多学生却很调皮或处于困惑状态(有噪声的数据)。
  2. 第一课(训练): 你开始用整个混乱的教室来教这位学生老师。起初,老师感到很困惑,也会犯错。
  3. 自我反思(过滤): 经过几节课后,老师变得聪明了一点。现在,你问老师:“再看一遍所有的学生。哪些学生似乎最理解这节课的内容?”老师指出了那些“看起来很干净”的学生。
  4. 新的班级组合(策略): 这里的关键在于,你不仅仅是扔掉那些“坏”学生。这样做是很危险的,因为有些“坏”学生可能只是因为遇到了难题而挣扎,而不是真的不好。
    • 相反,你创建了一个新班级,其中包含了老师识别出的“好”学生的两倍数量,但你也保留了原班级的其余部分
    • 这确保了老师既能对简单的、清晰的例子进行额外练习(利用/Exploitation),又能接触到困难且多样化的例子(多样性/Diversity),从而不会只局限于掌握基础知识。
  5. 重复: 你用这个稍微好一点的班级组合来教老师。老师变得更加聪明。然后,你让那个更聪明的新老师再次挑选最好的学生。你再次进行混合。

改进的循环

论文称之为迭代循环

  • 第一轮: 老师有点笨,所以他们的过滤器还可以,但不完美。
  • 第二轮: 因为老师从第一轮中的“好”组合中学习,所以他们变得更聪明了。他们的过滤器也更好了。
  • 第三轮: 老师变得更加聪明,创造了一个甚至更好的组合。

到最后,这位老师构建出了自己的“精选”数据集,其质量几乎可以媲美从一开始就由超级专家为其过滤的数据集。

为什么这很重要

该论文声称了三个主要观点:

  • 不需要魔杖: 你不需要一个预先存在的“上帝模式”AI 来过滤你的数据。你可以利用正在训练的模型本身来构建这个过滤器。
  • 不要扔掉一切: 如果你只保留“完美”的例子,模型可能会产生偏差,或者忘记如何处理复杂的现实世界情况。通过将“可能较好”的数据与“完整”的数据混合,你得到了两全其美:高质量与高多样性。
  • 它行得通: 他们在海量的图像和文本数据集(例如数百万张照片和说明)上进行了测试。使用这种自我过滤方法训练的模型,其表现与使用昂贵的、预制专家系统过滤的数据所训练的模型一样好,甚至更好。

局限性(不足之处)

作者诚实地说明了局限性:

  • 局部视角: 模型根据它目前为止所学到的知识来决定什么是“好”的。它并没有预知未来特定任务所需内容的“水晶球”。
  • 计算成本: 暂停训练、运行模型对所有数据进行评分并重新启动训练是需要时间的。不过,他们建议这可以在较旧、较慢的计算机上进行,而主训练过程则在快速的计算机上进行。

简而言之,这篇论文表明学习和过滤可以同时发生。与其等待一个完美的过滤器到来,不如让你的模型在每一步迈出时,都在成长自己的过滤器,变得越来越聪明,并不断精选更好的数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →