Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights
原作者: Tzu-Heng Huang, Manjot Bilkhu, John Cooper, Frederic Sala, Javier Movellan
原作者: Tzu-Heng Huang, Manjot Bilkhu, John Cooper, Frederic Sala, Javier Movellan
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:通过模仿模型权重评估样本效用以实现高效数据选择
问题陈述
大规模网络爬取数据集是现代多模态模型(例如 CLIP、SigLIP、AIMv2)训练的基础,但其本身固有地包含噪声、偏差和无关信息。当前的数据选择策略存在显著局限性:
- 无模型方法(例如手工设计的启发式规则、与下游数据集的语义相似度)通常需要进行代价高昂的试错,引入不必要的数据依赖,且缺乏评估单个样本效用的粒度。
- 基于模型的方法(例如专用过滤网络、基于损失的分值、影响函数)增加了流水线复杂度,且在大规模场景下计算成本高昂。特别是影响函数,需要在干净的验证集上进行昂贵的梯度计算,而这些验证集难以策划和维护。
因此,亟需一种更简单、与数据集无关且计算高效的机制,在不依赖昂贵的验证集划分或复杂辅助网络的情况下识别高价值数据。
方法论:Mimic Score 与 Grad-Mimic
作者提出了一种新的数据质量指标,称为Mimic Score,以及一个名为Grad-Mimic的两阶段框架。
1. Mimic Score
核心洞察是:那些将模型梯度拉向不良方向的样本应被降低权重。为了定义“理想”方向,该方法利用预训练参考模型(θref)的权重空间几何,假设该参考模型位于比当前模型(θt)更优的权重空间区域。
对于训练步骤 t 处的给定样本 si,Mimic Score(mi,t)通过测量样本的负梯度(−gi,t)与指向从当前权重到参考权重的向量(vt=θref−θt)之间的对齐程度来计算。
该分数计算为负梯度在目标向量上的投影长度:
Mimic_Score(si,t)=mi,t=∥vt∥⟨−gi,t,vt⟩
这种方法避免了额外的前向传播或验证集计算,而是依赖于模型权重之间的差异(简单的矩阵减法)。
2. Grad-Mimic 框架
Grad-Mimic 在两个阶段利用 Mimic Score:
阶段 1:在线批次重加权
在训练过程中,实时计算小批量中样本的 Mimic Score。这些分数使用带有温度参数 τ 的 softmax 函数进行归一化。随后,通过重新加权梯度来更新模型参数:
θt+1:=θt−ηi=1∑bm~i,t⋅gi,t
其中 m~i,t 是归一化后的分数。这优先处理与参考模型最优方向对齐的样本,并降低那些不对齐样本的权重。阶段 2:离线样本选择
训练结束后,聚合训练步骤中的 Mimic Score 以估算整体样本效用。连续分数通过阈值化、一维聚类(k-means/GMM)或 top-k 百分比选择等方法二值化为保留/丢弃决策。为了处理单步评估中的噪声,该框架采用弱监督技术(特别是 Snorkel 框架),将这些二值投票聚合为概率共识,从而构建一个鲁棒的集成过滤器,用于构建更小、更高质量的数据集。
主要贡献
- 新的数据质量指标(Mimic Score): 作者通过利用人工智能中的“访问不对称性”(即预训练权重是公开的,而策划好的数据集不是),将权重空间几何提炼为数据质量洞察。它基于与参考模型的方向对齐程度来量化样本效用。
- 高效的数据选择框架(Grad-Mimic): 一个两阶段系统,通过在线重加权加速收敛,并通过离线聚合自动化高效的数据选择。
- 显著的计算增益: 与基于影响函数的方法或损失差异方法(例如 Rho-Loss)不同,Mimic Score 计算产生的运行时开销极小,并减少了 GPU 内存使用,因为它操作的是最后一层权重差异,而非全模型推理或 Hessian 近似。
- 可靠的集成过滤: 聚合后的 Mimic Score 提供了对数据集质量和模型性能增益的鲁棒估计,有效增强了现有的选择策略。
- 广泛的消融研究: 论文验证了该框架在不同设计选择(温度、层选择)上的泛化能力,并证明了对参考模型质量的鲁棒性。
实验结果
作者在受控的误标样本检测和大规模网络爬取数据策划(DataComp)方面评估了 Grad-Mimic。
误标样本检测: 在六个图像数据集(例如 CIFAR-100、Flowers102)上注入了高达 60% 的标签噪声,Grad-Mimic 始终优于基线方法,包括 Mini-batch SGD、GraNd、AGRA、Grad-Match 和 Rho-Loss。
- 性能: 它在所有噪声水平下均实现了最高的平均测试准确率。
- 检测: 聚合后的 Mimic Score 准确识别了误标样本,F1 分数超过 95%。
- 相关性: 基于 Mimic Score 的保留率与整体数据集质量的相关系数(Pearson)为 0.903。
- 效率: 与竞争的基于模型的方法相比,Grad-Mimic 将计算开销降低了2.6 倍。
大规模数据策划(CLIP 训练):
- 收敛性: 当在 DataComp 规模(1000 万 + 和 1 亿 + 样本)上从头训练 CLIP 模型时,Grad-Mimic 加速了收敛,达到与 vanilla 训练相同性能水平所需的训练步数减少了20.7%。
- 过滤: 基于 Mimic Score 的过滤器增强了现有的 CLIP Score 过滤器。通过移除低价值样本(Mimic Score 最低的 30%),作者在中等规模数据集中使用少 470 万个训练样本实现了改进的模型性能。
- 质量估算: 策划后数据集的平均 Mimic Score 与下游性能增益高度相关(Pearson 0.958)。
鲁棒性: 即使参考模型是在显著更少的数据上训练的(样本量少 372 倍)或受到噪声污染,该方法仍然有效,在退化场景下优于标准训练。
意义与主张
论文声称,Grad-Mimic 通过利用日益丰富的高质量预训练权重,为数据选择瓶颈提供了实用的解决方案。其意义在于:
- 解耦数据依赖: 它消除了影响函数方法所需的昂贵、干净的验证集需求。
- 可扩展性: 通过依赖简单的权重空间几何(最后一层减法)而非复杂的推理或 Hessian 计算,它能够高效扩展到百万级样本的数据集。
- 自动化: 它自动化了低价值样本(例如短标题、不对齐的图像)的识别,而这些通常需要人工设计的启发式规则。
- 通用适用性: 该框架被证明在不同模态(图像 - 文本、纯文本)和训练模式(线性探测、全微调、从头训练)下均有效。
作者总结道,虽然高性能的参考模型是理想的,但该方法足够鲁棒,可以使用较弱的代理模型运行,使其成为在现代 AI 格局中提高数据效率和模型性能的灵活工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 AI 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。