← 最新论文
🤖 machine learning

Active Learning with Low-Rank Structure for Data Selection

本文介绍了一种新的数据选择框架,该框架利用低秩近似和基于残差的采样来高效地选择加权数据子集,并针对具有全局代数结构的数据集,提供了相比于传统基于聚类的方法在理论保证和实证改进方面的优势。

原作者: Vincent Cohen-Addad, Sasidhar Kunapuli, Vahab Mirrokni, Mahdi Nikdan, David P. Woodruff, Samson Zhou

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincent Cohen-Addad, Sasidhar Kunapuli, Vahab Mirrokni, Mahdi Nikdan, David P. Woodruff, Samson Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位试图创造世界上最棒的汤的厨师。你拥有一个巨大的仓库,里面装满了成千上万种不同的蔬菜、香料和高汤(这就是你的数据集)。为了做出完美的汤,你需要品尝并混合所有的食材。但问题在于:你的厨房很小,炉灶火力很弱,而且你只有几个小时的时间。用整个仓库来烹饪是不可能的。

你需要挑选出一小把完美的食材,它们能提供与整个仓库完全相同的风味。这就是**数据选择(Data Selection)**问题。

旧方法:按“距离”挑选

在很长一段时间里,顶尖厨师们使用一种叫做**聚类(Clustering)**的方法。想象你走进仓库,从每个不同的角落各取一种蔬菜。你从北边拿一个胡萝卜,从南边拿一个土豆,从东边拿一个辣椒,从西边拿一个西红柿。

其逻辑是:“如果我挑选彼此距离较远的物品,我就一定能涵盖所有基础。”这种方法对于简单的食谱效果尚可。但在现代世界,当数据变得巨大且复杂时(比如一个拥有数百万件物品的仓库),这种方法存在缺陷。它关注的是物品所处的位置,而不是它们实际发挥的作用。你最终可能会得到一袋看起来各不相同、但味道却完全一样的蔬菜,却遗漏了那个真正定义了汤之灵魂的神奇香料。

新方法:按“结构”挑选

本文的作者说:“别再盯着蔬菜站在哪里看。去观察风味的形状。”

他们提出了一种基于**低秩结构(Low-Rank Structure)**的新方法。
不要把你的汤料看作单个的物品,而要看作一个复杂的 3D 雕塑。尽管这个雕塑看起来很复杂,但它实际上可能仅仅是由几根主要的梁柱和支撑构成的。其余的部分只是装饰。

  • 主梁(低秩): 这些是风味最重要的方向。如果你掌握了这些,你就掌握了汤的精髓。
  • 装饰(残差): 这些是微小的、不重要的细节,它们不会显著改变味道。

作者的方法使用一种数学上的“X光检查”(称为低秩近似/Low-Rank Approximation)来寻找这些主梁。他们不再挑选距离较远的蔬菜,而是挑选那些支撑起风味结构主梁的特定食材。

他们是如何做的:“敏感度”量表

为了确定哪些食材是“主梁”,他们使用了一种名为**敏感度采样(Sensitivity Sampling)**的技术。

想象你有一个巨大的天平。你把一种蔬菜放上去,天平会告诉你:“如果你把这个留下来不吃,汤的味道会改变多少?”

  • 如果味道变化很大,天平就会爆表。这种蔬菜具有高敏感度(非常重要)。
  • 如果味道几乎没有变化,天平就保持低位。这种蔬菜是低敏感度(冗余的)。

他们的算法会计算仓库中每一项的得分,然后随机抽取一小组食材,但会根据它们的重要性进行加权。你更有可能选到那些“高敏感度”的物品。

实验结果:为什么这很重要

论文通过两种方式测试了这个想法:

  1. 信用卡测试: 他们尝试使用一个标准的金融数据集来预测谁会错过信用卡还款。他们的“低秩”方法挑选的一小组客户,在预测结果方面比传统的“聚类”方法或单纯的随机挑选表现得更好。
  2. 巨型大脑测试(大语言模型/LLMs): 他们尝试教一个庞大的 AI(Llama3-8B)进行数学运算和回答问题。用整个数据集来训练 AI 需要耗费极长时间且成本高昂。通过使用他们的方法只挑选 6% 到 25% 的数据,他们训练出的 AI 比使用随机数据或旧的聚类方法得到的 AI 更加聪明

核心启示

该论文声称,对于现代的大规模数据集,数据的“形状”(其代数结构)比数据点之间的“距离”更为重要。

通过专注于数据的主要结构梁而非仅仅试图覆盖所有的角落,你可以丢弃 90% 的数据,却仍然能训练出一个表现与使用全部数据一样好、甚至更好的机器学习模型。这就像是你意识到,你不需要品尝海洋中的每一粒盐才能知道汤有多咸;你只需要品尝那一勺能代表海洋真实特性的汤即可。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →