← 最新论文
🤖 AI

Unifying and Optimizing Data Values for Selection via Sequential Decision-Making

本文通过将问题重新表述为可通过动态规划解决的序列决策任务,统一了数据选择与数据估值,揭示了现有方法(如 Data Shapley)仅为近视近似,并提出了一种可扩展的基于二分图的代理方法,该方法在经典机器学习和大规模大语言模型微调中均实现了可证明的性能提升。

原作者: Hongliang Chi, Qiong Wu, Zhengyi Zhou, Jonathan Light, Emily Dodwell, Yao Ma

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongliang Chi, Qiong Wu, Zhengyi Zhou, Jonathan Light, Emily Dodwell, Yao Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观: “数据自助餐”问题

想象你是一位正在准备盛大宴会的厨师。你拥有大量的食材(你的数据),但你只有时间烹饪几道菜肴(你的模型)。你想挑选出最完美的食材,以做出最美味的佳肴。

问题在于:并非所有食材都是平等的。 有些新鲜且至关重要;有些则陈旧或冗余。在人工智能领域,我们把弄清楚哪些数据点是“最好的”这一过程称为数据估值(Data Valuation)

长期以来,科学家们一直使用复杂的数学方法(基于博弈论)来为每种食材分配一个“分数”。他们认为:“如果我只挑选得分最高的 100 种食材,我就能做出最好的餐点。”

这篇论文指出,这种方法是有缺陷的。 这就像是在通过观察单个食材本身来挑选汤里的最佳配料,却完全没有考虑它们在锅里是如何协同作用的。

核心思想:是一个序列,而非一个列表

作者认为,挑选数据并不像制作一份静态的购物清单。它更像是搭建积木塔或者一步步攀登高山

  • 旧方法(静态列表): 你给每个积木打分,按重量从重到轻排序,然后抓取前 10 个。
  • 新方法(序列): 你意识到挑选积木的顺序至关重要。你选的第一个积木奠定了基础。第二个积木取决于第一个。如果你先选了一个重的积木,可能会让后面较轻的积木变得毫无意义。

作者将此重新定义为一个**序列决策(Sequential Decision-Making)**问题。他们问道:“挑选这些数据点的完美顺序是什么,才能让我的模型在每一个阶段(1 个点、2 个点、10 个点、100 个点)都表现得尽可能出色?”

“近视”错误(只看下一步)

论文解释说,流行的算法(如 Data Shapley)是“近视”的。

  • 类比: 想象你正在黑暗的森林中寻找宝藏。一个“近视”的人只看脚下的地面,看看有没有闪亮的硬币。他捡起硬币就走,从不抬头看前方,从而错过了如果向左走三步就能发现一个金库的机会。
  • 论文的观点: 现有的数据估值方法就像那个近视的步行者。他们只看一个数据点的眼前价值,并假设这就是全部。他们没能看到,现在挑选这个点可能会破坏你稍后挑选一个更好的数据点的能力。

作者展示了这些“近视”的方法实际上只是线性近似。它们试图用一条直线去解决一个复杂的曲线问题。如果地形是平坦的(简单数据),这种方法还可以;但当地形变得崎岖复杂时(复杂数据),它就会彻底失效。

解决方案:“二分图”地图

由于计算对于海量数据集而言,寻找每一个可能的组合的“完美顺序”在数学上是不可能的(这会耗费比宇宙年龄还要长的时间),作者需要一个捷径。

他们构建了一个二分图(Bipartite Graph)

  • 类比: 想象你有一组实习生(你的数据)和一组测试题(你希望模型学习的内容)。
  • 你不需要去猜测哪个实习生更“聪明”,而是画出线条,将实习生连接到他们能够正确回答的特定测试题上。
  • 策略: 你不是先选最“聪明”的实习生,而是先选那个能回答最多独特问题(即其他人尚未覆盖的问题)的实习生。
    • 实习生 A 知道 5 道题。
    • 实习生 B 也知道 5 道题,但其中 4 道与实习生 A 知道的一样。
    • 实习生 C 知道 3 道题,但这些题都是其他人都不懂的题目。
  • 获胜者: 你首先选择实习生 C,因为他们为团队增加了最多的价值。然后,你再选择下一个能填补剩余空白的人。

这种方法被称为覆盖率(Coverage)。它确保你在建立一个多样化、全方位的团队,而不是仅仅挑选那些可能都在做同样几件事的“高分选手”。

研究发现(结果)

作者在许多不同的数据集上,将这种新方法与旧的“近视”方法进行了对比测试,包括:

  1. 标准机器学习: 挑选数据来训练预测电价或识别手写数字的模型。
  2. 大语言模型 (LLMs): 挑选指令来微调大型 AI(如 Llama 3)。

结果显示:

  • 差距: 旧方法明显逊色于理论上的“完美”顺序。它们浪费了很多性能潜力。
  • 修复方案: 他们的“二分图”方法缩小了这一差距。它找到了表现更好的数据子集,尤其是在早期阶段(当你拥有的数据点非常少时)。
  • 为什么重要: 在现实世界中,你通常无法负担使用所有数据。你需要的是那最精华的 10% 或 1%。这种方法能比以往更有效地帮你找到那顶尖的 10%。

一句话总结

这篇论文证明了挑选最佳数据是一个循序渐进的拼图问题,而非简单的排名列表,并提供了一种新的“基于覆盖率”的地图,帮助你挑选最具独特性和价值的数据点,从而更快地构建出更聪明的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →