← 最新论文
💬 NLP

SEDD: Scalable and Efficient Dataset Deduplication with GPUs

SEDD 是一个高性能、GPU 加速的大规模数据集去重框架,它通过用流式方法替代数据洗牌并优化哈希函数,在保持高保真度的同时实现了高达 375 倍的加速,显著优于现有的 CPU 和 GPU 工具。

原作者: Youngjun Son, Chaewon Kim, Jaejin Lee

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Youngjun Son, Chaewon Kim, Jaejin Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过给一位天才学生(人工智能)提供一座庞大的图书馆供其阅读来教导它。然而,这座图书馆存在一个问题:里面塞满了成千上万本相同的故事书,只是字体略有不同或改动了几个词。如果学生把同一个故事读上一千遍,他们就会浪费时间反复记忆,而不是学习新事物。他们甚至可能开始认为,那个故事才是唯一重要的事情。

为了解决这个问题,你需要一位图书管理员来遍历图书馆,找出所有重复的书籍,并将多余的副本扔掉。这个过程被称为数据集去重

你提供的这篇论文介绍了一位名为SEDD的全新、超高速图书管理员。以下是其工作原理的简单解释:

旧方法:缓慢且疲惫的图书管理员

在 SEDD 出现之前,主要有两种完成这项工作的方法:

  1. CPU 方法(人类图书管理员): 这就像一位非常谨慎的人类,在图书馆中穿梭,阅读每一本书,并逐一进行比较。这种方法准确但极其缓慢。如果你拥有一个规模相当于整个互联网(数万亿个单词)的图书馆,这位人类需要花费数年时间才能完成。
  2. GPU 方法(计划糟糕的快速机器人): 英伟达(NVIDIA)创造了一个名为 NeMo Curator 的机器人,它的阅读速度远快于人类。然而,这个机器人有一个缺陷:每次需要比较两本书时,它都必须物理地在不同房间之间来回奔跑去取书,在地板上写笔记,并整理成堆的纸张。这种“来回奔跑”(称为数据洗牌)浪费了太多时间,以至于机器人的超快速度往往只是浪费在排队等待上。

新方法:SEDD(超级高效的图书管理员)

这篇论文的作者构建了SEDD,这是一个专为在强大的计算机芯片(即GPU,与高端电子游戏使用的芯片相同)上运行而设计的新系统。他们通过三个巧妙的技巧解决了机器人的问题:

1. “滚动”印章(更智能的哈希)

为了找出重复项,系统必须将每一本书转化为独特的“指纹”(代码)。

  • 旧方法: 想象用沉重且缓慢的墨印给书的每一页盖章。
  • SEDD 的方法: SEDD 使用“滚动印章”。如果你有一句话叫“猫坐着”,而下一句是“猫坐在垫子上”,SEDD 不会重新给整句话盖章。它只需擦掉“猫”并给“坐在垫子上”部分盖章。它重用了刚刚完成的工作。这使得生成指纹的速度比旧的计算机方法快 375 倍

2. “无洗牌”流水线(流式处理)

这是 SEDD 最大的创新。

  • 旧方法: 机器人会收集所有书籍,将它们在地面上整理成堆,走开,再回来重新整理,然后写下结果。这是一个不断移动沉重箱子的循环。
  • SEDD 的方法: SEDD 采用流式方法。想象一条传送带。当书籍在传送带上移动时,机器人抓取它们,进行检查,并立即将重复项扔进垃圾桶。它从不先停下来整理整堆书。它还能同时做两件事:在检查一本书的同时,它已经在将下一本书拉上传送带。这消除了拖慢之前机器人的“来回奔跑”。

3. “尺寸完美”的箱子(智能桶)

在整理书籍时,你需要箱子。如果箱子太多,你会花一整天时间往返于它们之间;如果箱子太少,箱子就会溢出并变得杂乱无章。

  • SEDD 使用一种特殊的数学技巧,自动计算出针对其正在处理的特定规模图书馆的完美箱子数量。这确保了机器人始终忙碌,从不等待箱子清空。

结果:它有多快?

该论文在包含数百万份文档和数万亿个单词的庞大图书馆(数据集)上测试了 SEDD。

  • 对比人类(CPU): SEDD 快158 倍
  • 对比之前的机器人(GPU): SEDD 快7.8 倍
  • 重大胜利: SEDD 仅使用 32 块强大的图形卡组成的集群,就在3 小时内清理了一个包含1.2 万亿个单词的图书馆(这是用于训练人工智能的海量数据)。

它是否遗漏了任何重复项?

速度固然重要,但准确性同样关键。如果图书管理员误将一本独特的书扔掉,学生就会失去知识。

  • 论文表明,SEDD 极其准确。它找到重复项的比例与缓慢、谨慎的人类方法相比,95% 或更高的情况下是一致的。
  • 当他们使用经 SEDD 清理过的书籍来测试人工智能学生时,该学生的表现与使用较慢、较旧方法清理过的书籍训练的学生一样好(甚至更好)。

总结

SEDD就像是将图书馆清洁团队从手持剪贴板的缓慢人类,升级为一条高速装配线机器人。它永不停歇,重复利用自己的工具,并且确切知道如何整理书架而从不感到疲倦。它使得为大型人工智能模型准备数据变得快速、廉价且高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →