← Nieuwste papers
💬 NLP

SEDD: Scalable and Efficient Dataset Deduplication with GPUs

SEDD is een hoogpresterend, GPU-versneld framework voor het ontdubbelen van datasets op grote schaal dat aanzienlijk beter presteert dan bestaande CPU- en GPU-tools door data-shuffling te vervangen door een streaming-aanpak en hash-functies te optimaliseren, waardoor een snelheidswinst van tot 375×\times wordt bereikt bij behoud van hoge nauwkeurigheid.

Oorspronkelijke auteurs: Youngjun Son, Chaewon Kim, Jaejin Lee

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Youngjun Son, Chaewon Kim, Jaejin Lee

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante student (een Kunstmatige Intelligentie) probeert te onderwijzen door hen een enorme bibliotheek met boeken te geven om te lezen. Deze bibliotheek heeft echter een probleem: hij zit vol met duizenden kopieën van hetzelfde verhaal, alleen met iets andere lettertypes of een paar gewijzigde woorden. Als de student hetzelfde verhaal 1.000 keer leest, verspillen ze tijd door het steeds opnieuw uit het hoofd te leren in plaats van nieuwe dingen te leren. Ze kunnen zelfs gaan denken dat dit verhaal het enige is dat telt.

Om dit op te lossen, heb je een bibliothecaris nodig die door de bibliotheek loopt, alle dubbele boeken vindt en de extra's weggooit. Dit proces heet dataset-deduplicatie.

Het paper dat je hebt aangeleverd introduceert een nieuwe, supersnelle bibliothecaris genaamd SEDD. Hier is hoe het werkt, simpel uitgelegd:

De Oude Manier: De Langzame, Vermoeide Bibliothecaris

Voordat SEDD bestond, waren er twee hoofdmanieren om deze taak uit te voeren:

  1. De CPU-methode (De Menselijke Bibliothecaris): Dit was als een zeer zorgvuldige mens die door de bibliotheek loopt, elk boek leest en ze één voor één vergelijkt. Het was nauwkeurig maar ongelooflijk traag. Als je een bibliotheek had ter grootte van het internet (biljoenen woorden), zou deze mens jaren nodig hebben om klaar te zijn.
  2. De GPU-methode (De Snelle Robot met een Slecht Plan): NVIDIA creëerde een robot (genaamd NeMo Curator) die veel sneller kon lezen dan een mens. Deze robot had echter een gebrek: elke keer als hij twee boeken moest vergelijken, moest hij fysiek heen en weer rennen tussen verschillende kamers om ze te pakken, notities op de vloer schrijven en stapels papier door elkaar te schudden. Dit "heen en weer rennen" (data shuffling genoemd) kostte zoveel tijd dat de supersnelheid van de robot vaak werd verspild aan wachten in de rij.

De Nieuwe Manier: SEDD (De Super-efficiënte Bibliothecaris)

De auteurs van dit paper bouwden SEDD, een nieuw systeem dat specifiek is ontworpen om te draaien op krachtige computerchips genaamd GPU's (dezelfde chips die worden gebruikt voor high-end videospellen). Ze losten de problemen van de robot op met drie slimme trucs:

1. De "Rollende" Stempel (Slimmere Hashing)

Om duplicaten te vinden, moet het systeem elk boek omzetten in een unieke "vingerafdruk" (een code).

  • De Oude Manier: Stel je voor dat je elke enkele pagina van een boek stempelt met een zware, trage inktstempel.
  • De Manier van SEDD: SEDD gebruikt een "rollende stempel". Als je een zin hebt als "De kat zat", en je gaat naar de volgende zin "De kat zat op de mat", dan stempelt SEDD niet het hele ding opnieuw. Het wist alleen het "De" en stempelt het "op de mat"-gedeelte. Het hergebruikt het werk dat het net heeft gedaan. Dit maakt het maken van vingerafdrukken 375 keer sneller dan de oude computermethoden.

2. De "Geen-Shuffle"-Pijpleiding (Streaming)

Dit is de grootste innovatie van SEDD.

  • De Oude Manier: De robot zou alle boeken verzamelen, sorteren in stapels op de vloer, weglopen, terugkomen, ze opnieuw sorteren en de resultaten opschrijven. Het was een constante cyclus van zware dozen verplaatsen.
  • De Manier van SEDD: SEDD gebruikt een streaming-aanpak. Stel je een transportband voor. Terwijl de boeken de band af bewegen, pakt de robot ze, controleert ze en gooit de duplicaten direct in een vuilnisbak. Het stopt nooit om eerst de hele stapel te sorteren. Het doet ook twee dingen tegelijk: terwijl het één boek controleert, trekt het al het volgende boek op de band. Dit elimineert het "heen en weer rennen" dat de vorige robot vertraagde.

3. De "Perfect Grootte" Bakken (Slimme Emmers)

Wanneer je boeken sorteert, heb je bakken nodig. Als je te veel bakken hebt, loop je de hele dag tussen hen heen. Als je te weinig hebt, raken de bakken overvol en rommelig.

  • SEDD gebruikt een speciale wiskundige truc om automatisch het perfecte aantal bakken te berekenen voor de specifieke grootte van de bibliotheek waar het aan werkt. Dit zorgt ervoor dat de robot altijd bezig is en nooit hoeft te wachten tot een bak leeg is.

De Resultaten: Hoe snel is het?

Het paper testte SEDD op enorme bibliotheken (datasets) met miljoenen documenten en biljoenen woorden.

  • T.o.v. de Mens (CPU): SEDD was 158 keer sneller.
  • T.o.v. de Vorige Robot (GPU): SEDD was 7,8 keer sneller.
  • De Grote Overwinning: SEDD slaagde erin een bibliotheek van 1,2 biljoen woorden (een enorm hoeveelheid data die wordt gebruikt voor het trainen van AI) te reinigen in slechts 3 uur met behulp van een cluster van 32 krachtige grafische kaarten.

Miste het duplicaten?

Snelheid is geweldig, maar nauwkeurigheid is belangrijk. Als de bibliothecaris per ongeluk een uniek boek weggooit, verliest de student kennis.

  • Het paper toont aan dat SEDD extreem nauwkeurig is. Het vond dezelfde duplicaten als de trage, zorgvuldige menselijke methode 95% van de tijd of meer.
  • Toen ze de AI-student testten met de boeken die door SEDD waren gereinigd, presteerde de student net zo goed (of beter) dan een student die was getraind op boeken die door de langzamere, oudere methoden waren gereinigd.

Samenvatting

SEDD is als het upgraden van een bibliotheek schoonmaakteam van een trage mens met een klembord naar een supersnel assemblagelijn-robot die nooit stopt met bewegen, zijn eigen gereedschap hergebruikt en precies weet hoe hij de planken moet ordenen zonder ooit moe te worden. Het maakt het voorbereiden van data voor gigantische AI-modellen snel, goedkoop en efficiënt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →