← नवीनतम पेपर
💬 NLP

SEDD: Scalable and Efficient Dataset Deduplication with GPUs

SEDD एक उच्च-प्रदर्शन, GPU-त्वरित फ्रेमवर्क है जो बड़े पैमाने के डेटासेट डिडुप्लिकेशन (deduplication) के लिए है, जो डेटा शफलिंग को स्ट्रीमिंग दृष्टिकोण से बदलकर और हैश फंक्शनों को अनुकूलित करके मौजूदा CPU और GPU टूल्स की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे उच्च निष्ठा (fidelity) बनाए रखते हुए 375×\times तक की गति वृद्धि प्राप्त होती है।

मूल लेखक: Youngjun Son, Chaewon Kim, Jaejin Lee

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Youngjun Son, Chaewon Kim, Jaejin Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (एक आर्टिफिशियल इंटेलिजेंस) को किताबों की एक विशाल लाइब्रेरी देकर पढ़ाना चाहते हैं। हालाँकि, इस लाइब्रेरी में एक समस्या है: यह एक ही कहानी की हज़ारों प्रतियों से भरी हुई है, जिनमें बस फ़ॉन्ट थोड़ा अलग है या कुछ शब्द बदले हुए हैं। यदि छात्र एक ही कहानी को 1,000 बार पढ़ता है, तो वह नई चीजें सीखने के बजाय उसे बार-बार रटने में अपना समय बर्बाद कर देता है। वह यहाँ तक भी सोच सकता है कि वह कहानी ही एकमात्र महत्वपूर्ण चीज़ है।

इसे ठीक करने के लिए, आपको एक लाइब्रेरियन की आवश्यकता है जो लाइब्रेरी में जाए, सभी डुप्लिकेट किताबों को ढूँढे, और अतिरिक्त किताबों को फेंक दे। इस प्रक्रिया को डेटासेट डीडुप्लिकेशन (dataset deduplication) कहा जाता है।

आपके द्वारा दिए गए पेपर में एक नया, सुपर-फास्ट लाइब्रेरियन SEDD पेश किया गया है। यह कैसे काम करता है, इसे सरल भाषा में यहाँ समझाया गया है:

पुराना तरीका: धीमा, थका हुआ लाइब्रेरियन

SEDD से पहले, इस काम को करने के दो मुख्य तरीके थे:

  1. CPU विधि (मानव लाइब्रेरियन): यह एक बहुत ही सावधान मानव की तरह था जो लाइब्रेरी में घूमकर हर किताब को पढ़ रहा था और एक-एक करके उनकी तुलना कर रहा था। यह सटीक था लेकिन अविश्वसनीय रूप से धीमा था। यदि आपके पास इंटरनेट के आकार की लाइब्रेरी (खरबों शब्द) होती, तो इस इंसान को इसे पूरा करने में वर्षों लग जाते।
  2. GPU विधि (एक खराब योजना वाला तेज़ रोबोट): NVIDIA ने एक रोबोट बनाया (जिसे Neemo Curator कहा जाता है) जो इंसान की तुलना में बहुत तेज़ी से पढ़ सकता था। हालाँकि, इस रोबोट में एक दोष था: हर बार जब इसे दो किताबों की तुलना करने की आवश्यकता होती थी, तो इसे दो अलग-अलग कमरों के बीच दौड़कर जाना पड़ता था ताकि वह किताबें ला सके, फर्श पर नोट्स लिख सके और कागजों के ढेर को इधर-उधर कर सके। यह "दौड़ना और वापस आना" (जिसे डेटा शफलिंग कहा जाता है) इतना समय बर्बाद करता था कि रोबोट की सुपर-स्पीड अक्सर लाइन में खड़े होकर इंतज़ार करने में ही बर्बाद हो जाती थी।

नया तरीका: SEDD (सुपर-कुशल लाइब्रेरियन)

लेखकों ने SEDD नामक एक नया सिस्टम बनाया है जिसे विशेष रूप से शक्तिशाली कंप्यूटर चिप्स जिन्हें GPUs (वही चिप्स जिनका उपयोग हाई-एंड वीडियो गेम्स के लिए किया जाता है) कहा जाता है, पर चलाने के लिए डिज़ाइन किया गया है। उन्होंने तीन चतुर तरीकों से रोबोट की समस्याओं को ठीक किया:

1. "रोलिंग" स्टैम्प (स्मार्टर हैशिंग)

डुप्लिकेट खोजने के लिए, सिस्टम को हर किताब को एक अद्वितीय "फिंगरप्रिंट" (एक कोड) में बदलना होता है।

  • पुराना तरीका: कल्पना कीजिए कि हर किताब के हर पन्ने पर एक भारी, धीमे स्याही वाले स्टैम्प से मुहर लगाना।
  • SEDD का तरीका: SEDD एक "रोलिंग स्टैम्प" का उपयोग करता है। यदि आपके पास "The cat sat" जैसा एक वाक्य है, और आप अगले वाक्य "The cat sat on the mat" पर जाते हैं, तो SEDD पूरी चीज़ को फिर से स्टैम्प नहीं करता है। यह बस "The" को मिटा देता है और "on the mat" वाले हिस्से को स्टैम्प कर देता है। यह उस काम का पुन: उपयोग करता है जो इसने अभी-अभी किया था। यह फिंगरप्रिंट बनाने की प्रक्रिया को पुराने कंप्यूटर तरीकों की तुलना में 375 गुना तेज़ बनाता है।

2. "नो-शफल" पाइपलाइन (स्ट्रीमिंग)

यही SEDD का सबसे बड़ा नवाचार है।

  • पुराना तरीका: रोबोट सभी किताबों को इकट्ठा करता, उन्हें फर्श पर ढेरों में छाँटता, चला जाता, वापस आता, फिर से छाँटता और परिणाम लिखता। यह भारी बक्सों को इधर-उधर करने का एक निरंतर चक्र था।
  • SEDD का तरीका: SEDD एक स्ट्रीमिंग दृष्टिकोण का उपयोग करता है। कल्पना कीजिए कि एक कन्वेयर बेल्ट है। जैसे-जैसे किताबें बेल्ट पर नीचे आती हैं, रोबोट उन्हें पकड़ता है, उनकी जाँच करता है, और तुरंत डुप्लिकेट्स को कचरे के डिब्बे में फेंक देता है। यह पहले पूरे ढेर को छाँटने के लिए कभी नहीं रुकता। यह एक साथ दो काम भी करता है: जब यह एक किताब की जाँच कर रहा होता है, तब यह अगली किताब को पहले से ही बेल्ट पर खींच रहा होता है। यह उस "दौड़ना और वापस आना" को समाप्त करता है जिसने पिछले रोबोट को धीमा कर दिया था।

3. "परफेक्टली साइज़्ड" बिन्स (स्मार्ट बकेट्स)

किताबों को छाँटने के लिए, आपको डिब्बों (bins) की आवश्यकता होती है। यदि आपके पास बहुत अधिक डिब्बे हैं, तो आप सारा दिन उनके बीच चलने में बिता देंगे। यदि आपके पास बहुत कम हैं, तो डिब्बे भर जाएंगे और अस्त-व्यस्त हो जाएंगे।

  • SEDD एक विशेष गणितीय ट्रिक का उपयोग करता है ताकि वह उस विशिष्ट लाइब्रेरी के आकार के लिए, जिस पर वह काम कर रहा है, डिब्बों की एकदम सही संख्या का स्वतः पता लगा सके। यह सुनिश्चित करता है कि रोबोट हमेशा व्यस्त रहे और कभी भी डिब्बे खाली होने का इंतज़ार न करे।

परिणाम: यह कितना तेज़ है?

पेपर ने लाखों दस्तावेज़ों (datasets) वाली विशाल लाइब्रेरी में SEDD का परीक्षण किया।

  • मानव (CPU) के मुकाबले: SEDD 158 गुना तेज़ था।
  • पिछले रोबोट (GPU) के मुकाबले: SEDD 7.8 गुना तेज़ था।
  • बड़ी जीत: SEDD ने 32 शक्तिशाली ग्राफिक्स कार्डों के क्लस्टर का उपयोग करके केवल 3 घंटों में 1.2 ट्रिलियन शब्दों की लाइब्रेरी को साफ़ कर दिया (यह डेटा की एक विशाल मात्रा है जिसका उपयोग AI को प्रशिक्षित करने के लिए किया जाता है)।

क्या इसने कोई डुप्लिकेट मिस किया?

गति बढ़िया है, लेकिन सटीकता भी मायने रखती है। यदि लाइब्रेरियन गलती से एक अनूठी किताब को फेंक देता है, तो छात्र ज्ञान खो देता है।

  • पेपर दिखाता है कि SEDD अत्यंत सटीक है। इसने धीमे, सावधान मानव तरीके की तुलना में 95% बार या उससे अधिक समान डुप्लिकेट्स को खोज निकाला।
  • जब उन्होंने SEDD द्वारा साफ़ की गई किताबों का उपयोग करके AI छात्र का परीक्षण किया, तो छात्र ने ठीक उतना ही (या बेहतर) प्रदर्शन किया जितना कि धीमे, पुराने तरीकों से साफ़ की गई किताबों पर प्रशिक्षित होने पर करता।

सारांश

SEDD एक लाइब्रेरी सफाई दल को क्लिपबोर्ड लिए हुए एक धीमे इंसान से बदलकर एक हाई-स्पीड असेंबली लाइन रोबोट में अपग्रेड करने जैसा है, जो कभी रुकता नहीं है, अपने औजारों का पुन: उपयोग करता है, और बिना थके शेल्फ को व्यवस्थित करने का सटीक तरीका जानता है। यह विशाल AI मॉडल के लिए डेटा तैयार करना तेज़, सस्ता और कुशल बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →