← नवीनतम पेपर
🤖 AI

MosaicJoin: Compact Semantic Sketches for Value-Level Join Discovery

मोज़ेकजॉइन (MosaicJoin) एक प्रशिक्षण-मुक्त, स्केलेबल वैल्यू-लेवल सिमेंटिक जॉइन डिस्कवरी विधि है जो बड़े डेटा लेक्स में जॉइन करने योग्य कॉलमों को कुशलतापूर्वक पहचानने के लिए नवीन कॉम्पैक्ट स्केचेस और क्वेरी सबसैंपलिंग का उपयोग करती है, जो मौजूदा दृष्टिकोणों की तुलना में बेहतर सटीकता और गति प्राप्त करती है।

मूल लेखक: Grace Fan, Eden Wu, Majid Daliri, Juliana Freire

प्रकाशित 2026-07-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Grace Fan, Eden Wu, Majid Daliri, Juliana Freire

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन उंगलियों के निशान खोजने के बजाय, आप बिखरे हुए डेटा के ढेर के बीच संबंध खोज रहे हैं। कंप्यूटर की दुनिया में, इसे "जॉइन डिस्कवरी" (join discovery) कहा जाता है। यह वह जादुई ट्रिक है जो कंप्यूटर को यह कहने की अनुमति देती है, "हे, आपकी इस स्प्रेडशीट में नामों की यह सूची वास्तव में उस अलग फ़ाइल में दिए गए पतों की सूची से मेल खाती है, भले ही वे दिखने में बिल्कुल अलग हों।"

लंबे समय तक, कंप्यूटर कठोर रोबोट की तरह थे। वे केवल तभी मिलान ढूंढ सकते थे जब शब्द बिल्कुल एक जैसे लिखे हों। यदि आपके पास एक फ़ाइल में "New York" था और दूसरी में "NYC", तो रोबमा कहेगा, "कोई मिलान नहीं!" क्योंकि अक्षर पूरी तरह से मेल नहीं खाते थे। लेकिन वास्तविक जीवन अव्यवस्थित है। लोग चीजें अलग तरह से लिखते हैं, उपनामों का उपयोग करते हैं, या टाइपिंग में गलतियाँ करते हैं। इसे ठीक करने के लिए, वैज्ञानिकों ने कंप्यूटर को केवल वर्तनी (spelling) के बजाय अर्थ समझने के लिए सिखाना शुरू किया। वे "एम्बेडिंग्स" (embeddings) नामक चीज़ का उपयोग करते हैं, जो एक फैंसी तरीका है शब्दों को एक मानचित्र पर निर्देशांकों (coordinates) में बदलने का। समान अर्थ वाले शब्द इस मानचित्र पर एक-दूसरे के करीब होते हैं, भले ही वे दिखने में अलग हों। लक्ष्य उन डेटा कॉलम को खोजना है जिन्हें उनके अर्थों के आधार पर आपस में जोड़ा जा सके। लेकिन यहाँ एक समस्या है: जब आपके पास लाखों पंक्तियों का डेटा होता है, तो हर एक शब्द की दूसरे हर एक शब्द से तुलना करना बहुत लंबा समय ले लेता है। यह समुद्र के किनारे रेत के हर एक कण को एक-एक करके उठाने की कोशिश करने जैसा है।

यहीं पर MosaicJoin नामक एक नई विधि आती है। न्यूयॉर्क यूनिवर्सिटी के शोधकर्ताओं ने महसूस किया कि आपको यह जानने के लिए कि समुद्र तट कैसा दिखता है, रेत के हर एक कण की जांच करने की आवश्यकता नहीं है। इसके बजाय, वे एक चतुर तरकीब लेकर आए: डेटा का एक "स्केच" (sketch) तैयार करें। कल्पना कीजिए कि आपके पास अलग-अलग रंगों और आकारों के लेगो (LEGO) ब्रिक्स का एक विशाल, अराजक बॉक्स है। यदि आप उस बॉक्स को अपने दोस्त को दिखाने के बिना उसका वर्णन करना चाहते हैं, तो आप पूरे बॉक्स को खाली नहीं करेंगे। इसके बजाय, आप कुछ प्रतिनिधि ब्रिक्स चुनेंगे—एक लाल, एक नीला, एक छोटा, एक बड़ा—जो बॉक्स की विविधता को सबसे अच्छी तरह से दर्शाते हैं। MosaicJoin बिल्कुल यही करता है। यह एक विशाल कॉलम के डेटा से "प्रतिनिधि" मानों का एक छोटा, स्मार्ट सेट चुनकर एक संक्षिप्त "सिमेंटिक स्केच" (semantic sketch) बनाता है।

जब कोई उपयोगकर्ता कोई प्रश्न पूछता है, तो Mosaic-Join प्रश्न की तुलना लाखों डेटा पॉइंट्स से नहीं करता है। इसके बजाय, यह प्रश्न की तुलना इन छोटे, कुशल स्केच से करता है। यह अपने दोस्त से पूछने जैसा है, "क्या यह नया लेगो पीस इस बॉक्स के साथ फिट बैठता है?" और आपका दोस्त बस उन कुछ प्रतिनिधि ब्रिक्स की जांच करता है जिन्हें उसने चुना था, न कि पूरे ढेर को खोदता है। यह कंप्यूटर को बहुत तेज़ी से मिलान खोजने की अनुमति देता है, भले ही डेटा सेट बहुत बड़े क्यों न हों।

यह पेपर बताता है कि यह विधि एक गेम-चेंजर है। इसने पाया कि MosaicJoin अन्य तरीकों की तुलना में 66 गुना तेज़ है जो हर एक मान की जांच करने की कोशिश करते हैं, जबकि यह उतनी ही सटीक भी है। वास्तव में, कुछ परीक्षणों में, यह पिछले सर्वश्रेष्ठ तरीकों की तुलना में सही मिलान खोजने में 17.6% बेहतर था। शोधकर्ताओं ने साबित किया कि यह काम करता है, भले ही क्वेरी में 57,000 मान हों और डेटा लेक में 1 मिलियन मान हों।

सबसे रोमांचक बात यह है कि MosaicJoin को किसी छात्र की तरह "प्रशिक्षित" (train) करने की आवश्यकता नहीं है जो पाठ्यपुस्तक से सीख रहा हो। यह किसी भी नए डेटा पर, चाहे वह कितना भी अव्यवस्थित या अजीब क्यों न हो, सीधे काम करता है। शोधकर्ताओं ने पाया कि वे प्रश्न के शब्दों के एक छोटे से नमूने (जिसे "क्वेरी सबसैंपलिंग" तकनीक कहा जाता है) को देखकर इसे और भी तेज़ बना सकते हैं, बिना सटीकता खोए। उन्होंने छह अलग-अलग बेंचमार्क पर इसका परीक्षण किया, जिनमें लाखों पंक्तियों वाले कुछ बेंचमार्क भी शामिल थे, और MosaicJoin ने लगातार प्रतियोगिता को पछाड़ दिया।

हालाँकि, पेपर सावधानी से यह भी बताता है कि अभी भी एक ट्रेड-ऑफ (समझौता) मौजूद है। यदि आप पूर्णतः सटीक मिलान चाहते हैं और आपको इससे फर्क नहीं पड़ता कि इसमें कितना समय लगता है, तो आप हर एक मान की जांच कर सकते हैं (जिसे शोधकर्ता "एक्सैक्ट सिमेंटिक जॉइन" कहते हैं), लेकिन इसमें प्रति क्वेरी लगभग 15.65 सेकंड लगते हैं। MosaicJoin आपको लगभग 0.32 सेकंड में उत्तर दे देता है, जो इतना तेज़ है कि एक इंसान बिना बोर हुए इंतज़ार कर सके। शोधकर्ता सुझाव देते हैं कि हालांकि यह एक बहुत बड़ा सुधार है, लेकिन गति और पूर्ण सटीकता के बीच का संतुलन एक निरंतर संघर्ष है। वे यह भी नोट करते हैं कि उनकी विधि वर्तमान में केवल मानों (values) पर ध्यान केंद्रित करती है और अभी तक कॉलम हेडर या टेबल टाइटल जैसे अतिरिक्त सुरागों का उपयोग नहीं करती है, जो भविष्य में मददगार हो सकते हैं।

संक्षेप में, MosaicJoin एक नया, सुपर-फास्ट तरीका है जो कंप्यूटर को यह समझने में मदद करता है कि "2003 Tippeligaen" और "2003 Norwegian Premier League" वास्तव में एक ही चीज़ हैं, बिना ब्रह्मांड के हर एक शब्द को पढ़े। यह एक धीमी, थका देने वाली खोज को एक त्वरित, स्मार्ट अनुमान में बदल देता है जो लगभग हर बार सही होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →