← नवीनतम पेपर
💻 computer science

GRAFT: Graph-Matched Retrieval and Fusion of Tables in Data Lakes

यह शोध पत्र GRAFT का प्रस्ताव करता है, जो एक नया फ्रेमवर्क है जो डेटा लेक में टेबल रिट्रीवल को एक IGMS ऑब्जेक्टिव और एक इम्पलिसिट Q-लर्निंग-आधारित सबग्राफ जनरेशन प्रक्रिया का उपयोग करके ग्राफ मैचिंग समस्या के रूप में मॉडल करता है ताकि जॉइन करने योग्य (joinable) और यूनियन करने योग्य (unionable) टेबल्स को प्रभावी ढंग से एकीकृत किया जा सके, जिससे रिट्रीवल सटीकता और एविडेंस पर्याप्तता में मौजूदा बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन होता है।

मूल लेखक: Daomin Ji, Hui Luo, Zhifeng Bao, Shane Culpepper, Shazia Sadiq

प्रकाशित 2026-07-15
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daomin Ji, Hui Luo, Zhifeng Bao, Shane Culpepper, Shazia Sadiq

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में, लेकिन आपके सुराग एक ही नोटबुक में नहीं हैं। इसके बजाय, वे एक विशाल, अराजक लाइब्रेरी में हजारों अलग-अलग फाइलिंग कैबिनेट में बिखरे हुए हैं जिसे "डेटा लेक" (Data Lake) कहा जाता है। कुछ कैबिनेट में नामों की सूचियाँ हैं, कुछ में नंबरों की सूचियाँ हैं, और कुछ में नक्शे हैं। अपने केस को सुलझाने के लिए, आप केवल उस कैबिनेट को नहीं उठा सकते जो आपके सवाल जैसा दिखता हो; आपको कैबिनेट की एक विशिष्ट श्रृंखला (chain) ढूंढनी होगी जिन्हें लेगो ब्रिक्स (Lego bricks) की तरह जोड़कर पूरी तस्वीर बनाई जा सके।

यही वह समस्या है जिसे GRAFT (Graph-Matched Retrieval and Fusion of Tables) हल करने की कोशिश करता है। इसके लेखक, जो RMIT, वूलोंगोंग विश्वविद्यालय और क्वींसलैंड विश्वविद्यालय के शोधकर्ताओं की एक टीम है, तर्क देते हैं कि डेटा लेक में खोजने के पुराने तरीके ऐसे हैं जैसे कि आप टुकड़ों के रंग को देखते हुए एक जिगसॉ पहेली (jigsaw puzzle) को सुलझाने की कोशिश कर रहे हों, उनके आकार को अनदेखा करते हुए।

पुराना तरीका: "अकेले सुराग" की गलती

पिछले तरीके एक अकेले जासूस की तरह काम करते थे जो उस एकल फाइल को चुनता है जिसमें उनके सवाल से मेल खाने वाले सबसे अधिक शब्द होते हैं। यदि आप पूछते हैं, "कंप्यूटर साइंस के प्रोफेसर कौन हैं?", तो पुराना सिस्टम प्रोफेसरों के नामों वाली एक फाइल तो उठा सकता है, लेकिन वह उस फाइल को मिस कर सकता है जो उन्हें उनके विभागों से जोड़ती है, या वह फाइल जो प्रोफेसरों के विभिन्न प्रकारों को सूचीबद्ध करती है।

पेपर स्पष्ट रूप से दो सामान्य रणनीतियों के खिलाफ तर्क देता है:

  1. पॉइंट-वाइज रिट्रीवल (Point-wise retrieval): आपके सवाल के शब्दों से कितनी अच्छी तरह मेल खाता है, इसके आधार पर एक-एक करके टेबल चुनना। लेखक दिखाते हैं कि यह अक्सर बिखरी हुई फाइलों का ढेर वापस कर देता है जिन्हें आपस में जोड़ा नहीं जा सकता।
  2. ग्रीडी एक्सपेंशन (Greedy expansion): एक फाइल से शुरू करना और फिर अगले उस फाइल को जोड़ना जो पिछले वाले से सबसे अधिक संबंधित लगता है। पेपर सुझाव देता है कि यह एक ब्रेडक्रंब ट्रेल (breadcrumb trail) का पीछा करने जैसा है जो आपको चक्करों में फंसा देता है, जिससे वह महत्वपूर्ण पुल छूट जाता है जो पहेली के दो दूरस्थ हिस्सों को जोड़ता है।

वास्तविक दुनिया के डेटासेट (जिन्हें Spider और BIRD कहा जाता है) का उपयोग करते हुए एक परीक्षण में, ये पुराने तरीके अक्सर बिंदुओं को जोड़ने के लिए आवश्यक "ब्रिज" टेबल्स को खोजने में विफल रहे, जिससे अधूरे या गलत उत्तर मिले।

नया तरीका: GRAFT का "मास्टर ब्लूप्रिंट"

GRAFT खेल को बदल देता है क्योंकि यह खोज को एक ग्राफ मैचिंग (graph matching) समस्या के रूप में देखता है। केवल शब्दों को पढ़ने के बजाय, यह आपके सवाल से एक "मास्टर ब्लूप्रिंट" (जिसे इन्टेंट ग्राफ कहा जाता है) बनाता है। यह ब्लूप्रिंट सटीक रूप से मानचित्रित करता है कि आपको क्या चाहिए: संस्थाएं (जैसे "प्रोफेसर"), गुण (जैसे "नाम"), और अदृश्य संबंध (जैसे "विभाग में कार्य करता है") जो मौजूद होने चाहिए।

फिर, यह डेटा लेक को टेबल्स के एक विशाल, अस्त-व्यस्त मानचित्र के रूप में देखता है। यह इस मानचित्र में एक पथ खोजने की कोशिश करता है जो ब्लूप्रिंट में बिल्कुल फिट बैठता हो।

इसे करने के लिए, GRAFT एक चतुर स्कोरिंग सिस्टम का उपयोग करता है जिसे IGMS (Information-theoretic Graph Matching Score) कहा जाता है। IGMS को एक "उपयोगिता मीटर" के रूप में सोचें जो एक साथ तीन चीजें जांचता है:

  1. प्रासंगिकता (Relevance): क्या यह फाइल वास्तव में उस बारे में बात करती है जो मैंने पूछा है?
  2. कनेक्टिविटी (Connectivity): क्या यह फाइल उन अन्य फाइलों के साथ जुड़ सकती है जिन्हें मैंने पहले ही खोज लिया है?
  3. विविधता (Diversity): क्या यह फाइल नई जानकारी जोड़ रही है, या यह केवल वही है जो मेरे पास पहले से है?

पेपर गणितीय रूप से सिद्ध करता है कि यह स्कोरिंग सिस्टम "सबमॉड्यूलर" (submodular) है, जो एक फैंसी तरीका है यह कहने का कि यह दोहराव से बचने में स्मार्ट है। यह सुनिश्चित करता है कि आपको एक ही बात कहने वाली दो फाइलें न मिलें, जो केवल आपके सबूतों को अव्यवस्थित करेंगी।

"स्व-शिक्षण" करने वाला जासूस

यहाँ मामला बहुत दिलचस्प हो जाता है। डेटा लेक के साथ कोई "उत्तर कुंजी" (Answer Key) नहीं आती है जो कंप्यूटर को बताती है कि कौन से टेबल्स सही हैं। तो, GRAFT कैसे सीखता है कि उन्हें कैसे खोजा जाए?

लेखकों ने एक स्व-शिक्षण लूप (self-teaching loop) बनाया। उन्होंने एक रोबोट बनाया जो अपने स्वयं के अभ्यास प्रश्न उत्पन्न करता है। यह डेटा लेक के एक यादृच्छिक हिस्से को पकड़ता है, उसे एक नकली "सवाल" (इन्टेंट ग्राफ) में सिकोड़ देता है, और फिर उस सवाल से मूल हिस्से को फिर से बनाने की कोशिश करता है। ऐसा लाखों बार करके, सिस्टम एक "वैल्यू फंक्शन" सीखता है—मूल रूप से एक अंतर्ज्ञान (gut feeling) कि डेटा लेक के माध्यम से कौन सा पथ सही उत्तर तक ले जाने की सबसे अधिक संभावना है।

उन्होंने इस अंतर्ज्ञान को प्रशिक्षित करने के लिए इम्प्लिसिट Q-लर्निंग (Implicit Q-learning - IQL) नामक तकनीक का उपयोग किया। अपने प्रयोगों में, उन्होंने 200,000 ऐसे स्व-निर्मित अभ्यास प्रक्षेप पथ (trajectories) उत्पन्न किए। पेपर सुझाव देता है कि यह स्व-जनित प्रशिक्षण डेटा महत्वपूर्ण है क्योंकि यह सिस्टम को बिना किसी मानव द्वारा हजारों उदाहरणों को मैन्युअल रूप से लेबल किए बिना सीखने की अनुमति देता है।

परिणाम: तेज़ और स्मार्ट

जब शोधकर्ताओं ने GRAFT का पुराने तरीकों के मुकाबले परीक्षण किया, तो परिणाम मापे गए और विशिष्ट थे:

  • सटीकता (Accuracy): GRAFT ने सबसे मजबूत पिछले तरीके (JAR) की तुलना में F1 स्कोर (कुल सटीकता का एक माप) में 7.8% और सफिशिएंसी (सभी आवश्यक टुकड़ों को खोजने की क्षमता) में 10.6% का सुधार किया।
  • गति (Speed): जटिल गणित करने के बावजूद, GRAFT तेज़ है। यह Spider डेटासेट पर उत्तर खोजने में लगभग 3.5 सेकंड लेता है। यह "स्ट्रक्चर-अवेयर" प्रतिस्पर्धी JAR (जिसमें 22.4 सेकंड लगते हैं) की तुलना में बहुत तेज़ है, और कम सटीक लेकिन तेज़ "ग्रीडी" तरीकों के बराबर है।
  • वास्तविक दुनिया का प्रभाव: "ट्रेनिंग डेटा एनरिचमेंट" (जहाँ लक्ष्य भविष्यवाणी मॉडल को बेहतर बनाने के लिए अतिरिक्त डेटा खोजना है) नामक कार्य में, GRAFT ने त्रुटि दर (RMSE) को 3.65 तक कम करने और सटीकता को 0.748 तक बढ़ाने में मदद की, जिसने अन्य सभी तरीकों को पछाड़ दिया।

पेपर क्या दावा नहीं करता

यह जानना महत्वपूर्ण है कि GRAFT क्या नहीं करता है। पेपर यह दावा नहीं करता है कि GRAFT हर संभावित डेटा समस्या को तुरंत हल कर सकता है।

  • यह दावा नहीं करता कि यह एक "जादुई गोली" (magic bullet) है जो बिना किसी सेटअप के काम करती है; इसे पहले डेटा लेक का एक ग्राफ बनाने की आवश्यकता होती है।
  • यह यह सुझाव भी नहीं देता कि "स्व-जनित" प्रशिक्षण डेटा पूर्ण है; लेखक नोट करते हैं कि प्रशिक्षण की गुणवत्ता इस बात पर निर्भर करती है कि "कंप्रेशन ऑपरेटर" (वह रोबोट जो डेटा को सिकोड़ता है) कितना अच्छा काम करता है।
  • पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि केवल अधिक टेबल्स जोड़ना (उच्च रिकॉल) पर्याप्त है। वे दिखाते हैं कि यदि आप बहुत अधिक रेडंडेंट (redundant) टेबल्स जोड़ते हैं, तो भविष्यवाणी मॉडल वास्तव में खराब हो जाते हैं क्योंकि वे शोर (noise) से भ्रमित हो जाते हैं। GRAFT विशेष रूप रूप से दोहराव वाली जानकारी को दंडित करके इससे बचता है।

निचोड़ (The Bottom Line)

लेखक सुझाव देते हैं कि टेबल रिट्रीवल को केवल एक शब्द-खोज के बजाय एक पहेली-मिलान गेम के रूप में मानकर, और कंप्यूटर को उसके अपने जनित अभ्यास दौरों से सीखने के लिए प्रशिक्षित करके, हम ऐसे स्वायत्त डेटा एजेंट बना सकते हैं जो सही सबूत खोजने में बहुत बेहतर हैं। अपने परीक्षणों में, यह दृष्टिकोण लगातार प्रतिस्पर्धा को पीछे छोड़ता रहा, जटिल प्रश्नों का उत्तर देने के लिए टेबल्स का सही मिश्रण खोजा, बिना शोर में खोए। यह एक ऐसे भविष्य की ओर एक कदम है जहाँ आपका कंप्यूटर केवल आपके लिए एक फ़ाइल नहीं खोजता, बल्कि आपके लिए पूरी कहानी तैयार करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →