← नवीनतम पेपर
💬 NLP

Latent Bridges for Multi-Table Question Answering

यह शोध पत्र GRAB को प्रस्तुत करता है, जो एक कुशल पाइपलाइन है जो विषम ग्राफों (heterogeneous graphs) को क्वेरी-सशर्त लेटेंट टोकन में एनकोड करके फ्रोजन लार्ज लैंग्वेज मॉडल्स को रिलेशनल डेटा से जोड़ता है, जिससे केवल एक हल्के 91M पैरामीटर वाले मॉड्यूल को प्रशिक्षित करके मल्टी-टेबल प्रश्न उत्तर प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Simone Varriale, Tamara Cucumides, Floris Geerts, Paolo Papotti

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Simone Varriale, Tamara Cucumides, Floris Geerts, Paolo Papotti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास सूचनाओं का एक विशाल पुस्तकालय है, लेकिन किताबों के बजाय, जानकारी सैकड़ों अलग-अलग स्प्रेडशीट्स (टेबल्स) में संग्रहीत है। कुछ स्प्रेडशीट्स उत्पादों की सूची देती हैं, कुछ शहरों की, और कुछ बिक्री के आंकड़ों की। वे सभी आपस में जुड़ी हुई हैं, लेकिन उनके जुड़ाव छिपे हुए हैं क्योंकि डेटा जिस तरह से व्यवस्थित है, वह इसे स्पष्ट नहीं होने देता।

अब, कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन (एक AI जिसे LLM कहा जाता है) से एक प्रश्न पूछते हैं जैसे: "किस शहर में सबसे अधिक हार्डवेयर लेनदेन हुए?"

समस्या: "केवल टेक्स्ट वाला" लाइब्रेरियन

पारंपरिक रूप से, इस उत्तर को प्राप्त करने के लिए, हम इन सभी स्प्रेडशीट्स को समतल (flatten) कर देंगे और उन्हें एक विशाल, अव्यवस्थित पैराग्राफ के रूप में टेक्स्ट में बदल देंगे। हम इस पैराग्राफ को लाइब्रेरियन को खिला देंगे।

समस्या यह है कि स्प्रेडशीट्स की एक विशेष संरचना होती है: पंक्तियाँ (rows), कॉलम (columns) और उनके बीच के छिपे हुए लिंक। जब आप एक स्प्रेडशीट को पैराग्राफ में बदल देते हैं, तो आप उसकी संरचना खो देते हैं। यह एक जटिल लेगो (Lego) महल को लेने, उसे ईंटों के ढेर में तोड़ने और फिर लाइब्रेरियन को वह ढेर थमाने जैसा है और उनसे उस महल को अपने दिमाग में फिर से बनाने के लिए कहने जैसा है। लाइब्रेरियन बुद्धिमान तो है, लेकिन उसे अंदाजा लगाना पड़ता है कि ईंटें कहाँ फिट बैठेंगी। विशेष रूप से तब, जब प्रश्न के लिए विभिन्न स्प्रेडशीट्स के बीच छलांग लगाने की आवश्यकता होती है, तो वे भटक सकते हैं।

समाधान: GRAB (एक "आर्किटेक्ट का ब्लूप्रिंट")

इस पेपर के लेखक GRAB नामक एक नया सिस्टम पेश करते हैं। केवल लाइब्रेरियन को ईंटों का ढेर (टेक्स्ट) देने के बजाय, GRAB पहले एक विशेषज्ञ आर्किटेक्ट की तरह काम करता है जो एक ब्लूप्रिंट बनाता है।

GRAB इस प्रकार काम करता है, चरण-दर-चरण:

  1. आर्किटेक्ट (ग्राफ कंस्ट्रक्टर - Graph Constructor):
    GRAB स्प्रेडशीट्स को देखता है और महसूस करता है कि वे केवल टेक्स्ट नहीं हैं; वे एक नेटवर्क हैं। यह एक दृश्य मानचित्र (ग्राफ) बनाता है जहाँ:

    • पंक्तियाँ (Rows) विशिष्ट स्थानों की तरह हैं।
    • कॉलम (Columns) श्रेणियों की तरह हैं (जैसे, "शहर" या "उत्पाद")।
    • मान (Values) वास्तविक वस्तुएं हैं (जैसे, "रोम" या "हथौड़ा")।
    • जुड़ाव (Connections): यदि "रोम" दो अलग-अलग स्प्रेडशीट्स के "शहर" कॉलम में दिखाई देता है, तो आर्किटेक्ट उन्हें जोड़ने के लिए एक सीधा रेखा खींचता है। यह विभिन्न टेबल्स के बीच छिपे हुए लिंक को दृश्यमान और स्पष्ट बनाता है।
  2. संदेशवाहक (ग्राफ एनकोडर - Graph Encoder):
    एक बार मानचित्र बन जाने के बाद, एक संदेशवाहक मानचित्र पर दौड़ता है और जुड़े हुए बिंदुओं के बीच नोट्स पहुँचाता है। यह संदेशवाहक सभी संरचनात्मक सुराग एकत्र करता है: "हे, यह 'रोम' टेबल A में 'हार्डवेयर' से और टेबल B में 'बिक्री' से जुड़ा है।" यह प्रक्रिया सिस्टम को हर एक शब्द पढ़े बिना संबंधों को समझने में मदद करती है।

  3. अनुवादक (लेटेंट ब्रिज - Latent Bridge):
    आर्किटेक्ट और संदेशवाहक ने अपना काम कर दिया है, लेकिन लाइब्रेरियन (AI) केवल "टेक्स्ट" बोलता है। GRAB के पास एक विशेष अनुवादक है जो उस जटिल मानचित्र और आपके द्वारा पूछे गए विशिष्ट प्रश्न ("कौन सा शहर...?") को एक छोटे, अत्यंत स्मार्ट सारांश में संकुचित कर देता है।

    • इसे एक हाइलाइटर की तरह समझें। लाइब्रेरियन को पूरा मानचित्र देने के बजाय, अनुवादक केवल उन हिस्सों को हाइलाइट करता है जो आपके विशिष्ट प्रश्न के लिए प्रासंगिक हैं। यदि आप "शहरों" के बारे में पूछते हैं, तो यह शहरों को हाइलाइट करता है। यदि आप "बिक्री" के बारे में पूछते हैं, तो यह बिक्री को हाइलाइट करता है। यह सब कुछ सारांशित नहीं करता; यह केवल वही सारांशित करता जिसकी आपको आवश्यकता है।
  4. लाइब्रेरियन (एक फ्रोजन LLM - Frozen LLM):
    अंत में, लाइब्रेरियन को दो चीजें प्राप्त होती हैं:

    • मूल टेक्स्ट (समतल की गई स्प्रेडशीट्स, ताकि यदि उन्हें किसी विशिष्ट संख्या को पढ़ने की आवश्यकता हो)।
    • हाइलाइट किया गया ब्लूप्रिंट (GRAB से प्राप्त संरचनात्मक सारांश)।

    क्योंकि अब लाइब्रेरियन के पास ब्लूप्रिंट है, इसलिए उन्हें संरचना का अनुमान लगाने की आवश्यकता नहीं है। वे अपना ध्यान तर्क करने और उत्तर देने पर केंद्रित कर सकते हैं।

यह एक बड़ी बात क्यों है

  • लाइब्रेरियन नहीं बदलता: आमतौर पर, स्प्रेडशीट्स में लाइब्रेरियन को बेहतर बनाने के लिए, आपको उन्हें शुरू से फिर से प्रशिक्षित (retrain) करना पड़ता है, जो महंगा है और इससे वे अन्य चीजें (जैसे कविता लिखना) करने की क्षमता खो सकते हैं। GRAB लाइब्रेरियन को बिल्कुल वैसा ही रखता है ("फ्रोजन")। यह केवल छोटे, हल्के वजन वाले आर्किटेक्ट और अनुवादक (लगभग 91 मिलियन पैरामीटर, जो लाइब्रेरियन के अरबों पैरामीटर्स की तुलना में बहुत छोटा है) को प्रशिक्षित करता है।
  • यह कुशल है: आप इस पूरे सिस्टम को एक ही कंप्यूटर पर प्रशिक्षित कर सकते हैं, जबकि लाइब्रेरियन को फिर से प्रशिक्षित करने के लिए एक विशाल सुपरकंप्यूटर की आवश्यकता होगी।
  • यह कठिन समस्याओं पर सबसे अच्छा काम करता है: पेपर दिखाता है कि GRAB तब चमकता है जब प्रश्न कठिन हो और जिसमें कई टेबल्स के बीच कूदने की आवश्यकता हो। यह "संरचनात्मक" पहेली को हल करता है ताकि लाइब्रेरियन "तर्क" वाले हिस्से को हल कर सके।

इसकी सीमाएँ

पेपर इस बारे में ईमानदार है कि GRAB क्या नहीं कर सकता।

  • यह कैलकुलेटर नहीं है: GRAB सही पंक्तियों और कॉलमों को खोजने में बहुत अच्छा है (जैसे, "रोम में सभी बिक्री खोजें")। लेकिन यदि प्रश्न के लिए सटीक, जटिल गणित की आवश्यकता होती है (जैसे, हजारों संख्याओं का सटीक औसत निकालना), तो GRAB अभी भी गणित करने के लिए लाइब्रेरियन पर निर्भर करता है। यह लाइब्रेरियन को संख्याएँ खोजने में मदद करता है, लेकिन यह स्वयं अंकगणित नहीं करता है।
  • इसे टेक्स्ट की आवश्यकता होती है: GRAB टेक्स्ट की जगह नहीं लेता है; यह उसका पूरक है। लाइब्रेरियन को सटीक मानों को पढ़ने के लिए मूल टेक्स्ट की आवश्यकता होती है, जबकि GRAB उन्हें जल्दी से खोजने के लिए मानचित्र प्रदान करता है।

संक्षेप में

GRAB एक जासूस को जांच शुरू करने से पहले आवर्धक लेंस (magnifying glass) और एक मानचित्र देने जैसा है। जासूस को शून्य से मानचित्र पढ़ना सीखने (AI को फिर से प्रशिक्षित करने) के बजाय, GRAB एक विशेष उपकरण प्रदान करता है जो सुरागों को हाइलाइट करता है और बिंदुओं को जोड़ता है, जिससे जासूस मामले को बहुत तेज़ी से और अधिक सटीकता से सुलझा पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →