← नवीनतम पेपर
🤖 AI

Schema-First Retrieval: Embedding Catalogs for Natural Language Analytics

यह शोध पत्र स्कीमा-फर्स्ट रिट्रीवल (Schema-First Retrieval) का परिचय देता है, जो एक नवीन रिट्रीवल लेयर है जो विविध कैटलॉग मेटाडेटा (टेबल्स, कॉलम्स, मेट्रिक्स, रिलेशनशिप्स और क्वेरी हिस्ट्री) को एम्बेड और इंडेक्स करता है ताकि एंटरप्राइज टेक्स्ट-टू-SQL सिस्टम में स्कीमा चयन की सटीकता को महत्वपूर्ण रूप से सुधारा जा सके और SQL निष्पादन त्रुटियों को कम किया जा सके, और यह कैटलॉग कॉन्टेक्स्ट को प्रॉम्प्ट फॉर्मेटिंग विवरण के बजाय एक प्रथम-श्रेणी की रिट्रीवल समस्या के रूप में मानता है।

मूल लेखक: Adarsh Agrawal, Shashank Indukuri

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adarsh Agrawal, Shashank Indukuri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े भ्रमित लाइब्रेरियन से एक विशिष्ट पुस्तक के बारे में पूछने की कोशिश कर रहे हैं।

समस्या: गलत बुकशेल्फ़ (The Wrong Bookshelf)
पुराने तरीके में (जिसे पेपर में "रॉ स्कीमा प्रॉम्प्टिंग" कहा गया है), आप लाइब्रेरियन के पास जाते हैं और कहते हैं, "मुझे राजस्व (revenue) के बारे में जानना है।" लेकिन लाइब्रेरियन के पास "राजस्व" नाम का कोई बुकशेल्फ़ नहीं है। इसके बजाय, उनके पास हजारों शेल्फ हैं जिनके नाम बहुत उलझाने वाले हैं जैसे tbl_fin_2024_q3 या amt_net_rev_lcl| क्योंकि लाइब्रेरियन को नहीं पता कि आपका मतलब किस शेल्फ से है, वे गलत शेल्फ से एक किताब उठा सकते हैं। वे एक बेहतरीन वाक्य (SQL कोड) तो लिख सकते हैं, लेकिन उसका उत्तर बेकार होगा। बड़ी कंपनियों में, "लाइब्रेरी" (डेटाबेस) इतनी विशाल और अव्यवस्थित होती है कि लाइब्रेरियन उत्तर लिखना शुरू करने से पहले ही गलत संदर्भ (context) उठा लेता है।

समाधान: स्कीमा-फर्स्ट रिट्रीवल (Schema-First Retrieval)
यह पेपर एक नया सिस्टम पेश करता है जिसे स्कीमा-फर्स्ट रिट्रीवल कहा जाता है। लाइब्रेरियन को पूरी लाइब्रेरी से अनुमान लगाने के लिए कहने के बजाय, यह सिस्टम एक सुपर-स्मार्ट कैटलॉग कार्ड सिस्टम की तरह काम करता है जो लाइब्रेरियन के देखने से पहले ही जानकारी के सटीक हिस्सों को खोज लेता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "कैटलॉग कार्ड्स" के पांच प्रकार (The Five Types of "Catalog Cards")

केवल किताबों के शीर्षकों को देखने के बजाय, यह सिस्टम लाइब्रेरी के हर जानकारी के टुकड़े के लिए पांच विशिष्ट प्रकार के "कार्ड" बनाता है:

  • टेबल कार्ड्स (Table Cards): ये "सेक्शन" के संकेतों की तरह हैं (जैसे, "यह सेक्शन स्कूलों के बारे में है")।
  • कॉलम कार्ड्स (Column Cards): ये किताब के भीतर विशिष्ट "अध्यायों" या "पंक्तियों" की तरह हैं (जैसे, "यह कॉलम ग्रेड स्तरों को सूचीबद्ध करता है")।
  • मेट्रिक कार्ड्स (Metric Cards): ये "ग्लोसरी" या "बिजनेस डिक्शनरी" की तरह हैं। यदि आप "चर्न" (churn) के लिए पूछते हैं, तो यह कार्ड समझाता है कि इसका वास्तव में क्या अर्थ है (जैसे, "वे लोग जिन्होंने सेवा का उपयोग करना बंद कर दिया"), भले ही डेटाबेस में इसे कुछ और कहा गया हो।
  • रिलेशनशिप कार्ड्स (Relationship Cards): ये "क्रॉस-रेफरेंस" की तरह हैं जो आपको बताते हैं कि दो अलग-अलग किताबें एक-दूसरे से कैसे जुड़ती हैं (जैसे, "कुल बिक्री खोजने के लिए, आपको 'ऑर्डर्स' की किताब को 'कस्टमर्स' की किताब के साथ जोड़ना होगा")।
  • हिस्ट्री कार्ड्स (History Cards): ये "पिछले प्रश्नों का लॉग" हैं। यदि पिछले सप्ताह किसी ने समान प्रश्न पूछा था, तो यह कार्ड सिस्टम को याद दिलाता है, "हे, हमने पिछली बार इन विशिष्ट पृष्ठों का उपयोग करके इसका उत्तर पाया था।"

2. खोज प्रक्रिया (The Search Process - "The Retrieval Layer")

जब आप कोई प्रश्न पूछते हैं, तो सिस्टम केवल पूरी लाइब्रेरी लाइब्रेरियन की मेज पर नहीं डाल देता। यह तीन-चरणीय खोज करता है:

  1. एक विस्तृत जाल (The Broad Net): यह एक "सिमेंटिक नेट" (AI एम्बेडिंग्स) का उपयोग करता है ताकि किसी भी ऐसी चीज़ को पकड़ सके जो आपके प्रश्न जैसा सुनाई देती है, भले ही शब्द अलग हों।
  2. विशेषज्ञ समीक्षा (Reranking): एक दूसरा, अधिक सावधानीपूर्वक AI उन चुनी गई वस्तुओं को देखता है। वह महसूस करता है, "रुको, 'राजस्व' आमतौर पर इस विशिष्ट टेबल में होता है, उस दूसरे में नहीं," और वह सबसे अच्छे मिलान को शीर्ष पर रखने के लिए सूची को पुनर्व्यवस्थित करता है।
  3. मेमोरी चेक (The Memory Check): यह "हिस्ट्री कार्ड्स" की जांच करता है। यदि कोई कंपनी आमतौर पर "राजस्व" के बारे में एक विशिष्ट तरीके से पूछती है, तो यह उस पथ को प्राथमिकता देता है।

3. "सुरक्षा गार्ड" (Access Control)

पेपर इस बात पर जोर देता है कि लाइब्रेरियन (AI) को सुरक्षा नियमों को याद रखने के लिए भरोसेमंद नहीं माना जाना चाहिए। इसके बजाय, दरवाजे पर एक सुरक्षा गार्ड खड़ा है।

  • लाइब्रेरियन के किताबें देखने से पहले, गार्ड जांच करता है: "क्या इस उपयोगकर्ता के पास 'सैलरी' सेक्शन देखने की अनुमति है?"
  • यदि नहीं, तो गार्ड भौतिक रूप रूप से उन पृष्ठों को हटा देता है।
  • यदि लाइब्रेरियन किसी वर्जित पृष्ठ का उपयोग करके वाक्य लिखने की कोशिश करता है, तो गार्ड वाक्य को भेजने से पहले ही उसे रोक देता है। यह सख्त नियमों द्वारा किया जाता है, न कि लाइब्रेरियन से "कृपया सावधान रहें" कहने से।

4. परिणाम: कम गलतियाँ (The Results: Fewer Mistakes)

इस पेपर ने तीन अलग-अलग "लाइब्रेरी" (डेटासेट) पर इस सिस्टम का परीक्षण किया:

  • सही पृष्ठ खोजना: इस सिस्टम ने पुराने तरीकों की तुलना में सही टेबल्स और कॉलम्स को बहुत अधिक बार खोजा। उदाहरण के लिए, एक परीक्षण में, इसने सही टेबल को 96% बार खोजा, जबकि पुराने तरीकों में दर बहुत कम थी।
  • कम टूटे हुए वाक्य: जब सिस्टम ने इस "कैटलॉग-फर्स्ट" दृष्टिकोण का उपयोग किया, तो अंतिम कोड में त्रुटियों की संख्या में 2.5 गुना की कमी आई।
    • क्यों? अक्सर, पुराना सिस्टम इसलिए विफल हो जाता था क्योंकि वह कॉलम का नाम सही ढंग से लिखना नहीं जानता था (जैसे, स्पेस वाले नाम के चारों ओर उद्धरण चिह्न लगाना भूल जाना)। क्योंकि नया सिस्टम "कॉलम कार्ड" निकालता है जिसमें पहले से ही सही फॉर्मेटिंग होती है, लाइब्रेरियन बस उसे पूरी तरह से कॉपी कर लेता है।

मुख्य निष्कर्ष (The Big Takeaway)

पेपर तर्क देता है कि नेचुरल लैंग्वेज एनालिटिक्स (साधारण अंग्रेजी में प्रश्न पूछना) को "लेखन" की समस्या के रूप में नहीं देखा जाना चाहिए। यह वास्तव में एक खोज (searching) की समस्या है।

यदि आप एक स्मार्ट AI को गलत नक्शा देते हैं, तो वह गलत जगह ले जाने वाला एक बेहतरीन वाक्य लिखेगा। एक बेहतर नक्शा (कैटलॉग) बनाकर और AI के लिखना शुरू करने से पहले सही रास्ता खोजकर, आप विश्वसनीय, सुरक्षित और सटीक उत्तर प्राप्त करते हैं। AI वह खोज नहीं कर रहा है; वह केवल उन क्यूरेटेड, सुरक्षित और सही दस्तावेजों के आधार पर रिपोर्ट लिख रहा है जो सिस्टम ने उसके लिए खोजे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →