← नवीनतम पेपर
💬 NLP

SQL Query Engine: A Self-Healing LLM Pipeline for Natural Language to PostgreSQL Translation

यह शोध पत्र SQL Query Engine को प्रस्तुत करता है, जो एक ओपन-सोर्स, सेल्फ-होस्टेड सेवा है जो स्वचालित स्कीमा इंट्रोस्पेक्शन (schema introspection), एक लचीले रिस्पॉन्स पार्सर और एक इटरेटिव सेल्फ-हीलिंग लूप वाले दो-चरणीय LLM पाइपलाइन का उपयोग करके प्राकृतिक भाषा को मान्य PostgreSQL क्वेरीज़ में अनुवादित करती है, जो रीड-ओनली सुरक्षा और शून्य प्रतिगमन (zero regressions) सुनिश्चित करते हुए निष्पादन सटीकता को महत्वपूर्ण रूप से बढ़ाती है।

मूल लेखक: Muhammad Adeel Ijaz

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Adeel Ijaz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन थोड़ी अधीम रोबोटिक असिस्टेंट है। आप अपनी कंपनी के डेटाबेस के बारे में सवाल पूछना चाहते हैं (जैसे "पिछले महीने हमने कितने ऑर्डर बेचे?") और वह रोबोट केवल "डेटाबेस की भाषा" (SQL) बोलता है।

यदि आप रोबोट से कोई प्रश्न पूछते हैं, तो वह उत्तर प्राप्त करने के लिए कोड लिखने की कोशिश करता है। कभी-कभी, वह तुरंत सही कर देता है। लेकिन अक्सर, वह कोई टाइपो (लिखने की गलती) करता है, गलत कॉलम का नाम उपयोग करता है, या कोई नियम भूल जाता है। पुराने दिनों में, रोबता केवल "Error" कहता और हार मान लेता, जिससे आपको कोई उत्तर नहीं मिलता।

SQL Query Engine एक नया सिस्टम है जो नियमों को बदल देता है। यह उस रोबोट को एक स्व-सुधार की महाशक्ति (self-healing superpower) और एक सख्त सुरक्षा निरीक्षक (strict safety inspector) देने जैसा है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. दो-चरणीय प्रक्रिया: आर्किटेक्ट और इंस्पेक्टर

सिर्फ एक बार अनुमान लगाने के बजाय, सिस्टम दो अलग चरणों में काम करता है:

  • चरण 1: आर्किटेक्ट (जनरेशन/निर्माण)
    रोबोट आपके डेटाबेस को देखता है (जैसे घर के ब्लूप्रिंट को देखना) और आपके प्रश्न का उत्तर देने के लिए SQL कोड लिखने की कोशिश करता है। वह केवल अनुमान नहीं लगाता; वह एक "मल्टी-स्ट्रेटेजी पार्सर" का उपयोग करता है ताकि यह सुनिश्चित हो सके कि वह वास्तव में कोड को ढूंढ ले, भले ही रोबोट ने उसे किसी अव्यवस्थित पैराग्राफ या JSON बॉक्स के अंदर लिखा हो।
  • चरण 2: इंस्पेक्टर (मूल्यांकन और स्व-सुधार)
    यह जादू वाला हिस्सा है। आपको परिणाम दिखाने से पहले, सिस्टम उस कोड को डेटाबेस के विरुद्ध चलाता है।
    • यदि यह काम करता है: बहुत बढ़िया! यह तुरंत आपको उत्तर दिखा देता है।
    • यदि यह विफल होता है: सिस्टम एरर मैसेज (जैसे, "'order_date' कॉलम मौजूद नहीं है") को पकड़ लेता है और उसे वापस रोबोट को सौंप देता है। यह कहता है, "हे, तुमने यहाँ गलती की है। डेटाबेस कहता है कि 'order_date' वास्तव में 'order_timestamp' है। इसे ठीक करो और फिर से प्रयास करो।"
    • रोबोट फिर से प्रयास करता है। यदि वह फिर से विफल होता है, तो सिस्टम उसे नया एरर देता है, और रोबोट फिर से प्रयास करता है। यह लूप तब तक चलता रहता है जब तक कि वह इसे सही नहीं कर लेता या उसके प्रयास समाप्त नहीं हो जाते।

2. सुरक्षा जाल: "जो टूटा नहीं है उसे ठीक न करें"

पेपर में दो चतुर तरकीबों पर प्रकाश डाला गया है जो यह सुनिश्चित करती हैं कि रोबोट "सुधारने" की कोशिश में किसी अच्छे उत्तर को गलती से खराब न कर दे:

  • "अर्ली-एसेप्ट" (Early-Accept) नियम: यदि रोबलेट एक ऐसा क्वेरी लिखता है जो पूरी तरह से काम करता है और डेटा लौटाता है, तो सिस्टम तुरंत रुक जाता है। यह रोबोट को अपने काम को "दोबारा जांचने" के लिए नहीं कहता। यह रोबोट को बहुत अधिक सोचने और एक सही उत्तर को गलत उत्तर में बदलने से रोकता है।
  • "बेस्ट रिजल्ट" (Best Result) ट्रैकर: कल्पना कीजिए कि रोबोट 5 बार प्रयास करता है। पहला प्रयास एकदम सही था लेकिन खाली (कोई डेटा नहीं मिला) था। दूसरा प्रयास टूटा हुआ था। तीसरा प्रयास एकदम सही था और उसमें डेटा था। सिस्टम जो भी सबसे अच्छा उसने देखा, उसे याद रखता है। यदि रोबोट के प्रयास समाप्त हो जाते हैं, तो सिस्टम आपको मिला सबसे अच्छा उत्तर देता है, बजाय इसके कि वह केवल "मैं विफल रहा" कहे।

3. सुरक्षा गार्ड: "रीड-ओनली" चश्मा

AI के डेटाबेस से बात करने के साथ सबसे बड़ा डर यह है कि वह गलती से आपका डेटा डिलीट कर सकता है या कीमतें बदल सकता है।

  • उपमा: कल्पना कीजिए कि रोबोट ने विशेष चश्मा पहना हुआ है जो उसे भौतिक रूप से उन चीजों को छूने से रोकता है जो खिड़की नहीं हैं।
  • यह कैसे काम करता है: सिस्टम डेटाबेस कनेक्शन को रीड-ओनली (केवल पढ़ने योग्य) होने के लिए मजबूर करता है। भले ही रोबोट डेटा को DELETE या UPDATE करने का कमांड लिखने की कोशिश करे, डेटाबेस ड्राइवर (दरबान) उस कमांड को अंदर जाने से रोकने के लिए उसे मना कर देता है। यह एक सख्त सुरक्षा दीवार है, न कि केवल एक विनम्र अनुरोध।

4. मेमोरी: "सेशन नोटबुक"

यदि आप रोबोट से एक प्रश्न पूछते हैं, और फिर एक फॉलो-अप प्रश्न पूछते हैं, तो सिस्टम संदर्भ (context) को याद रखता है।

  • उपमा: हर बार सवाल पूछने पर रोबोट को घर के पूरे ब्लूप्रिंट को फिर से पढ़ने के लिए कहने के बजाय, यह एक नोटबुक (Redis में कैश की गई) मेज पर खुली रखता है। यह बातचीत की शुरुआत में केवल एक बार ब्लूप्रिंट को देखता है, फिर बस अपनी नोटबुक के पन्ने पलटता है। यह बातचीत को बहुत तेज़ बनाता है।

5. परिणाम: क्या यह वास्तव में काम करता है?

लेखकों ने इस सिस्टम का परीक्षण दो प्रकार की चुनौतियों पर किया:

  • सिंथेटिक टेस्ट: साफ, आदर्श डेटाबेस पर काल्पनिक प्रश्न।
  • रियल-वर्ल्ड टेस्ट (BIRD): जटिल डेटाबेस पर अव्यवस्थित, वास्तविक दुनिया के प्रश्न।

निर्णय:

  • साफ टेस्ट पर, सेल्फ-हीलिंग लूप ने सटीकता को 9.3% तक सुधारा।
  • अव्यवस्थित वास्तविक दुनिया के टेस्ट पर, इसने सटीकता में 4.6% का सुधार किया।
  • महत्वपूर्ण रूप से, सर्वश्रेष्ठ मॉडल्स के लिए, इसने कभी भी एक सही उत्तर को खराब नहीं किया (शून्य "रिग्रेशन")।

यह एक बड़ी बात क्यों है?

आज के अधिकांश AI टूल्स "एक बार में खत्म" (one-and-done) वाले हैं। यदि वे पहली बार में गलत होते हैं, तो आप फंस जाते हैं। यह सिस्टम AI को एक मानव कर्मचारी की तरह मानता है: यह उन्हें गलती करने देता है, उन्हें फीडबैक देता है ("हे, उस कॉलम का नाम चेक करो"), और उन्हें तब तक फिर से प्रयास करने देता है जब तक कि वे इसे सही नहीं कर लेते।

यह एक नाजुक, त्रुटि-प्रवण प्रक्रिया को एक लचीले, स्व-सुधार करने वाले पाइपलाइन में बदल देता है जो डेटा डिलीट करने के डर के बिना वास्तविक व्यवसायों में उपयोग करने के लिए सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →