← नवीनतम पेपर
🤖 AI

SIRIUS-SQL: Anchoring Multi-Candidate Text-to-SQL in Execution Feedback

SIRIUS-SQL एक नवीन Text-to-SQL फ्रेमवर्क है जो विविध जनरेशन के लिए एक डिफिकल्टी-स्मूथिंग (difficulty-smoothing) RL ट्रेनिंग रणनीति, लक्षित त्रुटि सुधार के लिए एक एक्जीक्यूशन-ग्राउंडेड लाइफसाइकिल और एक कॉन्फिडेंस-गेटेड हाइब्रिड सेलेक्टर के माध्यम से मौजूदा मल्टी-कैंडिडेट सिस्टम्स की सीमाओं को संबोधित करके जटिल स्कीमा पर सटीकता में सुधार करता है, जिससे BIRD और SPIDER बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Leo Luo, Haining Xie, Siqi Shen, Zhipeng Ma, Rui Ling, Hang Xu, Hefeng Jiang, Dingwei Chen, Yang Li, Peng Chen, Jie Jiang

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leo Luo, Haining Xie, Siqi Shen, Zhipeng Ma, Rui Ling, Hang Xu, Hefeng Jiang, Dingwei Chen, Yang Li, Peng Chen, Jie Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ (AI) को एक बहुत ही विशिष्ट, जटिल निर्देश देने की कोशिश कर रहे हैं ताकि वह एक भोजन (SQL क्वेरी) बना सके, जो एक विशाल, बिखरे हुए रेसिपी बुक (डेटाबेस) पर आधारित है।

यदि आप रोबोट से इसे केवल एक बार बनाने के लिए कहते हैं, तो वह अक्सर गलतियाँ करता है क्योंकि रेसिपी बुक भ्रमित करने वाली होती है, सामग्री के नाम अजीब होते हैं, या निर्देश अस्पष्ट होते हैं।

पुराना तरीका: "भीड़ का वोट" समस्या
हाल ही में, अन्य प्रणालियों ने इस समस्या को हल करने के लिए रोबोट को एक बार के बजाय 16 बार भोजन बनाने के लिए कहा (majority voting)। फिर वे उन 16 व्यंजनों में से उसे चुनते हैं जिस पर अधिकांश लोग सहमत होते हैं।

इस पेपर के लेखक, SIRIUS-SQL, कहते हैं कि इस "भीड़ के वोट" वाले दृष्टिकोण में तीन बड़ी समस्याएँ हैं:

  1. इको चैंबर (Echo Chamber): यदि आप एक ही रोबोट को 16 बार खाना बनाने के लिए कहते हैं, तो वह वही 16 गलतियाँ बार-बार करता है। यह एक ही व्यक्ति से 16 बार पासवर्ड का अनुमान लगाने के लिए कहने जैसा है; वे संभवतः बार-बार एक ही गलत चीज़ का अनुमान लगाएंगे।
  2. "एक ही आकार सबके लिए" वाला समाधान (One-Size-Fits-All Fix): जब कोई व्यंजन गलत बनता है, तो पुराने सिस्टम बस कहते हैं, "ओह, यह खराब हो गया, फिर से कोशिश करो," बिना यह देखे कि यह कैसे खराब हुआ। क्या बर्तन जल गया? क्या वे नमक डालना भूल गए? क्या उन्होंने गलत पैन का उपयोग किया? इन सभी के लिए अलग-अलग सुधारों की आवश्यकता होती है, लेकिन पुराना सिस्टम उन सभी के साथ एक जैसा व्यवहार करता है।
  3. गलत विजेता: कभी-कभी, सही व्यंजन वास्तव में उन 16 व्यंजनों के ढेर में मौजूद होता है, लेकिन भीड़ गलत चीज़ के लिए वोट देती है क्योंकि वे गलत चीजों को देख रहे होते हैं (जैसे स्वाद बनाम सामग्री की सूची)।

SIRIUS-SQL का समाधान: एक मास्टर शेफ और एक जनरललिस्ट
SIRIUS-SQL इस समस्या को तीन-चरणीय रणनीति के साथ ठीक करता है:

1. "विशेषज्ञ" और "जनरलिस्ट" (इको चैंबर को ठीक करना)

एक ही रोबोट को 16 बार खाना बनाने के लिए कहने के बजाय, वे दो अलग-अलग शेफ का उपयोग करते हैं:

  • विशेषज्ञ (SIRIUS-32B): यह एक रोबोट है जिसे विशेष रूप से खाना पकाने (SQL) के लिए प्रशिक्षित किया गया है। इसे एक विशेष "रिवॉर्ड सिस्टम" (Reinforcement Learning) का उपयोग करके सिखाया गया था जहाँ इसे इनाम तभी मिलता है जब व्यंजन वास्तव में काम करता है। यह सही व्यंजन के कई अलग-अलग संस्करण बनाना सीखता है, न कि केवल एक ही गलती को दोहराता है।
  • जनरलिस्ट (Generalist): यह एक सुपर-स्मार्ट, सर्व-उद्देश्य वाला रोबोट है (जैसे एक प्रसिद्ध AI मॉडल) जो जटिल भाषा और अजीब निर्देशों को समझने में अच्छा है।
  • परिणाम: विशेषज्ञ के गहरे ज्ञान को जनरलिस्ट की व्यापक समझ के साथ जोड़कर, उन्हें बहुत अधिक विविधता प्राप्त होती है। यह एक मास्टर सुशी शेफ और एक रचनात्मक फ्रेंच शेफ के मिलकर काम करने जैसा है; आपको सही रेसिपी बनाने की बेहतर संभावना मिलती है।

2. "ट्राइएज नर्स" प्रणाली (एक ही आकार सबके लिए वाले समाधान को ठीक करना)

जब कोई व्यंजन गलत निकलता है, तो SIRIUS-SQL केवल यह नहीं कहता कि "फिर से प्रयास करें।" यह एक ट्राइएज नर्स की तरह काम करता है, जो निदान करता है कि वास्तव में क्या गलत हुआ:

  • रनटाइम एरर (बर्तन जल गया): रोबोट ने ऐसे टूल का उपयोग करने की कोशिश की जो मौजूद ही नहीं है। सिस्टम तुरंत सिंटैक्स (syntax) को ठीक करता है।
  • टाइमआउट (चूल्हा बहुत धीमा है): रेसिपी बहुत जटिल है और इसमें बहुत समय लग रहा है। सिस्टम स्वाद बदले बिना रेसिपी को अधिक कुशल बनाने के लिए इसे फिर से लिखता है।
  • खाली परिणाम (पैन खाली है): रोबोट ने रेसिपी का पूरी तरह से पालन किया, लेकिन परिणाम खाली रहा क्योंकि उसने गलत सामग्री की तलाश की। सिस्टम सही सामग्री खोजने के लिए विशिष्ट "स्ट्रक्चरल" सुधारों का प्रयास करता है।

इन विशिष्ट सुधारों के प्रयास करने के बाद ही रोबोट को दोबारा मौका मिलता है। यह समय बचाता है और सिस्टम को असंभव सुधारों पर प्रयास बर्बाद करने से रोकता है।

3. "स्मार्ट जज" (गलत विजेता को ठीक करना)

अंत में, जब ढेर में से सबसे अच्छा व्यंजन चुनने का समय आता है, तो सिस्टम दो-चरणीय मतदान प्रक्रिया का उपयोग करता है:

  • चरण 1: स्वाद परीक्षण (Taste Test): यह वास्तविक परिणामों को देखता है। यदि 10 व्यंजन एक जैसे स्वाद के हैं, तो उन्हें उच्च स्कोर मिलता है।
  • चरण 2: टाई-ब्रेकर (Tie-Breaker): यदि दो समूहों के व्यंजनों का स्वाद स्कोर समान है, तो सिस्टम केवल अनुमान नहीं लगाता। यह रेसिपी के ब्लूप्रिंट (संरचना) को देखता है। यह पूछता है: "क्या कई अलग-अलग शेफ (विशेषज्ञ और जनरलिस्ट) ने स्वतंत्र रूप से एक ही ब्लूप्रिंट तैयार किया है?" यदि हाँ, तो वह ब्लूप्रिंट संभवतः असली विजेता है।

परिणाम
इस "विशेषज्ञ + जनरलिस्ट" टीम, "ट्राइएज नर्स" मरम्मत प्रणाली और "स्मार्ट जज" का उपयोग करके, SIRIUS-SQL अपने काम में सर्वश्रेष्ठ बन गया।

  • BIRD टेस्ट पर (जो वास्तविक दुनिया के बिखरे हुए डेटा के साथ एक कठिन टेस्ट है), इसने 75.88% सटीकता प्राप्त की, जो पिछले सर्वश्रेष्ठ सिस्टम को पीछे छोड़ देती है।
  • SPIDER टेस्ट पर (जो एक मानक टेस्ट है), इसने 91.20% सटीकता प्राप्त की।

संक्षेप में, SIRIUS-SQL एक ही रोबोट द्वारा 16 बार अनुमान लगाने पर निर्भर रहने के बजाय, विशेषज्ञों की एक टीम का उपयोग करता है, विशिष्ट त्रुटियों का निदान करता है, और सही उत्तर खोजने के लिए एक स्मार्ट, बहु-चरणीय मतदान प्रणाली का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →