← नवीनतम पेपर
🤖 AI

Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems

यह शोध पत्र STEF को प्रस्तुत करता है, जो एक स्कीमा-अज्ञेय (schema-agnostic) मूल्यांकन ढांचा है जो डेटाबेस स्कीमा या ग्राउंड-ट्रुथ क्वेरी की आवश्यकता के बिना, प्राकृतिक भाषा इनपुट और जनरेट की गई SQL से व्याख्या योग्य सटीकता स्कोर उत्पन्न करके Text-to-SQL सिस्टम की निरंतर, प्रोडक्शन-नेटिव निगरानी सक्षम बनाता है।

मूल लेखक: Taslim Jamal Arif, Kuldeep Singh

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taslim Jamal Arif, Kuldeep Singh

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक है जो "मानव" भाषा (जैसे "पिछले साल की बिक्री दिखाओ") बोलता है और उसे "डेटाबेस भाषा" (SQL कोड) में अनुवाद करता है ताकि कंपनी के रिकॉर्ड से जानकारी निकाली जा सके।

यह शोध पत्र जिस बड़ी समस्या का समाधान करता है वह यह है: आप कैसे जानेंगे कि जब आपका रोबोट वास्तविक कंपनियों में वास्तविक लोगों के लिए काम कर रहा है, तो क्या वह अच्छा काम कर रहा है?

पुराना तरीका: "उत्तर कुंजी" (Answer Key) की समस्या

अतीत में, इन रोबोटों का परीक्षण करने के लिए शोधकर्ताओं ने एक ऐसी विधि का उपयोग किया था जैसे कि किसी मानव विशेषज्ञ द्वारा लिखे गए "गोल्ड स्टैंडर्ड" उत्तर के साथ गणित के टेस्ट को ग्रेड करना।

  • परिदृश्य: आप रोबोट को एक प्रश्न देते हैं, वह एक उत्तर देता है, और आप इसकी तुलना एक "गोल्ड स्टैंडर्ड" उत्तर से करते हैं जो एक मानव विशेषज्ञ द्वारा लिखा गया है।
  • दोष: वास्तविक दुनिया में, आपके पास हर उस प्रश्न के लिए कोई उत्तर कुंजी नहीं होती जो एक ग्राहक पूछता है। इसके अलावा, कंपनी का डेटाबेस अक्सर गुप्त, परिवर्तनशील या बहुत जटिल होता है जिसे परीक्षण टीम के साथ साझा नहीं किया जा सकता।
  • परिणाम: एक बार जब रोबोट को वास्तविक कार्यालय में तैनात कर दिया जाता है, तो किसी को पता नहीं चलता कि समय के साथ उसका प्रदर्शन खराब हो रहा है या नहीं। यह एक टूटे हुए स्पीडोमीटर वाली कार चलाने जैसा है; आपको तब तक पता नहीं चलता कि आप तेज़ गति से गाड़ी चला रहे हैं जब तक कि दुर्घटना न हो जाए।

नया समाधान: STEF ("स्मार्ट ट्रांसलेटर" इंस्पेक्टर)

लेखकों ने एक नया सिस्टम बनाया है जिसे STEF (Schema-agnostic Text-to-SQL Evaluation Framework) कहा जाता है। STEF को एक सुपर-इंटेलिजेंट एडिटर के रूप में समझें जिसे यह जांचने के लिए मूल पुस्तक या डेटाबेस मैप की आवश्यकता नहीं है कि अनुवाद अच्छा है या नहीं।

STEF कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:

1. "नो-रेफरेंस" (No-Reference) नियम

STEF को "गोल्ड स्टैंडर्ड" उत्तर या डेटाबेस मैप की आवश्यकता नहीं होती है। यह केवल तीन चीजों को देखता है:

  • मानव ने क्या पूछा।
  • रोबोट ने आंतरिक रूप से उस प्रश्न को कैसे फिर से तैयार किया।
  • रोबोट ने जो कोड लिखा।
    यह एक अनुवादक की तरह है जो यह जांचता है कि क्या एक फ्रांसीसी वाक्य अंग्रेजी में सही अर्थ देता है, बिना मूल स्पेनिश स्रोत पाठ को जाने।

2. "डीकंस्ट्रक्शन" (सूप के हिस्सों को अलग करना)

कोड की स्ट्रिंग-दर-स्ट्रिंग तुलना करने के बजाय (जो कि यह जांचने जैसा है कि क्या दो वाक्यों में बिल्कुल समान अक्षर हैं), STEF अनुरोध को सामग्रियों (ingredients) में तोड़ देता है:

  • हम क्या खोज रहे हैं? (कॉलम/Columns)
  • हम क्या गिन रहे हैं या जोड़ रहे हैं? (गणित/Math)
  • हम क्या बाहर निकाल रहे हैं? ("केवल मुझे सक्रिय उपयोगकर्ताओं को दिखाएं" वाला हिस्सा)
  • हम इसे कैसे समूहबद्ध (group) कर रहे हैं? (देश के अनुसार, वर्ष के अनुसार, आदि)

STEF जांचता है कि क्या रोबोट ने सही सामग्रियां शामिल की हैं। यदि मानव ने "सक्रिय उपयोगकर्ताओं" के लिए पूछा था और रोबोट "निष्क्रिय" उपयोगकर्ताओं को फ़िल्टर करना भूल गया, तो STEF तुरंत छूटी हुई सामग्री को पकड़ लेता है।

3. "मानव" जज (LLM)

STEF एक अन्य AI (एक "जज") का उपयोग करता है जो सामग्रियों को देखता है और निर्णय लेता है: "क्या यह कोड वास्तव में प्रश्न का उत्तर देता है?"

  • कॉन्फिडेंस स्कोर (Confidence Score): जज केवल "हाँ" या "नहीं" नहीं कहता। वह कहता है, "मुझे 90% यकीन है कि यह सही है," या "मुझे केवल 50% यकीन है।"
  • पेनल्टी (Penalty): यदि जज अनिश्चित है, तो अंतिम स्कोर में थोड़ी पेनल्टी लगाई जाती है। यह सिस्टम को अनुमान लगाने पर पूर्ण स्कोर देने से रोकता है।

4. "वास्तविक दुनिया" के नियम (Normalization)

यह सबसे चतुर हिस्सा है। वास्तविक दुनिया में, रोबोट कभी-कभी ऐसे अतिरिक्त कदम जोड़ते हैं जो वास्तव में मददगार होते हैं, गलत नहीं। STEF यह जानता है।

  • "सॉर्ट" नियम: यदि रोबota परिणामों को उच्चतम से निम्नतम क्रम में व्यवस्थित करता है (भले ही मानव ने नहीं पूछा हो), तो STEF कहता है, "यह एक अच्छा स्पर्श है, गलती नहीं।"
  • "सुरक्षा" नियम: यदि रोबोट कंप्यूटर को क्रैश होने से बचाने के लिए "मुझे शीर्ष 10,000 परिणाम दिखाएं" जैसा लिमिट जोड़ता है, तो STEF कहता है, "अच्छा काम किया, यह सुरक्षित है," बजाय इसके कि "गलत, आपने 10,000 के लिए नहीं पूछा।"
  • "ग्रुप" नियम: यदि गणित को समझने के लिए डेटा को समूहबद्ध करना आवश्यक है, तो STEF इसे स्वीकार करता है भले ही मानव ने स्पष्ट रूप से "ग्रुप बाय" न कहा हो।

5. "कंपनी कस्टमाइजेशन" (नियम पुस्तिका)

हर कंपनी अलग होती है। एक कंपनी कॉलम को "रीजन" (Region) कह सकती है, जबकि दूसरी "टेरिटरी" (Territory) कह सकती है।
STEF के पास एक कॉन्फ़िगर करने योग्य नियम पुस्तिका (Rulebook) है। आप STEF को बता सकते हैं: "हे, इस कंपनी में, 'रीजन' और 'टेरिटरी' का मतलब एक ही है," या "हमेशा 'स्टेटस' फ़िल्टर को अनदेखा करें क्योंकि यह स्वचालित रूप से जोड़ा जाता है।" यह STEF को बिना पुन: प्रोग्राम किए किसी भी कंपनी के अनुकूल होने की अनुमति देता है।

अंतिम स्कोर

STEF 0 से 100 तक का स्कोर देता है।

  • 90-100: उत्कृष्ट। रोबोट मुख्य भूमिका के लिए तैयार है।
  • 50-75: औसत। रोबोट बहुत अधिक अनुमान लगा रहा है; मनुष्यों को इसकी जांच करनी चाहिए।
  • 50 से नीचे: खराब। रोबोट विफल हो रहा है और इसे तत्काल मदद की आवश्यकता है।

यह क्यों महत्वपूर्ण है

STEF से पहले, कंपनियां अपने AI सहायकों के साथ अंधेरे में उड़ रही थीं। वे यह नहीं बता सकती थीं कि क्या AI धीरे-धीरे कम बुद्धिमान हो रहा है या क्या यह खतरनाक गलतियाँ कर रहा है। STEF इन AI एजेंटों के लिए एक निरंतर स्वास्थ्य मॉनिटर के रूप में कार्य करता है। यह कंपनियों को समस्याओं को वास्तविक व्यावसायिक निर्णयों को प्रभावित करने से पहले ठीक करने की अनुमति देता है, और यह सब बिना उनके गुप्त डेटाबेस को देखे या हर प्रश्न के लिए नए उत्तर की कुंजियाँ लिखे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →