← नवीनतम पेपर
💻 computer science

SQLyzr: A Comprehensive Benchmark and Evaluation Platform for Text-to-SQL

यह शोध पत्र SQLyzr को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और मूल्यांकन मंच है जो विविध मेट्रिक्स, यथार्थवादी वर्कलोड संरेखण और सूक्ष्म नैदानिक उपकरण प्रदान करके मौजूदा टेक्स्ट-टू-SQL मूल्यांकनों की सीमाओं को संबोधित करता है ताकि लार्ज लैंग्वेज मॉडल-आधारित टेक्स्ट-टू-SQL सिस्टम के क्रमिक सुधार को सुगम बनाया जा सके।

मूल लेखक: Sepideh Abedini, M. Tamer Özsu

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sepideh Abedini, M. Tamer Özsu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट सहायक (एक AI) है जो आपसे वादा करता है कि वह आपके साधारण अंग्रेजी के सवालों को जटिल कंप्यूटर डेटाबेस कमांड (SQL) में बदल देगा। आप पूछते हैं, "मुझे वे सभी ग्राहक दिखाएं जिन्होंने पिछले महीने जूते खरीदे थे," और रोबोट को उस उत्तर को प्राप्त करने के लिए कोड लिखना होता है।

समस्या यह है: आप कैसे जानेंगे कि रोबोट वास्तव में अपना काम अच्छा कर रहा है या नहीं?

वर्तमान में, इन रोबोटों का परीक्षण करने का तरीका एक हाई स्कूल गणित शिक्षक की तरह है जो छात्र को एक एकल परीक्षा देता है, यह जांचता है कि अंतिम उत्तर सही है या गलत, और उसे "85%" का ग्रेड देकर हाथ में दे देता है। बस इतना ही। यह आपको यह नहीं बताता कि छात्र क्यों फेल हुआ, क्या वह धीमा था, या क्या वह अधिक कठिन समस्या को संभाल सकता था।

यह पेपर SQLyzr पेश करता है, जो इन टेक्स्ट-टू-SQL रोबोटों के लिए एक सुपर-चार्ज्ड, इंटरैक्टिव ट्रेनिंग जिम और डायग्नोस्टिक लैब की तरह है। केवल एक एकल टेस्ट स्कोर देने के बजाय, SQLyzr आपको एक पूर्ण रिपोर्ट कार्ड, एक वर्कआउट प्लान और वास्तविक दुनिया की अराजकता को सिम्युलेट करने का एक तरीका देता है।

SQLyzr कैसे काम करता है, इसे सरल उपमाओं (analogies) के साथ नीचे समझाया गया है:

1. पुराने परीक्षणों के साथ समस्या (एक "वन-साइज़-फिट्स-ऑल" परीक्षा)

मौजूदा बेंचमार्क एक स्थिर बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) की तरह हैं।

  • दोष: उन्हें केवल इस बात की परवाह है कि उत्तर सही है या गलत। उन्हें इस बात की परवाह नहीं है कि रोबोट ने सोचने में 10 सेकंड लिए या 10 मिनट, या उसने जो कोड लिखा वह अव्यवस्थित और अक्षम था।
  • वास्तविकता: वास्तविक दुनिया में, एक धीमा या अव्यवस्थित उत्तर बेकार है, भले ही वह तकनीकी रूप से "सही" हो। इसके अलावा, ये परीक्षण बहुत छोटे, नकली डेटाबेस का उपयोग करते हैं। यह एक फॉर्मूला 1 कार का शांत पार्किंग लॉट में परीक्षण करने जैसा है; यह आपको यह नहीं बताता कि वह भीड़भाड़ वाले राजमार्ग पर कैसा प्रदर्शन करती है।

2. SQLyzr समाधान: एक बहु-स्तरीय डायग्नोस्टिक लैब

SQLyzr खेल को बदल देता है क्योंकि यह एक साधारण पास/फेल टेस्ट के बजाय एक मैकेनिक के डायग्नोस्टिक कंप्यूटर की तरह कार्य करता है।

A. "एक्स-रे" दृष्टि (बारीक वर्गीकरण - Fine-Grained Classification)

केवल यह कहने के बजाय कि "आपने 80% प्राप्त किया," SQL_yzr परीक्षण को विशिष्ट श्रेणियों में तोड़ देता है, जैसे कि एक मेडिकल स्पेशलिस्ट।

  • यह पूछता है: "क्या रोबोट सरल सवालों में विफल रहा? क्या उसे जटिल 'नेस्टेड' सवालों (सवालों के अंदर सवाल) के साथ संघर्ष करना पड़ा? क्या उसने विशिष्ट प्रकार के जॉइन्स (joins) के साथ गलती की?"
  • उपमा: कल्पना करें कि एक स्पोर्ट्स कोच जो केवल यह नहीं कहता कि "आप खेल हार गए," बल्कि कहता है, "आपका पासिंग शानदार था, लेकिन आपकी डिफेंस बाएं हाथ के खिलाड़ियों के खिलाफ कमजोर थी।" यह डेवलपर्स को विशिष्ट कमजोरियों को ठीक करने में मदद करता है।

B. "ट्रैफिक सिम्युलेटर" (वास्तविक दुनिया का स्केलिंग - Real-World Scaling)

पुराने परीक्षण छोटे डेटाबेस का उपयोग करते हैं (जैसे 100 नामों की सूची)। SQLyzr डेटाबेस को बढ़ा (inflate) सकता है ताकि यह लाखों रिकॉर्ड वाली एक वास्तविक कंपनी की तरह दिखे।

  • उपमा: यह एक खाली पार्किंग लॉट में डिलीवरी ड्राइवर का परीक्षण करने बनाम उसे रश ऑवर (भीड़भाड़ वाले समय) के दौरान ट्रैफिक में भेजने के बीच का अंतर है। SQLyzr उस रश ऑवर को सिम्युलेट करता है ताकि यह देखा जा सके कि जब डेटा बहुत बड़ा हो जाता है तो रोबोट का कोड धीमा होता है या क्रैश हो जाता है।

C. "दक्षता की जाँच" (लागत और गति - Efficiency Check)

SQLyzr केवल यह नहीं जांचता कि उत्तर सही है या नहीं; यह यह भी जांचता है कि रोबोट वहां तक कैसे पहुँचा।

  • उपमा: कल्पना करें कि दो लोग भूलभुलैया (maze) सुलझा रहे हैं। दोनों निकास ढूंढ लेते हैं। लेकिन व्यक्ति A ने सीधा रास्ता लिया, जबकि व्यक्ति B एक घंटे तक चक्कर काटता रहा। SQLyzr व्यक्ति A को बेहतर स्कोर देता है क्योंकि वह कुशल था। यह यह भी ट्रैक करता है कि रोबोट ने सोचने के लिए कितनी "ऊर्जा" (कंप्यूटिंग लागत) का उपयोग किया।

D. "ट्यूटर" (त्रुटि विश्लेषण और सुधार - Error Analysis & Fixes)

कभी-कभी, रोबлоट का उत्तर "परफेक्ट" उत्तर से थोड़ा अलग होता है लेकिन फिर भी काम करता है। पुराने परीक्षण इसे विफलता के रूप में चिह्नित करते हैं। SQLyzr एक सहायक ट्यूटर की तरह कार्य करता है।

  • उपमा: यदि आप "लाल कार" मांगते हैं और रोबोट "क्रिमसन वाहन" के लिए कोड लिखता है, तो एक सख्त परीक्षण कहता है "गलत।" SQLyzr कहता है, "हे, यह वास्तव में वही चीज़ है! यहाँ एक सुझाव है कि आप अपने कोड को मानक के साथ पूरी तरह से मिलाने के लिए कैसे ट्यून कर सकते हैं।" यह रोबोट को उसकी छोटी-मोटी चूकों से सीखने में मदद करता है।

E. "अनुकूली वर्कआउट" (वर्कलोड ऑग्मेंटेशन - Adaptive Workout)

यह सबसे शानदार फीचर है। एक बार जब रोबोट टेस्ट ले लेता है, तो SQLyzr देखता है कि वह कहाँ विफल हुआ और विशेष रूप से उन कमजोर बिंदुओं को लक्षित करने के लिए नए, कठिन प्रश्न उत्पन्न करता है।

  • उपमा: यदि कोई छात्र गणित के वर्ड प्रॉब्लम्स में बार-बार फेल होता है, तो शिक्षक उसे केवल वही टेस्ट दोबारा नहीं देता। शिक्षक नए वर्ड प्रॉब्लम्स बनाता है जो थोड़े कठिन होते हैं, जिससे छात्र को तब तक अभ्यास करने के लिए मजबूर किया जाता है जब तक कि वह उसमें महारत हासिल न कर ले। SQL-yzr इसे स्वचालित रूप से करता है, जिससे बेंचमार्क एक निरंतर सुधार लूप (continuous improvement loop) बन जाता है।

3. आप इसका उपयोग कैसे करते हैं (डैशबोर्ड)

पेपर एक दृश्य इंटरफ़ेस (डैशबोर्ड) का वर्णन करता है जहाँ आप:

  • अपना रोबोट चुनें: परीक्षण के लिए किस AI मॉडल को टेस्ट करना है, इसे चुनें।
  • कठिनाई निर्धारित करें: चुनें कि डेटाबेस कितना बड़ा होना चाहिए।
  • दौड़ देखें: लाइव ग्राफ देखें जो दिखाते हैं कि रोबोट दूसरों की तुलना में कैसा प्रदर्शन कर रहा है।
  • रिपोर्ट प्राप्त करें: एक रंगीन चार्ट देखें जो सटीक रूप से दिखाता है कि रोबोट कहाँ मजबूत है और उसे कहाँ वापस स्कूल जाने की आवश्यकता है।

निचोड़ (The Bottom Line)

SQLyzr क्षेत्र को "क्या इसने टेस्ट पास किया?" से बदलकर "यह वास्तविक दुनिया में कैसा प्रदर्शन करता है, और हम इसे बेहतर कैसे बना सकते हैं?" की ओर ले जा रहा है।

यह एक स्थिर, एक बार होने वाली परीक्षा को एक गतिशील, इंटरैक्टिव ट्रेनिंग पार्टनर में बदल देता है जो डेवलपर्स को डेटा प्रबंधित करने के लिए स्मार्ट, तेज़ और अधिक विश्वसनीय AI टूल बनाने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →