BEAVER: An Enterprise Benchmark for Text-to-SQL
यह शोध पत्र BEAVER को प्रस्तुत करता है, जो निजी उद्यम डेटा वेयरहाउस से प्राप्त पहला टेक्स्ट-टू-SQL बेंचमार्क है जिसमें 19 डोमेन के 9,128 वास्तविक दुनिया के प्रश्न शामिल हैं, जो अत्याधुनिक मॉडलों के लिए एक महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और डोमेन ज्ञान एवं उन्नत फंक्शन उपयोग जैसी जटिल चुनौतियों का निदान करने के लिए एक सूक्ष्म मूल्यांकन ढांचे का प्रस्ताव करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अस्त-व्यस्त पुस्तकालय है जहाँ किताबें शीर्षक या लेखक के आधार पर नहीं, बल्कि एक गुप्त कोड के आधार पर व्यवस्थित हैं जिसे केवल लाइब्रेरियन ही जानते हैं। अलमारियों पर "Classrooms" के बजाय "FCLT_ROOMS" जैसे रहस्यमय प्रतीकों वाले लेबल लगे हैं और किताबें हजारों अलग-अलग कमरों में बिखरी हुई हैं।
अब, कल्पना कीजिए कि आप एक लाइब्रेरियन से पूछना चाहते हैं, "मुझे आर्ट्स बिल्डिंग की वे शीर्ष 10 कक्षाएं दिखाएं जो 400 वर्ग फुट से बड़े कमरों में होती हैं।" एक सामान्य पुस्तकालय में, आप बस इतना कह देंगे और वे उसे ढूंढ लेंगे। लेकिन इस गुप्त पुस्तकालय में, लाइब्रेरियन (एक AI) को यह करना होगा:
- अनुमान लगाना कि किन 5 अलग-अलग कमरों में देखना है।
- यह समझना कि "Stata building" वास्तव में "कमरा 32" का कोड है।
- उन किताबों के बीच संबंध स्थापित करना जो बिल्कुल असंबंधित लगती हैं।
- रैंक देने के लिए जटिल गणित करना।
यही वह समस्या है जिसे BEAVER हल करने की कोशिश कर रहा है।
समस्या: "बहुत साफ" पुस्तकालय
वर्षों से, वैज्ञानिक AI को मानव प्रश्नों को डेटाबेस कमांड (जिसे Text-to-SQL कहा जाता है) में बदलने के लिए प्रशिक्षित कर रहे हैं। उन्होंने इन AI का परीक्षण "अभ्यास पुस्तकालयों" (सार्वजनिक बेंचमार्क जैसे Spider या BIRD) का उपयोग करके किया। ये अभ्यास पुस्तकालय "खिलौने वाले सेट" की तरह हैं: अलमारियाँ व्यवस्थित हैं, लेबल स्पष्ट हैं, और प्रश्न सरल हैं।
इन खिलौने वाले सेटों में, AI जीनियस होते हैं, और 80%+ उत्तर सही देते हैं। लेकिन इस शोध पत्र के लेखक कहते हैं, "यह एक रेस कार का चिकने ट्रैक पर परीक्षण करने और यह मानने जैसा है कि वह कीचड़ भरे दलदल में भी चल सकती है। वास्तविक कंपनियों के डेटाबेस 'कीचड़ भरे दलदल' हैं: विशाल, अस्त-व्यस्त, गुप्त कोडों से भरे हुए, और लोगों द्वारा पूछे जाने वाले प्रश्न अविश्वसनीय रूप से जटिल हैं।"
समाधान: BEAVER (दलदल सिम्युलेटर)
टीम ने निजी कंपनी डेटाबेस से वास्तविक, अस्त-व्यस्त डेटा का उपयोग करके AI के लिए पहला "टेस्ट ड्राइव" बनाया, जिसे BEAVER कहा जाता है।
- डेटा: उन्होंने तीन अलग-अलग कंपनियों (एक विश्वविद्यालय, एक अनुसंधान प्रयोगशाला और एक आवास सुविधा) से 9,128 वास्तविक प्रश्न और उत्तर एकत्र किए।
- पैमाना: ये खिलौने वाले सेट नहीं हैं। औसत डेटाबेस में 100 से अधिक टेबल (अलमारियाँ) और लगभग 900 कॉलम (डेटा की पंक्तियाँ) हैं। प्रश्न लंबे हैं और गहन सोच की मांग करते हैं।
- विस्तार: चूंकि गोपनीयता नियमों के कारण वे पर्याप्त वास्तविक डेटा प्राप्त नहीं कर सके, इसलिए उन्होंने एक "टेम्पलेट मशीन" बनाई। उन्होंने वास्तविक प्रश्नों के ढांचे (जैसे "शीर्ष 10 खोजें...") को लिया और उन्हें विभिन्न कंपनी विवरणों के साथ मिलाकर हजारों नए, यथार्थवादी अभ्यास प्रश्न बनाए।
पाँच छिपे हुए चरण (उप-कार्य)
शोध पत्र का तर्क है कि अंतिम उत्तर सही प्राप्त करना केवल एक बड़ी छलांग नहीं है। यह केक बनाने जैसा है; यदि आप एक भी चरण में गलती करते हैं, तो पूरा केक खराब हो जाता है। उन्होंने AI के काम को पाँच विशिष्ट चरणों में विभाजित किया ताकि यह देखा जा सके कि वह कहाँ विफल होता है:
- सही कमरे खोजना (Multi-table retrieval): मुझे किन 5 अलमारियों को देखने की आवश्यकता है?
- संबंध स्थापित करना (Join key detection): मैं "Room" की अलमारी को "Class" की अलमारी से कैसे जोड़ूँ जब उनके लेबल मेल नहीं खाते?
- लेबलों को डिकोड करना (Column mapping): क्या "Stata building" का अर्थ कॉलम X या कॉलम Y है?
- गुप्त बातें जानना (Domain knowledge): मैं जानता हूँ कि "Stata building" वास्तव में "Building Key 32" है, भले ही यह तथ्य प्रश्न में नहीं लिखा है।
- काम को तोड़ना (Query decomposition): यह प्रश्न एक बार में करने के लिए बहुत कठिन है। मुझे पहले भाग A को हल करना होगा, फिर भाग B को, और फिर उन्हें मिलाना होगा।
परिणाम: एक वास्तविकता की जाँच
जब उन्होंने उपलब्ध सबसे स्मार्ट AI (OpenAI और अन्य के नवीनतम मॉडलों सहित) का BEAVER पर परीक्षण किया, तो परिणाम चौंकाने वाले थे।
- स्कोर: 80% के बजाय, सर्वश्रेष्ठ AI केवल 10.8% उत्तर सही दे पाया।
- "चीट शीट" परीक्षण: शोधकर्ताओं ने फिर AI को एक "चीट शीट" (उन 5 छिपे हुए चरणों के सही उत्तर) दी। चीट शीट के साथ भी, AI का स्कोर बढ़कर केवल 30.1% ही हुआ।
इसका क्या अर्थ है?
इसका मतलब है कि AI मुख्य रूप से दो चीजों में विफल हो रहा है:
- बुनियादी बातें: वह सही अलमारियों को खोजने या सही संबंध जोड़ने में भी सक्षम नहीं है (ये 5 उप-कार्य)।
- गणित: भले ही उसे पता हो कि क्या करना है, वह अंतिम उत्तर बनाने के लिए आवश्यक जटिल गणित और तर्क (जैसे उन्नत फंक्शन का उपयोग करना या डेटा को सही ढंग से व्यवस्थित करना) के साथ संघर्ष करता है।
निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि हम केवल साफ, खिलौने वाले डेटाबेस पर AI को प्रशिक्षित करना जारी नहीं रख सकते। एक ऐसा AI बनाने के लिए जो वास्तव में कंपनियों में काम कर सके, हमें यह मानना बंद करना होगा कि डेटा साफ है। BEIVER एक नया, कठिन परीक्षण है जो AI डेवलपर्स को इन विशिष्ट, अस्त-व्यस्त समस्याओं को ठीक करने के लिए मजबूर करता है, इससे पहले कि उनके टूल्स वास्तविक दुनिया में भरोसेमंद बन सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।