← नवीनतम पेपर
💬 NLP

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

यह शोध पत्र Spider 2.0-AIFunc को प्रस्तुत करता है, जो 125 वास्तविक दुनिया के डेटाबेस में 465 सत्यापित इंस्टेंस का एक नया बेंचमार्क है जिसे स्नोफ्लेक (Snowflake) प्लेटफॉर्म पर AI-नेटिव SQL क्वेरी उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जबकि शीर्ष प्रोप्रायटरी मॉडल 67-70% सटीकता प्राप्त करते हैं, पारंपरिक टेक्स्ट-टू-SQL कार्यों के लिए अनुकूलित वर्तमान एजेंट फ्रेमवर्क इस उभरते परिवेश में प्रभावी रूप से स्थानांतरित नहीं होते हैं।

मूल लेखक: Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, हाई-टेक लाइब्रेरी (एक क्लाउड डेटाबेस) है जहाँ लोग कस्टमर रिव्यु से लेकर सेल्स रिकॉर्ड तक सब कुछ स्टोर करते हैं। वर्षों तक, इस लाइब्रेरी के बारे में सवाल पूछने के लिए एक बहुत ही सख्त, रोबोटिक भाषा जिसे SQL कहा जाता है, बोलने की आवश्यकता होती थी। यह ऐसा था जैसे किसी रेस्टोरेंट में एक जटिल भोजन ऑर्डर करने के लिए केवल संख्याओं और प्रतीकों के कोड में बात करना।

हाल ही में, लाइब्रेरी के मालिकों (जैसे Snowflake) ने एक नया फीचर जोड़ा है: AI Functions। इन्हें "स्मार्ट असिस्टेंट" के रूप में सोचें जो सीधे ऑर्डरिंग सिस्टम में बने हुए हैं। अब, केवल "सभी लाल सेब" के बारे में पूछने के बजाय, आप सिस्टम से कह सकते हैं कि "इन सेबों के रिव्यु पढ़ें और मुझे बताएं कि लोग खुश हैं या नाराज," या "ऐसे रिव्यु खोजें जो इस एक रिव्यु के समान लग रहे हों।" यह डेटाबेस को एक AI-Native सिस्टम में बदल देता है, जहाँ आप मानक डेटा कमांड को स्मार्ट, भाषा-आधारित सोच के साथ एक ही वाक्य में मिला सकते हैं।

समस्या: पुराना नक्शा काम नहीं करता

शोधकर्ताओं ने देखा कि जबकि ये नए "स्मार्ट असिस्टेंट" शक्तिशाली हैं, कंप्यूटर दिमागों (AI मॉडल्स) को प्रशिक्षित करने और जांचने के लिए उपयोग किए जाने वाले परीक्षण पुराने हो गए थे। पुराने परीक्षण केवल यह जांचते थे कि क्या कंप्यूटर सख्त रोबोटिक भाषा बोल सकता है। वे यह नहीं जांचते थे कि क्या कंप्यूटर नए "स्मार्ट असिस्टेंट" का उपयोग कर सकता है। यह एक ड्राइवर का परीक्षण करने जैसा था जो केवल एक सीधी, खाली सड़क पर किया गया हो, जबकि वास्तविक दुनिया में अब ट्रैफिक, पैदल यात्री और निर्माण कार्य भी मौजूद हैं।

समाधान: Spider 2.0-AIFunc

इसे ठीक करने के लिए, टीम ने एक नया, कठिन ड्राइविंग टेस्ट बनाया जिसे Spider 2.0-AIFunc कहा गया।

  1. परिवर्तन (The Transformation): उन्होंने 513 मौजूदा "ड्राइविंग टेस्ट" (डेटा के बारे में प्रश्न) लिए और उन्हें फिर से लिखा। उन्होंने प्रश्नों को इस तरह से बदला कि उनके लिए नए "स्मार्ट असिस्टेंट" की आवश्यकता हो।
    • पुराना प्रश्न: "सभी नकारात्मक रिव्यु दिखाएं।" (इसके लिए पहले इंसान को रिव्यु पढ़ने की आवश्यकता होती है)।
    • नया प्रश्न: "ऐसे सभी रिव्यु दिखाएं जहाँ AI असिस्टेंट कहता है कि भावना (sentiment) नकारात्मक है।" (AI डेटाबेस के अंदर ही पढ़ाई करता है)।
  2. निर्माण दल (The Construction Crew): उन्होंने इन प्रश्नों को फिर से लिखने के लिए AI एजेंटों (डिजिटल वर्कर्स) की एक टीम का उपयोग किया। ये एजेंट संपादकों और मैकेनिकों की तरह काम करते थे:
    • उन्होंने जांचा कि निर्देश स्पष्ट थे या नहीं (जैसे, "आपका 'नकारात्मक' से वास्तव में क्या मतलब है?")।
    • उन्होंने सुनिश्चित किया कि "स्मार्ट असिस्टेंट" के पास काम करने के लिए सभी सही उपकरण (पैरामीटर्स) हों।
    • उन्होंने यह सुनिश्चित करने के लिए परीक्षणों को बार-बार चलाया कि उत्तर स्थिर रहें और केवल इसलिए न बदल जाएं क्योंकि AI असिस्टेंट का दिन खराब था।
  3. अंतिम परीक्षा (The Final Exam): परिणाम स्वरूप 125 अलग-अलग डेटाबेस में 465 सत्यापित प्रश्नों का एक बेंचमार्क तैयार हुआ। यह "स्मार्ट असिस्टेंट" के छह प्रकार के कार्यों को कवर करता है, जैसे भावनाओं के आधार पर रिव्यु को सॉर्ट करना, समान टेक्स्ट खोजना, या एक पैराग्राफ से विशिष्ट विवरण निकालना।

परिणाम: टेस्ट में कौन पास हुआ?

शोधकर्ताओं ने 10 अलग-अलग AI मॉडल्स (ड्राइवर्स) को इस नई परीक्षा के माध्यम से गुजारा ताकि यह देखा जा सके कि वे इन जटिल, AI-संचालित क्वेरीज़ को लिखने में कितने कुशल हैं।

  • शीर्ष ड्राइवर (Propripietary Models): बड़े, क्लोज्ड-सोर्स मॉडल्स (जैसे Claude Opus और Gemini) ने सबसे अच्छा प्रदर्शन किया। उन्होंने लगभग 67% से 70% उत्तर सही दिए। वे यह समझने में माहिर थे कि किस "स्मार्ट असिस्टेंट" का उपयोग करना है और उससे सही सवाल कैसे पूछना है।
  • ओपन-सोर्स ड्राइवर (Open-Source Drivers): सर्वश्रेष्ठ ओपन-सोर्स मॉडल्स (जैसे Kimi K2.5) ने लगभग 58% स्कोर किया। वे ठीक-ठाक थे, लेकिन उनसे गलतियां हुईं।
  • अंतर (The Gap): ओपन-सोर्स मॉडल्स के संघर्ष करने का मुख्य कारण यह नहीं था कि वे बुनियादी कोड नहीं लिख सकते थे। वे "स्मार्ट" भागों में लड़खड़ा गए:
    • नियमों को समझने में चूक: गलत टेबल या कॉलम चुन लेना।
    • खराब निर्देश: AI असिस्टेंट को ठीक से यह बताने में भूल जाना कि उसे वास्तव में क्या देखना है (उदाहरण के लिए, वर्गीकरण कार्य के लिए सभी संभावित श्रेणियों को सूचीबद्ध न करना)।
    • लॉजिक संबंधी त्रुटियां: ऑपरेशन्स के क्रम को मिला देना (जैसे, AI से पूछने के बजाय डेटा को फिल्टर करना)।

आश्चर्यजनक खोज: कम ही अधिक है (Less is More)

शोधकर्ताओं ने यह भी परीक्षण किया कि क्या जटिल "एजेंट फ्रेमवर्क" (विस्तृत टूलकिट जो AI को उसके चरणों की योजना बनाने में मदद करते हैं) का उपयोग करने से मदद मिलती है।

  • निष्कर्ष: आश्चर्यजनक रूप से, सबसे जटिल टूलकिट्स ने ज्यादा मदद नहीं की। वास्तव में, एक न्यूनतम सेटअप—केवल एक सरल टूल डेटाबेस को देखने के लिए और एक क्वेरी चलाने के लिए—उतनी ही अच्छी तरह से या उससे भी बेहतर प्रदर्शन करता है जितना कि फैंसी फ्रेमवर्क।
  • रूपक (Metaphor): यह एक मास्टर शेफ को एक छोटे, साधारण चाकू बनाम एक विशाल, जटिल स्विस आर्मी नाइफ देने जैसा है। इस विशेष प्रकार के खाना पकाने (AI-Native SQL) के लिए, मास्टर शेफ को अतिरिक्त गैजेट्स की आवश्यकता नहीं थी; उन्हें बस चाकू का उपयोग करना आना चाहिए था। पुराने जमाने के डेटा कार्यों के लिए डिज़ाइन किए गए जटिल फ्रेमवर्क वास्तव में काम में बाधा डालते थे या कोई मूल्य नहीं जोड़ते थे।

सारांश

यह पेपर एक नया, वास्तविक परीक्षण पेश करता है जो AI मॉडल्स की यह जांच करता है कि क्या वे आधुनिक "AI-संचालित" डेटाबेस फीचर्स का उपयोग कर सकते हैं। इसने पाया कि हालांकि बेहतरीन AI मॉडल्स इसमें अच्छे होते जा रहे हैं, फिर भी शीर्ष-स्तरीय मॉडल्स और ओपन-सोर्स मॉडल्स के बीच एक अंतर है। सफलता की कुंजी अधिक जटिल प्लानिंग टूल्स का उपयोग करना नहीं है, बल्कि AI फंक्शन्स के लिए बुनियादी निर्देशों और पैरामीटर्स को बिल्कुल सही तरीके से प्राप्त करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →