← नवीनतम पेपर
💬 NLP

EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge

यह शोध पत्र EntSQL को प्रस्तुत करता है, जो पाँच व्यावसायिक डोमेन में 1,066 उदाहरणों वाला एक नया चीनी-अंग्रेजी बेंचमार्क है, जिसे लंबे-संदर्भ वाले उद्यम ज्ञान (long-context enterprise knowledge) में टेक्स्ट-टू-एसक्यूएल (Text-to-SQL) जनरेशन की चुनौतियों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जहाँ वर्तमान मॉडल मालिकाना व्यावसायिक समझ की आवश्यकता के कारण उच्च सटीकता प्राप्त करने में संघर्ष करते हैं।

मूल लेखक: Chengxi Liao, Tao Xu, Zulong Chen, Chuanfei Xu, Yiyan Wang, Xinyun Wang, Yanlong Zhang, Xiaojun Chen, Zhibo Yang, Zeyi Wen

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chengxi Liao, Tao Xu, Zulong Chen, Chuanfei Xu, Yiyan Wang, Xinyun Wang, Yanlong Zhang, Xiaojun Chen, Zhibo Yang, Zeyi Wen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुशिक्षित लाइब्रेरियन (एक AI) है जो मानव भाषा और "डेटाबेस भाषा" (SQL) दोनों बोल सकता है। आमतौर पर, यदि आप इस लाइब्रेरियन से पूछते हैं, "पिछले महीने हमने कितनी किताबें बेचीं?" तो वे लाइब्रेरी के कार्ड कैटलॉग (डेटाबेस स्कीमा) को देख सकते हैं और उत्तर प्राप्त करने के लिए लाइब्रेरियन के सहायक को एक सटीक नोट लिख सकते हैं।

लेकिन वास्तविक दुनिया में, बड़ी कंपनियों के लिए यह इतना सरल नहीं है। कंपनी के पास एक गुप्त नियम पुस्तिका होती है जिसे इमारत के बाहर कोई नहीं जानता। हो सकता है कि "पिछला महीना" वास्तव में "जून में समाप्त होने वाली वित्तीय तिमाही" का अर्थ हो, या "शीर्ष उत्पाद" में वे वस्तुएं शामिल न हों जो वर्तमान में क्लीयरेंस पर हैं। यदि लाइब्रेरियन के पास यह गुप्त नियम पुस्तिका नहीं है, तो वे अनुमान लगाएंगे, और उनका नोट गलत होगा।

"EntSQL" से परिचय: गुप्त नियम पुस्तिका का परीक्षण

यह पेपर एक नया परीक्षण पेश करता है जिसे EntSQL कहा जाता है। इसे AI लाइब्रेरियन के लिए एक अंतिम परीक्षा के रूप में सोचें, लेकिन केवल उन्हें लाइब्रेरी के सामान्य कैटलॉग को पढ़ने के लिए कहने के बजाय, यह परीक्षा उन्हें एक विशाल, 50-पृष्ठ की निजी कंपनी हैंडबुक देती है और उस पर आधारित एक क्वेरी लिखने के लिए कहती है।

यहाँ इस पेपर के निष्कर्षों का सरल उपमाओं का उपयोग करके विवरण दिया गया है:

1. समस्या: "लुप्त मैनुअल" (The Missing Manual)

इन AI लाइब्रेरियन के लिए मौजूदा परीक्षण (जैसे Spider या BIRD) ऐसे हैं जैसे उन्हें एक सामान्य लाइब्रेरी कैटलॉग देना। वे स्पष्ट कैटलॉग में किताबें खोजने में अच्छे हैं। लेकिन एक वास्तविक व्यवसाय में, "कैटलॉग" (डेटाबेस) बिना "कर्मचारी नियमावली" (निजी व्यावसायिक नियमों) के बेकार है।

  • उपमा: कल्पना कीजिए कि एक AI से पूछा जाता है, "'प्रोजेक्ट X' पर हमने कितना खर्च किया?" डेटाबेस में केवल cost नामक एक कॉलम है। उसे यह नहीं पता कि "प्रोजेक्ट X" वास्तव में "मार्केटिंग" के लिए एक कोड नाम है, या इसमें केवल एक विशिष्ट तिथि के बाद की लागत ही गिनी जाती है। इस निजी हैंडबुक के बिना, AI अंधेरे में तीर चला रहा है।

2. परीक्षण: EntSQL

शोधकर्ताओं ने पांच अलग-अलग कंपनी विभागों: वित्त (Finance), ट्रेजरी (Treasury), एचआर (HR), बिजनेस मैनेजमेंट (Business Management), और पार्टी बिल्डिंग (Party Building) से वास्तविक (लेकिन गुमनाम) डेटा का उपयोग करके एक परीक्षण बनाया।

  • सेटअप: उन्होंने AI को एक प्रश्न, एक डेटाबेस संरचना, और एक लंबा, अव्यवस्थित दस्तावेज़ दिया जिसमें कंपनी के विशिष्ट नियम शामिल थे।
  • कठिनाई: प्रश्न पेचीदा थे। इनके लिए आवश्यक था कि AI एक लंबे दस्तावेज़ को पढ़े, "वित्तीय वर्ष" या "बोनस गणना" के बारे में विशिष्ट नियम खोजे, और फिर उस नियम को डेटाबेस के साथ जोड़कर एक जटिल कंप्यूटर निर्देश लिखे।
  • पैमाना: इस परीक्षण में 1,000 से अधिक प्रश्न थे। "गोल्ड स्टैंडर्ड" उत्तर (सही निर्देश) बहुत लंबे और जटिल थे, जैसे कि कोड का 400-शब्दों वाला एक पैराग्राफ।

3. परिणाम: AI अभी भी संघर्ष कर रहा है

शोधकर्ताओं ने इस परीक्षा पर दुनिया के सबसे स्मार्ट AI मॉडल (जैसे Claude, GPT-4, और अन्य) का परीक्षण किया।

  • स्कोर: सबसे अच्छा AI भी लंबे दस्तावेजों के साथ केवल 16% उत्तर सही दे पाया।
  • उपमा: यह एक मेधावी छात्र को 500 पन्नों की पाठ्यपुस्तक देने और फिर उन्हें गणित की समस्या हल करने के लिए कहने जैसा है। वे गणित करना जानते हैं, लेकिन वे पुस्तक में उस विशिष्ट नियम को नहीं ढूंढ पाते जो इस विशिष्ट समस्या पर लागू होता है। वे टेक्स्ट में खो जाते हैं।
  • "साक्ष्य" संकेत (Evidence Hint): जब शोधकर्ताओं ने AI को किताब का एक हाइलाइटेड (चयनित) संस्करण दिया (केवल वे 2 या 3 वाक्य जो महत्वपूर्ण थे), तो स्कोर बढ़कर लगभग 21% हो गया। यह साबित करता है कि AI गणित में बुरा नहीं है; यह बस टेक्स्ट के ढेर में सुई खोजने में बुरा है।

4. वे कहाँ विफल हुए

शोधकर्ताओं ने देखा कि AI कहाँ गलतियाँ कर रहा था। यह आमतौर पर इसलिए नहीं था क्योंकि AI कोड लिखना भूल गया था।

  • मुख्य त्रुटि (54%): AI "फ़िल्टर" को मिस कर गया। यह ऐसा था जैसे "लाल कारों" के लिए पूछने पर AI "सभी कारें" या "नीली कारें" ले आता है। वह दस्तावेज़ से विशिष्ट नियमों को डेटा पर सही ढंग से लागू नहीं कर सका।
  • स्कोप त्रुटि (14%): AI ने गलत समय अवधि या गलत विभाग को देख लिया। यह "2023" के बजट की गणना करने जैसा था जब प्रश्न "2024" के बारे में था।

5. मानव अंतराल (The Human Gap)

शोधकर्ताओं ने एक मानव विशेषज्ञ से भी वही परीक्षण लेने के लिए कहा।

  • अंतराल: हाइलाइट किए गए नोट्स मिलने पर मानव विशेषज्ञ ने लगभग 84% सही उत्तर दिए। AI ने केवल 20%
  • निष्कर्ष: एक कंपनी हैंडबुक के साथ मनुष्य क्या कर सकते हैं और वर्तमान AI क्या कर सकता है, इसके बीच एक बड़ा अंतर है। AI अभी भी किसी विशिष्ट व्यवसाय के "अलिखित नियमों" को समझने में बहुत खराब है।

सारांश

EntSQL एक नया बेंचमार्क है जो कहता है: "केवल यह परीक्षण न करें कि क्या AI डेटाबेस पढ़ सकता है। यह परीक्षण करें कि क्या वह कंपनी की गुप्त नियम पुस्तिका पढ़ सकता है और उसे लागू कर सकता है।"

पेपर निष्कर्ष निकालता है कि हालांकि AI कोड लिखने में बेहतर हो रहा है, लेकिन यह वर्तमान में उस अव्यवस्थित, निजी, लंबे-संदर्भ वाले ज्ञान को समझने में बहुत खराब है जिस पर वास्तविक व्यवसाय निर्भर करते हैं। यह एक याद दिलाता है कि कार्यालय में AI को वास्तव में मदद करने के लिए, इसे बारीक विवरण (fine print) पढ़ने में बहुत बेहतर होना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →