← नवीनतम पेपर
💻 computer science

ISEE: Interactive Semantic Enrichment for Database Fields

यह शोध पत्र ISEE को प्रस्तुत करता है, जो एक संवादात्मक प्रणाली है जो डेटा-संबंधी कार्यों में LLM एजेंट के प्रदर्शन को बेहतर बनाने के लिए उपयोगकर्ता के डोमेन ज्ञान का उपयोग करके अस्पष्ट डेटाबेस फ़ील्ड विवरणों को सहयोगात्मक रूप से समृद्ध करती है।

मूल लेखक: Yuan Tian, Yiru Chen, Rakesh R. Menon, Zifan Liu, Ting Cai, Fei Wu, Anudeep Chimakurthi, Prashanthi Ramamurthy, Sridevi Aishwariya Ganesan, Kun Qian, Yunyao Li

प्रकाशित 2026-08-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuan Tian, Yiru Chen, Rakesh R. Menon, Zifan Liu, Ting Cai, Fei Wu, Anudeep Chimakurthi, Prashanthi Ramamurthy, Sridevi Aishwariya Ganesan, Kun Qian, Yunyao Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को अपना बिखरा हुआ और जटिल नोटबुक समझना सिखाने की कोशिश कर रहे हैं। आपके पास एक ऐसा रोबोट है जो लगभग कुछ भी पढ़ सकता है, लेकिन वह केवल वही जानता है जो उसने इंटरनेट से सीखा है। यदि आप अपनी नोटबुक में "Python" लिखते हैं, तो रोबोट इसे सांप समझ सकता है, न कि कंप्यूटर भाषा, क्योंकि वह आपके विशिष्ट संदर्भ (context) को नहीं जानता। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है: शक्तिशाली AI उपकरण जो डिजिटल सहायकों के रूप में कार्य करते हैं, लेकिन वे अक्सर तब अटक जाते हैं जब उनका सामना विशेष शब्दावली (jargon), संक्षिप्त रूपों (abbreviations), या निजी कंपनी के रहस्यों से होता है जो सार्वजनिक वेब पर उपलब्ध नहीं हैं।

समस्या तब और बढ़ जाती है जब ये रोबोट विशाल डेटाबेस में जानकारी खोजने में आपकी मदद करने की कोशिश करते हैं। एक डेटाबेस को एक विशाल पुस्तकालय के रूप में सोचें जहाँ हर किताब पर एक लेबल लगा है। यदि लेबल पर केवल "Value" लिखा है, तो रोबोट को पता नहीं चलेगा कि इसका अर्थ "कितने पैसे" है, "कितनी वस्तुएं" हैं, या "कोई चीज़ कितनी महत्वपूर्ण है"। स्पष्ट लेबल के बिना, रोबोट सही किताब नहीं ढूँढ पाएगा, और यदि वह गलत अनुमान लगाता है, तो पूरा सिस्टम टूट जाएगा। यह शोध इस प्रश्न पर प्रहार करता है: हम इंसानों और AI को मिलकर इन भ्रमित करने वाले लेबलों को ठीक करने के लिए कैसे एकजुट कर सकते हैं ताकि रोबोट वास्तव में अपना काम कर सके?

समस्या: "अनुवाद में खोई हुई" लाइब्रेरी

वास्तविक दुनिया में, कंपनियों के पास कस्टम फील्ड्स (custom fields) से भरे डेटाबेस होते हैं। एक फील्ड का नाम "Q3_Sales_Corr" या "User_Active_Flag" हो सकता है। उस मानव विशेषज्ञ के लिए जिसने इस सिस्टम को बनाया है, ये नाम बिल्कुल स्पष्ट हैं। लेकिन एक AI के लिए, ये एक रहस्य हैं। AI अपने सामान्य प्रशिक्षण के आधार पर अर्थ का अनुमान लगाने की कोशिश करता है, लेकिन जब उत्तर किसी विशिष्ट व्यावसायिक नियम या निजी संक्षिप्त रूप में छिपा होता है, तो AI दीवार से टकरा जाता है। यह एक पहेली को सुलझाने जैसा है जहाँ उसकी कुंजी कभी लिखी ही नहीं गई थी।

इस शोध के लेखक तर्क देते हैं कि हम केवल AI पर इन रहस्यों को खुद से "सीखने" के लिए निर्भर नहीं रह सकते, और न ही हम उम्मीद कर सकते हैं कि इंसान हर बार शून्य से सटीक विवरण लिखेंगे। इसके बजाय, हमें एक टीम-अप (जुगलबंदी) की आवश्यकता है।

समाधान: ISEE (इंटरैक्टिव लाइब्रेरियन)

ISEE (इंटरैक्टिव सिमेंटिक एनरिचमेंट) के बारे में सोचें। ISEE को एक अत्यंत व्यवस्थित, सहायक लाइब्रेरियन के रूप में देखें जो न केवल आपको किताब थमाता है, बल्कि इससे पहले कि आप पूछें, वह आपके साथ बैठकर यह समझने की कोशिश करता है कि आपको वास्तव में क्या चाहिए।

यहाँ ISEE सिस्टम कैसे काम करता है, इसे तीन मजेदार चरणों में विभाजित किया गया है:

  1. "रिपोर्ट कार्ड" (स्कोरिंग सिस्टम):
    सबसे पहले, ISEE डेटाबेस फील्ड के वर्तमान विवरण (जैसे "Value") को देखता है और उसे एक रिपोर्ट कार्ड देता है। यह केवल "अच्छा" या "बुरा" नहीं कहता। यह विवरण को पांच विशिष्ट चीजों पर ग्रेड देता है:

    • उपयोगिता (Usability): क्या यह रोबोट को सही उत्तर खोजने में मदद करेगा?
    • सूचनात्मकता (Informativeness): क्या यह उपयोगी विवरणों से भरा है, या खाली है?
    • स्पष्टता (Clarity): क्या हर कोई इसकी व्याख्या एक ही तरह से करता है?
    • संक्षिप्तता (Conciseness): क्या यह बहुत अधिक शब्दों वाला है?
    • पठनीयता (Readability): क्या इसे पढ़ना आसान है?
      यदि विवरण का स्कोर कम आता है, तो ISEE इंसान को बताता है, "हे, यह भ्रमित करने वाला है! चलिए इसे ठीक करते हैं।"
  2. "जासूसी सवाल" (स्पष्टीकरण):
    इंसान को पूरा नया पैराग्राफ लिखने के लिए कहने के (जो कठिन और थकाऊ है) के बजाय, ISEE एक जासूस की तरह काम करता है। यह विशेष "सुरागों" की एक विशेष सूची के आधार पर विशिष्ट, आसानी से उत्तर दिए जाने वाले प्रश्न पूछता है।

    • उदाहरण: यदि फील्ड "Python" है, तो ISEE पूछ सकता है, "क्या आप सांप के बारे में बात कर रहे हैं या प्रोग्रामिंग भाषा के बारे में?"
    • उदाहरण: यदि फील्ड "Laptop" है, तो यह पूछ सकता है, "क्या यह गेमिंग, स्कूल या काम के लिए है?"
      इंसान बस एक बटन क्लिक करता है या छोटा उत्तर टाइप करता है। यह उपन्यास लिखने की तुलना में बहुत आसान है।
  3. "अनुमान लगाने का खेल" (क्वेरी पॉपुलेशन):
    कभी-कभी, किसी अवधारणा को शब्दों से समझाना कठिन होता है। इसलिए, ISEE उदाहरण प्रश्न उत्पन्न करके यह अनुमान लगाने की कोशिश करता है कि इंसान का क्या मतलब है।

    • उदाहरण: ISEE कह सकता है, "क्या आपका मतलब 'प्रति ग्राहक औसत खरीद राशि' जैसा कुछ था?"
      इंसान को बस यह कहना होगा, "हाँ, यही है!" या "नहीं, कुछ और आजमाएं।" यह AI को बिना तर्क को शुरू से समझाए, फील्ड के उद्देश्य को समझने में मदद करता है।

उन्होंने क्या पाया: टीमवर्क का जादू

शोधकर्ताओं ने ISEE का परीक्षण कई तरीकों से किया ताकि यह देखा जा सके कि क्या यह वास्तव में काम करता है।

मानव परीक्षण:
उन्होंने 8 वास्तविक विशेषज्ञों को आमंत्रित किया जो रोज डेटाबेस के साथ काम करते हैं। इन विशेषज्ञों ने भ्रमित करने वाले फील्ड विवरणों को ठीक करने के लिए तीन अलग-अलग तरीकों का उपयोग किया:

  1. स्वयं विवरण लिखना (मैनुअल एडिटिंग)।
  2. AI द्वारा बनाई गई सूची में से सबसे अच्छा चुनना (कैंडिडेट सिलेक्शन)।
  3. एक मानक AI बॉट के साथ बातचीत करना (कन्वर्सेशनल AI)।
  4. नए ISEE सिस्टम का उपयोग करना।

परिणाम स्पष्ट थे: ISEE विजेता था।

  • विशेषज्ञों ने ISEE का उपयोग करते समय बहुत कम तनाव और हताशा महसूस की।
  • जब स्वतंत्र जजों ने, यह जाने बिना कि विवरण किसने लिखे हैं, अंतिम विवरणों को देखा, तो ISEE के विवरणों को बहुत उच्च रेटिंग दी गई (7 में से औसतन 6.2 का स्कोर), जबकि अन्य (जो 3.2 से 4.5 के बीच थे) काफी पीछे थे।
  • विशेषज्ञों ने कहा कि ISEE ने हाथ से संपादन करने की तुलना में उनके काम की सटीकता में 119% का सुधार किया।

रोबोट सिमुलेशन:
यह देखने के लिए कि क्या यह बड़े पैमाने पर काम करेगा, शोधकर्ताओं ने एक मानव विशेषज्ञ के रूप में कार्य करने के लिए एक AI का उपयोग किया। उन्होंने सिस्टम में वास्तविक दुनिया के डेटाबेस प्रश्नों (11 अलग-अलग डेटाबेस से 1,534 प्रश्न) का एक विशाल डेटासेट डाला।

  • जब AI ने मूल बिखरे हुए विवरणों का उपयोग करके प्रश्नों के उत्तर देने की कोशिश की, तो वह केवल 42% बार सही उत्तर दे सका (सही कॉलम खोजने के लिए)।
  • जब उन्होंने ISEE द्वारा समृद्ध किए गए विवरणों का उपयोग किया, तो सफलता दर बढ़कर 64.7% हो गई।
  • यह सुझाव देता है कि भले ही "इंसान" एक रोबोट हो, प्रश्न पूछने और उदाहरणों की जाँच करने की इंटरैक्टिव प्रक्रिया डेटा को बहुत स्मार्ट बनाती है।

वास्तविक दुनिया का उदाहरण:
एक विशिष्ट केस स्टडी में, "Value" नामक एक फील्ड समस्या पैदा कर रहा था। रोबोट को लगा कि इसका अर्थ ऑर्डर की कुल कीमत है, लेकिन वास्तव में इसका अर्थ एक एकल लेनदेन से प्राप्त धन था।

  • ISEE से पहले: रोबोट ने गलत उत्तर दिया।
  • ISEE के बाद: इंसान ने यह स्पष्ट करने के लिए सिस्टम का उपयोग किया कि "Value" का अर्थ "प्रति लेनदेन मौद्रिक राशि" था। विवरण का स्कोर भयानक 18 से बढ़कर शानदार 82 हो गया। अचानक, रोबोट पूरी तरह से समझ गया और सही उत्तर दिया।

निष्कर्ष

यह शोध सुझाव देता है कि हमें इंसानों को सटीक विवरण लिखने के लिए मजबूर करने की आवश्यकता नहीं है, और न ही हमें यह उम्मीद करनी चाहिए कि AI जादुई रूप से हमारे रहस्यों को सीख लेगा। इसके बजाय, एक ऐसा सिस्टम बनाकर जो मौजूदा बिखराव को स्कोर करे, भ्रम को दूर करने के लिए सरल प्रश्न पूछे, और इंसानों को AI के अनुमानों को सत्यापित करने दे, हम डेटा को मशीनों के लिए समझना बहुत आसान बना सकते हैं।

लेखकों ने पाया कि यह इंटरैक्टिव दृष्टिकोण इंसानों के मानसिक प्रयास को काफी कम करता है और साथ ही AI को डेटा खोजने या उसे क्वेरी करने के लिए कोड लिखने जैसे कार्यों में बहुत स्मार्ट बनाता है। हालांकि अध्ययन सिमुलेशन और विशेषज्ञों के एक छोटे समूह पर आधारित था, परिणाम दृढ़ता से सुझाव देते हैं कि कार्यस्थल में AI की पूर्ण क्षमता को अनलॉक करने के लिए इंसान को प्रक्रिया में शामिल रखना (keeping humans in the loop) ही कुंजी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →