← नवीनतम पेपर
💬 NLP

SQUiD: Synthesizing Relational Databases from Unstructured Text

यह शोध पत्र SQUiD को पेश करता है, जो एक नवीन न्यूरोसिम्बोलिक ढांचा (neurosymbolic framework) है जो असंरचित पाठ (unstructured text) से रिलेशनल डेटाबेस स्कीमा को स्वचालित रूप से संश्लेषित करने और तालिकाओं को भरने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो मौजूदा बेसलाइनों की तुलना में विविध डेटासेट्स पर बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Mushtari Sadia, Zhenning Yang, Yunming Xiao, Ang Chen, Amrita Roy Chowdhury

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mushtari Sadia, Zhenning Yang, Yunming Xiao, Ang Chen, Amrita Roy Chowdhury

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास हस्तलिखित यात्रा वृत्तांतों, चिकित्सा संबंधी नोट्स और व्यावसायिक रिपोर्टों का एक विशाल, अस्त-व्यस्त ढेर है। ये असंरचित पाठ (unstructured texts) हैं—शब्दों के पैराग्राफ जिनका कोई स्पष्ट संगठन नहीं है। अब, कल्पना कीजिए कि आप इस अराजक ढेर को एक पूरी तरह से व्यवस्थित रिलेशनल डेटाबेस (Relational Database) (जैसे कि वे जो बैंकों या एयरलाइंस द्वारा उपयोग किए जाते हैं) में बदलना चाहते हैं, जहाँ डेटा को तालिकाओं (tables) में सलीके से संग्रहीत किया जाता है, आपस में जोड़ा जाता है, और तुरंत खोजने के लिए तैयार रहता है।

इसे मैन्युअल रूप से करना ऐसा ही है जैसे आँखों पर पट्टी बाँधकर एक पुस्तकालय को हाथ से छाँटना। यह धीमा, त्रुटिपूर्ण और उबाऊ है।

मिलिए SQUiD (Synthesizing Qualitative Unstructured Data) से। SQUiD को एक जादू की छड़ी के रूप में नहीं, बल्कि एक सुपर-स्मार्ट, न्यूरो-सिंबोलिक निर्माण दल (construction crew) के रूप में सोचें जो चार-चरणीय असेंबली लाइन का उपयोग करके शून्य से एक डेटाबेस बनाता है।

यहाँ बताया गया है कि SQUiD कैसे काम करता है, एक रचनात्मक उपमा के माध्यम से:

समस्या: "डायरेक्ट प्रॉम्प्ट" की तबाही

यदि आप केवल एक मानक AI (एक लार्ज लैंग्वेज मॉडल या LLM) से कहते हैं कि "इस टेक्स्ट से मेरे लिए एक डेटाबेस बनाओ," तो यह एक चित्रकार से घर बनाने के लिए कहने जैसा है।

  • परिणाम: AI काल्पनिक नाम बना सकता है (hallucinate), "ट्रैवलर" टेबल को "ट्रिप" टेबल से जोड़ने के लिए भूल सकता है, या SQL कोड लिख सकता है जिसमें सिंटैक्स त्रुटियाँ हों (जैसे कि बिना क्रिया वाला वाक्य)। यह अस्त-व्यस्त होता है और अक्सर टूट जाता है।

SQUiD समाधान: चार-चरणों वाली असेंबली लाइन

SQUiD इस असंभव कार्य को चार प्रबंधनीय कार्यों में विभाजित करता है, जिसमें AI की रचनात्मकता और कठोर, नियम-आधारित तर्क (न्यूरोसिंबोलिक हिस्सा) का मिश्रण है।

चरण 1: आर्किटेक्ट (स्कीमा जनरेशन)

  • कार्य: निर्माण से पहले, आपको एक ब्लूप्रिंट की आवश्यकता होती है। AI टेक्स्ट को पढ़ता है और निर्णय लेता है: "ठीक है, हमें Travelers के लिए एक टेबल, Destinations के लिए एक, और Trips के लिए एक चाहिए।"
  • नुस्खा: यह केवल अनुमान नहीं लगाता। यह सख्त वास्तुशिल्प नियमों (जैसे कि बिल्डिंग कोड) का पालन करता है। यह सुनिश्चित करता है कि प्रत्येक टेबल में एक अद्वितीय ID (प्राइमरी की) हो और टेबल सही ढंग से जुड़ी हों (फॉरेन की)।
  • उपमा: कल्पना कीजिए कि एक आर्किटेक्ट जो तब तक घर का नक्शा नहीं बनाता जब तक वह यह सुनिश्चित न कर ले कि किचन डाइनिंग रूम से जुड़ा है और छत हवा में नहीं तैर रही है। यह चरण सुनिश्चित करता है कि डेटा जोड़ा जाने से पहले डेटाबेस की संरचना कानूनी और तार्किक रूप से सुदृढ़ हो।

चरण 2: खोज अभियान (वैल्यू आइडेंटिफिकेशन)

  • कार्य: अब, दल को टेक्स्ट में छिपे हुए वास्तविक ईंटों (डेटा पॉइंट्स) को खोजने की आवश्यकता है।
  • नुस्खा: SQUiD इन ईंटों को खोजने के लिए दो विधियों का उपयोग करता है:
    1. रोबोट स्कैनर (सिंबोलिक टूल्स): एक सख्त, नियम-आधारित टूल जो स्पष्ट संज्ञाओं और संख्याओं (जैसे "Sophia," "34," "Rome") को पकड़ता है। यह तेज़ है लेकिन संदर्भ (context) को मिस कर सकता है।
    2. डिटेक्टिव (LLM): एक रचनात्मक AI जो संदर्भ समझने के लिए वाक्यों को पढ़ता है (जैसे यह समझना कि "प्रीमियम पैकेज" एक विशिष्ट प्रकार की बुकिंग है)।
  • जादू: यह दोनों सूचियों को मिला देता है। यदि रोबोट "प्रीमियम" को मिस कर देता है, तो डिटेक्टिव उसे जोड़ देता है। फिर यह डुप्लिकेट्स को साफ करता है (ताकि एक ही ट्रिप के लिए "Rome" को दो बार सूचीबद्ध न किया जाए)।

चरण गा: असेंबली लाइन (टेबल पॉपुलेशन)

  • कार्य: अब हमारे पास ईंटों का ढेर और एक ब्लूप्रिंट है। हमें सही ईंटों को सही जगहों पर रखना है।
  • नुस्खा: यहीं पर SQUiD चतुर हो जाता है। AI को एक साथ पूरा डेटाबेस लिखने के लिए कहने के बजाय (जिससे भ्रम पैदा होता है), यह एक विशिष्ट टूल का उपयोग करके एक बार में एक पंक्ति (row) बनाने के लिए कहता है।
  • उपमा: कल्पना कीजिए कि एक फैक्ट्री रोबोटिक आर्म। इसे "एक कार बनाओ" कहने के बजाय, इसे कहा जाता है "बायां अगला पहिया लगाओ।" फिर "दायां अगला पहिया लगाओ।" इसे छोटे हिस्सों में तोड़कर, AI कभी भी भ्रमित नहीं होता कि कौन सा पहिया किस कार पर जाना चाहिए। यह भी सुनिश्चित करता है कि यदि "Sophia" Traveler टेबल में है, तो Trip टेबल में उसकी ID बिल्कुल मेल खाती है। कोई टूटी हुई कड़ियाँ नहीं!

चरण 4: राजमिस्त्री (डेटाबेस मटेरियलाइजेशन)

  • कार्य: व्यवस्थित ईंटों को एक ठोस, काम करने वाली इमारत (SQL कोड) में बदलें।
  • नुस्खा: AI को जटिल SQL कोड लिखने के लिए कहने के बजाय (जो टाइपो के प्रति संवेदनशील है), SQUiD चरण 3 से प्राप्त स्वच्छ, व्यवस्थित डेटा लेता है और स्वचालित रूप से SQL कमांड लिखने के लिए एक कंप्यूटर प्रोग्राम का उपयोग करता है।
  • उपमा: AI संरचना बनाता है, लेकिन एक कंप्यूटर स्क्रिप्ट एक राजमिस्त्री की तरह कार्य करती है, जो ब्लूप्रिंट के अनुसार ईंटों को पूरी तरह से बिछाती है। यह गारंटी देता है कि अंतिम डेटाबेस में शून्य सिंटैक्स त्रुटियां हैं और यह तुरंत चलता है।

यह एक बड़ी बात क्यों है?

  • यह एक नया खेल है: पिछले AI उपकरण या तो मौजूदा डेटाबेस के बारे में प्रश्न केवल उत्तर दे सकते थे (Text-to-SQL) या सरल फ्लैट टेबल बना सकते थे। SQUiD केवल टेक्स्ट पढ़कर एक जटिल, मल्टी-टेबल रिलेशनल डेटाबेस बनाने वाला पहला उपकरण है।
  • यह विश्वसनीय है: अपने काम को विभाजित करके, SQUiD उन "भ्रमों" (hallucinations) से बचता है जो मानक AI में आम हैं।
  • यह हर जगह काम करता है: चाहे टेक्स्ट पर्यटन, वित्त या मानसिक स्वास्थ्य के बारे में हो, SQUiD अपनी निर्माण टीम को सही प्रकार का डेटाबेस बनाने के लिए अनुकूलित करता है।

निचोड़

SQUiD एक अनुवादक और आर्किटेक्ट दोनों का मिश्रण है। यह आपके डेटा की बिखरी हुई, असंरचित कहानी को एक स्वच्छ, क्वेरी करने योग्य और पूरी तरह से जुड़ी हुई रिलेशनल डेटाबेस में बदल देता है, यह सुनिश्चित करते हुए कि जानकारी का हर टुकड़ा सही स्थान पर है, सही ढंग से जुड़ा हुआ है, और उपयोग के लिए तैयार है। यह टेक्स्ट दस्तावेजों के "वाइल्ड वेस्ट" और रिलेशनल डेटाबेस के "व्यवस्थित शहर" के बीच के अंतर को पाटता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →