Constraint-Aware Synthetic Tabular Data Generation via Inter-Column Constraint Discovery with LLM Agents
यह शोध पत्र एक एकीकृत, टूल-ग्राउंडेड वर्कफ़्लो प्रस्तावित करता है जो संरचनात्मक रूप से वैध सिंथेटिक सारणीबद्ध डेटा उत्पन्न करने के लिए एलएलएम एजेंटों के माध्यम से इंटर-कॉलम बाधाओं (समीकरणों, रैखिक असमानताओं और तार्किक निर्भरताओं) की खोज और प्रवर्तन करता है, जिससे सांख्यिकीय निष्ठा को बनाए रखते हुए और डाउनस्ट्रीम उपयोगिता में सुधार करते हुए शून्य मापे गए उल्लंघन प्राप्त होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
डिजिटल युग में, विशाल मात्रा में जानकारी स्प्रेडशीट्स में बंद है, जो उड़ान के समय से लेकर क्रेडिट आवेदनों, बास्केटबॉल सांख्यिकी और चिकित्सा इतिहास तक सब कुछ रिकॉर्ड करती है। जब वास्तविक डेटा दुर्लभ, संवेदनशील या साझा करने में कठिन होता है, तो शोधकर्ता और इंजीनियर सिंथेटिक डेटा की ओर मुड़ते हैं: कंप्यूटर-जनरेटेड रिकॉर्ड जो वास्तविक दुनिया के सांख्यिकीय पैटर्न की नकल करते हैं। ये कृत्रिम डेटासेट टीमों को गोपनीयता जोखिम उठाए बिना या गोपनीय विवरणों को उजागर किए बिना सॉफ्टवेयर बनाने और परीक्षण करने, आर्टिफिशियल इंटेलिजेंस को प्रशिक्षित करने और विभिन्न परिदृश्यों का पता लगाने की अनुमति देते हैं। हालाँकि, एक बड़ी समस्या लंबे समय से इस क्षेत्र को परेशान करती रही है। जबकि कंप्यूटर डेटा के सामान्य आकार की नकल करने में उत्कृष्ट हैं—यह सुनिश्चित करते हुए कि औसत आयु या आय का वितरण सही दिखता है—वे अक्सर उन गहरे, तार्किक नियमों को समझने में विफल रहते हैं जो कॉलमों को एक साथ बांधते हैं। एक कंप्यूटर एक ऐसा सिंथेटिक ऑर्डर जनरेट कर सकता है जहाँ पैकेज खरीदारी होने से पहले ही डिलीवर कर दिया गया हो, या एक ऐसा वित्तीय रिकॉर्ड जहाँ कुल लागत कीमत और मात्रा के गुणनफल से मेल नहीं खाती हो। ये त्रुटियां, जिन्हें संरचनात्मक उल्लंघन (structural violations) कहा जाता है, डेटा को सतह पर तो वास्तविक दिखाती हैं लेकिन सरल तार्किक जांच के तहत टूट जाती हैं, जिससे यह गंभीर विश्लेषण या निर्णय लेने के लिए बेकार हो जाता है।
शोधकर्ताओं की एक टीम ने इस दोष को ठीक करने के लिए एक नई विधि विकसित की है, एक ऐसी प्रणाली बनाई है जो आर्टिफिशियल इंटेलिजेंस को डेटासेट के छिपे हुए तार्किक नियमों को खोजने और उन्हें लागू करने के लिए सिखाती है। डेटा जनरेटर को शुरू से ही सख्त नियमों का पालन करने के लिए मजबूर करने के बजाय, जो अक्सर डेटा को विकृत करता है या जटिल पुन: प्रशिक्षण की आवश्यकता होती है, उनका दृष्टिकोण एक परिष्कृत पोस्ट-प्रोसेसिंग स्टेप के रूप में कार्य करता है। यह प्रणाली पहले लार्ज लैंग्वेज मॉडल्स—विशाल मात्रा में टेक्स्ट पर प्रशिक्षित उन्नत एआई टूल्स—का उपयोग करती है ताकि डेटासेट के विवरण और नमूना रिकॉर्ड को पढ़ा जा सके। ये मॉडल जिज्ञासु ऑडिटर्स की तरह कार्य करते हैं, जो इस बारे में परिकल्पनाएं प्रस्तावित करते हैं कि विभिन्न कॉलम एक-दूसरे से कैसे संबंधित होने चाहिए। वे सुझाव दे सकते हैं कि डिलीवरी की तारीख हमेशा ऑर्डर की तारीख से बाद की होनी चाहिए, या एक विशिष्ट उत्पाद प्रकार केवल कुछ निश्चित तरीकों से ही भेजा जा सकता है।
नवाचार इस बात में निहित है कि इन प्रस्तावों का परीक्षण और परिशोधन कैसे किया जाता है। एआई के अनुमानों को आँख मूंदकर स्वीकार करने के बजाय, प्रणाली प्रत्येक विचार को एक सख्त, मशीन-पठनीय निर्देश में अनुवादित करती है जिसे मूल डेटा के प्रत्येक रो (row) के विरुद्ध जांचा जा सकता है। यदि कोई प्रस्तावित नियम कुछ ही बार विफल होता है, तो सिस्टम उसे तुरंत खारिज नहीं करता है। इसके बजाय, यह एआई को वे विशिष्ट उदाहरण दिखाता है जहाँ नियम टूटा था, जिससे मॉडल को अपनी परिकल्पना को संशोधित करने की अनुमति मिलती है। प्रस्ताव, परीक्षण और सुधार का यह चक्र तब तक चलता रहता है जब तक कि सिस्टम नियमों के एक ऐसे सेट पर नहीं बैठ जाता जो पूरे डेटासेट के लिए सत्य हो। शोधकर्ताओं ने तीन मुख्य प्रकार के संबंधों पर ध्यान केंद्रित किया: समीकरण जहाँ एक संख्या दूसरों का सटीक परिणाम होती है, असमानताएँ जहाँ एक मान दूसरे से बड़ा या छोटा होना चाहिए, और तार्किक निर्भरताएँ जहाँ एक आइटम की श्रेणी अन्य अनुमत श्रेणियों को निर्धारित करती है।
एक बार जब नियम खोज लिए जाते हैं और सत्यापित हो जाते हैं, तो प्रणाली उन्हें किसी भी मानक टूल द्वारा जनरेट किए गए सिंथेटिक डेटा पर लागू करती है। यह एक समन्वयक (coordinator) के रूप में कार्य करता है, त्रुटियों को एक विशिष्ट क्रम में ठीक करता है ताकि यह सुनिश्चित हो सके कि एक गलती को ठीक करने से दूसरी गलती पैदा न हो। उदाहरण के लिए, यदि किसी नियम के लिए आवश्यक है कि कुल योग दो भागों का योग हो, तो सिस्टम पहले भागों के आधार पर कुल योग को ठीक करता है, और उसके बाद ही भागों को किसी भी व्यापक सीमा के भीतर फिट होने के लिए समायोजित करता है। यह सावधानीपूर्वक अनुक्रमण (sequencing) सुनिश्चित करता है कि अंतिम डेटासेट सभी खोजे गए नियमों का एक साथ पालन करे। अपने प्रयोगों में, शोधकर्ताओं ने सात अलग-अलग सार्वजनिक डेटासेट्स पर इस वर्कफ़्लो का परीक्षण किया, जिनमें उड़ान रिकॉर्ड से लेकर स्टील उद्योग की ऊर्जा खपत तक शामिल थे, और चार अलग-अलग प्रकार के डेटा जनरेटर्स का उपयोग किया। सुधार से पहले, सिंथेटिक डेटा में अक्सर सैकड़ों उल्लंघन होते थे, कुछ डेटासेट्स ने दिखाया कि लगभग हर एक जनरेटेड रिकॉर्ड कम से कम एक नियम को तोड़ता है। सिस्टम द्वारा सुधार लागू करने के बाद, लागू किए जा सकने वाले प्रत्येक नियम के लिए उल्लंघनों की संख्या घटकर शून्य हो गई।
महत्वपूर्ण रूप से, इस कठोर सफाई ने डेटा की उपयोगिता को नष्ट नहीं किया। शोधकर्ताओं ने यह मापा कि कैसे साफ किया गया डेटा वास्तविक दुनिया के कार्यों में प्रदर्शन करता है, जैसे कि क्रेडिट जोखिम या उड़ान में देरी की भविष्यवाणी करने के लिए एक मॉडल को प्रशिक्षित करना। अधिकांश मामलों में, डेटा की उपयोगिता वास्तव में सुधर गई, और सबसे खराब मामलों में, प्रदर्शन में गिरावट नगण्य थी। सिस्टम ने डेटा की व्यक्तिगत विशेषताओं को भी सुरक्षित रखा, यह सुनिश्चित करते हुए कि प्रत्येक कॉलम में मूल्यों का वितरण मूल के प्रति वफादार रहे। यह अध्ययन प्रदर्शित करता है कि तार्किक नियमों को अलग-थलग जांच के बजाय परस्पर क्रिया करने वाले बाधाओं (constraints) की एक प्रणाली के रूप में मानकर, ऐसा सिंथेटिक डेटा उत्पन्न करना संभव है जो न केवल वास्तविक चीज़ के सांख्यिकीय रूप से समान है बल्कि संरचनात्मक रूप से भी सुदृढ़ है। यह दृष्टिकोण विश्वसनीय सिंथेटिक डेटा बनाने के लिए एक व्यावहारिक मार्ग प्रदान करता है, यह सुनिश्चित करते हुए कि हमारे भविष्य के सिस्टम को प्रशिक्षित करने के लिए उपयोग किए जाने वाले कृत्रिम रिकॉर्ड तार्किक सत्य की नींव पर बने हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।