← नवीनतम पेपर
🤖 AI

LeafData: An Agentic System for Data Migration

LeafData एक एजेंटिक सिस्टम है जो चैटबॉट-संचालित इंटरफ़ेस के माध्यम से उपयोगकर्ता की मंशा को सत्यापित, निष्पादन योग्य JSON कॉन्फ़िगरेशन में बदलकर डेटा माइग्रेशन को सुव्यवस्थित करता है, जिससे मैन्युअल कोडिंग और डोमेन विशेषज्ञता की आवश्यकता समाप्त हो जाती है।

मूल लेखक: Sadanand Katukuri, Rajasekhar Bada, Navya Induri, Rohit Gandham, Lynette Pinto, Joses Selvan, Abishek Krishnamoorthy, Joseph Rozario, Pu Tian, Pavan Poudel, Yalong Wu

प्रकाशित 2026-07-27
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sadanand Katukuri, Rajasekhar Bada, Navya Induri, Rohit Gandham, Lynette Pinto, Joses Selvan, Abishek Krishnamoorthy, Joseph Rozario, Pu Tian, Pavan Poudel, Yalong Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल लेगो (Lego) किला बनाने की कोशिश कर रहे हैं, लेकिन निर्देश एक गुप्त कोड में लिखे गए हैं जिसे केवल कुछ विशेषज्ञ ही पढ़ सकते हैं। एक कंप्यूटर सिस्टम से दूसरे में डेटा ले जाने की वर्तमान वास्तविकता यही है। डेटा साइंस की दुनिया में, "डेटा माइग्रेशन" (data migration) केवल जानकारी को एक जगह (जैसे एक पुरानी फाइलिंग कैबिनेट) से पैक करके एक नए घर (जैसे एक चमकदार नए डिजिटल क्लाउड) में ले जाने की क्रिया है। इसे करने के लिए, इंजीनियरों को आमतौर पर "पाइपलाइन" नामक जटिल "रेसिपी" लिखनी पड़ती है। ये पाइपलाइन कंप्यूटर को ठीक-ठीक बताती हैं कि डेटा को कैसे पकड़ना है, उसे कैसे साफ करना है, और उसे सही जगह पर कैसे छोड़ना है। पारंपरिक रूप से, ये रेसिपी लिखने के लिए JSON नामक एक विशेष भाषा की आवश्यकता होती है, जो एक सख्त, निर्दयी व्याकरण की तरह है जो पूर्ण विराम और विशिष्ट नियमों की मांग करता है। यदि आप एक कॉमा भी भूल जाते हैं या एक नंबर गलत कर देते हैं, तो पूरी प्रक्रिया क्रैश हो जाती है। यह एक बड़ी बाधा पैदा करता है: यदि आप कोडिंग के जादूगर नहीं हैं, तो आप आसानी से अपना डेटा स्थानांतरित नहीं कर सकते, भले ही आप जानते हों कि आप क्या करना चाहते हैं।

यहाँ LeafData आता है, एक नया सिस्टम जिसे आपके रोजमर्रा के विचारों और उस सख्त कंप्यूटर कोड के बीच एक मित्रवत अनुवादक बनने के लिए डिज़ाइन किया गया है। LeafData को केवल आदेशों का पालन करने वाले रोबोट के रूप में नहीं, बल्कि एक सहायक, सुपर-स्मार्ट टूर गाइड के रूप में सोचें। आपको गुप्त कोड सीखने के लिए मजबूर करने के बजाय, आप बस गाइड को बताते हैं, "मैं अपनी कस्टमर लिस्ट इस पुराने डेटाबेस से उस नई स्प्रेडशीट में ले जाना चाहता हूँ।" इसके बाद गाइड एक जासूस की तरह, एक-एक करके, सरल प्रश्न पूछता है। यह सुनिश्चित करने के लिए कि आपने कोई गलती नहीं की है, यह आपके उत्तरों की जांच एक सख्त नियम पुस्तिका के विरुद्ध करता है। एक बार जब इसके पास सभी हिस्से आ जाते हैं, तो यह स्वचालित रूप से एक आदर्श "रेसिपी" (JSON कॉन्फ़िगरेशन) बनाता है और इसे एक मास्टर बिल्डर (एक ऑर्केस्ट्रेशन प्लेटफॉर्म) को सौंप देता है जो वास्तव में डेटा को स्थानांतरित करने का भारी काम करता है। परिणाम यह है कि कोई भी, यहाँ तक कि एक जिज्ञासु किशोर जिसके पास एक शानदार विचार है, बिना कभी गुप्त कोड सीखे जटिल डेटा स्थानांतरित कर सकता है।

शोध का मुख्य निष्कर्ष

यह शोध पत्र LeafData को पेश करता है, जो एक "एजेंटिक सिस्टम" (जो केवल एक स्मार्ट, स्वायत्त सहायक कहने का एक फैंसी तरीका है) है जो प्राकृतिक भाषा के उपयोगकर्ता अनुरोधों को मान्य, निष्पादन योग्य डेटा माइग्रेशन पाइपलाइनों में बदल देता है। लेखकों ने पाया कि एक चैटबॉट इंटरफेस को एक सख्त वैलिडेशन इंजन के साथ जोड़कर, वे उपयोगकर्ताओं को मैन्युअल रूप रूप से जटिल कॉन्फ़िगरेशन फ़ाइलें लिखने की आवश्यकता को समाप्त कर सकते हैं।

यह जादू चरण-दर-चरण इस प्रकार होता है:

1. चैटबॉट गाइड (फ्रंटएंड)
कल्पना कीजिए कि आप एक बहुत ही धैर्यवान लाइब्रेरियन से बात कर रहे हैं जो जानता है कि आपको पुल बनाने के लिए वास्तव में क्या चाहिए। आप शुरुआत करते हैं, "मैं अपने MySQL डेटाबेस से AWS S3 पर एक फ़ाइल में डेटा ले जाना चाहता हूँ।" चैटबॉट केवल "ठीक है" नहीं कहता और उम्मीद नहीं करता। इसके बजाय, यह "स्टेट ट्रैकिंग" मोड में प्रवेश करता है। वह जानता है कि आपने उसे सोर्स (स्रोत) और डेस्टिनेशन (गंतव्य) बताया है, लेकिन वह जानता है कि उसने अभी तक होस्ट नेम या पोर्ट नंबर नहीं बताया है। वह इन विवरणों को एक-एक करके मांगता है।

  • सुरक्षा जाल: यदि आप टाइप करते हैं "Port: abc" (जो कि निरर्थक है क्योंकि पोर्ट एक संख्या होनी चाहिए), तो चैटबॉट तुरंत आपको रोकता है। वह कहता है, "पोर्ट संख्यात्मक होना चाहिए। कृपया पुनः प्रयास करें।" यह आगे बढ़ने से पहले हर एक उत्तर की जांच करने के लिए एक सख्त नियम पुस्तिका (जिसे Apache Avro schema कहा जाता है) का उपयोग करता है। यह सुनिश्चित करता है कि जब तक सिस्टम आपसे बात करना समाप्त नहीं करता, आपके निर्देश 100% सही होते हैं।
  • "टाइम ट्रैवल" सुविधा: यदि आप अपना विचार बदलते हैं, तो आपको फिर से शुरू करने की आवश्यकता नहीं है। आप @change जैसे विशेष कमांड का उपयोग कर सकते हैं, जैसे "वास्तव में, मेरा मतलब एक अलग डेटाबेस नाम का उपयोग करना था," और सिस्टम बिना किसी अन्य सही जानकारी को खोए अपने आंतरिक नोट्स को अपडेट कर देता है।

2. आर्किटेक्ट (बैकएंड)
एक बार जब चैटबॉट सभी सही, मान्य जानकारी एकत्र कर लेता है, तो वह अपने नोट्स को बैकएंड सेवा को सौंप देता है। सिस्टम का यह हिस्सा एक आर्किटेक्ट की तरह है जो आपकी आवश्यकताओं की एक साधारण सूची लेकर ब्लूप्रिंट तैयार करता है।

  • ब्लूप्रिंट: सिस्टम विशिष्ट JSON फ़ाइलें बनाता है। ये केवल यादृच्छिक टेक्स्ट फ़ाइलें नहीं हैं; ये संरचित "आर्टिफैक्ट्स" हैं जो यह परिभाषित करते हैं कि स्रोत से कैसे जुड़ना है, गंतव्य से कैसे जुड़ना है, और डेटा स्थानांतरित करने के लिए चरण-दर-चरण योजना (जिसे DAG, या Directed Acyclic Graph कहा जाता है) क्या है।
  • अनुवादक: सिस्टम को इससे कोई फर्क नहीं पड़ता कि आप डेटाबेस, स्प्रेडशीट, या वेबसाइट API से डेटा ले जा रहे हैं। इसमें एक "कनेक्टर एब्स्ट्रैक्शन लेयर" है, जो एक यूनिवर्सल एडॉप्टर की तरह है। चाहे आप USB ड्राइव लगा रहे हों या फाइबर ऑप्टिक केबल, एडॉप्टर यह सुनिश्चित करता है कि बिजली का प्रवाह एक ही तरह से हो। इसका अर्थ है कि सिस्टम MySQL, Oracle, MongoDB, SFTP फ़ाइलों और REST API को उसी अंतर्निहित तर्क का उपयोग करके संभाल सकता है।

3. बिल्डर (ऑर्केस्ट्रेशन)
अंत में, ये JSON ब्लूप्रिंट Apache Airflow नामक एक मास्टर बिल्डर में डाले जाते हैं। Airflow फ़ाइलों को पढ़ता है और वास्तविक पाइपलाइन बनाता है। यह एक विजुअल ग्राफ (फ्लोचार्ट की तरह) बनाता है जो कार्यों को दिखाता है: "पहले, स्रोत से डेटा लें। दूसरा, इसे एक अस्थायी स्थान पर सहेजें। तीसरा, इसे गंतव्य में लोड करें।"

  • परिणाम: शोध पत्र इसे वास्तविक उदाहरणों के साथ प्रदर्शित करता है। एक मामले में, उन्होंने AWS S3 बकेट (एक क्लाउड स्टोरेज फोल्डर) से मेडिकल रिकॉर्ड को MySQL डेटाबेस में स्थानांतरित किया। सिस्टम ने स्वचालित रूप से फ़ाइल डाउनलोड करने के लिए एक कार्य, उसे साफ करने के लिए एक कार्य और उसे अपलोड करने के लिए एक कार्य बनाया। परिणाम एक सफल स्थानांतरण था जिसमें स्पष्ट लॉग था कि क्या हुआ।
  • जटिल डेटा: उन्होंने इसे "मेसी" (अव्यवस्थित) डेटा, जैसे कि MongoDB के दस्तावेज़ (जिनमें नेस्टेड, अनियमित संरचनाएं होती हैं) या REST API से JSON के साथ भी काम करते हुए दिखाया। सिस्टम ने इन जटिल संरचनाओं को डेटाबेस के लिए साफ, व्यवस्थित पंक्तियों में स्वचालित रूप से बदला, जिससे यह साबित हुआ कि यह मानवीय हस्तक्षेप के बिना विभिन्न प्रकार के डेटा को संभाल सकता है।

LeafData क्या नहीं करता (अभी तक)

इस सिस्टम की सीमाओं को समझना महत्वपूर्ण है। शोध पत्र स्पष्ट रूप से बताता है कि LeafData वर्तमान में लीनियर पाइपलाइन्स (linear pipelines) का समर्थन करता है। इसका मतलब है कि यह पॉइंट A से पॉइंट B तक एक सीधी रेखा में डेटा ले जाने के लिए बेहतरीन है। यह अभी उन जटिल वर्कफ़्लो को नहीं संभालता जहाँ पथ विभाजित (ब्रांचिंग) होता है या जहाँ सिस्टम को डेटा के आधार पर निर्णय लेना होता है (कंडीशनल लॉजिक)। उदाहरण के लिए, यह नहीं कह सकता कि, "यदि डेटा बड़ा है, तो क्लाउड पर जाएं; यदि छोटा है, तो स्थानीय सर्वर पर जाएं।" यह भविष्य के संस्करणों का काम है।

निष्कर्ष

लेखक आश्वस्त हैं कि यह दृष्टिकोण काम करता है। उन्होंने केवल यह सुझाव नहीं दिया कि यह काम कर सकता है; उन्होंने एक काम करने वाला प्रोटोटाइप बनाया और वास्तविक डेटा माइग्रेशन के साथ इसका परीक्षण किया। उन्होंने दिखाया कि एक चैटबॉट का उपयोग करके उपयोगकर्ता को मार्गदर्शन देने और उत्तरों को जांचने के लिए एक सख्त वैलिडेटर का उपयोग करके, वे त्रुटि-मुक्त कॉन्फ़िगरेशन फ़ाइलें बना सकते थे जिन्होंने सफलतापूर्वक विभिन्न सिस्टमों में डेटा स्थानांतरित किया।

मुख्य बात यह है कि LeafData तकनीक के साथ हमारे संवाद करने के तरीके में बदलाव का सुझाव देता है: मनुष्य को मशीन की सख्त भाषा सीखने के लिए मजबूर करने के बजाय, हम मशीन को हमारी प्राकृतिक भाषा समझने के लिए सिखा सकते हैं, बशर्ते हमारे पास एक सख्त "ग्रामर पुलिस" (वैलिडेशन लेयर) हो ताकि हम सटीक रहें। यह डेटा माइग्रेशन की शक्तिशाली दुनिया को गैर-विशेषज्ञों के लिए सुलभ बनाता है, पाइपलाइन सेट करने में लगने वाले समय को कम करता है और टाइपिंग की ऐसी गलती के डर को हटा देता है जो पूरे सिस्टम को तोड़ सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →