AgenticData: An Agentic Data Analytics System for Heterogeneous Data
AgenticData एक अभिनव एजेंटिक प्रणाली है जो फीडबैक-संचालित योजना और सिमेंटिक अनुकूलन के साथ मल्टी-एजेंट सहयोग रणनीति का लाभ उठाकर प्राकृतिक भाषा प्रश्नों के माध्यम से विषम संरचित और असंरचित डेटा के स्वायत्त विश्लेषण को सक्षम बनाती है ताकि मौजूदा तरीकों की तुलना में श्रेष्ठ सटीकता प्राप्त की जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत बड़ी गुत्थी सुलझाने की कोशिश कर रहे हैं, लेकिन सुराग हर जगह बिखरे हुए हैं। कुछ सुराग साफ-सुथरे बही-खातों में लिखे हैं जिनमें "नाम," "तारीख," और "राशि" जैसे स्पष्ट कॉलम हैं। अन्य सुराग हजारों अव्यवस्थित डायरी प्रविष्टियों, स्कैन किए गए दस्तावेजों और वेब पेजों के भीतर दबे हुए हैं जहाँ जानकारी पैराग्राफ के बीच छिपी हुई है। लंबे समय से, कंप्यूटर साफ-सुथरे बही-खातों को पढ़ने में तो बहुत अच्छे रहे हैं लेकिन अस्त-व्यस्त डायरियों का अर्थ समझने में बहुत खराब रहे हैं। उन्हें आमतौर पर दोनों के बीच संबंध जोड़ने के लिए जटिल निर्देश (कोड) लिखने के लिए एक मानव विशेषज्ञ की आवश्यकता होती है। यह एक लाइब्रेरियन से एक विशिष्ट तथ्य खोजने के लिए कहने जैसा है, लेकिन आपको लाइब्रेरियन के काम शुरू करने से पहले खुद पूरा सर्च इंजन का कोड लिखना पड़ता है। यह धीमा, महंगा और निराशाजनक है। बड़ा सवाल कंप्यूटर विज्ञान के इस कोने में यह है: क्या हम एक ऐसा सिस्टम बना सकते हैं जो एक सुपर-स्मार्ट जासूस की तरह काम करे, जो दोनों तरह के—साफ-सुथरे बही-खातों और अस्त-व्यस्त डायरियों—को पढ़ सके, समझ सके कि हम साधारण भाषा में क्या चाहते हैं, और अपने आप इस रहस्य को सुलझा सके?
यहाँ AgenticData आता है, एक नया सिस्टम जिसे वह सुपर-स्मार्ट जासूस बनने के लिए डिज़ाइन किया गया है। इसे एक हलचल भरे न्यूज़रूम में काम करने वाली विशेषज्ञ एजेंटों की एक टीम के रूप में सोचें। एक विशाल मस्तिष्क होने के बजाय जो एक साथ सब कुछ करने की कोशिश करता है, AgenticData एक "मल्टी-एजेंट" दृष्टिकोण का उपयोग करता है। इसमें एक डेटा प्रोफाइलर (Data Profiler) है जो यह समझने के लिए पूरी लाइब्रेरी को स्कैन करता है कि कौन सी किताबें और फाइलें मौजूद हैं और वे एक-दूसरे से कैसे संबंधित हो सकती हैं। इसमें एक प्लानर (Planner) है जो सवाल का जवाब देने के लिए चरण-दर-चरण रणनीति तैयार करता है। इसमें एक वैलिडेटर (Validator) है जो एक सख्त संपादक की तरह काम करता है, जो किसी के भी काम शुरू करने से पहले योजना में गलतियों की जाँच करता है। और इसमें एक मेमोरी मैनेजर (Memory Manager) है जो पिछले सफलताओं और विफलताओं की एक नोटबुक रखता है ताकि टीम एक ही गलती दोबारा न दोहराए। जब आप प्राकृतिक भाषा में कोई प्रश्न पूछते हैं—जैसे "उन सभी बास्केटबॉल खिलाड़ियों के कुल वेतन को दिखाएं जिन्होंने 10 से अधिक चैंपियनशिप जीती हैं"—तो यह टीम सही डेटा खोजने, गणित लगाने और आपको उत्तर देने के लिए मिलकर काम करती है, बिना आपके एक भी लाइन का कोड लिखे।
AgenticData के पीछे के शोधकर्ताओं ने पाया कि यह टीम वाला दृष्टिकोण अविश्वसनीय रूप से अच्छा काम करता है। अपने प्रयोगों में, उन्होंने इस सिस्टम का परीक्षण पांच बेंचमार्क पर किया, जो डेटा विश्लेषण के लिए मानकीकृत परीक्षणों की तरह हैं। परिणामों ने दिखाया कि AgenticData वर्तमान सर्वोत्तम तरीकों की तुलना में काफी अधिक सटीक था। कुछ कठिन कार्यों पर, इसने अन्य शीर्ष प्रणालियों की तुलना में सटीकता में लगभग 30% तक सुधार किया। उदाहरण के लिए, वास्तविक बैंक डेटा से जुड़े एक डेटासेट पर, यह अपने अगले सबसे अच्छे प्रतिस्पर्धी की तुलना में लगभग 20% अधिक सटीक था। सिस्टम ने केवल अनुमान नहीं लगाया; इसने एक चतुर फीडबैक लूप का उपयोग किया। यदि "वैलिडेटर" को योजना में कोई गलती मिली, तो सिस्टम ने हार नहीं मानी। इसने त्रुटि को अपनी मेमोरी में स्टोर किया, इससे सीखा, और एक नई, बेहतर योजना बनाई। "कोशिश करने, असफल होने, सीखने और फिर से कोशिश करने" की इस प्रक्रिया ने इसे उन जटिल पहेलियों को हल करने की अनुमति दी जिन्होंने अन्य सिस्टमों को उलझा दिया था।
सबसे रोमांचक निष्कर्षों में से एक यह है कि AgenticData "अस्त-व्यस्त" डेटा को कैसे संभालता है। पारंपरिक सिस्टम अक्सर संघर्ष करते हैं जब वे किसी दस्तावेज़ में स्पष्ट संरचना नहीं पाते हैं। हालाँकि, AgenticData अपने एजेंटों का उपयोग करके असंरचित टेक्स्ट को उपयोगी टुकड़ों में तोड़ता है, विभिन्न दस्तावेजों के बीच संबंध खोजता है, और यहाँ तक कि उन्हें संरचित तालिकाओं (tables) से भी जोड़ता है। विकिपीडिया लेखों और वास्तविक दुनिया के बैंक रिकॉर्ड से जुड़े परीक्षणों में, सिस्टम ने सटीक उत्तर देने के लिए इन अराजक डेटा स्रोतों को सफलतापूर्वक नेविगेट किया। शोधकर्ताओं ने सिस्टम की लागत और गति को भी मापा। उन्होंने पाया कि अपने एजेंटों द्वारा अपनी "बौद्धिक शक्ति" (विशेष रूप से, कितनी बार वे बड़े भाषा मॉडलों (LLMs) का उपयोग करते हैं) के उपयोग को अनुकूलित करके, AgenticData अन्य तरीकों की तुलना में लगभग आधे खर्च में उच्च-गुणवत्ता वाले परिणाम प्राप्त कर सकता है।
यह पेपर स्पष्ट रूप से इस विचार के विरुद्ध तर्क देता है कि एक एकल, विशाल AI मॉडल अकेले इन सभी कार्यों को संभाल सकता है। उन्होंने पाया कि योजना बनाने, निष्पादित करने और सब कुछ सत्यापित करने के लिए केवल एक ही मॉडल पर निर्भर रहने से अक्सर त्रुटियां और "हलुसिनेशन" (जहाँ AI मनगढ़ंत बातें बनाता है) होते हैं। इसके बजाय, उनके प्रयोग सुझाव देते हैं कि काम को विशिष्ट भूमिकाओं वाले एक सहयोगी दल और एक मजबूत मेमोरी सिस्टम में विभाजित करना सफलता की कुंजी है। उन्होंने इस विचार को भी खारिज कर दिया कि मनुष्यों को प्रत्येक नए विश्लेषण के लिए कोड लिखना होगा; उनके सिस्टम ने दिखाया कि यह स्वायत्त रूप से आवश्यक चरणों को उत्पन्न कर सकता है। हालाँकि यह सिस्टम पूर्ण नहीं है—इसे जटिल प्रश्नों की योजना बनाने में कुछ मिनट लग सकते हैं और यह कभी-कभी अत्यंत दुर्लभ डेटा पैटर्न के साथ संघर्ष कर सकता है—लेकिन परिणाम बताते हैं कि यह एक बड़ी प्रगति है। टीम ने इस सिस्टम को वास्तविक दुनिया के परिवेश में, जिसमें बैंक और पावर ग्रिड कंपनियां शामिल हैं, पहले ही तैनात कर दिया है, जहाँ यह वर्तमान में पेशेवरों को जटिल डेटा का विश्लेषण करने में मदद कर रहा है बिना किसी डेटा वैज्ञानिक की टीम के लिए हर एक प्रश्न हेतु कोड लिखने की आवश्यकता के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।