EvoDS: Self-Evolving Autonomous Data Science Agent with Skill Learning and Context Management
यह शोध पत्र EvoDS को प्रस्तुत करता है, जो एक स्व-विकसित स्वायत्त डेटा विज्ञान एजेंट है जो नए कौशल प्राप्त करने और दीर्घकालिक संदर्भ को अनुकूल रूप से प्रबंधित करने के लिए एजेंटिक सुदृढीकरण शिक्षण (agentic reinforcement learning) का उपयोग करता है, जिससे यह टोकन सीमा विफलताओं को समाप्त करते हुए बहु-चरणीय डेटा विज्ञान कार्यों में मौजूदा अत्याधुनिक एजेंटों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली लेकिन बहुत भुलक्कड़ सहायक है जो एक जटिल पहेली को हल करने की कोशिश कर रहा है। यह सहायक एक AI है, और वह पहेली एक डेटा साइंस प्रोजेक्ट (जैसे स्टॉक की कीमतों की भविष्यवाणी करना या मेडिकल डेटा का विश्लेषण करना) है।
यह पेपर EvoDS को पेश करता है, जो एक नए प्रकार का AI सहायक है जिसे समय के साथ स्मार्ट बनने और बहुत अधिक जानकारी से अभिभूत (overwhelmed) न होने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:
समस्या: "अभिभूत होने वाला इंटर्न" (The "Overwhelmed Intern")
डेटा साइंस के लिए मौजूदा AI सहायक उन इंटर्न की तरह हैं जिनके पास उपकरणों की एक निश्चित सूची (एक हथौड़ा, एक पेचकश, एक रिंच) होती है लेकिन वे नए उपकरण आविष्कार नहीं कर सकते।
- वे नए कौशल नहीं सीख सकते: यदि वे ऐसी समस्या का सामना करते हैं जिसे उनके उपकरण ठीक नहीं कर सकते, तो वे बस अपना सिर दीवार पर मारते रहते हैं, बार-बार उन्हीं पुराने तरीकों को आज़माते रहते हैं। वे अपने "अहा!" वाले पलों को बाद के लिए सहेज कर नहीं रखते।
- वे शोर में खो जाते हैं: डेटा प्रोजेक्ट्स में लंबी बातचीत, बहुत सारा कोड और कई मध्यवर्ती चरण शामिल होते हैं। मौजूदा सहायक सब कुछ याद रखने की कोशिश करते हैं। अंततः, उनकी मेमोरी इतनी भर जाती है (जैसे 1,000 टैब खुला हुआ ब्राउज़र) कि वे सबसे महत्वपूर्ण हिस्सों को भूल जाते हैं या जगह खत्म होने के कारण क्रैश हो जाते हैं।
समाधान: "स्व-विकसित टीम" (The "Self-Evolving Team")
EvoDS एक स्व-सुधारने वाले प्रोजेक्ट मैनेजर की तरह है जो विशेषज्ञों की एक टीम का नेतृत्व करता है। यह ऊपर दी गई दो समस्याओं को तीन मुख्य विचारों का उपयोग करके हल करता है:
1. "बढ़ता हुआ टूलबॉक्स" (स्वायत्त कौशल प्राप्ति - Autonomous Skill Acquisition)
कल्पना कीजिए कि आपका सहायक एक लीक को ठीक करने की कोशिश कर रहा है, लेकिन उसके पास केवल एक रिंच है। हार मानने के बजाय, वह कहता है, "मुझे इस पाइप के लिए एक विशिष्ट पैच की आवश्यकता है।" फिर वह एक नया उपकरण (एक कस्टम पैच) आविष्कृत करता है, यह सुनिश्चित करने के लिए उसका परीक्षण करता है कि वह काम करता है, और उसे अपने स्थायी टूलबॉक्स में जोड़ देता है।
- यह कैसे काम करता है: यदि AI को ऐसी समस्या का सामना करना पड़ता है जिसे वह अपने वर्तमान उपकरणों से हल नहीं कर सकता, तो वह इसे ठीक करने के लिए अपना खुद का नया कोड (एक नया "कौशल") लिखता है। यदि वह नया कोड काम करता है, तो वह उसे सहेज लेता है। अगली बार जब इसी तरह की समस्या आती है, तो वह शून्य से शुरुआत करने के बजाय उस नए उपकरण का उपयोग करता है। वह वास्तव में चलते-चलते अपना खुद का कौशल सेट बनाता है।
2. "स्मार्ट समराइज़र" (अनुकूली संदर्भ संपीड़न - Adaptive Context Compression)
कल्पना कीजिए कि आप एक उपन्यास लिख रहे हैं, लेकिन आप केवल पिछले 10 पन्नों को ही अपने दिमाग में रख सकते हैं। यदि कहानी बहुत लंबी हो जाती है, तो आमतौर पर आपको शुरुआत के पन्ने हटाने पड़ते हैं।
- यह कैसे काम करता है: EvoDS पुराने पन्नों को बेतरतीब ढंग से डिलीट नहीं करता है। इसके बजाय, इसके पास एक विशेष "समराइज़र" (Summarizer) है जो पुराने पन्नों को पढ़ता है और सबसे महत्वपूर्ण चीजों (कहानी के मोड़ और पात्रों के लक्ष्यों) का एक-पैराग्राफ का सारांश लिखता है, जबकि उबाऊ विवरणों को हटा देता है। यह AI की "वर्किंग मेमोरी" को साफ और लक्ष्य पर केंद्रित रखता है, ताकि सैकड़ों चरणों के बाद भी वह प्रोजेक्ट के मुख्य बिंदु को न भूले।
3. "मैनेजर और विशेषज्ञ" (पदानुक्रमित मल्टी-एजेंट - Hierarchical Multi-Agent)
एक विशाल मस्तिष्क के बजाय जो सब कुछ करने की कोशिश करता है (डेटा क्लीन करना, मॉडल बनाना, चार्ट बनाना और त्रुटियों को ठीक करना), EvoDS काम को विभाजित करता है।
- मैनेजर: एक उच्च-स्तरीय बॉस जो बड़े चित्र (big picture) को देखता है और तय करता है कि किसे क्या करना चाहिए।
- विशेषज्ञ: विशेषज्ञों की एक टीम (एक "क्लीनर", एक "मॉडलर", एक "विजुअलाइज़र")। प्रत्येक एक केवल अपने विशिष्ट कार्य पर ध्यान केंद्रित करता है।
- इससे क्यों मदद मिलती है: यह एक निर्माण स्थल की तरह है। आप इलेक्ट्रीशियन से ईंटें बिछाने के लिए नहीं कहते। प्रत्येक एजेंट को एक छोटा, विशिष्ट काम देकर, "मैनेजर" बहुत अधिक विवरणों से भ्रमित नहीं होता है, और विशेषज्ञ बिना भटके तेज़ी से काम कर सकते हैं।
यह कैसे बेहतर होता है (प्रशिक्षण - The Training)
पेपर बताता है कि EvoDS अभ्यास और फीडबैक की एक प्रक्रिया के माध्यम से सीखता है:
- सुपरवाइज्ड लर्निंग (SFT): पहले, यह बुनियादी बातें सीखने के लिए एक "शिक्षक" (एक बहुत बुद्धिमान AI) को समस्याएँ हल करते हुए देखता है।
- रीइन्फोर्समेंट लर्निंग (RL): फिर, यह खुद काम करना शुरू करता है। यदि यह किसी समस्या को अच्छी तरह से हल करता है, तो इसे एक "पुरस्कार" मिलता है। यदि यह समय बर्बाद करता है या इसकी मेमोरी खत्म हो जाती है, तो इसे "दंड" मिलता है। समय के साथ, यह कुशल, नए उपकरण बनाने में सक्षम और अपने इतिहास को पूरी तरह से सारांशित करने में कुशल होने के लिए सीखता है।
परिणाम
लेखकों ने चार अलग-अलग डेटा साइंस चुनौतियों पर EvoDS का परीक्षण किया।
- यह जीत गया: इसने अन्य शीर्ष ओपन-सोर्स AI एजेंटों की तुलना में काफी बेहतर प्रदर्शन किया (औसत रूप से लगभग 29% बेहतर)।
- यह क्रैश नहीं हुआ: जबकि अन्य AI अक्सर मेमोरी खत्म होने (जिसे "आउट-ऑफ-टोकन" विफलता कहा जाता है) के कारण विफल हो जाते थे, EvoDS ने लंबे, जटिल कार्यों को बिना क्रैश हुए संभाला।
- इसने सीखा: जब AI ने अपने द्वारा आविष्कार किए गए नए टूल का उपयोग करके किसी समस्या को हल किया, तो इसने उस टूल को याद रखा और भविष्य में अलग-अलग समस्याओं पर सफलतापूर्वक उपयोग किया।
संक्षेप में
EvoDS एक AI डेटा वैज्ञानिक है जो केवल एक स्क्रिप्ट का पालन नहीं करता है। यह एक जिज्ञासु प्रशिक्षु की तरह है जो, फंस जाने पर, समस्या को हल करने के लिए एक नया उपकरण बनाता है, उस उपकरण को बाद के लिए सहेजता है, और अपने लंबे कार्यदिवस को लगातार सारांशित करता है ताकि वह लक्ष्य से न भटके। यह इसे उन जटिल, दीर्घकालिक परियोजनाओं को संभालने की अनुमति देता जिन्हें अन्य AI केवल भ्रमित होकर अधूरा छोड़ देते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।