EvolveNet: Collaborative Harness Evolution for Agent Self-Improvement
EvolveNet एजेंटों के आत्म-सुधार के लिए एक सहयोगात्मक ढांचे को पेश करता है जो स्थानीय एजेंटों को स्वतंत्र विकास के लिए एक साझा हार्नेस प्रसारित करता है और फिर उनके प्रोग्राम अनुकूलन को एकत्रित करता है, जिससे कच्चे डेटा को केंद्रीकृत किए बिना अलग-थलग वर्कलोड्स के बीच ज्ञान हस्तांतरण सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दिमाग (एक लार्ज लैंग्वेज मॉडल) है जो कोड लिख सकता है, गणित की समस्याओं को हल कर सकता है, या यात्राओं की योजना बना सकता है। लेकिन यह दिमाग जमा हुआ है; आप इसे फिर से प्रशिक्षित नहीं कर सकते या इसकी आंतरिक वायरिंग नहीं बदल सकते। इसे वास्तव में काम करने के योग्य बनाने के लिए, आपको इसे एक "हारनेस" (harness)—निर्देशों, एक स्क्रिप्ट, या एक प्रोग्राम के सेट में लपेटने की आवश्यकता है जो इस दिमाग को बताता है कि कब बोलना है, किन उपकरणों का उपयोग करना है, अपने काम की जांच कैसे करनी है, और यदि वह कोई गलती करता है तो क्या करना है। इस हारनेस को रोबोट के शरीर और तंत्रिका तंत्र के रूप में समझें। एक बेहतर शरीर उसी जमा हुए दिमाग को वे चमत्कार करने में सक्षम बना सकता है जो वह पहले नहीं कर पाता था।
लंबे समय तक, वैज्ञानिकों ने इन शरीरों को सुधारने के लिए रोबोट की सभी गलतियों और सफलताओं को एक केंद्रीय मुख्यालय में डेटा के एक विशाल ढेर के रूप में इकट्ठा करने की कोशिश की। वहां, एक एकल "ऑप्टिमाइज़र" (optimizer) सभी के लिए एक आदर्श शरीर विकसित करने का प्रयास करता था। लेकिन वास्तविक दुनिया में, रोबोट (या एजेंट) हर जगह बिखरे हुए हैं: अलग-अलग कंपनियों में, अलग-अलग डेटाबेस के साथ, और अलग-अलग वातावरणों में। वे गोपनीयता नियमों या तकनीकी सीमाओं के कारण अपना निजी डेटा साझा नहीं कर सकते। यह एक पहेली पैदा करता है: यदि आप सभी के अनुभव को एक स्थान पर नहीं ला सकते, तो आप सभी के लिए एक साझा, सुपर-स्मार्ट शरीर कैसे बना सकते हैं?
यहीं पर EvolveNet पेपर एक चतुर नए विचार के साथ सामने आता है। सारा बिखरा हुआ डेटा एक जगह इकट्ठा करने के बजाय, EvolveNet इस पटकथा को उलट देता है। यह एक "साझा शरीर" (हारनेस) को सभी अलग-अलग रोबोट्स के पास भेजता है। प्रत्येक रोबोट अपने स्वयं के स्थानीय डेटा और अपनी विशिष्ट समस्याओं का उपयोग करके उस शरीर को बेहतर बनाने का प्रयास करता है। एक बार जब वे अपना काम पूरा कर लेते हैं, तो वे अपना डेटा वापस नहीं भेजते; वे केवल वे परिवर्तन वापस भेजते हैं जो उन्होंने शरीर में किए हैं। एक केंद्रीय सर्वर फिर एक मास्टर दर्जी की तरह कार्य करता है, जो इन विभिन्न संशोधनों के सबसे अच्छे हिस्सों को जोड़कर एक नया, बेहतर साझा शरीर तैयार करता है, जिसे फिर से सभी के पास वापस भेज दिया जाता है।
पेपर पाता है कि यह "सहयोगात्मक विकास" (collaborative evolution) अविश्वसनीय रूप से अच्छा काम करता है। पांच अलग-अलग क्षेत्रों में परीक्षणों में—जैसे टेक्स्ट को डेटाबेस क्वेरी में बदलना, डेटा साइंस कोड लिखना, और प्रतिस्पर्धी प्रोग्रामिंग चुनौतियों को हल करना—साझा शरीर हर कार्य में काफी बेहतर हो गया। उदाहरण के लिए, DS-1000 नामक कोडिंग चुनौती पर, सटीकता 55.5% से बढ़कर 68.5% हो गई। महत्वपूर्ण रूप से, पेपर यह दर्शाता है कि यह सुधार केवल सबसे अच्छे रोबोट को चुनने और बाकी को अनदेखा करने से नहीं आता है। इसके बजाय, यह विभिन्न रोबोट्स द्वारा खोजे गए अद्वितीय सुधारों को जोड़ने से आता है। एक रोबोट गणित की किसी विशिष्ट लाइब्रेरी के साथ समस्या को ठीक कर सकता है, जबकि दूसरा किसी अन्य क्षेत्र में लॉजिक एरर को ठीक कर सकता है। सर्वर का काम यह पता लगाना है कि इन दोनों सुधारों को एक-दूसरे से टकराए बिना कैसे रखा जाए। शोधकर्ताओं ने पाया कि "स्कोप-टाइप्ड" (scope-typed) नियमों का उपयोग करके—अनिवारतः शरीर को यह बताना कि, "इस सुधार का उपयोग केवल तब करें जब आप गणित के साथ काम कर रहे हों, लेकिन उस सुधार का उपयोग केवल तब करें जब आप मानचित्रों के साथ काम कर रहे हों"—वे इन विभिन्न कौशलों को एक एकल, सुपर-सक्षम एजेंट में मिला सके।
यह अध्ययन इस विचार को भी खारिज करता है कि अच्छे परिणाम प्राप्त करने के लिए आपको अपने डेटा को केंद्रीकृत करने की आवश्यकता है। यह सिद्ध करता है कि आप अच्छे परिणाम प्राप्त करने के लिए डेटा को स्थानीय और निजी रखते हुए भी मिलकर एक स्मार्ट सिस्टम बना सकते हैं। हालांकि, लेखक सावधानीपूर्वक नोट करते हैं कि यह कोई जादुई छड़ी नहीं है जो सब कुछ तुरंत हल कर देती है। इस प्रक्रिया में परीक्षण और त्रुटि के कई दौर लगते हैं, और सिस्टम इस बात पर निर्भर करता है कि यह जांचने के लिए कुछ लेबल किया गया डेटा उपलब्ध हो कि परिवर्तन वास्तव में काम करते हैं या नहीं। हालांकि परिणाम मजबूत हैं और कई वास्तविक दुनिया के परिदृश्यों में मापे गए हैं, पेपर सुझाव देता है कि जैसे-जैसे ये सिस्टम बड़े होते जाएंगे और अधिक दौरों के लिए चलेंगे, नई चुनौतियां भी आ सकती हैं, जैसे कि कोड का बहुत बड़ा या अव्यवस्थित होना, जिसे प्रबंधित करने की आवश्यकता होगी। लेकिन फिलहाल, EvolveNet दिखाता है कि कई एजेंटों को अपने विशिष्ट कौशल विकसित करने देने और फिर उन्हें सावधानीपूर्वक जोड़ने से, हम एक सामूहिक बुद्धिमत्ता बना सकते हैं जो किसी भी अकेले एजेंट की तुलना में कहीं अधिक स्मार्ट है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।