ANDES: Agent Native Data Evolving Synthesis Tool for Autonomous Instruction Alignment
यह शोध पत्र ANDES को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो डेटा जनरेशन को एक सेल्फ-इवॉल्विंग वर्ल्ड ट्री रूटिंग मैकेनिज्म के माध्यम से प्लग-एंड-प्ले एजेंट स्किल में बदलकर स्वायत्त एआई निर्देश संरेखण (autonomous AI instruction alignment) को बढ़ाता है, जिससे कमजोर एजेंटों को सख्त कंप्यूट बाधाओं के तहत अत्याधुनिक प्रदर्शन प्राप्त करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन रोबोट सहायक को यह सिखाने की कोशिश कर रहे हैं कि मददगार कैसे बनना है। आप जानते हैं कि रोबोट को उदाहरणों (डेटा) से सीखने की आवश्यकता है, लेकिन आप उन उदाहरणों को खुद मैन्युअल रूप से लिखने में अपने कई साल बर्बाद नहीं करना चाहते। इसलिए, आप एक दूसरे, थोड़े अधिक बुद्धिमान रोबोट (एक "एजेंट") को काम सौंपने का निर्णय लेते हैं ताकि वह पहले रोबोट के लिए प्रशिक्षण डेटा खोजने और व्यवस्थित करने का काम कर सके।
समस्या यह है कि जैसा कि इस शोध पत्र के लेखकों ने खोजा है, एक रोबोट को अच्छे उदाहरण खोजने के लिए "खुले इंटरनेट" की अराजकता में जाने के लिए कहना वैसा ही है जैसे किसी बच्चे को विशिष्ट पुस्तकें खोजने के लिए एक विशाल, शोर-शराबे वाली लाइब्रेरी में भेज देना। वे अभिभूत हो जाते हैं, गलत किताबें उठा लेते हैं, या शोर के बीच फंस जाते हैं। वैकल्पिक रूप से, यदि आप उन्हें पढ़ने के लिए पुस्तकों की एक स्थिर सूची दे देते हैं, तो वे तब अनुकूलित नहीं हो सकते जब उन्हें बाद में पता चलता है कि उनके पास किसी विशिष्ट कौशल की कमी है।
"एंडिस" (Andes): द इंटेलिजेंट लाइब्रेरियन स्किल
लेखक Andes (एजेंट नेटिव डेटा इवॉल्विंग सिंथेसिस) नामक एक नया टूल पेश करते हैं। एंडिस को एक रोबोट के रूप में न सोचें जो बाहर जाकर खोजता है, बल्कि इसे एक सुपर-पावर्ड, प्लग-एंड-प्ले "लाइब्रेरियन स्किल" के रूप में समझें जिसे आप अपने प्रशिक्षण रोबोट को दे सकते हैं।
एंडिस कैसे काम करता है, इसके लिए सरल रूपकों का उपयोग किया गया है:
1. "वर्ल्ड ट्री" (अनंत मानचित्र)
एक विशाल, जीवित मानचित्र की कल्पना करें जिसमें सभी संभावित विषय एक पारिवारिक वृक्ष (फैमिली ट्री) की तरह व्यवस्थित हैं।
- तना (Trunk): व्यापक विषय (जैसे "गणित" या "कोडिंग")।
- शाखाएँ (Branches): विशिष्ट विषय (जैसे "बीजगणित" या "डीबगिंग")।
- पत्तियाँ (Leaves): विशिष्ट परिदृश्य (जैसे "एक द्विघात समीकरण को हल करना" या "एक टूटे हुए लूप को ठीक करना")।
आमतौर पर, यदि कोई रोबोट डेटा उत्पन्न करने की कोशिश करता है, तो वह बार-बार उन्हीं कुछ पत्तियों को चुन सकता है, जिससे उबाऊ और दोहराव वाला प्रशिक्षण होता है। एंडिस के पास सेल्फ-इवॉल्विंग रूटिंग (Self-Evolving Routing) नामक एक विशेष तंत्र है।
- स्मार्ट कंपास: जब रोबोट को "गणित" सीखने की आवश्यकता होती है, तो एंडिस केवल यादृच्छिक पत्तियाँ नहीं चुनता। यह गणित के लिए सबसे प्रासंगिक शाखाओं को खोजने के लिए एक कंपास का उपयोग करता है।
- बढ़ता हुआ पेड़: यदि रोबकी देखता है कि रोबोट बार-बार "बीजगणित" के लिए पूछ रहा है, तो एंडिस देखता है कि पेड़ वहां घनीभूत हो रहा है। पुराने उदाहरणों को फिर से उपयोग करने के बजाय, यह तुरंत नई शाखाएं और पत्तियां उगाता है। यह नए, अद्वितीय परिदृश्य बनाता है ताकि रोबोट कभी बोर न हो या दोहराव के चक्र में न फंसे।
2. "दो-चरणीय रसोई" (डेटा बनाना)
एक बार जब एंडिस पेड़ से सही "सामग्री" (विषय) चुन लेता है, तो यह उन्हें केवल कच्चा नहीं परोसता। यह उन्हें दो चरणों वाली रसोई से गुजारता है:
- चरण 1 (शेफ/रसोइया): यह प्रश्न और उत्तर का एक ड्राफ्ट तैयार करता है (जैसे एक कच्ची रेसिपी)।
- चरण 2 (फूड क्रिटिक/भोजन समीक्षक): दूसरा रोबोट व्यंजन का स्वाद चखता है। यह जाँचता है: "क्या यह बहुत सरल है? क्या तर्क टूटा हुआ है? क्या हम एक ही व्यंजन 50 बार बना रहे हैं?"
- यदि व्यंजन खराब है, तो उसे फेंक दिया जाता है।
- यदि वह ठीक है लेकिन उसमें सुधार की आवश्यकता है, तो शेफ उसे ठीक करता है।
- समीक्षक मुख्य रोबोट ट्रेनर के लिए एक रिपोर्ट कार्ड भी लिखता है।
3. "फीडबैक लूप" (संवाद)
यह सबसे महत्वपूर्ण हिस्सा है। पुराने सिस्टम में, रोबोट डेटा एक बार उत्पन्न करता था और रुक जाता था। एंडिस के साथ, यह एक संवाद है।
- समीक्षक द्वारा रिपोर्ट कार्ड लिखने के बाद, मुख्य रोबोट ट्रेनर उसे पढ़ता है।
- रिपोर्ट कह सकती है: "आपने 100 गणित की समस्याएं उत्पन्न कीं, लेकिन वे सभी जोड़ के बारे में थीं। आपको घटाव की अधिक आवश्यकता है, और इन तीन उदाहरणों में तर्क कमजोर था।"
- ट्रेनर रोबोट कहता है, "समझ गया!" और अपने अगले अनुरोध को घटाव पर ध्यान केंद्रित करने और तर्क को ठीक करने के लिए समायोजित करता है।
- एंडिस इस नए अनुरोध को सुनता है और अंतराल को भरने के लिए अगला डेटा बैच पूरी तरह से तैयार करता है।
यह एक बड़ी बात क्यों है?
शोधकर्ताओं ने इसका परीक्षण PostTrainBench नामक एक बेंचमार्क पर किया, जो मापता है कि रोबोट खुद को कितनी अच्छी तरह सिखा सकते हैं।
- संघर्ष: एंडिस के बिना, यहाँ तक कि बहुत उन्नत रोबोट भी अच्छे डेटा को खोजने में संघर्ष करते थे, और अक्सर उन बुनियादी मॉडलों से भी खराब प्रदर्शन करते थे जिन्हें वे सुधारने की कोशिश कर रहे थे। वे शोर में खो जाते थे या दोहराव के चक्र में फंस जाते थे।
- सफलता: जब शोधकर्ताओं ने अपेक्षाकृत "कमजोर" रोबोट को Andes स्किल दी, तो वह अचानक एक मास्टर टीचर बन गया। इसने इस बेंचमार्क पर अब तक का सर्वश्रेष्ठ परिणाम प्राप्त किया, और उन बहुत अधिक शक्तिशाली रोबोटों को भी पछाड़ दिया जिनके पास यह विशिष्ट टूल नहीं था।
सारांश में:
एंडिस इस समस्या को हल करता है कि "हम एक रोबोट को खुद को सिखाना कैसे सिखाएं?" यह उसे एक गतिशील, स्वयं-अपडेट होने वाला पुस्तकालय और एक स्मार्ट फीडबैक लूप देकर। इंटरनेट में बिना किसी दिशा के भटकने के लिए मजबूर करने के बजाय, एंडिस एक विशेष उपकरण के रूप में कार्य करता है जो तुरंत उच्च-गुणवत्ता वाला, विविध और सटीक रूप से लक्षित प्रशिक्षण उदाहरण उत्पन्न करता है, जबकि रोबोट की प्रगति के आधार पर अपनी गलतियों को लगातार सुधारता रहता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।