SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration
स्किलफ्लो (SkillFlow) एक फ्लो-आधारित फ्रेमवर्क है जो टेम्पर्ड ट्रैजेक्टरी बैलेंस (Tempered Trajectory Balance) का उपयोग करता है ताकि एक प्रशिक्षित सुपरवाइजर एजेंट को विविध रणनीतियों और पारदर्शी क्रेडिट असाइनमेंट के साथ कार्य ऑर्केस्ट्रेशन को स्वचालित करने में सक्षम बनाया जा सके, जबकि यह विभिन्न जटिल कार्यों में बेहतर प्रदर्शन के लिए अपने स्किल लाइब्रेरी को स्वायत्त रूप से विकसित करने हेतु एक रिकर्सिव मैकेनिज्म का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े अनाड़ी रोबोट सहायक को जटिल पहेलियाँ हल करना सिखा रहे हैं, जैसे कि एक टूटी हुई वेबसाइट को ठीक करना, एक आभासी घर में रास्ता खोजना, या एक कठिन गणित की समस्या को हल करना।
अतीत में, हमने इन रोबोटों को दो मुख्य तरीकों से सिखाने की कोशिश की थी, जिनमें से दोनों में बड़ी समस्याएँ थीं:
- "कठोर नियमावली" (Rigid Manual) का तरीका: हमने रोबोट को नियमों और उपकरणों की एक निश्चित सूची दी। यदि रोबोट कहीं फंस जाता, तो वह एक नया उपकरण नहीं बना सकता था; वह बस विफल हो जाता।
- "प्रयास और त्रुटि" (Trial and Error) का तरीका: हमने रोबोट को लाखों चीज़ें रैंडमली आज़माने दिया। यदि वह सफल होता, तो हम अंत में उसे एक 'हाई-फाइव' देते। लेकिन क्योंकि "हाई-फाइव" केवल फिनिश लाइन पर मिलता था, रोबमा को यह पता नहीं चलता था कि किस विशिष्ट चाल ने अंतर पैदा किया। वह अक्सर केवल एक भाग्यशाली रास्ता सीख जाता था और किसी भी थोड़ी अलग स्थिति को संभालने का तरीका भूल जाता था (इसे "स्ट्रैटेजी कोलैप्स" कहा जाता है)।
SkillFlow प्रशिक्षण का एक नया तरीका है जो इन समस्याओं को हल करता है। यह यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. "फ्लो" मैप (एक एकल पथ के बजाय)
रोबोट की निर्णय लेने की प्रक्रिया को एक विशाल, शाखाओं वाली नदी प्रणाली (सभी संभावित विकल्पों का एक मानचित्र) के रूप में कल्पना करें।
- पुराना तरीका: रोबोट समुद्र तक पहुँचने के लिए एक सबसे तेज़ नदी खोजने की कोशिश करता है। यदि वह नदी सूख जाती है, तो रोबोट फंस जाता है।
- SkillFlow: रोबोट को केवल एक नदी चुनने के लिए मजबूर करने के बजाय, SkillFlow उसे पूरी नदी प्रणाली के प्रवाह (flow) को समझने की शिक्षा देता है। यह सीखता है कि सफलता की ओर ले जाने वाले कई अलग-अलग मार्ग हो सकते हैं, और यह सभी अच्छे रास्तों को खुला रखता है। इसे "रिवॉर्ड-प्रोपोर्शनल सैंपलिंग" (Reward-Proportional Sampling) कहा जाता है। यह कुछ ऐसा कहने जैसा है, "केवल एक भाग्यशाली मार्ग को याद मत करो; किसी भी नदी में कुशलता से तैरना सीखो जो सफलता की ओर ले जाती है।"
2. "टाइम-ट्रैवलिंग" कोच (ज़ीरो-कॉस्ट क्रेडिट)
आमतौर पर, जब रोबोट कोई गलती करता है, तो हमें अंत तक पता नहीं चलता कि वह कहाँ गलत हुआ।
- समस्या: यदि एक रोबोट पहेली सुलझाने के लिए 10 कदम उठाता है और विफल हो जाता है, तो क्या वह कदम 1 पर विफल हुआ या कदम 9 पर?
- SkillFlow का समाधान: SkillFlow एक विशेष "कोच" का उपयोग करता है जो भविष्य को देख सकता है। कार्य पूरा होने के बाद, कोच पीछे मुड़कर देखता है और हर एक कदम की जाँच करता है और कहता है, "आह, कदम 4 पर, आपने एक बेहतरीन चुनाव किया जिससे सफलता मिली," या "कदम 7 पर, आपने समय बर्बाद किया।"
- जादू: पेपर का दावा है कि इस "कोच" के लिए किसी अतिरिक्त कंप्यूटर पावर की आवश्यकता नहीं है। यह ऐसा है जैसे रोबोट काम पूरा होते ही अपना होमवर्क तुरंत खुद ग्रेड कर रहा है, बिना किसी दूसरे शिक्षक के आने और जाँच करने के। इसे "ज़ीरो-कॉस्ट पर-स्टेप क्रेडिट" (Zero-Cost Per-Step Credit) कहा जाता है।
3. "स्व-सुधारने वाला टूलबॉक्स" (रिकर्सिव स्किल इवोल्यूशन)
यह सबसे अनूठा हिस्सा है। अधिकांश रोबोटों के पास एक टूलबॉक्स होता है जो कभी नहीं बदलता। यदि उन्हें एक नए उपकरण की आवश्यकता होती है, तो वे इसे नहीं बना सकते।
- SkillFlow का समाधान: SkillFlow रोबोट के "प्रवाह" और "कोच" के फीडबैक पर नज़र रखता है। जब यह देखता है कि रोबोट किसी विशिष्ट उपकरण की कमी के कारण संघर्ष कर रहा है, तो यह उस कमी को भरने के लिए स्वचालित रूप से एक नया उपकरण (एक "कौशल") बनाता है।
- यह कैसे तय करता है?
- उपकरण कब जोड़ें? जब रोबोट बेहतर होना बंद कर देता है (जब "प्रवाह" एक पठार/प्लेटो पर पहुँच जाता है)।
- कौन से उपकरण जोड़ें? यह उन सटीक क्षणों को देखता है जहाँ रोबमान भ्रमित था और मदद के लिए एक नया निर्देश (एक "टिप") लिखता है।
- कौन से उपकरण फेंक दें? यह उन उपकरणों को हटा देता है जिनका उपयोग शायद ही कभी किया जाता है या जो भ्रम पैदा करते हैं।
- परिणाम: रोबोट का टूलबॉक्स स्वचालित रूप से बढ़ता और घटता है, जो उसके सामने आने वाले कार्यों के लिए पूरी तरह से अनुकूलित हो जाता है। यह एक ऐसे शेफ की तरह है जो, हज़ार भोजन बनाने के बाद, महसूस करता है कि उसे एक विशिष्ट नए चाकू की आवश्यकता है, वह उसे आविष्कार करता है, और उन कुंद (dull) चाकुओं को फेंक देता है जिनका वह उपयोग नहीं करता।
बड़ी तस्वीर
इस सिस्टम का परीक्षण 14 अलग-अलग प्रकार की चुनौतियों पर किया गया, जिसमें सामान्य ज्ञान के प्रश्नों के उत्तर देने से लेकर कोड लिखने और आभासी दुनिया में नेविगेट करने तक शामिल थे।
परिणाम:
- बेहतर सटीकता: SkillFlow रोबोट ने पुराने तरीकों से प्रशिक्षित रोबोटों की तुलना में अधिक समस्याओं को सही ढंग से हल किया।
- अधिक लचीलापन: क्योंकि यह कई रास्ते खुले रखता है (प्रवाह), इसलिए कार्य में थोड़ा बदलाव होने पर यह भ्रमित नहीं हुआ।
- सस्ता: इसने तेज़ी से सीखा और कम कंप्यूटर संसाधनों का उपयोग किया क्योंकि इसने एक ही गलती को बार-बार सीखने या अतिरिक्त "कोच" सत्रों की आवश्यकता में समय बर्बाद नहीं किया।
संक्षेप में, SkillFlow AI एजेंटों को न केवल एक सही उत्तर खोजने के लिए, बल्कि सभी संभावित उत्तरों के परिदृश्य (landscape) को समझने, अपने चरणों को तुरंत ग्रेड करने और जो भी आगे आए उसे संभालने के लिए एकदम सही टूलबॉक्स बनाने के लिए सिखाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।