SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs
यह शोधपत्र SKILLGRAPH का प्रस्ताव करता है, जो एक ढांचा है जो कौशल को एक विकसित होते निर्देशित ग्राफ (directed graph) में नोड्स के रूप में प्रस्तुत करता है ताकि लार्ज लैंग्वेज मॉडल एजेंटों को कम्पोजिशनल कार्यों के लिए क्रमबद्ध कौशल उप-ग्राफ (skill subgraphs) प्राप्त करने में सक्षम बनाया जा सके, जिससे लाइब्रेरी रखरखाव और सुदृढीकरण शिक्षण (reinforcement learning) में अत्याधुनिक प्रदर्शन दोनों में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ SKILLGRAPH पेपर का सरल भाषा में अनुवाद दिया गया है:
बड़ी समस्या: "सपाट सूची" बनाम "रेसिपी बुक"
कल्पना कीजिए कि आप एक रोबोट बटलर को एक जटिल भोजन बनाना सिखा रहे हैं।
- पुराना तरीका (फ्लैट लाइब्रेरी): आप रोबोट को 1,000 टिप्स की एक विशाल, सपाट सूची देते हैं। वह कीवर्ड्स के लिए सूची खोजता है। यदि आप उससे "सैंडविच बनाने" के लिए कहते हैं, तो उसे "ब्रेड लें", "चीज़ लें" और "चाकू का उपयोग करें" जैसे टिप्स मिल सकते हैं। लेकिन सूची रोबोट को यह नहीं बताती कि कौन सा टिप पहले आना चाहिए, या कि ब्रेड लेने से पहले आप ब्रेड पर चीज़ नहीं रख सकते। रोबोट भ्रमित हो जाता है, गलत क्रम में चीजें करने की कोशिश करता है, और असफल हो जाता है।
- पेपर का समाधान (SKILLGRAPH): एक सपाट सूची के बजाय, रोबोट एक संरचित मानचित्र (ग्राफ) रखता है। इस मानचित्र में, "ब्रेड लें" "चीज़ रखें" से एक तीर के साथ जुड़ा है जो कहता है "इसे इसके बाद करें।" वह जानता है कि "चाकू का उपयोग करना" "चीज़ काटने" में मदद करता है, और "फ्रिज खोलना" "चीज़ लेने" के लिए एक पूर्व शर्त है।
SKILLGRAPH कैसे काम करता है: तीन-चरणीय लूप
पेपर एक ऐसा सिस्टम प्रस्तावित करता है जहाँ रोबोट का "मस्तिष्क" (पॉलिसी) और उसका "स्किल मैप" (ग्राफ) एक क्लोज्ड लूप में एक साथ बढ़ते और सुधरते हैं। इसे एक छात्र की तरह समझें जो वीडियो गेम खेलते हुए साथ-साथ गेम की स्ट्रैटेजी गाइड भी लिख रहा है।
1. मानचित्र बनाना (ग्राफ निर्माण - Graph Construction)
रोबोट कार्यों को हल करने की कोशिश करता है। कभी वह जीतता है, कभी हारता है।
- शिक्षक: एक स्मार्ट "टीचर AI" इन प्रयासों को देखता है।
- कौशल का सार (Distilling Skills): टीचर सफल प्रयासों को छोटे, पुन: प्रयोज्य "कौशलों" (जैसे "माइक्रोवेव चेक करें") में बदल देता है। वह विफलताओं को यह सीखने के सबक में बदल देता है कि क्या नहीं करना है।
- तीर खींचना: टीचर केवल कौशलों को लिखता ही नहीं है; वह उनके बीच तीर भी खींचता है। वह नोट करता है: "आपको किसी वस्तु को गर्म करने से पहले उसे उठाना होगा।" वह कनेक्शन का एक जाल बनाता है जो दिखाता है कि कौन से कौशल दूसरों पर निर्भर हैं।
2. मानचित्र को पढ़ना (ग्राफ-अवेयर रिट्रीवल - Graph-Aware Retrieval)
जब रोबोट एक नए कार्य का सामना करता है, तो वह केवल कीवर्ड्स नहीं खोजता। वह मानचित्र के माध्यम से यात्रा करता है।
- सीड सिलेक्शन (Seed Selection): वह शुरुआती बिंदु ढूंढता है (जैसे, "मुझे कुछ गर्म करने की आवश्यकता है")।
- पीछे और आगे की यात्रा: वह यह देखने के लिए पीछे देखता है कि इससे पहले क्या कदम आवश्यक हैं (जैसे, "मुझे पहले वस्तु ढूँढनी होगी") और यह देखने के लिए आगे देखता है कि इसके बाद क्या होगा (जैसे, "फिर मुझे इसे रखना होगा")।
- क्रमित सूची: वह सरल से जटिल तक चरणों की एक पूरी तरह से व्यवस्थित सूची निकालता है, यह सुनिश्चित करते हुए कि रोबोट कभी भी स्टेप 1 करने से पहले स्टेप 5 करने की कोशिश न करे।
3. मानचित्र को अपडेट करना (ग्राफ इवोल्यूशन - Graph Evolution)
यही जादुई हिस्सा है। मानचित्र स्थिर नहीं है; जैसे-जैसे रोबोट सीखता है, यह बदलता रहता है।
- गलतियाँ सुधारना: यदि कोई कौशल बार-बार विफल हो रहा है (जैसे, "फ्रिज खोलें" लेकिन रोबोट हमेशा दीवार से टकरा जाता है), तो सिस्टम उसे "डेप्रिकेटेड" (रद्दी) के रूप में चिह्नित करता है।
- नए कौशल जोड़ना: यदि रोबोट इसलिए विफल होता है क्योंकि उसे नहीं पता कि "तापमान कैसे जांचें," तो टीचर उसके लिए एक नया कौशल आविष्कार करता है और उसे मानचित्र में जोड़ देता है।
- विलय और विभाजन (Merging & Splitting): यदि दो कौशल मूल रूप से एक जैसे हैं, तो सिस्टम उन्हें मर्ज कर देता है। यदि एक कौशल बहुत अस्पष्ट है, तो वह उसे दो स्पष्ट कौशलों में विभाजित कर देता है।
- रास्ते मजबूत करना: यदि मानचित्र पर एक विशिष्ट पथ जीत की ओर ले जाता है, तो सिस्टम उस पथ को "मोटा" (मजबूत) बना देता है ताकि रोबोट अगली बार उसका उपयोग करने की अधिक संभावना रखे।
"लेवल अप" सिस्टम (प्रोग्रेसिव अनलॉकिंग)
कल्पना कीजिए कि एक वीडियो गेम में आप अंतिम बॉस से लड़ने तक नहीं लड़ सकते जब तक कि आपने बुनियादी तलवार चलाने के मूव्स में महारत हासिल न कर ली हो।
- SKILLGRAPH कौशलों को लेवल (Levels) में व्यवस्थित करता है।
- लेवल 0: बुनियादी कौशल (जैसे, "आगे बढ़ें")।
- लेवल 1: मध्यम कौशल (जैसे, "वस्तु उठाएं")।
- लेवल 2: जटिल कौशल (जैसे, "भोजन पकाएं")।
- रोबोट को लेवल 1 में कुशल साबित होने तक लेवल 2 के कौशलों से बाहर (lock out) रखा जाता है। यह रोबोट को बुनियादी बातों को समझने से पहले जटिल निर्देशों से अभिभूत होने से रोकता है।
परिणाम क्या दिखाते हैं
शोधकर्ताओं ने तीन प्रकार की चुनौतियों पर इसका परीक्षण किया:
- ALFWorld: एक टेक्स्ट-आधारित घर जहाँ रोबोट को सफाई, खाना बनाना और व्यवस्थित करना होता है।
- WebShop: एक सिम्युलेटेड ऑनलाइन स्टोर जहाँ रोबोट को विशिष्ट वस्तुओं को खोजना और खरीदना होता है।
- Search QA: कठिन सवालों के जवाब देना जिनके लिए कई चरणों में जानकारी खोजने की आवश्यकता होती है।
परिणाम:
- SKILLGRAPH ने लगभग हर अन्य विधि को हरा दिया, जिसमें बहुत स्मार्ट "क्लोज्ड-सोर्स" मॉडल (जैसे GPT-4o) और अन्य मेमोरी-आधारित सिस्टम शामिल थे।
- यह विशेष रूप से जटिल कार्यों के लिए अच्छा था जिनमें कई चरणों को जोड़ने की आवश्यकता थी।
- इसने तेजी से सीखा और कम गलतियाँ कीं क्योंकि इसे हर बार "पहिये का पुन: आविष्कार" नहीं करना पड़ा; इसने बस अपडेट किए गए मानचित्र का पालन किया।
संक्षेप में
SKILLGRAPH एक ऐसा सिस्टम है जो AI के अनुभव को नोट्स के ढेर के रूप में नहीं देखता। इसके बजाय, यह अनुभव को कौशल के एक जीवित, सांस लेते मानचित्र में व्यवस्थित करता है। जैसे-जैसे AI बेहतर होता है, मानचित्र और स्मार्ट होता जाता है, नए रास्ते जोड़ता है, बंद रास्तों को हटाता है, और AI को ठीक वही कदम उठाने की शिक्षा देता है जो उसे उठाने चाहिए और किस क्रम में। यह एक छात्र को यादों के रैंडम फ्लैशकार्ड देने बनाम उन्हें एक अच्छी तरह से व्यवस्थित टेक्स्टबुक देने के बीच का अंतर है जो उनके सीखने के साथ खुद को अपडेट करती रहती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।