HERAKLES: Hierarchical Skill Compilation for Open-ended LLM Agents
HERAKLES एक पदानुक्रमित एजेंट है जो प्राप्त करने योग्य उप-लक्ष्यों (subgoals) के चयन के लिए एक उच्च-स्तरीय LLM नीति को एक निम्न-स्तरीय नियंत्रक के साथ जोड़ता है जो सफल व्यवहारों को पुन: प्रयोज्य कौशलों में संकलित करता है, जिससे आंशिक रूप से दृश्यमान वातावरणों में कुशल ओपन-एंडेड अन्वेषण और कौशल संयोजन सक्षम होता है जहाँ पुरस्कार विरल (sparse) होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
स्वयं-शिक्षण रोबोट की खोज
कल्पना कीजिए कि एक ऐसी दुनिया जहाँ कंप्यूटर केवल इंसान द्वारा लिखे गए सख्त नुस्खों का पालन नहीं करते, बल्कि वे खुद खाना बनाना, निर्माण करना और अन्वेषण करना सीखते हैं, और हर दिन अधिक स्मार्ट होते जाते हैं। यह आर्टिफिशियल इंटेलिजेंस में "ओपन-एंडेड लर्निंग" (open-ended learning) का सपना है। लंबे समय से, AI एक ऐसे छात्र की तरह रहा है जो एक विशाल पाठ्यपुस्तक को रट लेता है लेकिन उस प्रश्न के आने पर जम जाता है जो किताब में नहीं है। हालाँकि, असली इंसान अलग होते हैं। हम केवल रटते नहीं हैं; हम कौशल का एक पुस्तकालय बनाते हैं। जब हम साइकिल चलाना सीखते हैं, तो हम केवल संतुलन बनाना नहीं सीखते; हम पैडल मारना, स्टीयर करना और ब्रेक लगाना अलग-अलग उपकरणों के रूप में सीखते हैं जिन्हें हम बाद में मोटरसाइकिल चलाना सीखने के लिए आपस में मिला सकते हैं।
आप जो शोध पत्र पढ़ने जा रहे हैं, वह इस क्षेत्र में एक विशिष्ट समस्या का समाधान करता है: हम एक AI एजेंट को जीवन भर बिना अटके कैसे सिखा सकते हैं? मुख्य विचार "पदानुक्रमित शिक्षण" (hierarchical learning) है। इसे एक कंपनी की तरह समझें जिसमें एक बॉस और एक कर्मचारी होता है। बॉस (उच्च-स्तरीय मस्तिष्क) सारा भारी काम नहीं करता; इसके बजाय, वे बड़े, डरावले प्रोजेक्ट्स को छोटे, प्रबंधनीय कार्यों में तोड़ देते हैं। कर्मचारी उन कार्यों को करता है, और एक बार जब वे उनमें बहुत अच्छे हो जाते हैं, तो वे कार्य "कौशल" बन जाते हैं जिन्हें बॉस बस एक शब्द के आदेश से चला सकता है। यह शोध पत्र यह पता लगाने के बारे में है कि एक रोबोट को स्वचालित रूप से यह कैसे बनाया जाए, जो चुनौतियों के एक अराजक ढेर को क्षमताओं के एक व्यवस्थित, संगठित टूलबॉक्स में बदल सके।
HERAKLES की कहानी: वह रोबोट जो अपना टूलबॉक्स खुद बनाता है
HERAKLES से मिलिए, एक नए प्रकार का रोबोट मस्तिष्क जिसे आजीवन सीखने वाला बनने के लिए डिज़ाइन किया गया है। कल्पना कीजिए कि आप एक विशाल, रहस्यमय जंगल को जीतने की कोशिश कर रहे एक युवा साहसी हैं। शुरुआत में, आप केवल एक समय में एक कदम उठाना जानते हैं। यदि आप एक दूर के पहाड़ तक पहुँचना चाहते हैं, तो आपको हर एक कदम को शुरू से समझना होगा, जो थका देने वाला और धीमा है। आप पहले पहाड़ी तक पहुँचने से पहले ही थक सकते हैं और हार मान सकते हैं।
HERAKLES इसे दो अलग-अलग भूमिकाओं वाली एक स्मार्ट टीम के रूप में कार्य करके हल करता है। पहली भूमिका है जनरल (high-level policy), जो एक बहुत ही स्मार्ट, भाषा-जानने वाला AI है। दूसरी भूमिका है सोल्जर (low-level policy), जो एक तेज़, कुशल रोबोट है जो वास्तव में शरीर को हिलाता है और वस्तुओं को उठाता है।
यहाँ जादू कैसे होता है:
1. जनरल योजना बनाता है, सोल्जर क्रियान्वित करता है
जब जनरल "पत्थर की कुल्हाड़ी बनाएँ" जैसा बड़ा लक्ष्य देखता है, तो वह इसे एक साथ करने की कोशिश नहीं करता। इसके बजाय, वह देखता है कि सोल्जर पहले से क्या कर सकता है। शायद सोल्जर जानता है कि "लकड़ी काटना" और "मेज रखना" क्या है। जनरल बड़े लक्ष्य को छोटे हिस्सों में तोड़ देता है: "पहले, लकड़ी काटो। फिर, मेज रखो। अंत में, कुल्हाड़ी बनाओ।" जनरल इन छोटे आदेशों को सोल्जर को देता है।
2. "स्किल कंपाइलेशन" (Skill Compilation) का तरीका
यहीं पर HERAKLES वास्तव में चतुर हो जाता है। हर बार जब सोल्जर "लकड़ी काटना" जैसा कोई कार्य सफलतापूर्वक पूरा करता है, तो जनरल उसे केवल भूल नहीं जाता। वे उस पूरे मूवमेंट सीक्वेंस को लेते हैं और उसे एक एकल, पुन: प्रयोज्य (reusable) कौशल में "कंपाइल" कर देते हैं। यह वैसा ही है जैसे सोल्जर साइकिल चलाना सीखता है, और अचानक, जनरल सिर्फ "पैडल मारो, स्टीयर करो, बैलेंस करो, पैडल मारो, स्टीयर करो..." कहने के बजाय "नदी तक जाओ" कह सकता है।
जैसे-जैसे रोबोट अधिक सीखता है, उसके कौशलों का टूलबॉक्स बढ़ता जाता है। जनरल के पास बड़े और बड़े "विकल्पों" (options) तक पहुँच होती है। घर बनाने के लिए 100 छोटे कदम उठाने के बजाय, जनरल शायद सिर्फ "दीवार बनाओ" (एक कौशल जिसे सोल्जर पहले ही मास्टर कर चुका है) और "छत बनाओ" (एक अन्य मास्टर किया गया कौशल) कह सकता है। यह रोबोट को बहुत तेज़ और अधिक कुशल बनाता है।
3. सुरक्षा फ़िल्टर (Safety Filter)
जनरल इतना स्मार्ट है कि वह जानता है कि सोल्जर अभी क्या नहीं कर सकता। यदि सोल्जर ने अभी तक "आग जलाना" नहीं सीखा है, तो जनरल उससे ऐसा करने के लिए नहीं कहेगा, क्योंकि इससे केवल विफलता और भ्रम होगा। सिस्टम एक विशेष "क्षमता जांचकर्ता" (competency checker) का उपयोग करता है ताकि जनरल को केवल वे लक्ष्य दिए जा सकें जिन्हें पूरा करने की सोल्जर के पास अच्छी संभावना हो। यह सीखने की प्रक्रिया को सुचारू रखता है और रोबोट को असंभव कार्यों पर अटकने से रोकता है।
उन्होंने क्या पाया
शोधकर्ताओं ने HERAKLES का परीक्षण Crafter नामक एक डिजिटल दुनिया में किया, जो Minecraft का एक 2D संस्करण है जहाँ आपको जीवित रहने के लिए संसाधन इकट्ठा करने और चीजें बनाने की आवश्यकता होती है। लक्ष्य यह देखना था कि क्या HERAKLES बिना किसी इंसान द्वारा हर कदम सिखाए, समय के साथ कठिन से कठिन कार्य करने में सक्षम है।
उन्होंने HERAKLES की तुलना अन्य AI विधियों से की:
- "सब कुछ करने वाला" रोबोट: एक रोबोट जो हर बार शून्य से हर छोटा कदम सीखने की कोशिश करता है। यह रोबोट जल्दी ही फंस गया क्योंकि जटिल कार्यों को सीखने में बहुत अधिक समय लगा।
- "जमा हुआ मस्तिष्क" वाला रोबोट: एक रोबोट जो एक स्मार्ट मस्तिष्क का उपयोग करता है लेकिन अपने शरीर के कौशल को स्थिर रखता है, कभी भी नए शारीरिक करतब नहीं सीखता।
- "छिपे हुए कोड" वाला रोबोट: एक रोबोट जो कौशल सीखने की कोशिश करता है लेकिन स्पष्ट भाषा के बजाय एक गुप्त कोड का उपयोग करता है, जिससे कौशलों को तार्किक रूप से जोड़ना कठिन हो जाता है।
परिणाम:
लंबे समय के मामले में HERAKLES स्पष्ट विजेता था। जबकि अन्य रोबोट कुछ आसान कार्यों (जैसे पेड़ तक चलना) को सीखने के बाद ही अटक गए, HERKLAS बेहतर होता गया। प्रशिक्षण के अंत तक (250,000 स्टेप्स के बाद), HERAKLES ने पत्थर की कुल्हाड़ी जैसी जटिल वस्तुएं बनाना सीख लिया था, जबकि अन्य बुनियादी कार्यों के लिए संघर्ष कर रहे थे।
शोध पत्र सुझाव देता है कि HERAKLES "सैंपल एफिशिएंसी" (sample efficiency) में बहुत बेहतर है, जिसका अर्थ है कि यह कम प्रयासों से अधिक सीखता है। इसने अद्भुत लचीलापन भी दिखाया। जब शोधकर्ताओं ने HERAKLES को ऐसी चीजें करने के लिए कहा जो उसने पहले कभी नहीं देखी थीं, जैसे "लकड़ी इकट्ठा करें" के बजाय "4 लकड़ियाँ इकट्ठा करें", या "collect wood" के बजाय "acquire wood" जैसे समानार्थी शब्द का उपयोग करना, तो यह लगभग हर बार सफल रहा। यह यह समझने में भी सक्षम था कि "लकड़ी की तलवार" कैसे बनाई जाए, बस यह महसूस करके कि यह "लकड़ी की कुल्हाड़ी" के बहुत समान है जिसे उसने पहले ही बनाना सीख लिया था।
यह क्यों महत्वपूर्ण है
लेखक सुझाव देते हैं कि यह तरीका एक ऐसे AI बनाने की दिशा में एक बड़ा कदम है जो वास्तव में अपने आप बढ़ और अनुकूलित हो सके। AI को अपने स्वयं के कौशल का पुस्तकालय बनाने और फिर उन कौशलों का उपयोग कठिन चुनौतियों का सामना करने के लिए करने देकर, HERAKLES उस "फंस जाने" की भावना से बच जाता है जो कई अन्य लर्निंग सिस्टम के साथ होती है।
हालाँकि, शोध पत्र इसकी सीमाओं को भी स्वीकार करता है। वर्तमान में, जनरल केवल टेक्स्ट (पाठ) समझता है, चित्र नहीं, इसलिए वह दुनिया को सीधे देख नहीं सकता। इसके अलावा, सिस्टम को शुरू करने के लिए लक्ष्यों की एक सूची की आवश्यकता होती; यह अभी खुद लक्ष्य आविष्कार नहीं करता है। लेकिन एक ऐसा रोबोट बनाने का विचार जो अपने अनुभवों को नए, पुन: प्रयोज्य कौशलों में "कंपाइल" कर सकता है, एक शक्तिशाली अवधारणा है। यह एक ऐसे भविष्य का संकेत देता है जहाँ AI एजेंट केवल अतीत को याद नहीं करते, बल्कि सीखने के अनंत भविष्य के लिए एक नींव सक्रिय रूप से बनाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।