← नवीनतम पेपर
💻 computer science

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

यह शोध पत्र LEACL का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो लंबी अवधि के हेरफेर कार्यों (long-horizon manipulation tasks) को स्वचालित रूप से विभाजित करने और आवश्यक विशिष्टताओं को उत्पन्न करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे सुदृढीकरण सीखने (reinforcement learning) वाले एजेंटों को केवल स्पार्स रिवॉर्ड्स (sparse rewards) का उपयोग करके स्वचालित पाठ्यक्रम शिक्षण (automatic curriculum learning) के माध्यम से उत्कृष्ट प्रदर्शन प्राप्त करने में सक्षम बनाया जा सके, जिसमें मैन्युअल रूप से डिज़ाइन किए गए डेंस रिवॉर्ड फंक्शन्स की आवश्यकता नहीं होती है।

मूल लेखक: Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

प्रकाशित 2026-07-28
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन, जैसे कि एक शानदार सैंडविच बनाना सिखाने की कोशिश कर रहे हैं। आप केवल रोबोट को यह नहीं कह सकते कि "सैंडविच बनाओ," और उम्मीद नहीं कर सकते कि वह टमाटर को काटना, ब्रेड पर मक्खन लगाना और परतों को सही ढंग से सजाना खुद ही समझ जाएगा। यदि आप रोबोट को केवल अंत में "अच्छा काम किया" या "बुरा काम किया" का संकेत देते हैं, तो वह वर्षों तक बिना किसी दिशा के भटकता रहेगा, और कभी भी विशिष्ट चरणों को नहीं सीख पाएगा। यह रीइन्फोर्समेंट लर्निंग (Reinforcement Learning - RL) की दुनिया है, जहाँ सॉफ्टवेयर एजेंट प्रयास और त्रुटि (trial and error) से सीखते हैं। पेचीदा हिस्सा "स्पार्स रिवॉर्ड" (sparse reward) की समस्या है: यदि रोबोट को केवल तभी इनाम मिलता है जब कार्य 100% पूरा हो जाता है, तो उसे पता ही नहीं चलता कि वह लक्ष्य के करीब पहुँच रहा है या उससे दूर जा रहा है। इसे ठीक करने के लिए, वैज्ञानिक अक्सर करिकुलम लर्निंग (Curriculum Learning) का उपयोग करते हैं, जो एक ऐसी विधि है जहाँ रोबमाट पहले कार्य के आसान संस्करणों (जैसे केवल ब्रेड उठाना) का अभ्यास करता है और फिर कठिन कार्यों (जैसे टमाटर काटना) की ओर बढ़ता है। लेकिन यहाँ एक पेंच है: इन आसान-से-कठिन चरणों को डिजाइन करने के लिए आमतौर पर एक मानव विशेषज्ञ को हर एक नियम और कठिनाई सेटिंग को मैन्युअल रूप से लिखना पड़ता है, जो धीमा, उबाऊ और हर नए कार्य के लिए करना कठिन है।

यहाँ LEACL (LLM-Enhanced Automatic Curriculum Learning) आता है, जो एक बहुत ही स्मार्ट सवाल पूछता है: "क्या हम एक सुपर-इंटेलिजेंट AI लैंग्वेज मॉडल से हमारे लिए उबाऊ प्लानिंग का काम करवा सकते हैं?" इस पेपर के पीछे के शोधकर्ताओं ने यह देखना चाहा कि क्या वे एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग कर सकते हैं—वही तकनीक जो चैटबॉट्स को शक्ति देती है—एक मास्टर टीचर के रूप में। इंसानों द्वारा मैन्युअल रूप से लेसन प्लान लिखने के बजाय, LLM एक प्राकृतिक भाषा के लक्ष्य (जैसे "दराज खोलें") को पढ़ेगा और स्वचालित रूप से इसे छोटे, प्रबंधनीय चरणों के क्रम में तोड़ देगा। इससे भी बेहतर बात यह है कि LLM फिर प्रत्येक चरण के लिए विशिष्ट "ट्रेनिंग व्हील्स" (कठिनाई सेटिंग्स और पैरामीटर) को डिजाइन करेगा, जिससे रोबोट केवल अंत में मिलने वाले सरल "सफलता/विफलता" के संकेत का उपयोग करके सीख सकेगा, बिना हर छोटी हरकत के लिए जटिल, हाथ से लिखे गए रिवॉर्ड निर्देशों के।

यह पेपर पाँच कठिन रोबोट कार्यों पर इस विचार का परीक्षण करता है, जैसे कैबिनेट का दराज खोलना, प्लेट पर कटोरा रखना, या चूल्हा चालू करना। इसके परिणाम काफी उत्साहजनक हैं। शोधकर्ताओं ने पाया कि जब उन्होंने LLM को करिकुलम (पाठ्यक्रम) डिजाइन करने दिया, तो रोबोट ने इन लंबे, जटिल कार्यों को बिना किसी मदद के एक साथ सीखने की तुलना में बहुत तेज़ी से और अधिक सफलतापूर्वक सीखा। वास्तव में, LLM-डिज़ाइन किया गया सिस्टम उन सिस्टम्स के समान ही अच्छा प्रदर्शन करता है, और कभी-कभी उनसे भी बेहतर, जहाँ मानव विशेषज्ञों ने घंटों तक मैन्युअल रूप से प्रशिक्षण चरणों और रिवॉर्ड नियमों को तैयार किया था। यह अध्ययन बताता है कि प्रशिक्षण प्रक्रिया के हर एक विवरण को नियंत्रित करने के लिए मानव की आवश्यकता के बिना, हम रोबोट को जटिल, बहु-चरणीय कार्य करने के लिए कैसे सिखा सकते हैं।

रोबोट का स्कूल का दिन: LEACL कैसे काम करता है

एक रोबोट को एक लंबे समय तक चलने वाले कार्य (जिसे "लॉन्ग-होरिज़न" कार्य कहा जाता है, जिसका अर्थ है एक ऐसा काम जिसे पूरा करने के लिए कई चरणों की आवश्यकता होती है) को सीखने की प्रक्रिया को एक छात्र द्वारा अंतिम परीक्षा पास करने की कोशिश करने जैसा समझें। यदि शिक्षक केवल अंत में ग्रेड देता है, तो छात्र गलत चीज़ें पढ़ सकता है या पूरी तरह से हार मान सकता है। ऑटोमैटिक करिकुलम लर्निंग (ACL) एक ट्यूटर की तरह है जो एक सिलेबस बनाता है, आसान सवालों से शुरू करता है और धीरे-धीरे उन्हें कठिन बनाता जाता है। लेकिन आमतौर पर, एक इंसान को वह सिलेबस लिखना पड़ता है।

LEACL एक LLM को मुख्य शिक्षक बनाकर खेल बदल देता है। यह प्रक्रिया तीन मजेदार चरणों में होती है:

  1. ब्रेकडाउन (कार्य का विखंडन - Task Decomposition):
    कल्पना कीजिए कि आप रोबोट को कहते हैं, "कैबिनेट का ऊपरी दराज खोलें।" एक इंसान सोच सकता है, "ठीक है, यह सिर्फ एक काम है।" लेकिन LLM इसे देखता है और कहता, "बिल्कुल नहीं! यह वास्तव में तीन काम हैं: पहला, दराज की ओर हाथ बढ़ाएं। दूसरा, हैंडल को पकड़ें। तीसरा, इसे खींचकर खोलें।" LLM दुनिया के बारे में अपने विशाल ज्ञान का उपयोग करता है (जैसे यह जानना कि आप दराज तब तक नहीं खींच सकते जब तक आप हैंडल नहीं पकड़ते) ताकि वह बड़े लक्ष्य को छोटे उप-कार्यों की एक तार्किक श्रृंखला में तोड़ सके। यह इन चरणों को एक विशेष "रेसिपी भाषा" में लिखता है जिसे PDDD कहा जाता है, जिसे रोबोट समझ सकता है।

  2. लेसन प्लान (मेटा-टास्क जनरेशन - Meta-Task Generation):
    अब जब रोबोट के पास चरण हैं, तो उसे यह जानने की आवश्यकता है कि उन्हें कैसे अभ्यास करना है। क्या उसे दराज को थोड़ा खुला रखकर शुरू करना चाहिए? या पूरी तरह से बंद? क्या हैंडल पास होना चाहिए या दूर? यहीं पर LLM फिर से चमकता है। यह एक रचनात्मक करिकुलम डिजाइनर के रूप में कार्य करता है, जो प्रत्येक चरण के लिए एक "टास्क स्पेस" तैयार करता है। यह एक पायथन स्क्रिप्ट बनाता है जो "हैंडल पकड़ने" के हजारों थोड़े अलग संस्करण उत्पन्न कर सकती है। कुछ बहुत आसान हैं (हैंडल रोबोट के ठीक सामने है), और कुछ कठिन हैं (हैंडल थोड़ा दूर है)। LLM यह भी पता लगाता है कि कौन से संस्करण दूसरों की तुलना में "कठिन" हैं, जिससे रोबोट के चढ़ने के लिए कठिनाई की एक आदर्श सीढ़ी तैयार होती है।

  3. अभ्यास (ऑटोमैटिक करिकुलम लर्निंग - Automatic Curriculum Learning):
    अंत में, रोबोट प्रशिक्षण शुरू करता है। यह एक ऐसे एल्गोरिदम का उपयोग करता है जो यह देखता है कि रोबोट कितना अच्छा प्रदर्शन कर रहा है। यदि रोबोट कार्य के "आसान" संस्करणों में महारत हासिल कर रहा है, तो सिस्टम स्वचालित रूप से "मध्यम" कठिनाई वाले संस्करणों पर स्विच कर देता है। यदि रोबोट संघर्ष कर रहा है, तो वह वापस आसान संस्करणों पर चला जाता है। रोबोट केवल प्रत्येक उप-कार्य के अंत में सफलता के लिए "1" और विफलता के लिए "0" का उपयोग करके सीखता है। उसे यह बताने के लिए किसी इंसान की ज़रूरत नहीं है कि, "अच्छा काम किया, तुमने अपना हाथ 2 इंच करीब लाया।" LLM द्वारा पूर्व-नियोजित करिकुलम मार्गदर्शन का सारा भारी काम करता है।

परिणाम: क्या रोबोट ने परीक्षा पास की?

शोधकर्ताओं ने एक सिमुलेशन का उपयोग करके पाँच अलग-अलग चुनौतियों पर इस प्रणाली का परीक्षण किया जिसे LIBERO (जिसे उन्होंने इन नए प्रकार के कार्यों को संभालने के लिए LIBERO+ के रूप में अपग्रेड किया था) कहा जाता है। कार्यों में शामिल थे:

  • निचला दराज खोलना।
  • एक सफेद कटोरा प्लेट पर रखना।
  • केचप उठाना और उसे टोकरी में रखना।
  • चूल्हा चालू करना और उस पर बर्तन रखना।
  • मग को माइक्रोवेव में रखना और दरवाजा बंद करना।

उन्होंने अपने LLM-संचालित सिस्टम (LEACL) की तुलना कई अन्य विधियों से की:

  • "कुछ न करने वाला" दृष्टिकोण (The "Do Nothing" approach): बस रोब का स्पारस रिवॉर्ड के साथ पूरा काम सीखने की कोशिश करने देना। (स्पॉइलर: यह पूरी तरह से विफल रहा, अधिकांश कार्यों पर 0% सफलता मिली)।
  • "नो करिकुलम" दृष्टिकोण (The "No Curriculum" approach): कार्य को तोड़ना लेकिन रोबोट को बिना किसी स्मार्ट कठिनाई सीढ़ी के प्रत्येक चरण सीखने देना। (यह भी बुरी तरह विफल रहा, सफलता दर 0% या बहुत कम रही)।
  • "मानव विशेषज्ञ" दृष्टिकोण (The "Human Expert" approach): जहाँ इंसानों ने मैन्युअल रूप से चरणों और रिवॉर्ड फंक्शन को डिजाइन किया (रोबोट को लक्ष्य के करीब आने के लिए अतिरिक्त अंक देना)। इसे आमतौर पर गोल्ड स्टैंडर्ड माना जाता है।
  • "LEAGUE" दृष्टिकोण: एक पिछला तरीका जो प्रत्येक चरण के लिए डेंस (dense) रिवॉर्ड फंक्शन (जटिल स्कोरिंग नियम) लिखने के लिए LLM का उपयोग करता है।

यहाँ क्या हुआ:
LEACL सिस्टम, जिसने करिकुलम को प्लान करने के लिए LLM का उपयोग किया लेकिन केवल सरल "सफलता/विफलता" सिग्नल पर भरोसा किया, उस सिस्टम से बेहतर प्रदर्शन कर गया जिसने बिना करिकुलम के सीखने की कोशिश की थी। अधिक प्रभावशाली बात यह है कि इसने पाँच में से चार कार्यों पर LEAGUE सिस्टम (जो जटिल, हाथ से ट्यून किए गए रिवॉर्ड नियमों का उपयोग करता था) से बेहतर प्रदर्शन किया।

शुद्ध आंकड़ों के मामले में, LEACL सिस्टम ने दराज खोलने के लिए 99.8% और प्लेट पर कटोरा रखने के लिए 90.7% जैसी सफलता दर हासिल की। ये संख्याएँ "ह्यूमन करिकुलम" के बहुत करीब थीं, जहाँ विशेषज्ञों ने सब कुछ मैन्युअल रूप से डिजाइन किया था। उदाहरण के लिए, "निचला दराज खोलने" के कार्य पर, मानव-डिज़ाइन किए गए सिस्टम ने 99.8 ± 0.2% प्राप्त किया, जबकि LEACL ने 99.8 ± 0.1% प्राप्त किया। "मग को माइक्रोवेव में रखने" के कार्य पर, मानव सिस्टम ने 89.0 ± 7.5% प्राप्त किया, जबकि LEACL ने 75.9 ± 3.4% प्राप्त किया।

यह क्यों मायने रखता है (और यह क्या नहीं करता है)

बड़ा निष्कर्ष यह है कि जटिल रिवॉर्ड फंक्शन डिजाइन करना कठिन है और अक्सर अनावश्यक है। पेपर का तर्क है कि रोबोट को एक "डेंस" रिवॉर्ड देने की कोशिश करना (जैसे "आपको 0.5 अंक मिलते हैं क्योंकि आपने हाथ को लक्ष्य के करीब लाया") वास्तव में एक जाल है। यह रोबोट को भ्रमित कर सकता है, जिससे वह गलत चीजों को प्राथमिकता देने लगता है या ऐसी "लापरवाह" आदतें विकसित कर लेता है जहाँ वह लक्ष्य के करीब तो पहुँच जाता है लेकिन काम को पूरी तरह से कभी पूरा नहीं कर पाता। यह देखते हुए कि LLM संरचना (करिकुलम) को संभालता है और रोबोट को सफलता या विफलता की सरल सच्चाई से सीखने देता है, रोबोट अधिक सटीक और विश्वसनीय कौशल सीखता है।

हालाँकि, पेपर सावधानी से यह भी नोट करता है कि इसकी कुछ सीमाएँ हैं। LLM को काम करने के लिए अभी भी एक "शब्दकोश" (जो संभव है उसका एक पूर्व-निर्धारित सेट या नियम) की आवश्यकता होती है। यह हवा में नए भौतिक विज्ञान या वस्तुओं का आविष्कार नहीं कर सकता; इसे सिमुलेशन (जैसे LIBERO+ वातावरण) के नियमों के भीतर काम करना होगा। साथ से, जबकि LLM ने बहुत अच्छा काम किया, मानव-डिज़ाइन किया गया करिकुलम अभी भी पाँच में से तीन कार्यों में थोड़ा आगे रहा, जो यह सुझाव देता है कि मानव अंतर्ज्ञान की अभी भी भूमिका है, भले ही LLM इसमें बहुत अच्छा होता जा रहा हो।

संक्षेप में, LEACL सुझाव देता है कि अब हमें रोबोटों के लिए विस्तृत निर्देश मैनुअल लिखने की आवश्यकता नहीं है। हम बस रोबोट को एक लक्ष्य दे सकते हैं, एक AI लैंग्वेज मॉडल को यह तय करने दे सकते हैं कि उसे सबसे अच्छा तरीके से कैसे सिखाया जाए, और रोबोट को अपने आप जटिल, बहु-चरणीय कार्य करने के लिए सीखते हुए देख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →