← नवीनतम पेपर
🤖 machine learning

SLAP: Shortcut Learning for Abstract Planning

यह शोधपत्र SLAP का प्रस्ताव करता है, जो एक ऐसी विधि है जो मौजूदा टास्क एंड मोशन प्लानिंग (TAMP) फ्रेमवर्क के भीतर नए एब्स्ट्रैक्ट एक्शन "शॉर्टकट्स" को स्वचालित रूप से खोजने के लिए मॉडल-फ्री रीइन्फोर्समेंट लर्निंग का लाभ उठाती है, जिससे पारंपरिक प्लानिंग और पदानुक्रमित (hierarchical) RL दृष्टिकोणों की तुलना में योजना की लंबाई काफी कम हो जाती है और कार्य सफलता दर में सुधार होता है।

मूल लेखक: Y. Isabel Liu, Bowen Li, Benjamin Eysenbach, Tom Silver

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Y. Isabel Liu, Bowen Li, Benjamin Eysenbach, Tom Silver

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिखरे हुए कमरे को साफ करने की कोशिश कर रहे हैं। आपके पास नियमों का एक सख्त सेट (एक "मैनुअल") है जो आपको बताता है कि चीजों को ठीक से कैसे हिलाना है: एक खिलौना उठाओ, बिन (डिब्बे) तक चलो, खिलौना छोड़ो।

यदि ब्लॉकों का एक टावर किसी विशिष्ट स्थान को रोक रहा है, तो मैनुअल कहता है: "ब्लॉक A उठाओ, उसे हटाओ। ब्लॉक B उठाओ, उसे हटाओ। ब्लॉक C उठाओ, उसे हटाओ।" आप इसे एक-एक करके तब तक करते हैं जब तक कि वह स्थान खाली न हो जाए। यह काम करता है, लेकिन इसमें बहुत समय लगता है।

हालाँकि, एक चतुर बच्चा मैनुअल का पालन नहीं करेगा। वह जिस खिलौने की जरूरत है उसे उठाएगा, और फिर अपने हाथ से ब्लॉकों के पूरे टावर को एक झटके में थप्पड़ (slap) मारकर एक तरफ हटा देगा, जिससे जगह तुरंत साफ हो जाएगी, और फिर वह खिलौना छोड़ देगा। यह तेज़ है, थोड़ा अस्त-व्यस्त है, और मैनुअल में नहीं है, लेकिन यह काम को सफलतापूर्वक पूरा कर देता है।

यह पेपर रोबोट्स को वही चतुर बच्चा बनने की शिक्षा देने के बारे में है।

यहाँ SLAP (एब्स्ट्रैक्ट प्लानिंग के लिए शॉर्टकट लर्निंग) का सरल शब्दों में विवरण दिया गया है:

1. समस्या: रोबोट बहुत कठोर है

वर्तमान रोबोट एक "टू-डू लिस्ट" (जिसे टास्क एंड मोशन प्लानिंग कहा जाता है) का पालन करने में माहिर होते हैं। वे एक बड़े काम को छोटे, तार्किक चरणों में तोड़ सकते हैं जैसे "उठाना," "रखना," और "हटाना।"

  • कमी: रोबट केवल वही कर सकता है जो इंसानों ने स्पष्ट रूप से उसे प्रोग्राम किया है। यदि रोबट को रास्ता साफ करने के लिए ब्लॉकों के टावर को "थप्पड़" मारना पड़ता है, तो वह ऐसा नहीं कर पाएगा क्योंकि "थप्पड़ मारना" उसकी स्वीकृत गतिविधियों की सूची में नहीं है। वह ब्लॉकों को एक-एक करके हटाने की कोशिश करेगा, जो धीमा और अक्षम है।

2. समाधान: SLAP (रोबोट का "अहा!" क्षण)

लेखकों ने SLAP नामक एक सिस्टम बनाया है। SLAP को एक स्मार्ट कोच की तरह समझें जो रोबोट को समस्या सुलझाते हुए देखता है और कहता है, "हे, तुम इसे कठिन तरीके से कर रहे हो। चलो एक शॉर्टकट आज़माते हैं।"

SLAP कैसे काम करता है, इसे एक वीडियो गेम एनालॉजी से समझते है:

  • मैप (एब्स्ट्रैक्ट प्लानिंग): एक वीडियो गेम लेवल के मैप की कल्पना करें। रोबोट "आधिकारिक" रास्तों को जानता है (लंबे, घुमावदार रास्ते जहाँ वह एक बार में एक ब्लॉक हटाता है)।
  • चीट कोड्स (शॉर्टकट): SLAP एक तकनीक का उपयोग करता है जिसे रीइन्फोर्समेंट लर्निंग (प्रयास और त्रुटि) कहा जाता है, ताकि मैप पर "चीट कोड्स" या "पोर्टल्स" खोजे जा सकें।
    • पॉइंट A से पॉइंट B तक चलने के बजाय, रोबोट एक नया मूव सीखता है: "यदि मैं इस ब्लॉक को पकड़कर अपने हाथ को घुमाता हूँ, तो मैं पूरे टावर को गिरा सकता हूँ।"
    • यह नया मूव एक शॉर्टकट है। यह दो ऐसे बिंदुओं को जोड़ता है जो पहले एक-दूसरे से दूर थे।

3. यह कैसे सीखता है (ट्रेनिंग कैंप)

SLAP केवल अनुमान नहीं लगाता; यह अभ्यास करता है।

  1. अंतराल की पहचान करना: यह "आधिकारिक मैप" को देखता है और दो अवस्थाओं (जैसे, "लक्ष्य ब्लॉक को पकड़े हुए" और "फर्श खाली है") के बीच एक लंबा, उबाऊ रास्ता देखता है।
  2. एक मिनी-गेम बनाना: यह केवल उस विशिष्ट समस्या को अलग करता है और एक छोटा, केंद्रित प्रशिक्षण वातावरण बनाता है।
  3. अभ्यास: रोबोट इस मिनी-गेम में हजारों रैंडम मूव्स का प्रयास करता है। अंततः, वह एक शानदार, गतिशील मूव (जैसे "थप्पड़ मारना", "हिलाना" या "पोंछना") खोज लेता है जो तुरंत रास्ता साफ कर देता है।
  4. मूव को सेव करना: एक बार जब रोबोट इस नए मूव में महारत हासिल कर लेता है, तो SLAP इसे मुख्य मैप पर एक नए "विकल्प" के रूप में सेव कर देता है।

4. परिणाम: तेज़ और स्मार्ट

जब रोबोट के सामने कोई नया, वास्तविक कार्य आता है:

  • पुराना तरीका: वह मैनुअल के लंबे, घुमावदार रास्ते का पालन करता है।
  • SLAP तरीका: वह मैप को देखता है, अपने द्वारा सीखे गए नए "पोर्टल" (शॉर्टकट) को देखता है, और सीधे उसके माध्यम से निकल जाता है।

प्रयोगों में:

  • रोबोट ने पुराने तरीके की तुलना में 50% से 73% तेजी से कार्यों को हल किया।
  • इसने उन रोबोट्स की तुलना में अधिक बार सफलता प्राप्त की जिन्होंने बिना किसी नियम के पूरे कार्य को शून्य से सीखने की कोशिश की (जो कि बिना स्टीयरिंग घुमाए बस गाड़ी चलाने की कोशिश करने जैसा है)।
  • इसने ऐसे मूव्स खोज निकाले जिन्हें इंसानों ने प्रोग्राम नहीं किया था, जैसे ब्लॉकों के टावर को थप्पड़ मारना या खिलौनों को इकट्ठा करने के लिए किसी टूल से मेज को पोंछना।

यह क्यों महत्वपूर्ण है

यह दो दुनियाओं के बीच एक सेतु है:

  1. प्लानिंग: कंप्यूटर की तार्किक, चरण-दर-चरण सोच (लंबे, जटिल कार्यों के लिए अच्छी है)।
  2. लर्निंग: इंसान की रचनात्मक, प्रयास और त्रुटि वाली लचीलापन (तेज़, चतुर समाधान खोजने के लिए अच्छी है)।

SLAP रोबोट को अपना तार्किक मस्तिष्क बनाए रखने देता है लेकिन उसे शारीरिक रूप से "इम्प्रोवाइज" (तत्काल निर्णय लेने) करने की क्षमता भी देता है। यह एक रोबोट को एक नियम पुस्तिका देने जैसा है, लेकिन फिर उसे यह सिखाना कि जब इससे बेहतर और तेज़ परिणाम मिले तो नियमों को कैसे तोड़ा जाए।

संक्षेप में: SLAP रोबोट्स को कठोर नौकरशाह बनना बंद करने और रचनात्मक समस्या समाधानकर्ता बनने की शिक्षा देता है, जिससे वे "स्टेप-बाय-स्टेप" के बजाय "शॉर्टकट" ढूंढ सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →