← नवीनतम पेपर
💻 computer science

Inverse Manipulation through Symbolic Planning and Residual Operator Learning

यह शोध पत्र रोबोटिक इनवर्स मैनिपुलेशन के लिए एक हाइब्रिड फ्रेमवर्क प्रस्तावित करता है जो मोटे प्रतीकात्मक योजनाओं (symbolic plans) को भौतिक रूप से सुदृढ़ कौशलों में परिष्कृत करने के लिए स्वचालित रूप से निकाले गए प्रतीकात्मक ऑपरेटरों को रेसिडुअल रिइन्फोर्समेंट लर्निंग (residual Reinforcement Learning) के साथ जोड़ता है, जिसे ManiSkill3 PushCube कार्य पर प्रभावी ढंग से प्रदर्शित किया गया है।

मूल लेखक: Yigit Yildirim, Giuseppe Rauso, Riccardo Caccavale, Alberto Finzi

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yigit Yildirim, Giuseppe Rauso, Riccardo Caccavale, Alberto Finzi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मेज पर एक क्यूब (घन) को धकेलना सिखा रहे हैं। वह "फॉरवर्ड" (आगे का) कार्य है। अब, कल्पना कीजिए कि आपको उसी रोबोट को ठीक उसी क्रिया को उल्टा (undo) करने और क्यूब को वापस वहीं लाने के लिए सिखाना है जहाँ से उसने शुरुआत की थी।

यह सुनने में सरल लगता है, लेकिन यह रोबोट के लिए वास्तव में एक कठिन पहेली है। यदि आप केवल रोबोट को "फिल्म को उल्टा चलाने" के लिए कहते हैं, तो वह अक्सर विफल हो जाता है। क्यों? क्योंकि यदि रोबोट ने क्यूब को पकड़ा नहीं था (उसने सिर्फ उसे धकेला था), तो वह केवल धकेलने की क्रिया को उलटने के लिए अपने हाथ को पीछे नहीं खींच सकता। क्यूब अब कहीं और रखा हुआ है, और रोबोट को इसे वापस लाने के लिए एक नई योजना की आवश्यकता है।

यह पेपर एक चतुर "हाइब्रिड" (मिश्रित) सिस्टम प्रस्तुत करता है जो इस समस्या को हल करता है, जो लॉजिकल प्लानिंग (जैसे शतरंज का खिलाड़ी आगे की सोचता है) को ट्रायल-एंड-एरर लर्निंग (जैसे एक बच्चा चलना सीखता है) के साथ जोड़ता है।

यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. "जादुई अनुवादक" (सिंबोलिक एक्सट्रैक्शन)

सबसे पहले, रोबोट एक इंसान (या स्क्रिप्ट) को फॉरवर्ड टास्क करते हुए देखता है, जैसे कि एक क्यूब को धकेलना। केवल हाथ की गतिविधियों को याद रखने के बजाय, सिस्टम एक अनुवादक की तरह काम करता है। यह दृश्य को देखता है और शुद्ध तर्क (logic) में एक सरल "रेसिपी" या नियम लिख देता है।

  • पहले: "क्यूब शुरुआत में है।"
  • बाद में: "क्यूब अंत में है।"
  • नियम: "यदि क्यूब शुरुआत में है, तो मैं इसे अंत तक धकेल सकता हूँ।"

2. "रिवर्स रेसिपी" (इनवर्स प्लानिंग)

एक बार जब रोबोट के पास नियम आ जाता है, तो वह स्वचालित रूप से एक "रिवर्स रेसिपी" लिख देता है। वह नियम को देखता है और पूछता है, "शुरुआत में वापस जाने के लिए मुझे क्या करने की आवश्यकता है?"

  • वह महसूस करता है कि उसे यह करना होगा: "क्यूब को वापस शुरुआत में रखें," "सुनिश्चित करें कि ग्रिपर खुला है," और "सुनिश्चित करें कि रोबोट का हाथ क्यूब के पास है।"
  • रोबोट फिर बुनियादी चालों का एक क्रम तय करने के लिए एक मानक प्लानर (जैसे जीपीएस) का उपयोग करता है। उदाहरण के लिए, वह स्थिति को ठीक करने के लिए "क्यूब को उठाना" और "इसे शुरुआत में रखना" आज़मा सकता है।

3. "काफी अच्छा" हैंडऑफ (दिए गए कार्य का हस्तांतरण)

यहीं पर जादू होता है। रोबोट का बुनियादी प्लानर अच्छा है, लेकिन पूर्ण नहीं है। हो सकता है कि वह क्यूब को उठा ले और उसे शुरुआत के लगभग पास छोड़ दे, लेकिन वह कुछ इंच दूर हो सकता है।

  • कई अन्य सिस्टमों में, यह एक विफलता होती।
  • इस सिस्टम में, रोबोट रुकता है और कहता है, "ठीक है, मैंने क्यूब को काफी करीब तक पहुँचा दिया है। अब, मुझे इसकी स्थिति को बारीकी से ठीक करने की आवश्यकता है।"

4. "फाइन-ट्यूनर" (रेसिडुअल लर्निंग)

यह टीम का दूसरा हिस्सा है: एक रीइन्फोर्समेंट लर्निंग (RL) एजेंट। इसे एक अत्यधिक कुशल सूक्ष्म-समायोजक (micro-adjuster) के रूप में सोचें।

  • सिस्टम RL एजेंट को बताता है: "आपको क्यूब को सटीक शुरुआती स्थान तक की शेष दूरी तक ले जाना है, लेकिन ऐसा न करें जिससे वे चीजें खराब हो जाएं जिन्हें हमने पहले ही ठीक कर लिया है (जैसे ग्रिपर को खुला रखना)।"
  • RL एजेंट हजारों सूक्ष्म गतिविधियों को आजमाता है। यदि वह क्यूब को करीब लाता है, तो उसे एक "इनाम" (रिवॉर्ड) मिलता है। यदि वह क्यूब को उस स्थान से दूर धकेल देता है जिसे हमने पहले ठीक किया था, तो उसे "डांट" (पेनल्टी) मिलती है।
  • अंततः, RL एजेंट को उन सटीक, सूक्ष्म धक्कों को सीखने में सफलता मिलती जो क्यूब को बिल्कुल सही जगह पर स्लाइड करने के लिए आवश्यक हैं।

परिणाम: एक परफेक्ट अनडू (Undo)

लेखकों ने इसका परीक्षण "PushCube" नामक कार्य पर किया।

  • समस्या: रोबोट ने एक क्यूब को धकेला।
  • पुराना तरीका (केवल रिवर्स करना): यह नहीं कर सका क्योंकि रोबोट ने क्यूब को पकड़ा नहीं था।
  • "लॉजिक ओनली" तरीका: क्यूब को करीब तो लाया, लेकिन लक्ष्य से लगभग 17 मिलीमीटर (एक पेंसिल इरेज़र की चौड़ाई के बराबर) दूर रह गया।
  • नया हाइब्रिड तरीका: लॉजिक वाले हिस्से ने क्यूब को करीब पहुँचाया, और लर्निंग वाले हिस्से ने इसे अंतिम रूप से सही जगह पर सेट किया। परिणाम? क्यूब शुरुआत के 1.4 मिलीमीटर के भीतर समाप्त हुआ, जिसमें 90% सफलता दर रही।

बड़ी तस्वीर

पेपर का दावा है कि काम को दो भागों में विभाजित करके—सिंबोलिक प्लानिंग बड़े चित्र के लिए और रेसिडुअल लर्निंग बारीक विवरणों के लिए—आप रोबोट को उन जटिल कार्यों को उलटने के लिए सिखा सकते हैं जिन्हें वे पहले रिवर्स नहीं कर सकते थे। यह एक "अंदाजे" को "भौतिक रूप से सटीक अनडू" में बदल देता है।

संक्षेप में: रोबोट किसी कार्य को उलटने के लिए सामान्य रणनीति समझने के लिए अपने दिमाग का उपयोग करता है, और फिर सटीक समायोजन करने के लिए अपने "मांसपेशियों की स्मृति" (ट्रायल-एंड-एरर के माध्यम से सीखी गई) का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →