← नवीनतम पेपर
💻 computer science

Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation

यह शोध पत्र HiRoC का प्रस्ताव करता है, जो एक पदानुक्रमित पोस्ट-ट्रेनिंग फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन मॉडल्स में फ्लैट पॉलिसियों की सीमाओं को दूर करने के लिए उच्च-स्तरीय कार्य नियोजन (high-level task planning) को निम्न-स्तरीय क्रिया निष्पादन (low-level action execution) से अलग करता है, जिससे स्पष्ट सिमेंटिक मार्गदर्शन और सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से सुदृढ़ लॉन्ग-होरिज़न रोबोटिक मैनिपुलेशन सक्षम होता है।

मूल लेखक: He Kong, Zengjue Chen, Qi Wang, Qianli Xing, Runliang Niu, Peidong Liu, Jiawei Li, Shiqi Wang, Yi Chang

प्रकाशित 2026-08-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: He Kong, Zengjue Chen, Qi Wang, Qianli Xing, Runliang Niu, Peidong Liu, Jiawei Li, Shiqi Wang, Yi Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखाने की कोशिश कर रहे हैं। आप सोच सकते हैं, "बस उसे 'सैंडविच बनाओ' कह दो, और वह बाकी सब खुद समझ जाएगा।" लेकिन एक रोबोट के लिए, यह वैसा ही है जैसे किसी इंसान को यह बताए बिना लॉटरी जीतने के लिए कहना कि टिकट कैसे खरीदना है, नंबर कैसे चुनने हैं, या परिणाम कैसे देखने हैं। यह विज़न-लैंग्वेज-एक्शन (VLA) मॉडल्स की दुनिया है। इन्हें एक सुपर-स्मार्ट रोबोटिक दिमाग के रूप में समझें जो कैमरों के माध्यम से दुनिया को देख सकता है, मानवीय भाषा को समझ सकता है, और यह तय कर सकता है कि शारीरिक रूप से क्या मूव्स लेने हैं। वैज्ञानिक इन दिमागों को सरल कार्य करने के लिए प्रशिक्षित कर रहे हैं, जैसे कि एक अकेले ब्लॉक को उठाना। लेकिन वास्तविक जीवन अव्यवस्थित और लंबा होता है। सैंडविच बनाना, लेगो (LEGO) सेट बनाना, या कमरा व्यवस्थित करना एक त्वरित मूव नहीं है; यह चरणों की एक लंबी श्रृंखला है जहाँ आपको याद रखना पड़ता है कि आपने अभी क्या किया और आगे क्या करना है इसकी योजना बनानी पड़ती है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं: हम इन रोबोटों को लंबे, जटिल कार्यों को संभालने के लिए कैसे सिखाएं ताकि वे बीच में भ्रमित न हों या हार न मान लें?

यही वह विषय है जिसे पेपर "बियॉन्ड फ्लैट पॉलिसीज़: हायरार्किकल पोस्ट-ट्रेनिंग फॉर एम्बॉडीड एजेंट्स इन रोबोटिक मैनिपुलेशन" संबोधित करता है। जिलिन यूनिवर्सिटी और जेडी (JD) की टीम के लेखक तर्क देते हैं कि रोबोटों को प्रशिक्षित करने का वर्तमान तरीका बहुत "फ्लैट" है। कल्पना कीजिए कि आप शीर्षक को देखते हुए और कहानी खत्म होने तक रैंडम वाक्य टाइप करते हुए एक उपन्यास लिखने की कोशिश कर रहे हैं। मौजूदा तरीके यही करते हैं: वे रोबोट को एक बड़ा निर्देश देते हैं (जैसे "कमरा साफ करो") और उम्मीद करते हैं कि वह हर एक कदम को अपने आप समझ लेगा। समस्या यह है कि यदि रोबोट शुरुआत में एक छोटी सी गलती करता है, तो वह खो जाता है और उबर नहीं पाता क्योंकि उसे यह नहीं पता होता कि अगला विशिष्ट चरण क्या होना चाहिए।

इसे ठीक करने के लिए, टीम एक नया सिस्टम प्रस्तावित करती है जिसे HiRoC (हायरार्किकल रोबोटिक कंट्रोल) कहा जाता है। वे रोबोट के दिमाग को दो अलग-अलग भूमिकाओं में विभाजित करते हैं, जैसे कि एक प्रोजेक्ट मैनेजर और एक वर्कर।

  • प्रोजेक्ट मैनेजर (प्लानर) बड़े चित्र (बिग पिक्चर) को देखता है। यह जटिल निर्देश ("कमरा साफ करो") लेता है और इसे छोटे, प्रबंधनीय उप-लक्ष्यों (sub-goals) की एक सूची में तोड़ देता है ("मोजे उठाओ," "मोजे टोकरी में डालो," "किताबें उठाओ," आदि)।
  • वर्कर (एक्सेक्यूटर) केवल वर्तमान उप-लक्ष्य की परवाह करता है। वह पूरे कमरे की चिंता नहीं करता; वह बस अभी "मोजे उठाने" पर ध्यान केंद्रित करता है।

पेपर सुझाव देता है कि यह "विभाजित करो और जीतो" (divide and conquer) वाला दृष्टिकोण पुराने "फ्लैट" तरीके की तुलना में बहुत बेहतर है। हालाँकि, एक पेच था: वर्कर को मूल रूप से बड़े निर्देश को सुनने के लिए प्रशिक्षित किया गया था, न कि छोटे उप-लक्ष्यों को। यदि आप वर्कर को मैनेजर की सूची सौंप देते, तो वह भ्रमित हो जाता, जैसे कि एक शेफ जो पूरा भोजन पकाना जानता है लेकिन उसे कभी सिर्फ "प्याज काटने" के लिए नहीं कहा गया है।

इसे हल करने के लिए, लेखकों ने एक विशेष प्रशिक्षण प्रक्रिया विकसित की। पहले, उन्होंने मैनेजर को अच्छी सूचियाँ बनाना सिखाया। फिर, उन्होंने वर्कर को उन विशिष्ट सूचियों को समझने के लिए पुन: प्रशिक्षित किया, जिससे भ्रम को दूर किया जा सके। अंत में, उन्होंने वर्कर को एक आभासी दुनिया में अभ्यास करने दिया, जहाँ उसे फीडबैक (रिवॉर्ड्स) मिला, न कि केवल पूरा कार्य पूरा करने के लिए, बल्कि प्रत्येक छोटे चरण को अच्छी तरह से करने के लिए भी।

उनके प्रयोगों के परिणाम काफी उत्साहजनक हैं। जब उन्होंने विभिन्न रोबोटिक कार्यों पर HiRoC का परीक्षण किया, तो इसने लगातार अन्य शीर्ष तरीकों से बेहतर प्रदर्शन किया। लंबे, जटिल कार्यों के एक सेट पर, उनके सिस्टम ने 98% सफलता दर हासिल की, जो अन्य तरीकों के औसत लगभग 83.5% की तुलना में एक महत्वपूर्ण उछाल है (औसत सुधार 10.06% है)। उन्होंने एक वास्तविक दुनिया के सिमुलेशन में भी सिस्टम का परीक्षण किया जहाँ एक रोबोट को एक बॉक्स में करेक्शन फ्लूइड डालना था, और इसने बिना किसी अतिरिक्त बदलाव की आवश्यकता के पूरी तरह से काम किया।

लेखक इस बात पर जोर देते हैं कि यह केवल कोई जादू का खेल नहीं है; यह सोचने का एक संरचित तरीका है। "योजना बनाने" (planning) को "करने" (doing) से अलग करके, रोबोट लंबे, बहु-चरणीय कार्यों को संभालने में बहुत बेहतर हो जाता है। हालाँकि वे स्वीकार करते हैं कि यह वर्तमान में एक सिमुलेशन-आधारित सफलता है और वास्तविक दुनिया का भौतिक विज्ञान अप्रत्याशित हो सकता है, पेपर दृढ़ता से सुझाव देता है कि रोबोटों को एक "हायरार्किकल" दिमाग देना—जो बड़ी समस्याओं को छोटे, समाधान योग्य टुकड़ों में तोड़ सके—उन्हें हमारे दैनिक जीवन में वास्तव में सहायक बनाने की कुंजी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →