← नवीनतम पेपर
💻 computer science

Iterative On-Policy Refinement of Hierarchical Diffusion Policies for Language-Conditioned Manipulation

यह शोध पत्र HD-ExpIt का प्रस्ताव करता है, जो एक ढांचा है जो भाषा-सशर्त हेरफेर (language-conditioned manipulation) के लिए पदानुक्रमित डिफ्यूजन नीतियों (hierarchical diffusion policies) को परिवेश फीडबैक का लाभ उठाकर और सफल व्यवहारों को स्वायत्त रूप से खोजने और उन्हें संकुचित (distill) करने के माध्यम से पुनरावृत्त रूप से परिष्कृत करता है, जिससे प्लानर को कंट्रोलर की क्षमताओं के साथ संरेखित किया जा सके और CALVIN बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Clemence Grislain, Olivier Sigaud, Mohamed Chetouani

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Clemence Grislain, Olivier Sigaud, Mohamed Chetouani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को आपके घर की सफाई करने के लिए सिखाने की कोशिश कर रहे हैं, जैसे कि एक वॉयस कमांड के माध्यम से: "कृपया लिविंग रूम को व्यवस्थित करें।"

अतीत में, इस तरह के जटिल कार्य को रोबोट को सिखाना ऐसा था जैसे एक ही व्यक्ति को सीईओ, आर्किटेक्ट, निर्माण कार्यकर्ता और सफाईकर्मी सब कुछ एक साथ बनने के लिए कहना। वे अभिभूत हो जाते, भ्रमित हो जाते और असफल हो जाते।

इसे हल करने के लिए, शोधकर्ताओं ने Hierarchical Policies (पदानुक्रमित नीतियां) बनाईं। इसे एक मैनेजर (उच्च-स्तरीय योजनाकार) और एक वर्कर (निम्न-स्तरीय नियंत्रक) को काम पर रखने के रूप में समझें।

  • मैनेजर बड़े चित्र (big picture) को देखता है। वे "व्यवस्थित करें" कमांड को छोटे चरणों में तोड़ते हैं: "कप उठाओ," "उसे सिंक में रखो," "मेज को पोंछो।"
  • वर्कर वह है जो वास्तव में रोबोट के हाथों को चलाता है। वे "कप उठाओ" के निर्देश को लेते हैं और यह समझते हैं कि कप को पकड़ने के लिए रोबोट की उंगलियों को ठीक से कैसे हिलाना है।

समस्या: "संपर्क विहीन" मैनेजर

यह पेपर पहचानता है कि इन टीमों के काम करने के तरीके में एक बड़ा दोष है। मैनेजर अक्सर पुराने वीडियो के एक विशाल पुस्तकालय (ऑफलाइन डेटा) पर प्रशिक्षित होता है। वे सीखते हैं कि सिद्धांत रूप में क्या होना चाहिए। वर्कर भी इन्हीं पुराने वीडियो पर प्रशिक्षित होता है।

लेकिन यहाँ एक पेंच है: मैनेजर को वर्कर की वर्तमान सीमाओं का पता नहीं होता।

  • मैनेजर कह सकता है, "ठीक है, अब सोफे के ऊपर से कूदो और रिमोट पकड़ो!"
  • वर्कर कोशिश करता है, लड़खड़ाता है और विफल हो जाता है।

क्यों? क्योंकि मैनेजर को आदर्श, पूर्ण वीडियो पर प्रशिक्षित किया गया था और उसे यह एहसास नहीं है कि वर्कर वर्तमान में अनाड़ी है या सोफा बहुत ऊँचा है। इसे "Coupling Mismatch" (जुड़ाव का बेमेल होना) कहा जाता है। मैनेजर की योजनाएं वर्कर के वास्तविक कौशल के लिए बहुत अधिक भव्य होती हैं।

इन समस्याओं को ठीक करने के पिछले प्रयास एक मध्यस्थ को उनके बीच अनुवाद करने के लिए नियुक्त करने जैसा था, या उन्हें एक विशिष्ट भाषा साझा करने के लिए मजबूर करने जैसा था। लेकिन ये तरीके कठोर थे और अभी भी उन पुराने, स्थिर वीडियो पर निर्भर थे। जब रोबोट बेहतर हो रहा था या स्थिति बदल रही थी, तो वे अनुकूलित नहीं हो सकते थे।

समाधान: HD-ExpIt (द "प्रैक्टिस लूप")

लेखक एक नया ढांचा प्रस्तावित करते हैं जिसे HD-ExpIt कहा जाता है। इसे एक Self-Reinforcing Practice Loop (स्व-सुदृढ़ीकरण अभ्यास चक्र) के रूप में समझें।

केवल पुराने वीडियो देखने के बजाय, रोबोट टीम को एक वास्तविक प्रशिक्षण जिम में रखा जाता है जहाँ वे प्रयास कर सकते हैं, विफल हो सकते हैं और परिणामों से सीख सकते हैं।

यह लूप चरण-दर-चरण इस प्रकार काम करता है:

  1. अनुमान (The Guess): मैनेजर कार्य को देखता है और जो कुछ भी वह जानता है उसके आधार पर एक योजना (उप-लक्ष्यों का एक क्रम) बनाता है।

  2. प्रयास (The Attempt): वर्कर वास्तविक दुनिया में इस योजना को निष्पादित करने का प्रयास करता है।

  3. फ़िल्टर (जादुई चरण):

    • यदि वर्कर सफल होता है? बहुत बढ़िया! हम इस सफलता की कहानी को सहेज लेते हैं।
    • यदि वर्कर विफल होता है? इसे कचरे में डाल दें। हम विफलता से नहीं सीखते; हम बस यह जानते हैं कि उस विशेष वर्कर के लिए अभी वह विशिष्ट योजना काम नहीं कर रही थी।
    • उपमा: कल्पना कीजिए कि मैनेजर एक शेफ है जो रेसिपी लिख रहा है। वर्कर एक सहायक शेफ (sous-chef) है। यदि सहायक शेफ केक जला देता है, तो मैनेजर केवल एक किताब के आधार पर नई रेसिपी नहीं लिखता है। इसके बजाय, मैनेजर उन सफल केक को देखता है जो सहायक शेफ ने वास्तव में बनाए हैं, और महसूस करता है, "ओह, मैंने 500-डिग्री ओवन के लिए कहा था, लेकिन आप केवल 400 संभाल सकते हैं," और फिर वे भविष्य की रेसिपी को सहायक शेफ के वास्तविक ओवन के अनुरूप अपडेट करते हैं।
  4. परिष्करण (The Refinement): रोबोट उन सभी सफल प्रयासों को लेता है जो उसने अभी किए हैं और उनका उपयोग मैनेजर और वर्कर दोनों को फिर से प्रशिक्षित करने के लिए करता है।

    • वर्कर कार्यों को करने में बेहतर होता जाता है।
    • मैनेजर ऐसे प्लान लिखना सीख जाता है जो वर्कर के लिए करना वास्तव में संभव है। वह वर्कर को "दौड़ने" के लिए कहने से पहले उसके "पैर" को समझ लेता है।

यह एक बड़ी बात क्यों है?

अधिकांश AI रोबोट उन छात्रों की तरह होते हैं जो केवल एक पाठ्यपुस्तक से अध्ययन करते हैं और कभी अभ्यास परीक्षा नहीं देते। वे सिद्धांत जानते हैं लेकिन वास्तविक दुनिया में आते ही जम जाते हैं।

HD-ExpIt एक ऐसे छात्र की तरह है जो एक अभ्यास परीक्षण देता है, देखता है कि उसने कहाँ गलती की, उन प्रश्नों का अध्ययन करता है जो उसने सही किए, और फिर फिर से परीक्षण देता है। वे हर बार बेहतर होते जाते हैं।

  • कोई बिचौलिया नहीं: इसे मैनेजर और वर्कर के बीच किसी अनुवादक या जटिल पुल की आवश्यकता नहीं है। वे बस अपने कार्यों के परिणामों के माध्यम से एक-दूसरे से बात करते हैं।
  • वास्तविक दुनिया में अनुकूलन: यह रोबोट की वास्तविक भौतिक सीमाओं को सीखता है, न कि केवल वह जो डेटा कहता है कि उन्हें होना चाहिए।
  • परिणाम: पेपर के परीक्षणों में (CALVIN बेंचमार्क का उपयोग करके, जो रोबोट के लिए एक बहुत कठिन बाधा दौड़ की तरह है), इस पद्धति ने रोबोट को कार्यों की लंबी श्रृंखलाओं (जैसे "दराज खोलें, ब्लॉक लें, बॉक्स में रखें, दराज बंद करें") को पिछले किसी भी तरीके की तुलना में बहुत अधिक विश्वसनीयता के साथ पूरा करने की अनुमति दी।

निचोड़ (The Bottom Line)

यह पेपर एक तरीका पेश करता है जिससे रोबोट टीमें करके सीखने (learn by doing) में सक्षम होती हैं। रोबोट को चीजें आज़माने देने, केवल सफलताओं को रखने, और उन सफलताओं का उपयोग मैनेजर को बेहतर निर्देश देने के लिए करने से, पूरा सिस्टम अधिक स्मार्ट, अधिक समन्वित और वास्तविक दुनिया में मानव भाषा के आदेशों का पालन करने में बहुत बेहतर हो जाता है। यह एक कठोर, पाठ्यपुस्तक-प्रशिक्षित रोबोट को एक लचीले, सीखने वाले साथी में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →