← नवीनतम पेपर
🤖 AI

Hybrid Diffusion for Simultaneous Symbolic and Continuous Planning

यह शोध पत्र एक नवीन हाइब्रिड डिफ्यूजन फ्रेमवर्क प्रस्तावित करके लॉन्ग-होराइज़न रोबोटिक कार्यों में मानक डिफ्यूजन मॉडल्स की सीमाओं को संबोधित करता है, जो उच्च-स्तरीय प्रतीकात्मक योजनाओं (सिंबोलिक प्लान्स) और निरंतर प्रक्षेप पथों (कंटीन्यूअस ट्राजेक्टरीज) को एक साथ उत्पन्न करता है, जिससे निर्णय लेने की क्षमता में सुधार होता है और लचीले, स्थिति-आधारित क्रिया संश्लेषण को सक्षम बनाया जाता है।

मूल लेखक: Sigmund Hennum Høeg, Aksel Vaaler, Chaoqi Liu, Olav Egeland, Yilun Du

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sigmund Hennum Høeg, Aksel Vaaler, Chaoqi Liu, Olav Egeland, Yilun Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कमरा साफ करना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह खिलौनों को उठाए, उन्हें रंग के आधार पर छाँटे, और उन्हें सही डिब्बों में रखे। यह सरल लग सकता है, लेकिन एक रोबोट के लिए, यह एक बहुत बड़ी पहेली है। उसे एक साथ यह तय करना होगा कि क्या करना है (रणनीति) और अपना हाथ कैसे हिलाना है (शारीरिक गति)।

लंबे समय तक, वैज्ञानिकों ने रोबोट को सिखाने के लिए डिफ्यूजन मॉडल (Diffusion Model) नामक एक प्रकार के AI का उपयोग किया है। एक डिफ्यूजन मॉडल को एक "डिनोइजिंग" (शोर हटाने वाले) कलाकार की तरह समझें। यदि आप एक स्पष्ट फोटो लेते हैं और उसमें धीरे-धीरे स्टैटिक (शोर/नॉयस) जोड़ते हैं जब तक कि वह केवल एक धुंधलापन न बन जाए, तो एक डिफ्यूजन मॉडल उस प्रक्रिया को उलटने का तरीका सीखता है। वह धुंधलेपन से शुरू होता है और धीरे-धीरे शोर को हटाकर एक स्पष्ट तस्वीर प्रकट करता है। रोबोटिक्स में, वह "तस्वीर" रोबोट के हाथ के लिए एक सुचारू पथ (path) है जिसका उसे अनुसरण करना है।

समस्या: "धुंधली" दीर्घकालिक योजना
पेपर बताता है कि जबकि ये मॉडल छोटे, सुचारू आंदोलनों (जैसे कप उठाना) के लिए बेहतरीन हैं, वे लंबे और जटिल कार्यों (जैसे दस ब्लॉकों को एक विशिष्ट क्रम में छाँटना) के लिए भ्रमित हो जाते हैं।

लेखक इसकी तुलना एक व्यक्ति से करते हुए करते हुए जो एक लंबी कहानी याद रखने की कोशिश कर रहा है। यदि आप केवल कहानी की भावनाओं (निरंतर गति) पर ध्यान केंद्रित करते हैं बिना मुख्य बिंदुओं (निर्णयों) को याद रखे, तो आप टोन (स्वर) तो सही पकड़ लेंगे लेकिन अंत भूल जाएंगे। रोबमा अंततः सुचारू रूप से चलता तो है लेकिन गलत चीजें करता है, या लूप (चक्र) में फंस जाता है। वह "बड़ी तस्वीर" के निर्णयों को "छोटी तस्वीर" की गतिविधियों से जोड़ने में संघर्ष करता है।

समाधान: हाइब्रिड डिफ्यूजन प्लानर (HDP)
इसे ठीक करने के लिए, लेखकों ने हाइब्रिड डिफ्यूजन प्लानर (HDP) नामक एक नया सिस्टम बनाया। उन्होंने महसूस किया कि एक लंबी पहेली को हल करने के लिए, आपको दो चीजों को एक साथ काम करने की आवश्यकता है:

  1. स्क्रिप्ट (प्रतीकात्मक योजना/Symbolic Plan): उच्च-स्तरीय चरणों की एक सूची, जैसे "ब्लॉक A उठाएं," "बिन 1 की ओर बढ़ें," "ब्लॉक A रखें।"
  2. प्रदर्शन (निरंतर योजना/Continuous Plan): उन चरणों को निष्पादित करने के लिए रोबोट के हाथ की वास्तविक सुचारू गतिविधियाँ।

केवल गतिविधियों को सिखाने के बजाय, HDP इसे स्क्रिप्ट और प्रदर्शन दोनों को एक साथ उत्पन्न करना सिखाता है।

यह कैसे काम करता है: "दो-ट्रैक" डिनोइजिंग
पेपर एक चतुर तकनीक का उपयोग करता है जिससे रोबोट को एक ही समय में दोनों चीजें सिखाई जाती हैं। कल्पना कीजिए कि आपके पास दो अलग-अलग पहेलियाँ हैं:

  • पहेली A (गति/Motion): रोबोट के हाथ के हिलने की एक धुंधली फोटो।
  • पहेली B (स्क्रिप्ट): एक वाक्य जहाँ कुछ शब्द काले बॉक्स द्वारा ढके गए हैं (मास्क किए गए हैं)।

HDP सिस्टम दोनों पहेलियों को एक ही समय में साफ करना सीखता है।

  • यह धुंधली गति और ढकी हुई स्क्रिप्ट लेता है।
  • यह गति को समझने में मदद करने के लिए स्क्रिप्ट से मिलने वाले सुरागों का उपयोग करता है। (उदाहरण के लिए, "यदि स्क्रिप्ट कहती है 'ब्लॉक A उठाएं,' तो हाथ ब्लॉक A के पास होना चाहिए।")
  • यह स्क्रिप्ट को समझने में मदद करने के लिए गति से मिलने वाले सुरागों का उपयोग करता है। (उदाहरण के लिए, "यदि हाथ बाईं ओर बढ़ रहा है, तो अगला चरण संभवतः 'बाएं बढ़ें' है।")

इन दोनों पहेलियों को हल किए जाने के दौरान एक-दूसरे से बात करने की अनुमति देकर, रोबोट यह सीख जाता है कि क्या करना है और कैसे करना है के बीच एक बहुत मजबूत संबंध है।

महत्व: "निर्देशक" और "अभिनेता"
लेखक दिखाते हैं कि यह तरीका पुराने तरीकों की तुलना में बहुत बेहतर है।

  • पुराना तरीका: रोबोट एक ही बार में पूरे पथ का अनुमान लगाने की कोशिश करता है। यह अक्सर विफल हो जाता है, जैसे कोई अभिनेता बिना स्क्रिप्ट के पूरा नाटक इम्प्रोवाइज (तत्काल सुधार) करने की कोशिश कर रहा हो।
  • नया तरीका (HDP): रोबोट एक निर्देशक और एक अभिनेता के रूप में मिलकर काम करता है। "निर्देशक" (प्रतीकात्मक योजना) स्पष्ट निर्देश देता है, और "अभिनेता" (गति योजना) उनका सटीक रूप से पालन करता है।

सुपरपावर्स: निर्देशों का पालन करना
क्योंकि रोबोट गति के साथ-साथ एक "स्क्रिप्ट" भी बना रहा है, आप अंतिम समय में उसे विशिष्ट निर्देश दे सकते हैं।

  • उदाहरण: आप रोबोट को कह सकते, "चाहे जो भी हो, सुनिश्चित करें कि लाल ब्लॉक टावर के ऊपर रहे।"
  • पुराने मॉडल इसे अनदेखा कर देते या भ्रमित हो जाते।
  • HDP इस निर्देश को ले सकता है, इसे "स्क्रिप्ट" में लॉक कर सकता है, और फिर इसे साकार करने के लिए भौतिक गतिविधियाँ उत्पन्न कर सकता है। यह एक शेफ को बताने जैसा है, "पास्ता बनाओ, लेकिन पनीर ऊपर से डालना," और शेफ वास्तव में वैसा ही करता है।

परिणाम
टीम ने कंप्यूटर सिमुलेशन और एक वास्तविक रोबोट आर्म के साथ इसका परीक्षण किया।

  • सिमुलेशन में: ब्लॉकों की बढ़ती संख्या को छाँटने के लिए कहा जाने पर, पुराने मॉडल जल्दी विफल हो गए। HDP बेहतर होता गया और बहुत अधिक जटिल कार्यों को संभाल सका।
  • वास्तविक दुनिया में: जब उन्होंने इसे एक वास्तविक रोबोट पर आजमाया, तो HDP कार्यों को पूरा करने में बहुत अधिक सफल रहा। पुराने मॉडल अक्सर ऐसी योजनाएं बनाते थे जो कागज पर तो ठीक दिखती थीं लेकिन उन्हें शारीरिक रूप से निष्पादित करना असंभव था।

सारांश में
यह पेपर रोबोट को लंबी, जटिल कार्य योजना बनाने का तरीका पेश करता है, जो "डांस मूव्स" (निरंतर गति) सीखने के साथ-साथ एक "टू-डू लिस्ट" (प्रतीकात्मक योजना) लिखना भी सीखता है। इन दोनों हिस्सों को एक-दूसरे की मदद करने की अनुमति देकर, रोबोट बहुत अधिक स्मार्ट, विश्वसनीय और नियंत्रित करने में आसान हो जाता है, यहाँ तक कि कई वस्तुओं को छाँटने या औजारों का उपयोग करने जैसे कठिन कार्यों के लिए भी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →