← नवीनतम पेपर
🤖 machine learning

DiRecT: Safe Diffusion-Based Planning via Receding-Horizon Denoising

DiRecT एक प्रशिक्षण-मुक्त (training-free) एल्गोरिदम है जो रिकेडिंग-होरिज़ोन डिनोइज़िंग (receding-horizon denoising) के माध्यम से केवल अंतिम स्वच्छ प्रक्षेपवक्र (final clean trajectory) पर बाधाओं को लागू करके डिफ्यूजन मॉडल्स में सुरक्षित नियोजन सुनिश्चित करता है, जिससे उन मध्यवर्ती चरणों के अत्यधिक बाधित होने से बचा जा सके जो मौजूदा दृष्टिकोणों में आमतौर पर नमूना गुणवत्ता (sample quality) को कम कर देते हैं।

मूल लेखक: Paolo Giaretta, Zeyang Li, Navid Azizan

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Paolo Giaretta, Zeyang Li, Navid Azizan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भीड़भाड़ वाले कमरे में कॉफी का कप लेने जाने के लिए चलना सिखा रहे हैं। आपके पास एक बहुत ही स्मार्ट रोबोट है जिसने लोगों के ऐसा करते हुए हजारों वीडियो देखे हैं। वह जानता है कि सामान्य रूप से कैसे हिलना-डुलना है, लेकिन उसे इस कमरे की विशिष्ट कुर्सियों या मेजों के बारे में नहीं पता है।

यदि आप केवल रोबोट से "कॉफी लेकर आओ" कहेंगे, तो हो सकता है कि वह किसी मेज से टकरा जाए क्योंकि वह रचनात्मक होने की कोशिश कर रहा है। यदि आप हर एक कदम पर उसे मेज से टकराने से रोकने की कोशिश करते हैं, तो आप एक ऐसा रोबोट बना सकते हैं जो जम जाता है, अटक जाता है, या एक अजीब, झटकेदार रास्ता अपना लेता है क्योंकि आपने उसके हर विचार को बहुत अधिक नियंत्रित (micromanage) किया है।

यही वह समस्या है जिसे DiRecT हल करता है।

समस्या: "ओवर-करेक्शन" का जाल (The "Over-Correction" Trap)

लेखक बताते हैं कि AI प्लानर्स को सुरक्षित बनाने के मौजूदा तरीके एक घबराए हुए माता-पिता की तरह हैं जो बच्चे का हाथ बहुत कसकर पकड़े रहते हैं।

  • पुराना तरीका: जैसे-जैसे रोबोट अपना रास्ता प्लान करता है (कदम-दर-कदम), कंप्यूटर चेक करता है: "क्या यह कदम सुरक्षित है?" यदि नहीं, तो वह रोबोट को तुरंत उस विशिष्ट कदम को बदलने के लिए मजबूर करता है।
  • दोष: रोबोट की प्लानिंग प्रक्रिया में बहुत सारा "शोर" या रफ ड्राफ्ट शामिल होते हैं। इन रफ ड्राफ्ट्स पर सुरक्षा की जांच करना एक चित्रकार को यह कहने जैसा है कि, "पेड़ जैसा दिखने वाला एक भी ब्रशस्ट्रोक मत बनाओ," जबकि वह अभी भी पैलेट पर रंग मिला रहा है। यह रोबोट की रचनात्मकता को रोकता है और अक्सर अंतिम परिणाम को बदसूरत, झटकेदार या लक्ष्य तक पहुँचने में विफल बना देता है।

समाधान: DiRecT (एक "रिसीडिंग-होराइजन" कोच)

लेखक DiRecT पेश करते हैं, जो एक घबराए हुए माता-पिता के बजाय एक बुद्धिमान कोच की तरह काम करता है।

1. "क्लीन ट्राजेक्टरी" की दृष्टि (The "Clean Trajectory" Vision)
हर रफ ड्राफ्ट पर सुरक्षा की जांच करने के बजाय, DiRect तब तक इंतजार करता है जब तक कि रोबोट के पास एक अंतिम, साफ योजना (clean plan) न हो। यह पूछता है: "यदि आप इस योजना का ठीक से पालन करते हैं, तो क्या आप मेज से टकराएंगे?"

  • उपमा: कल्पना कीजिए कि रोबोट कागज पर एक रास्ता बना रहा है। पुराने तरीकों ने पेंसिल के कागज को छूते ही रेखा को मिटाने की कोशिश की यदि वह थोड़ी टेढ़ी दिखी। DiRect को पेंसिल को स्वतंत्र रूप से खींचने देता है, फिर तैयार ड्राइंग को देखता है। यदि तैयार ड्राइंग किसी मेज से टकराती है, तो यह पूरी ड्राइंग को धीरे से दूर धकेल देता है।

2. "रिसीडिंग-होराइजन" तकनीक (The "Receding-Horizon" Trick)
पेपर "रिसीडिंग-होराइजन" (मॉडल प्रेडिक्टिव कंट्रोल से प्रेरित) की अवधारणा का उपयोग करता है।

  • उपमा: कोहरे वाली हेडलाइट्स के साथ रात में कार चलाने के बारे में सोचें। आप केवल कुछ फीट आगे ही देख सकते हैं।
    • पुराना तरीका: आप अभी पूरे 100 मील की यात्रा के लिए सही दिशा तय करने की कोशिश करते हैं, भले ही आप सड़क देख न पा रहे हों।
    • DiRect: आप अपने ठीक सामने की सड़क देखते हैं, अगले कुछ सेकंड के लिए एक सुरक्षित रास्ता प्लान करते हैं, उसे चलाते हैं, और फिर अगले कुछ सेकंड के लिए पुनः योजना (re-plan) बनाते हैं। आप लगातार अपनी योजना को अपडेट करते रहते हैं ताकि आप कभी दीवार से न टकराएं, लेकिन आप कार को सीधा चलाने के लिए मजबूर नहीं करते यदि सड़क मुड़ रही हो।

3. "ट्रेनिंग-फ्री" सुपरपावर (The "Training-Free" Superpower)
सबसे अच्छी बात? DiRect को रोबोट को दोबारा सिखाने की आवश्यकता नहीं है। यह रोबोट के मौजूदा ज्ञान (प्री-ट्रेंड मॉडल) के साथ काम करता है। यह बस प्लानिंग प्रक्रिया के ऊपर एक सुरक्षा परत जोड़ देता है।

  • उपमा: यह एक अनुभवी ड्राइवर को GPS देने जैसा है जो बाधाओं के बारे में चेतावनी देता है। आपको ड्राइवर को फिर से गाड़ी चलाना सिखाने की ज़रूरत नहीं है; आप बस उन्हें इस शहर के विशिष्ट गड्ढों से बचने के लिए एक उपकरण देते हैं।

व्यवहार में यह कैसे काम करता है

पेपर ने इसे कई रोबोट कार्यों पर परखा:

  • मेज़ नेविगेशन (Maze Navigation): एक भूलभुलैया के माध्यम से लुढ़कती हुई गेंद जिसमें नई, अप्रत्याशित दीवारें हैं। DiRect सफलतापूर्वक भूलभुलैया से बिना दीवारों से टकराए निकल गया, जबकि अन्य तरीके फंस गए या टकरा गए।
  • रोबोटिक आर्म्स (Robotic Arms): एक हाथ जो किसी वस्तु को पकड़ने के लिए बढ़ रहा है और खंभों से बच रहा है। DiRect ने सुनिश्चित किया कि हाथ ने कभी भी खंभों को नहीं छुआ, भले ही खंभे कठिन स्थानों पर रखे गए हों।
  • मल्टी-रोबोट स्वार्म्स (Multi-Robot Swarms): रोबोटों का एक समूह जो आपस में टकराए बिना एक साथ चल रहा है। DiRect ने उन्हें सुरक्षित और कुशल रखा, भले ही रोबोटों की संख्या बढ़ गई हो।

मुख्य निष्कर्ष (The Bottom Line)

DiRect AI प्लानर्स को सुरक्षित बनाने का एक नया तरीका है। AI की विचार प्रक्रिया में लगातार हस्तक्षेप करने के बजाय (जो AI को अनाड़ी बनाता है), यह AI को स्वतंत्र रूप से सोचने देता है और फिर यह सुनिश्चित करने के लिए अंतिम योजना को धीरे से सुधारता है कि वह सुरक्षित है। यह एक छात्र को बिना डर के रफ ड्राफ्ट लिखने देने जैसा है, और फिर अंतिम संस्करण को संपादित करने में मदद करने जैसा है ताकि वह पूर्ण हो सके, न कि हर वाक्य के बाद उसे रोकना।

परिणामस्वरूप, एक ऐसा रोबोट मिलता है जो सुरक्षित भी है (वह टकराता नहीं है) और कुशल भी (वह सुचारू रूप से चलता है और काम पूरा करता है)।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →