← नवीनतम पेपर
🤖 machine learning

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

यह शोध पत्र डिफ्यूजन रीरोल (Diffusion ReRoll) का प्रस्ताव करता है, जो रोबोटिक अनुक्रमिक भविष्यवाणी (robotic sequential prediction) के लिए एक नवीन डिफ्यूजन-आधारित ढांचा है जो स्थानीय रूप से स्थिर क्षेत्रों के चयनात्मक पुन: शोर (selective re-noising) के माध्यम से पुनरावृत्ति क्रॉस-होरिज़न संशोधन को सक्षम बनाता है, जो लॉन्ग-होरिज़न प्लानिंग, पॉलिसी लर्निंग और यूनिफाइड वीडियो-एक्शन मॉडलिंग में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Seonsoo Kim, Seongil Hong, Jun-Gill Kang

प्रकाशित 2026-07-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seonsoo Kim, Seongil Hong, Jun-Gill Kang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भूलभुलैया (maze) में नेविगेट करना या कप्स को एक के ऊपर एक रखने जैसे नाजुक कार्य करना सिखा रहे हैं। ऐसा करने के लिए, रोबोट को एक बार में केवल एक कदम उठाने के बजाय, भविष्य की पूरी गतिविधियों के क्रम (sequence) की एक साथ भविष्यवाणी करने की आवश्यकता होती है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन भविष्यवाणियों को करने के लिए एक लोकप्रिय उपकरण है जिसे "डिफ्यूजन मॉडल" (diffusion model) कहा जाता है। डिफ्यूजन मॉडल को एक मूर्तिकार की तरह समझें जो शोर (noise) और स्टेटिक से भरी मिट्टी के एक ब्लॉक से शुरुआत करता है। मूर्तिकार धीरे-धीरे शोर को हटाकर, कदम-दर-कदम, रोबोट के भविष्य के पथ की एक चिकनी, पूर्ण मूर्ति को प्रकट करता है। आमतौर पर, यह प्रक्रिया एकतरफा होती है: मूर्तिकार क्रम की शुरुआत से अंत तक शोर को हटाता है, और एक बार जब मूर्ति का कोई हिस्सा चिकना हो जाता है, तो वे उसे फिर कभी नहीं छूते हैं।

इस "एक बार और हमेशा के लिए" वाले दृष्टिकोण के साथ समस्या यह है कि यदि मूर्तिकार शुरुआत में कोई छोटी सी गलती कर देता है—जैसे कि किसी दीवार को गलत जगह पर तराश देना—तो वे उसी के साथ फंस जाते हैं। क्योंकि वे वापस नहीं जा सकते, इसलिए मूर्ति का बाकी हिस्सा ढह सकता है, या रोबोट एक ऐसा रास्ता चुन सकता है जो सीधे डेड एंड (बंद रास्ते) की ओर ले जाता है। यह रोबोटिक्स के लिए एक बड़ी बात है क्योंकि एक रोबोट जो अपनी गलतियों को सुधार नहीं सकता, वह खतरनाक और अक्षम होता है। वैज्ञानिक इन AI मॉडलों को यह समझने के लिए कि वे पूरे क्रम की संरचना को खोए बिना, अपने चलते-फिरते सुधार कैसे करें, एक तरीका खोजने की कोशिश कर रहे हैं।

यहीं पर एक नया तरीका आता है जिसे डिफ्यूजन रीरोल (Diffusion ReRoll) कहा जाता है। इस पेपर के पीछे के शोधकर्ताओं ने, जो एजेंसी फॉर डिफेंस डेवलपमेंट (Agency for Defense Development) में कार्यरत हैं, मानक मूर्तिकला प्रक्रिया पर एक चतुर मोड़ प्रस्तावित किया है। पूरी मूर्ति को शुरू से अंत तक एक बार में चिकना करने के बजाय, वे मूर्तिकार को रुकने, तैयार हिस्सों को देखने और यह महसूस करने देते हैं कि, "रुको, वह दीवार थोड़ी अजीब लग रही है।" जब ऐसा होता है, तो मूर्तिकार केवल उस हिस्से को अनदेखा नहीं करता; वे उस विशिष्ट खंड को लेते हैं, उसे वापस शोर वाली मिट्टी में बदलते हैं, और फिर से उसे चिकना करना शुरू करते हैं, लेकिन इस बार पूरे मूर्ति के संदर्भ (context) का उपयोग करके ताकि इसे सही किया जा सके।

शोधकर्ता इस प्रक्रिया को "रीरोल" (ReRoll) कहते हैं। कल्पना कीजिए कि आप एक कहानी लिख रहे हैं। पुराने तरीके में, आप पहला अध्याय लिखते हैं, फिर दूसरा, और एक बार जब आप पहला अध्याय पूरा कर लेते हैं, तो आप उसे फिर कभी संपादित नहीं करते, भले ही पहले अध्याय में आपके द्वारा बनाई गई कोई कहानी की कमी (plot hole) अंत को खराब कर दे। डिफिफ़्यूजन रीरोल के साथ, जैसे-जैसे आप कहानी लिखते हैं, आपको एहसास हो सकता है कि शुरुआत उस अंत से मेल नहीं खाती जो आपने अभी सोचा है। इसलिए, आप शुरुआत को "रीरोल" करते हैं: आप उन शब्दों को वापस एक बिखरे हुए ड्राफ्ट में बदलते हैं और उन्हें फिर से लिखते हैं, अब जब आप जानते हैं कि कहानी कैसे समाप्त होती है। यह रोबोट के योजना को लचीला बनाए रखने की अनुमति देता है। यदि रोबोट एक ऐसी गतिविधि की भविष्यवाणी करता है जो स्थानीय रूप से तो अच्छी दिखती है लेकिन वैश्विक स्तर पर खराब है, तो सिस्टम उस विशिष्ट गतिविधि को "रीरोल" कर सकता है, और उसे तब तक परिष्कृत कर सकता है जब तक कि पूरा क्रम समझ में न आने लगे।

शोधकर्ताओं ने इस विचार का परीक्षण कई सिम्युलेटेड वातावरणों में किया, जो वीडियो गेम की दुनिया की तरह हैं जिन्हें वास्तविक रोबोट कार्यों के लिए डिज़ाइन किया गया है। उन्होंने अपने नए "रीरोल" तरीके की तुलना मानक "एकतरफा" डिफ्यूजन मॉडलों और अन्य मौजूदा तकनीकों से की। परिणाम उत्साहजनक थे। लंबी दूरी की भूलभुलैया नेविगेशन कार्यों में, रीरोल विधि ने 'डिफ्यूजन फोर्सिंग' (Diffusion Forcing) नामक अग्रणी पद्धति की तुलना में सफलता दर में लगभग 21% का सुधार किया, और 'डिफ्यूज़र' (Diffuser) नामक दूसरी पद्धति की तुलना में 23% का सुधार किया। उन कार्यों में जहाँ रोबोट को वस्तुओं (जैसे मग उठाना) को संचालित करने के लिए क्रियाओं के क्रम को सीखना था, सफलता दर में सुधार और भी नाटकीय था, जिसमें मानक 'डिफ्यूजन पॉलिसी' (Diffusion Policy) की तुलना में 56.5% की वृद्धि देखी गई।

यह पेपर सुझाव देता है कि योजना के हिस्सों को चुनिंद रूप से "बिखेरने और परिष्कृत करने" की यह क्षमता एक शक्तिशाली उपकरण है। यह रोबोट को लंबे समय तक अपने विकल्प खुले रखने की अनुमति देता है, जिससे वह बहुत जल्दी एक खराब योजना में फंसने से बच जाता है। लेखक नोट करते हैं कि हालांकि ये परिणाम कंप्यूटर सिमुलेशन से हैं और अभी तक वास्तविक दुनिया में भौतिक रोबोटों पर परीक्षण नहीं किए गए हैं, फिर भी यह तरीका दिखाता है कि AI मॉडलों को अपनी सोच को संशोधित करने का तरीका देने से बहुत अधिक स्मार्ट और विश्वसनीय व्यवहार प्राप्त हो सकता है। यह उन रोबोटों की ओर एक कदम है जो केवल एक कठोर स्क्रिप्ट का पालन नहीं करते, बल्कि सोच सकते हैं, यह महसूस कर सकते हैं कि उन्होंने गलती की है, और उसे चलते-चलते ठीक कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →