← नवीनतम पेपर
💻 computer science

RoamFlow: Reinforcement-Aligned One-Step Action MeanFlow Policy for Image-Goal Navigation

RoamFlow एक जनरेटिव नेविगेशन फ्रेमवर्क है जो कुशल कुछ-चरणों वाले प्रक्षेपवक्र संश्लेषण (trajectory synthesis) के लिए MeanFlow का उपयोग करता है और सिम्युलेटेड एवं वास्तविक दुनिया के वातावरण में उच्च-प्रदर्शन वाली इमेज-गोल नेविगेशन प्राप्त करने के लिए विशेषज्ञ अनुकरण (expert imitation) के साथ सुदृढीकरण शिक्षण (reinforcement learning) को संयोजित करने वाली एक दो-चरणीय प्रशिक्षण रणनीति का उपयोग करता है।

मूल लेखक: Zixuan Zhang, Yuqi Chen, Junjie Gao, Siyuan Song, Yongzhou Pan, Beichen Wang, Mir Feroskhan

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zixuan Zhang, Yuqi Chen, Junjie Gao, Siyuan Song, Yongzhou Pan, Beichen Wang, Mir Feroskhan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को घर के बिखरे हुए सामान के बीच से गुजरते हुए सोफे की एक विशिष्ट फोटो खोजने के लिए निर्देशित करने की कोशिश कर रहे हैं। रोबोट के पास कोई नक्शा नहीं है; उसके पास केवल एक कैमरा और लक्ष्य के रूप में वह सोफे की एक फोटो है। यह इमेज-गोल नेविगेशन (Image-Goal Navigation) की चुनौती है।

यह पेपर RoamFlow नामक एक नई प्रणाली पेश करता है जो रोबोट को पिछले तरीकों की तुलना में बहुत तेज़ी से और समझदारी से यह काम करने में मदद करती है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "कदम-दर-कदम" का संघर्ष

पुराने रोबोटों के दिमाग एक ऐसे व्यक्ति की तरह काम करते थे जो भूलभुलैया को हल करने के लिए एक बार में एक छोटा कदम उठाने, चारों ओर देखने, अगला कदम तय करने और इसे दोहराने की कोशिश करता है।

  • समस्या: यह धीमा है। यदि रोबोट को सोफे तक पहुँचने के लिए 50 कदमों की योजना बनानी है, तो उसे 50 अलग-अलग बार "सोचना" होगा। जब तक वह सोचना समाप्त करता है, तब तक किसी चलते हुए अवरोध के प्रति प्रतिक्रिया करने के लिए बहुत देर हो चुकी होती है। साथ भी, क्योंकि वह केवल एक कदम आगे देखता है, वह अक्सर "मायोपिक" (निकट-दृष्टि वाला) हो जाता है और एक ऐसा बुरा रास्ता चुन लेता है जो उसे डेड एंड (बंद रास्ते) की ओर ले जाता है।

2. समाधान: "एक-कदम का सपना" (MeanFlow)

RoamFlow खेल बदल देता है। एक समय में एक कदम सोचने के बजाय, यह MeanFlow नामक तकनीक का उपयोग करता है ताकि एक ही झटके में पूरे रास्ते का "सपना" देख सके।

  • उपमा: कल्पना कीजिए कि आप एक कलाकार हैं।
    • पुराना तरीका (Diffusion): आप स्टैटिक नॉइज़ (static noise) से ढके एक खाली कैनवास से शुरुआत करते हैं। आप धीरे-धीरे शोर को मिटाते हैं, चित्र को एक बार में एक छोटे ब्रशस्ट्रोक के साथ परिष्कृत करते हैं जब तक कि छवि दिखाई न देने लगे। इसमें कई चरण लगते हैं।
    • RoamFlow (MeanFlow): शोर को धीरे-धीरे मिटाने के बजाय, यह सीखता है कि वह "औसत हवा" क्या है जो शोर को सीधे अंतिम चित्र में बदल देती है। आप एक ही छलांग में पूरे चित्र की भविष्यवाणी कर सकते हैं।
  • परिणाम: रोबोट 50 अलग-अलग चालें नहीं निकालता। वह एक ही बार में यह गणना करता है कि जहाँ वह है वहाँ से लक्ष्य तक पहुँचने के लिए "औसत दिशा" क्या होनी चाहिए। यह इसे अविश्वसनीय रूप से तेज़ बनाता है, जिससे यह बिना लैग (lag) के छोटे, बैटरी से चलने वाले रोबोट पर चल सकता है।

3. प्रशिक्षण: "चेला" फिर "कोच"

यह पेपर रोबोट को सिखाने के लिए दो चरणों वाली प्रशिक्षण प्रक्रिया का उपयोग करता है, जो बिल्कुल वैसा ही है जैसे कोई इंसान नया कौशल सीखता है।

  • चरण 1: चेला (इमिटेशन लर्निंग - Imitation Learning):
    पहले, रोबोट एक "मास्टर" (एक विशेषज्ञ कंप्यूटर एल्गोरिदम) को आदर्श रास्तों पर नेविगेट करते हुए देखता है। वह मास्टर की नकल बिल्कुल वैसे ही करने की कोशिश करता है। यह रोबोट को एक अच्छी शुरुआत देता है ताकि वह दीवारों से टकराकर चलना शुरू न करे।
  • चरण 2: कोच (रीइन्फोर्समेंट लर्निंग - Reinforcement Learning):
    सिर्फ नकल करना काफी नहीं है क्योंकि वास्तविक दुनिया अव्यवस्थित होती है। इसके बाद रोबोट को एक वीडियो गेम सिमुलेशन (Habitat) में डाला जाता है जहाँ उसे लक्ष्य तक जल्दी पहुँचने के लिए अंक मिलते हैं और दीवारों से टकराने पर अंक कटते हैं। वह अपने आप अभ्यास करता है, मास्टर की गलतियों को सुधारना सीखता है और नई, पेचीदा स्थितियों के अनुकूल होना सीखता है।

4. सुरक्षा फ़िल्टर: "ट्रैफिक पुलिस"

एक तेज़ दिमाग होने के बावजूद, रोबोट कुछ अलग-अलग संभावित रास्ते बना सकता है (जैसे, "बाएँ जाओ," "दाएँ जाओ," "सीधे जाओ")।

  • नवाचार: RoamFlow में एक विशेष "ट्रैफिक पुलिस" मॉड्यूल (एक ट्रजेक्टरी इवैल्यूएटर) होता है। यह उन सभी संभावित रास्तों को देखता है जो रोबोट ने अपने सपने में देखे थे और तुरंत सबसे सुरक्षित और सुगम रास्ता चुनता है।
  • उपमा: यह एक ऑर्केस्ट्रा के कंडक्टर की तरह है। संगीतकार (जेनरेटर) कुछ अलग नोट्स बजा सकते हैं, लेकिन कंडक्टर (इवैल्यूएटर) वही चुनता है जो सही लगता है और संगीत को बिना क्रैश हुए बहने देता है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

लेखकों ने कंप्यूटर सिमुलेशन और एक वास्तविक रोबोट कुत्ते (Unitree Go2) दोनों पर इसका परीक्षण किया।

  • गति: यह लगभग 19 मिलीसेकंड (1/50 सेकंड से भी कम) में चलता है, जो वास्तविक समय के नियंत्रण के लिए पर्याप्त तेज़ है।
  • सफलता: यह अन्य उच्च-तकनीकी तरीकों की तुलना में अपने लक्ष्य तक अधिक बार पहुँचा और इसने कम बाधाओं से टकराया।
  • दक्षता: यह बिना सुपरकंप्यूटर की आवश्यकता के उच्च प्रदर्शन प्राप्त करता है; यह रोबोट से जुड़े एक छोटे चिप पर काम करता है।

संक्षेप में, RoamFlow रोबोट को सिखाता है कि कैसे एक ही बार में पूरे रास्ते को "देखना" है, पूर्णता तक अभ्यास करना है, और फिर पलक झपकते ही सबसे सुरक्षित मार्ग को चुनना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →