← नवीनतम पेपर
🤖 AI

CoFL: Continuous Flow Fields for Language-Conditioned Navigation

CoFL एक एंड-टू-एंड नेविगेशन पॉलिसी है जो बर्ड्स-आई व्यू ऑब्जर्वेशन और लैंग्वेज इंस्ट्रक्शन्स से निरंतर फ्लो फील्ड्स जनरेट करती है, जो भंगुर मॉड्यूलर पाइपलाइनों को एक बड़े पैमाने के डेटासेट पर प्रशिक्षित स्केलेबल, ट्रजेक्टरी-इंटीग्रेटेड दृष्टिकोण से बदलकर अनदेखे वातावरण में सुचारू, प्रतिक्रियाशील और उच्च-प्रदर्शन वाला ज़ीरो-शॉट नेविगेशन सक्षम बनाती है।

मूल लेखक: Haokun Liu, Zhaoqi Ma, Yicheng Chen, Masaki Kitagawa, Wentao Zhang, Jinjie Li, Moju Zhao

प्रकाशित 2026-03-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haokun Liu, Zhaoqi Ma, Yicheng Chen, Masaki Kitagawa, Wentao Zhang, Jinjie Li, Moju Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सिखाने की कोशिश कर रहे हैं कि एक भीड़ भरे कमरे के माध्यम से एक विशिष्ट कुर्सी तक कैसे पहुँचा जाए, लेकिन आप इसे केवल अंग्रेजी में निर्देश दे सकते हैं।

अधिकांश वर्तमान रोबोट अति-उत्साही पर्यटकों (over-caffeinated tourists) की तरह हैं जिनका जीपीएस खराब है। वे पहले कमरे को समझने की कोशिश करते हैं, फिर नक्शे को, फिर रास्ते को, और फिर कदमों को, ये सभी अलग-अलग। यदि वे कोई संकेत गलत पढ़ लेते हैं (यह "अनुभूति" या perception वाला चरण है), तो वे हमेशा के लिए खो जाते हैं। अन्य आंखों पर पट्टी बांधकर नाचने वाले नर्तकों (blindfolded dancers) की तरह हैं जो बिंदु A से बिंदु B तक जाने के लिए 100 कदमों का एक विशिष्ट क्रम याद कर लेते हैं। यदि वे कदम 10 पर लड़खड़ा जाते हैं, तो वे उबर नहीं पाते; वे बस दीवार में टकराते हुए नाचते रहते हैं।

CoFL (कंटीन्यूअस फ्लो फील्ड्स - Continuous Flow Fields) रोबोट की नई महाशक्ति है: यह कदमों में सोचना बंद कर देता है और धाराओं (currents) में सोचना शुरू कर देता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "नदी" की उपमा (मूल विचार)

रोबोट को यह बताने के बजाय कि, "5 कदम आगे बढ़ें, बाएं मुड़ें, 2 कदम चलें," CoFL पूरे कमरे को एक अदृश्य हवा की नदी से रंग देता है।

  • नक्शा: कल्पना करें कि फर्श एक विशाल कैनवास है।
  • निर्देश: आप कहते हैं, "सोफे तक जाओ।"
  • जादू: CoFL तुरंत पूरे कमरे में हवा की तीरों की एक नदी बना देता है जो हर जगह बह रही है, और वे सभी सोफे की ओर इशारा कर रहे हैं।
    • सोफे के पास, तीर धीरे-धीरे घूमते हैं ताकि आपको पार्क करने में मदद मिल सके।
    • दीवार के पास, तीर बाधा से बचने के लिए मुड़ जाते हैं ताकि आप उसके चारों ओर से निकल सकें।
    • कमरे के बीच में, वे सीधे और सुचारू रूप से बहते हैं।

रोबोट को रास्ता बनाने की ज़रूरत नहीं है। उसे बस इस नदी में एक पत्ता (रोबोट) डालना है। नदी पत्ते को स्वाभाविक रूप से सोफे तक ले जाती है, रास्ते में पत्थरों (बाधाओं) से सहजता से बचते हुए। यदि रोबोट अपने रास्ते से भटक जाता है, तो वह बस वापस धारा में आ जाता है और चलता रहता है।

2. "मौसम का पूर्वानुमान" बनाम "यात्रा कार्यक्रम"

  • पुराने रोबोट (यात्रा कार्यक्रम/Itinerary): वे एक सख्त यात्रा कार्यक्रम लिखने की कोशिश करते हैं: "कदम 1: 2 मीटर चलें। कदम 2: 45 डिग्री मुड़ें।" यदि फर्श फिसलन भरा है या कोई कुर्सी हिल जाती है, तो यात्रा कार्यक्रम टूट जाता है।
  • CoFL (मौसम का पूर्वानुमान/Weather Forecast): यह पूरे कमरे के लिए "हवा" की भविष्यवाणी करता है। इसे विशिष्ट कदमों की परवाह नहीं है; यह बस जानता है कि फर्श के हर एक स्थान पर दिशा और गति क्या होनी चाहिए। यह इसे अविश्वसनीय रूप से लचीला बनाता है। यदि आप इसे किसी अलग स्थान से शुरू करने के लिए कहते हैं, तो "नदी" पहले से ही वहां इसका इंतज़ार कर रही होती है।

3. उन्होंने रोबोट को कैसे सिखाया (द "वीडियो गेम" ट्रेनिंग)

इस रोबोट को सिखाने के लिए, शोधकर्ताओं ने उसे केवल कुछ तस्वीरें नहीं दिखाईं। उन्होंने एक विशाल वीडियो गेम सिम्युलेटर बनाया जिसमें 5,00,000 से अधिक स्तर थे (घरों और कार्यालयों के वास्तविक 3D स्कैन का उपयोग करके)।

  • ट्रेनिंग: उन्होंने रोबोट को केवल "कुर्सी तक जाओ" नहीं दिखाया। उन्होंने गेम के हर एक कमरे के लिए एक "परफेक्ट नदी" तैयार की।
  • सबक: रोबोट ने एक कमरे को देखना (एक ड्रोन की नज़र से, जैसे ऊपर से देखते हुए) और तुरंत भविष्यवाणी करना सीखा: "यदि मैं यहाँ हूँ, तो हवा इस दिशा में बहनी चाहिए। यदि मैं वहाँ हूँ, तो इसे उस दिशा में बहना चाहिए।"

4. "ज़ीरो-शॉट" (Zero-Shot) महाशक्ति

सबसे शानदार बात? रोबोट को केवल वीडियो गेम में प्रशिक्षित किया गया था। उसने पहले कभी वास्तविक रोबोट नहीं देखा था।

जब उन्होंने इसे एक वास्तविक कमरे में असली फर्नीचर और असली बाधाओं के साथ रखा, तो यह तुरंत पूरी तरह से काम करने लगा। इसे "पुनः सीखने" या "फाइन-ट्यून" करने की आवश्यकता नहीं थी। यह एक वीडियो गेम के पात्र की तरह था जो स्क्रीन से बाहर निकलकर आपके लिविंग रूम में चल रहा है, यह जानते हुए कि बिना कभी देखे ही आपकी कॉफी टेबल से कैसे बचना है।

यह एक बड़ी बात क्यों है?

  • सुरक्षा: क्योंकि यह बाधाओं के आसपास की "धाराओं" को देखता है, इसलिए यह शायद ही कभी टकराता है। यह पानी की तरह चीजों के चारों ओर बहता है।
  • सुगमता (Smoothness): यह झटके नहीं लेता या रुकता-रुकता नहीं है। यह एक तरल पदार्थ की तरह चलता है।
  • गति: यह रास्ता तुरंत निकाल लेता है। इसे हर एक कदम के बारे में गहराई से सोचने की आवश्यकता नहीं है; यह बस प्रवाह का अनुसरण करता है।

संक्षेप में: CoFL ने नेविगेशन को निर्देशों के एक कठोर सेट से बदलकर एक प्राकृतिक, बहते हुए आंदोलन में बदल दिया है, जिससे रोबोट एक धारा में बहते पत्ते की तरह जटिल कमरों में आसानी से घूम सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →