← नवीनतम पेपर
🤖 AI

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

यह शोध पत्र FlowPilot को प्रस्तुत करता है, जो एक मैपलेस नेविगेशन पॉलिसी है जो लंबी अवधि के फुटपाथ कार्यों के लिए बड़े पैमाने पर फ्लीट डेटा पर एंकोर्ड फ्लो मैचिंग का उपयोग करके प्री-ट्रेनिंग करती है और सामाजिक अनुपालन एवं काउंटरफैक्चुअल रीजनिंग को बढ़ाने के लिए ह्यूम-इन-द-लूप प्रेफरेंस लर्निंग का लाभ उठाती है, जिससे केवल एक मोनोक्यूलर RGB कैमरे के साथ मजबूत प्रदर्शन प्राप्त होता है।

मूल लेखक: Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए डिलीवरी रोबोट को एक व्यस्त शहर के फुटपाथ पर नेविगेट करना सिखा रहे हैं। आप चाहते हैं कि वह केवल अपने सिर पर लगे एक सिंगल कैमरे का उपयोग करके मीलों चले, पैदल चलने वालों से बचकर निकले, पार्क किए गए स्कूटरों से दूर रहे और सामाजिक नियमों (जैसे लोगों का रास्ता न काटना) का पालन करे।

यह पेपर FlowPilot को पेश करता है, जो इन रोबोट्स के लिए एक नया "दिमाग" है जो वर्तमान तकनीक की तीन बड़ी समस्याओं को हल करता है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है।

समस्या: "अति-आत्मविश्वासी छात्र" (The Overconfident Student)

वर्तमान रोबोट इमिटेशन लर्निंग (Imitation Learning) का उपयोग करके प्रशिक्षित किए जाते हैं। इसे ऐसे समझें जैसे कोई छात्र एक मास्टर ड्राइवर के घंटों के वीडियो देख रहा हो।

  • समस्या: यदि छात्र केवल वीडियो की नकल करता है, तो वास्तविक दुनिया में चीजें उलझने पर वह भ्रमित हो सकता है। वह छोटी-छोटी गलतियाँ कर सकता है जो जमा होकर बड़ी हो जाती हैं (जैसे ढलान से लुढ़कता हुआ हिमखंड), वह इसलिए फंस सकता है क्योंकि उसे नहीं पता कि ऐसी स्थिति को कैसे संभालना है जो उसने पहले नहीं देखी है, या वह पैदल चलने वालों के साथ अभद्र व्यवहार कर सकता है क्योंकि उसने फुटपाथ के "सामाजिक नियम" नहीं सीखे हैं।
  • अंतराल: केवल वीडियो देखना (नकल करना) एक ऐसे रोबोट को बनाने के लिए पर्याप्त नहीं है जो सुरक्षित और सामाजिक रूप से विनम्र दोनों हो।

समाधान: FlowPilot की दो-चरणीय ट्रेनिंग

लेखकों ने इस समस्या को ठीक करने के लिए एक दो-चरणीय प्रशिक्षण प्रक्रिया बनाई है: चरण 1 है "बुनियादी बातें सीखना" और चरण 2 है "बारीकियों को सीखना।"

चरण 1: "एंकर्ड फ्लो" (बुनियादी बातें सीखना)

केवल एक एकल पथ का अनुमान लगाने के बजाय, रोबोट को यह समझने की आवश्यकता है कि किसी बाधा के चारों ओर जाने के कई तरीके हो सकते हैं (जैसे बाईं ओर जाना, दाईं ओर जाना, या धीमा होना)।

  • उपमा: कल्पना करें कि एक नदी चट्टानों के चारों ओर बह रही है। कभी-कभी पानी कई धाराओं में विभाजित हो जाता है। पुराने तरीकों ने या तो केवल एक धारा का अनुमान लगाने की कोशिश की, या वे बहुत अराजक थे।
  • नवाचार: FlowPilot "एंकर्ड फ्लो मैचिंग" (Anchored Flow Matching) का उपयोग करता है।
    • एंकर्स (Anchors): इन्हें "मानसिक बुकमार्क" या विशिष्ट ड्राइविंग शैलियों (जैसे, "आक्रामक पास होने वाला", "विनम्रता से रास्ता देने वाला") के रूप में सोचें। रोबोट पहले इन विशिष्ट शैलियों को सीखता है।
    • फ्लो (Flow): एक बार जब इसके पास ये बुकमार्क आ जाते हैं, तो यह उनके बीच में सुचारू रूप से बहना सीखता है। यह रोबोट को सुचारू, यथार्थवादी पथ बनाने की अनुमति देता है जो एक मानव द्वारा कठिन स्थान पर नेविगेट करने के विभिन्न तरीकों को कवर करते हैं, न कि एक एकल, कठोर पैटर्न में फंस जाता है।

चरण 2: "ह्यूमन-इन-द-लूप" (बारीकियों को सीखना)

बेहतरीन बुनियादी बातों के साथ भी, एक विशिष्ट कैमरा और पहियों वाले विशिष्ट रोबोट पर तैनात होने पर रोबोट थोड़ा अनाड़ी या सामाजिक रूप से अजीब हो सकता है।

  • उपमा: कल्पना करें कि रोबोट एक नया कर्मचारी है। वह नौकरी का विवरण (चरण 1 से) जानता है, लेकिन वह अभी तक आपकी विशिष्ट कार्यालय संस्कृति को नहीं जानता है।
  • नवाचार: टीम ने एक प्रेफरेंस लर्निंग (Preference Learning) प्रणाली पेश की है।
    • एक मानव पर्यवेक्षक वास्तविक जीवन में रोबोट को देखता है।
    • यदि रोबोट कुछ असुरक्षित या अभद्र करने लगता है, तो मानव धीरे से उसे वापस सही रास्ते पर लाता है।
    • रोबोट सीखता है: "आह, मानव ने उस क्रिया के बजाय इस क्रिया को प्राथमिकता दी।"
    • केवल मानव के सुधार की नकल करने के बजाय, रोबोट वरीयता (preference) को सीखता है। वह समझता है, "इस स्थिति में, तेज़ होने से बेहतर विनम्र होना है।" यह चरण "वीडियो की नकल करने" और "मानवीय मूल्यों के साथ तालमेल बिठाने" के बीच के अंतर को पाटता है।

परिणाम: एक स्मार्ट, सुरक्षित रोबोट

टीम ने कंप्यूटर सिमुलेशन और वास्तविक दुनिया की शहर की सड़कों दोनों में इस प्रणाली का परीक्षण किया।

  • सिमुलेशन में: बेस वर्ज़न FlowPilot 42% बार सफल रहा (जो अन्य तरीकों की तुलना में एक बड़ी छलांग है)।
  • वास्तविक दुनिया में: जब उन्होंने "ह्यूमन प्रेफरेंस" ट्रेनिंग (FlowPilot-HP) जोड़ी, तो रोबोट नियमों का पालन करने में बहुत बेहतर हो गया।
    • इसे मानव हस्तक्षेप की आवश्यकता 40% कम पड़ी।
    • इसने उन गलतियों को 52% कम किया जिनमें मानव को हस्तक्षेप करने की आवश्यकता थी।
    • यह "सामाजिक अनुपालन" (social compliance) में बहुत बेहतर था, जिसका अर्थ है कि इसने लोगों का रास्ता नहीं काटा या बाधाओं के बहुत करीब नहीं गया।

सारांश

Flow-Pilot को एक ऐसे रोबोट ड्राइवर के रूप में सोचें जो पहले वीडियो के एक विशाल पुस्तकालय से ड्राइविंग की जटिल भौतिकी सीखता है (चरण 1), और फिर उसे एक मानव पर्यवेक्षक से "मेंटरशिप" मिलती है जो उसकी बुरी आदतों को सुधारता है और उसे सड़क के अलिखित नियम सिखाता है (चरण 2)। परिणाम एक ऐसा रोबोट है जो केवल एक सिंगल कैमरे का उपयोग करके, व्यस्त फुटपाथों पर लंबी दूरी सुरक्षित रूप से, सुचारू रूप से और विनम्रता से नेविगेट कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →