From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation
यह शोध पत्र FlowPilot को प्रस्तुत करता है, जो एक मैपलेस नेविगेशन पॉलिसी है जो लंबी अवधि के फुटपाथ कार्यों के लिए बड़े पैमाने पर फ्लीट डेटा पर एंकोर्ड फ्लो मैचिंग का उपयोग करके प्री-ट्रेनिंग करती है और सामाजिक अनुपालन एवं काउंटरफैक्चुअल रीजनिंग को बढ़ाने के लिए ह्यूम-इन-द-लूप प्रेफरेंस लर्निंग का लाभ उठाती है, जिससे केवल एक मोनोक्यूलर RGB कैमरे के साथ मजबूत प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नए डिलीवरी रोबोट को एक व्यस्त शहर के फुटपाथ पर नेविगेट करना सिखा रहे हैं। आप चाहते हैं कि वह केवल अपने सिर पर लगे एक सिंगल कैमरे का उपयोग करके मीलों चले, पैदल चलने वालों से बचकर निकले, पार्क किए गए स्कूटरों से दूर रहे और सामाजिक नियमों (जैसे लोगों का रास्ता न काटना) का पालन करे।
यह पेपर FlowPilot को पेश करता है, जो इन रोबोट्स के लिए एक नया "दिमाग" है जो वर्तमान तकनीक की तीन बड़ी समस्याओं को हल करता है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है।
समस्या: "अति-आत्मविश्वासी छात्र" (The Overconfident Student)
वर्तमान रोबोट इमिटेशन लर्निंग (Imitation Learning) का उपयोग करके प्रशिक्षित किए जाते हैं। इसे ऐसे समझें जैसे कोई छात्र एक मास्टर ड्राइवर के घंटों के वीडियो देख रहा हो।
- समस्या: यदि छात्र केवल वीडियो की नकल करता है, तो वास्तविक दुनिया में चीजें उलझने पर वह भ्रमित हो सकता है। वह छोटी-छोटी गलतियाँ कर सकता है जो जमा होकर बड़ी हो जाती हैं (जैसे ढलान से लुढ़कता हुआ हिमखंड), वह इसलिए फंस सकता है क्योंकि उसे नहीं पता कि ऐसी स्थिति को कैसे संभालना है जो उसने पहले नहीं देखी है, या वह पैदल चलने वालों के साथ अभद्र व्यवहार कर सकता है क्योंकि उसने फुटपाथ के "सामाजिक नियम" नहीं सीखे हैं।
- अंतराल: केवल वीडियो देखना (नकल करना) एक ऐसे रोबोट को बनाने के लिए पर्याप्त नहीं है जो सुरक्षित और सामाजिक रूप से विनम्र दोनों हो।
समाधान: FlowPilot की दो-चरणीय ट्रेनिंग
लेखकों ने इस समस्या को ठीक करने के लिए एक दो-चरणीय प्रशिक्षण प्रक्रिया बनाई है: चरण 1 है "बुनियादी बातें सीखना" और चरण 2 है "बारीकियों को सीखना।"
चरण 1: "एंकर्ड फ्लो" (बुनियादी बातें सीखना)
केवल एक एकल पथ का अनुमान लगाने के बजाय, रोबोट को यह समझने की आवश्यकता है कि किसी बाधा के चारों ओर जाने के कई तरीके हो सकते हैं (जैसे बाईं ओर जाना, दाईं ओर जाना, या धीमा होना)।
- उपमा: कल्पना करें कि एक नदी चट्टानों के चारों ओर बह रही है। कभी-कभी पानी कई धाराओं में विभाजित हो जाता है। पुराने तरीकों ने या तो केवल एक धारा का अनुमान लगाने की कोशिश की, या वे बहुत अराजक थे।
- नवाचार: FlowPilot "एंकर्ड फ्लो मैचिंग" (Anchored Flow Matching) का उपयोग करता है।
- एंकर्स (Anchors): इन्हें "मानसिक बुकमार्क" या विशिष्ट ड्राइविंग शैलियों (जैसे, "आक्रामक पास होने वाला", "विनम्रता से रास्ता देने वाला") के रूप में सोचें। रोबोट पहले इन विशिष्ट शैलियों को सीखता है।
- फ्लो (Flow): एक बार जब इसके पास ये बुकमार्क आ जाते हैं, तो यह उनके बीच में सुचारू रूप से बहना सीखता है। यह रोबोट को सुचारू, यथार्थवादी पथ बनाने की अनुमति देता है जो एक मानव द्वारा कठिन स्थान पर नेविगेट करने के विभिन्न तरीकों को कवर करते हैं, न कि एक एकल, कठोर पैटर्न में फंस जाता है।
चरण 2: "ह्यूमन-इन-द-लूप" (बारीकियों को सीखना)
बेहतरीन बुनियादी बातों के साथ भी, एक विशिष्ट कैमरा और पहियों वाले विशिष्ट रोबोट पर तैनात होने पर रोबोट थोड़ा अनाड़ी या सामाजिक रूप से अजीब हो सकता है।
- उपमा: कल्पना करें कि रोबोट एक नया कर्मचारी है। वह नौकरी का विवरण (चरण 1 से) जानता है, लेकिन वह अभी तक आपकी विशिष्ट कार्यालय संस्कृति को नहीं जानता है।
- नवाचार: टीम ने एक प्रेफरेंस लर्निंग (Preference Learning) प्रणाली पेश की है।
- एक मानव पर्यवेक्षक वास्तविक जीवन में रोबोट को देखता है।
- यदि रोबोट कुछ असुरक्षित या अभद्र करने लगता है, तो मानव धीरे से उसे वापस सही रास्ते पर लाता है।
- रोबोट सीखता है: "आह, मानव ने उस क्रिया के बजाय इस क्रिया को प्राथमिकता दी।"
- केवल मानव के सुधार की नकल करने के बजाय, रोबोट वरीयता (preference) को सीखता है। वह समझता है, "इस स्थिति में, तेज़ होने से बेहतर विनम्र होना है।" यह चरण "वीडियो की नकल करने" और "मानवीय मूल्यों के साथ तालमेल बिठाने" के बीच के अंतर को पाटता है।
परिणाम: एक स्मार्ट, सुरक्षित रोबोट
टीम ने कंप्यूटर सिमुलेशन और वास्तविक दुनिया की शहर की सड़कों दोनों में इस प्रणाली का परीक्षण किया।
- सिमुलेशन में: बेस वर्ज़न FlowPilot 42% बार सफल रहा (जो अन्य तरीकों की तुलना में एक बड़ी छलांग है)।
- वास्तविक दुनिया में: जब उन्होंने "ह्यूमन प्रेफरेंस" ट्रेनिंग (FlowPilot-HP) जोड़ी, तो रोबोट नियमों का पालन करने में बहुत बेहतर हो गया।
- इसे मानव हस्तक्षेप की आवश्यकता 40% कम पड़ी।
- इसने उन गलतियों को 52% कम किया जिनमें मानव को हस्तक्षेप करने की आवश्यकता थी।
- यह "सामाजिक अनुपालन" (social compliance) में बहुत बेहतर था, जिसका अर्थ है कि इसने लोगों का रास्ता नहीं काटा या बाधाओं के बहुत करीब नहीं गया।
सारांश
Flow-Pilot को एक ऐसे रोबोट ड्राइवर के रूप में सोचें जो पहले वीडियो के एक विशाल पुस्तकालय से ड्राइविंग की जटिल भौतिकी सीखता है (चरण 1), और फिर उसे एक मानव पर्यवेक्षक से "मेंटरशिप" मिलती है जो उसकी बुरी आदतों को सुधारता है और उसे सड़क के अलिखित नियम सिखाता है (चरण 2)। परिणाम एक ऐसा रोबोट है जो केवल एक सिंगल कैमरे का उपयोग करके, व्यस्त फुटपाथों पर लंबी दूरी सुरक्षित रूप से, सुचारू रूप से और विनम्रता से नेविगेट कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।