VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision
VEGA बिना लेबल वाले एगोसेंट्रिक (egocentric) वीडियो से स्थानीय दृश्य ज्यामिति (local scene geometry) को पुनर्गठित करके बाधा-सचेत प्रक्षेपवक्र (obstacle-aware trajectories) उत्पन्न करने के लिए पर्यवेक्षण (supervision) हेतु नेविगेशन विजन-लैंग्वेज-एक्शन मॉडलों को प्रशिक्षित करने की एक विधि प्रस्तुत करता है, जिससे मौजूदा बेसलाइन की तुलना में टकराव बचाव और सफलता दरों में महत्वपूर्ण सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को भीड़भाड़ वाले कमरे में बिना कुर्सियों, लोगों या मेजों से टकराए चलना सिखाना चाहते हैं। आमतौर पर, रोबोट को यह सिखाने के लिए, आपको या तो:
- एक इंसान को उसी कमरे में चलते हुए रिकॉर्ड करना होगा जिसे देखकर रोबोट सीख सके, या
- रोबोट को मैन्युअल रूप से प्रोग्राम करना होगा ताकि वह विशिष्ट बाधाओं से बच सके।
ये दोनों तरीके धीमे, महंगे और बड़े पैमाने पर लागू करने में कठिन हैं। आप दुनिया के हर संभावित कमरे में इंसान को चलते हुए रिकॉर्ड नहीं कर सकते।
मिलिए VEGA से।
इस पेपर के पीछे के शोधकर्ताओं ने इंटरनेट पर मौजूद अरबों "इन-द-वाइल्ड" (वास्तविक दुनिया के) वीडियो (जैसे लोग अपने घरों में घूम रहे हैं, हाइकिंग ट्रेल्स पर हैं, या व्यस्त सड़कों पर हैं) का उपयोग करके रोबोट को नेविगेट करना सिखाने का एक चतुर तरीका निकाला है। ये वीडियो बेहतरीन हैं क्योंकि वे वास्तविक, अव्यवस्थित और भीड़भाड़ वाले वातावरण दिखाते हैं, लेकिन उनमें एक बड़ी समस्या है: वे रोबोट को यह नहीं बताते कि उसे कहाँ जाना है या वह फर्नीचर से कैसे बचना है। वे केवल "एक्शन-रहित" (action-free) वीडियो हैं।
यहाँ बताया गया है कि कैसे VEGA उन रैंडम वीडियो को एक नेविगेशन शिक्षक में बदल देता है, जिसमें कुछ रचनात्मक चरण शामिल हैं:
1. "मानसिक मानचित्र" वाली ट्रिक (The "Mental Map" Trick)
सबसे पहले, VEGA किसी वीडियो के एक सिंगल फ्रेम को देखता है और एक विशेष AI का उपयोग करके कमरे का एक 3D मानसिक मानचित्र (mental map) बनाता है। यह पता लगाता है कि फर्श कहाँ है, दीवारें कहाँ हैं, और बाधाएं (जैसे कॉफी टेबल या कुत्ता) कहाँ खड़ी हैं। यह एक "सेफ्टी मैप" बनाता है जो ठीक से जानता है कि चलने के लिए कितनी जगह उपलब्ध है।
2. "क्या होगा अगर?" वाला खेल (The "What If?" Game)
एक बार मानचित्र बन जाने के बाद, VEGA "क्या होगा अगर?" का खेल खेलता है:
- क्या होगा अगर रोबोट उस लाल कुर्सी तक जाना चाहता हो?
- क्या होगा अगर वह दरवाजे तक जाना चाहता हो?
- क्या होगा अगर वह बस कालीन के एक खाली स्थान तक चलना चाहता हो?
हर संभावित मंजिल के लिए, VEGA एक गणितीय प्लानर (mathematical planner) का उपयोग करके वहां पहुँचने के लिए एक परफेक्ट और सुरक्षित रास्ता की गणना करता है। यह इसे लाखों बार करता है, जिससे "लक्ष्य + सुरक्षित पथ" (Goal + Safe Path) के जोड़ों का एक विशाल पुस्तकालय तैयार होता है।
3. "छात्र" रोबोट (The "Student" Robot)
अब, VEGA एक रोबोट के दिमाग को प्रशिक्षित करता है (जिसे VLA या विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है)। यह छात्र रोबोट मूल वीडियो को देखता है और साथ ही वह "सुरक्षित पथ" भी देखता है जो VEGA ने कैलकुलेट किया है।
- सबक: "यहाँ वह है जो आप देख रहे हैं (वीडियो), यहाँ वह है जहाँ आप जाना चाहते हैं (लक्ष्य), और यहाँ वह सुरक्षित पथ है जिसे आपको अपनाना चाहिए।"
- परिणाम: रोबोट यह सीख जाता है कि एक दृश्य को देखना, एक लक्ष्य (जैसे "किचन में जाओ" या "उस तस्वीर तक जाओ") को समझना और तुरंत एक सुरक्षित रास्ता निकालना। प्रशिक्षण के बाद इसे 3D मैप की आवश्यकता नहीं होती; यह बस अपने कैमरे के फीड का उपयोग करता है।
यह एक बड़ी बात क्यों है?
इसे ड्राइविंग सीखने की तरह समझें।
- पुराना तरीका: आप केवल तभी ड्राइविंग सीखते हैं जब कोई ड्राइविंग इंस्ट्रक्टर आपके बगल में एक विशिष्ट कार में एक विशिष्ट सड़क पर बैठा हो और आपको बताए कि कब मुड़ना है।
- VEGA का तरीका: आप दुनिया भर के डैशकैम फुटेज के लाखों घंटों को देखते हैं। आप उन वीडियो में हर संभावित मंजिल के लिए "परफेक्ट ड्राइविंग लाइन्स" का उपयोग करके कंप्यूटर से गणना करते हैं। फिर आप अपने दिमाग को उन परफेक्ट लाइन्स की नकल करने के लिए प्रशिक्षित करते हैं।
परिणाम
शोधकर्ताओं ने इसका परीक्षण एक वास्तविक रोबोट पर, अव्यवस्थित और चलती-फिरती बाधाओं वाले कमरों में किया। अन्य शीर्ष स्तर के रोबोट नेविगेटर्स की तुलना में:
- सफलता: रोबोट अपनी मंजिल तक बहुत अधिक बार पहुँचा (कम से कम 150% बेहतर)।
- सुरक्षा: वह चीजों से 66% कम टकराया।
- स्थान: उसने खुद को घूमने के लिए अधिक जगह दी, और तंग जगहों से बचने में 60% अधिक सुधार दिखाया।
उन्होंने यह साबित करने के लिए कि उनका तरीका टक्करों से बचने और विशिष्ट लक्ष्यों तक पहुँचने में प्रतिस्पर्धा से बेहतर काम करता है, एक बड़ा टेस्ट भी बनाया जिसे VEGA-Bench कहा जाता है (जिसमें 250,000 दृश्य और 5 मिलियन लक्ष्य हैं)।
संक्षेप में: VEGA इंटरनेट की वीडियो लाइब्रेरी की अराजकता को लेता है, ज्यामिति (geometry) का उपयोग करके उसे एक संरचित "सुरक्षा नियमावली" में बदल देता है, और रोबोट को महंगे, हाथ से रिकॉर्ड किए गए प्रशिक्षण सत्रों की आवश्यकता के बिना वास्तविक दुनिया में नेविगेट करना सिखाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।