← नवीनतम पेपर
🤖 AI

FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models

FoMoVLA एक नवीन फ्रेमवर्क है जो विज़न-लैंग्वेज-एक्शन मॉडल्स को भविष्य के फीचर फोरसाइट (future feature foresight) और स्पार्स 2D पॉइंट ट्रैकिंग को संयुक्त रूप से सीखकर उन्नत करता है ताकि लक्ष्य भविष्यवाणी और निरंतर गति मार्गदर्शन के बीच के अंतर को पाटा जा सके, जिससे कई रोबोटिक बेंचमार्क पर अत्याधुनिक प्रदर्शन और मजबूत ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त होता है।

मूल लेखक: Wei Li, Peijin Jia, Yuan Ma, Xuefeng Jiang, Titong Jiang, Sheng Sun, Yujian Li, Xin Wen, Han Hong, Zhikang Liu, Bailin Li, Kun Zhan

प्रकाशित 2026-07-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wei Li, Peijin Jia, Yuan Ma, Xuefeng Jiang, Titong Jiang, Sheng Sun, Yujian Li, Xin Wen, Han Hong, Zhikang Liu, Bailin Li, Kun Zhan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। आप उसे सामग्री की एक तस्वीर दिखाते हैं और कहते हैं, "मेरे लिए एक टर्की क्लब बनाओ।" एक मानक रोबोट मस्तिष्क तस्वीर को देख सकता है, अगले कदम का अनुमान लगा सकता है, ब्रेड पकड़ सकता है, और बस उम्मीद कर सकता है कि सब ठीक हो जाए। यह "हॉट और कोल्ड" (पास या दूर) का खेल खेलने जैसा है जहाँ आप केवल उसी पर प्रतिक्रिया देते हैं जो उस क्षण हो रहा है। लेकिन वास्तविक जीवन एक स्लाइड शो नहीं, बल्कि एक फिल्म है। जटिल कार्यों को करने के लिए, आपको भविष्य की कल्पना करने की आवश्यकता होती है: "यदि मैं अभी टर्की पकड़ता हूँ, तो ब्रेड फिसल जाएगी, और मुझे उसे पकड़ने की आवश्यकता होगी।" यही विज़न-लैंग्वेज-एक्शन (VLA) मॉडल की चुनौती है। ये वे स्मार्ट दिमाग हैं जो एक रोबोट के देखने और सुनने को भौतिक गतिविधियों में बदलने की कोशिश कर रहे हैं। वैज्ञानिक बड़ा सवाल यह पूछ रहे हैं कि: हम रोबोट को केवल प्रतिक्रिया देना ही नहीं, बल्कि पूर्वानुमान लगाना कैसे सिखाएं? हम इसे यह कैसे समझाएं कि किसी वस्तु को केवल कहाँ जाना है, बल्कि वह वहाँ कैसे पहुँचती है?

यहाँ FoMoVLA आता है, एक नया फ्रेमवर्क जो रोबोट के दिमाग के लिए "क्रिस्टल बॉल" (भविष्य दिखाने वाला गोला) की तरह काम करता है। शोधकर्ताओं का तर्क है कि मौजूदा तरीके पहेली का एक महत्वपूर्ण हिस्सा भूल रहे हैं। कुछ तरीके पूरे भविष्य के चित्र को पिक्सेल-दर-पिक्सेल भविष्यवाणी करने की कोशिश करते हैं, जो तूफान में हर एक बूंद की भविष्यवाणी करने जैसा है—यह बहुत अधिक डेटा है और बहुत धीमा है। अन्य केवल अंतिम गंतव्य का अनुमान लगाते हैं, जैसे यह कहना कि "सैंडविच प्लेट पर होगा," लेकिन वहां तक पहुँचने की उथल-पुथल भरी यात्रा को भूल जाते हैं। FoMoVLA इसे ठीक करता है क्योंकि यह रोबोट को एक साथ दो पूरक कौशल सिखाता है: विजुअल फोरसाइट (दृश्य दूरदर्शिता) (दृश्य की अंतिम स्थिति की कल्पना करना) और मोशन गाइडेंस (गति मार्गदर्शन) (उन विशिष्ट पथों को ट्रैक करना जिनसे वस्तुएं वहां पहुँचती हैं)। इसे ऐसे समझें जैसे रोबلت को मानचित्र पर एक गंतव्य देखना (दूरदर्शिता) और साथ ही साथ वहां तक पहुँचने के लिए घुमावदार सड़क का पीछा करने वाले जीपीएस डॉट को देखना (गति)। इन दोनों को जोड़कर, रोबोट को चलने के तरीके की बहुत स्पष्ट और भौतिक समझ मिलती है, जिससे ब्लॉक को स्टैक करने या वस्तुओं को उठाने जैसे कठिन कार्यों पर बेहतर प्रदर्शन होता है, और वह वास्तव में काम करते समय रोबोट को धीमा भी नहीं करता है।

समस्या: वे रोबोट जो भविष्य देख नहीं सकते

आज के अधिकांश रोबोट दिमाग अविश्वसनीय रूप से प्रतिक्रियाशील (reactive) हैं। वे एक कप देखते हैं, वे उसे पकड़ते हैं। वे एक दरवाजा देखते हैं, वे उसे धकेलते हैं। लेकिन वे "क्या होगा अगर" वाले सवालों में संघर्ष करते हैं। यदि एक रोबोट एक भारी बॉक्स को हिलाने की कोशिश करता है, तो उसे यह जानने की आवश्यकता है कि बॉक्स गिरने से पहले ही वह झुक सकता है। वर्तमान तरीके इसे या तो पूरे भविष्य के वीडियो फ्रेम-दर-फ्रेम की भविष्यवाणी करके (जो गणनात्मक रूप से भारी है और बैकग्राउंड की दीवार जैसी बेकार विवरणों से भरा है) या केवल अंतिम लक्ष्य अवस्था की भविष्यवाणी करके (जो रोबोट को बताता है कि कहाँ जाना है लेकिन यह नहीं कि वहाँ कैसे पहुँचना है) हल करने की कोशिश करते हैं।

इस पेपर के लेखक सुझाव देते हैं कि ये दोनों दृष्टिकोण वास्तव में अच्छे दोस्त हैं जिन्हें एक-दूसरे से परिचित कराने की आवश्यकता है। आपको "लक्ष्य" (अंतिम चित्र) और "पथ" (गति) दोनों की आवश्यकता है। यदि आपके पास केवल लक्ष्य है, तो रोबोट यात्रा के भौतिक विज्ञान को नहीं जानता। यदि आपके पास केवल पथ है, तो रोबोट बिना किसी गंतव्य के भटक सकता है।

समाधान: FoMoVLA का दो-तरफा दृष्टिकोण

FoMoVLA (फोरसाइट एंड मोशन VLA) एक प्रशिक्षण फ्रेमवर्क है जो रोबोट को एक साथ दोनों चीजें करना सिखाता है। यह रोबोट के दिमाग को स्थायी रूप से नहीं बदलता है; इसके बजाय, यह एक विशेष "प्रशिक्षण मोड" जोड़ता है जहाँ रोबोट अपने मुख्य कार्य के साथ दो अतिरिक्त चीजें सीखता है।

  1. क्रिस्टल बॉल (फ्यूचर फीचर प्रेडिक्शन): रोबोट को यह कल्पना करने के लिए सिखाया जाता है कि कार्य पूरा होने के बाद दृश्य कैसा दिखेगा। पूरे भविष्य के चित्र को फिर से बनाने की कोशिश करने के बजाय (जो कठिन है), यह भविष्य की स्थिति के "वाइब" या प्रमुख विशेषताओं की भविष्यवाणी करना सीखता है। यह एक पहेली को देखकर यह अनुमान लगाने जैसा है कि अंतिम चित्र कैसा दिखेगा, बिना हर एक टुकड़े को फिर से बनाए।
  2. जीपीएस ट्रैकर (स्पार्स पॉइंट ट्रैकिंग): साथ ही, रोबोट वस्तुओं पर चलते हुए विशिष्ट बिंदुओं को ट्रैक करना सीखता है। कल्पना कीजिए कि आपने एक कप पर एक छोटा सा स्टिकर लगाया है और उसे मेज पर फिसलते हुए देख रहे हैं। रोबोट भविष्यवाणी करना सीखता है कि अगले कुछ सेकंड में वह स्टिकर बिल्कुल कहाँ होगा। यह रोबोट को गति के "कैसे" को सिखाता—क्रिया का निरंतर प्रवाह।

सीक्रेट सॉस: बिंदुओं को जोड़ना

असली जादू इस बात में है कि ये दो कौशल एक-दूसरे से कैसे बात करते हैं। कई पिछले प्रयासों में, रोबोटों ने इन कौशलों को अलग-अलग सीखा, जैसे दो छात्र अलग-अलग कमरों में पढ़ाई कर रहे हों। FoMoVla उन्हें FCCA (फ्यूचर-कंडीशन्ड क्रॉस-अटेंशन) नामक एक विशेष मॉड्यूल का उपयोग करके एक साथ सहयोग करने के लिए मजबूर करता है।

यह कैसे काम करता है: "क्रिस्टल बॉल" (भविष्य की भविष्यवाणी) "जीपीएस ट्रैकर" (गति की भविष्यवाणी) को बताती है कि गंतव्य कैसा दिखता है। ट्रैकर फिर वहां पहुँचने के लिए सबसे अच्छे पथ का पता लगाने के लिए उस जानकारी का उपयोग करता है। यह एक ड्राइवर (ट्रैकर) की तरह है जो गंतव्य (दूरदर्शिता) को जानता है, तो वह मोड़ लेने का अनुमान लगाने वाले ड्राइवर की तुलना में बहुत बेहतर नेविगेट कर सकता है। पेपर दिखाता है कि जब ये दोनों जुड़े होते हैं, तो रोबोट की भविष्यवाणियां बहुत अधिक सटीक और सुसंगत हो जाती हैं।

परिणाम: स्मार्ट रोबोट, कोई अतिरिक्त लागत नहीं

शोधकर्ताओं ने LIBERO सूट (ब्लॉक को स्टैक करने और वस्तुओं को हिलाने जैसे कार्यों का एक संग्रह) और RoboCasa डेटासेट (एक ह्यूमनॉइड रोबोट के साथ घरेलू वातावरण का अनुकरण) सहित कई चुनौतीपूर्ण रोबोट कार्यों पर FoMoVLA का परीक्षण किया।

  • प्रदर्शन: FoMoVLA ने अत्याधुनिक (state-of-the-art) परिणाम प्राप्त किए, और अन्य शीर्ष-स्तरीय रोबोट मॉडलों को पीछे छोड़ दिया। उदाहरण के लिए, LIBERO में "लॉन्ग" हॉरिजन कार्यों पर (जिनके लिए कई चरणों में योजना बनाने की आवश्यकता होती है), FoMoVLA ने 97.6% की सफलता दर हासिल की, जो पिछले तरीकों से काफी बेहतर है।
  • जीरो-शॉट जनरलाइजेशन: भले ही रोबोट का परीक्षण उन पूरी तरह से नए स्थितियों में किया गया जिन्हें उसने पहले कभी नहीं देखा था (जैसे अलग लाइटिंग या कैमरा एंगल), इसने फिर भी अविश्वसनीय रूप से अच्छा प्रदर्शन किया, और LIBERO-Plus बेंचमार्क पर 80.5% की सफलता दर हासिल की।
  • दक्षता: सबसे अच्छी बात? यह सारा अतिरिक्त "सोचना" केवल प्रशिक्षण के दौरान होता है। जब रोबोट वास्तव में वास्तविक दुनिया में काम कर रहा होता है, तो उसे क्रिस्टल बॉल या जीपीएस ट्रैकर चलाने की आवश्यकता नहीं होती है। वह केवल उस ज्ञान का उपयोग करता है जिसे उसने आत्मसात किया है। इसका मतलब है कि रोबोट पहले की तरह ही तेज़ चलता है, जिसमें लगभग कोई अतिरिक्त मेमोरी या समय की लागत नहीं आती (केवल लगभग 9.4 ms का विलंब/लेटेंसी जुड़ता है)।

क्या यह पेपर खारिज करता है

लेखक सावधानीपूर्वक यह भी बताते हैं कि क्या काम नहीं करता है। उन्होंने पाया कि केवल भविष्य के पिक्सेल (पूरी छवि) की भविष्यवाणी करना बहुत अव्यवस्थित और अनावश्यक है। उन्होंने यह भी पाया कि यदि आप रोबोट को भविष्य की भविष्यवाणी करना और गति को ट्रैक करना अलग-अलग सिखाते हैं बिना उन्हें आपस में बात करने देने के, तो परिणाम कुछ न करने से थोड़े ही बेहतर होते हैं। तालमेल—"क्या" और "कैसे" के बीच का संवाद—ही वह अंतर पैदा करता है।

निष्कर्ष

FoMoVLA सुझाव देता है कि वास्तव में सक्षम रोबोट बनाने के लिए, हमें उन्हें भविष्य की कल्पना करना और साथ ही गति के पथ को समझना सिखाने की आवश्यकता है। एक "लक्ष्य-उन्मुख" दृश्य और एक "गति-उन्मुख" दृश्य को जोड़कर, रोबोट दुनिया के साथ अधिक स्वाभाविक और विश्वसनीय रूप से काम करना सीख सकते हैं। हालांकि वर्तमान प्रणाली अभी भी 2D ट्रैकिंग पर निर्भर है और अभी तक पूर्ण 3D ज्यामिति को नहीं समझती है, फिर भी यह ऐसे रोबोट बनाने की दिशा में एक महत्वपूर्ण कदम है जो केवल प्रतिक्रिया नहीं देते, बल्कि वास्तव में पूर्वानुमान लगाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →