← नवीनतम पेपर
💻 computer science

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

यह शोध पत्र एक क्रॉस-व्यू एक्शन कंसिस्टेंसी पद्धति प्रस्तावित करता है जो केवल RGB छवियों और प्रोप्रियोसेप्शन का उपयोग करके, कैमरा व्यूपॉइंट परिवर्तनों के विरुद्ध मजबूती प्राप्त करने के लिए फ्लो-आधारित विजन-लैंग्वेज-एक्शन पॉलिसियों को नियमित करता है, जिससे बिना किसी कैमरा लेबल या डेप्थ इनपुट के सिम्युलेटेड और वास्तविक दुनिया के रोबोट कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

प्रकाशित 2026-09-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मानव प्रदर्शनों से सीखने वाले रोबोट तेजी से सक्षम होते जा रहे हैं, फिर भी वे एक अजीब सी नाजुकता से ग्रस्त होते हैं: वे उस विशिष्ट दृष्टिकोण (व्यूपॉइंट) से बंधे होते हैं जिससे उन्हें सिखाया गया था। कल्पना कीजिए कि एक रोबोट को एक कप उठाने के लिए प्रशिक्षित किया गया है जबकि एक कैमरा मेज के ऊपर एक शेल्फ पर रखा है। यदि वह कैमरा टकरा जाए, बगल में खिसक जाए, या ऊपर की ओर उठ जाए, तो रोबोट अचानक विफल हो सकता है, भले ही कप, मेज और रोबोट का अपना शरीर बिल्कुल नहीं बदला हो। ऐसा इसलिए होता है क्योंकि रोबोट का "मस्तिष्क", जो एक प्रकार का कृत्रिम बुद्धिमत्ता है जो यह जोड़ता है कि वह क्या देखता है और उसे क्या करना चाहिए, मूल कैमरे के सटीक कोण के आधार पर कार्य को पहचानना सीख गया है। वास्तविक दुनिया में, कैमरे टकरा जाते हैं, रोबले चलते हैं, और रोशनी बदल जाती है, इसलिए एक प्रणाली जो शिफ्ट हुए व्यूपॉइंट के अनुकूल नहीं हो सकती, वह वास्तव में उपयोगी नहीं है। शोधकर्ताओं ने रोबोटों को अधिक जटिल सेंसर देने के लिए, जैसे कि गहराई मापने वाले कैमरे (डेप्थ कैमरा) जो 3D में देखते हैं, या उन्हें कमरे की ज्यामिति (जियोमेट्री) को समझने के लिए सिखाने के माध्यम से इसे हल करने का प्रयास किया है, लेकिन इन समाधानों के लिए अक्सर महंगे हार्डवेयर या जटिल अंशांकन (कैलिब्रेशन) की आवश्यकता होती है जिसे बनाए रखना कठिन होता है।

त्सिंहहुआ विश्वविद्यालय और एम्स्टर्डम विश्वविद्यालय के शोधकर्ताओं की एक टीम ने बिना किसी नए सेंसर को जोड़े या वास्तविक दुनिया में रोबोट के संचालन के तरीके को बदले, कैमरा मूवमेंट के प्रति इन रोबोटिक नीतियों को मजबूत बनाने का एक तरीका खोज निकाला है। उन्होंने एक विशिष्ट प्रकार के रोबोट कंट्रोलर पर ध्यान केंद्रित किया जो केवल अगले कदम का अनुमान लगाने के बजाय, कार्यों के एक "प्रवाह" (फ्लो) की भविष्यवाणी करके सीखता है, ठीक वैसे ही जैसे पानी एक गंतव्य की ओर बहता है। उनकी खोज का मुख्य केंद्र एक प्रशिक्षण पद्धति है जो रोबोट को खुद के साथ सहमत होने के लिए मजबूर करती है। उन्होंने प्रशिक्षण छवियों के जोड़े बनाए जो दो अलग-अलग कोणों से एक ही भौतिक दृश्य को दिखाते थे: एक मूल कैमरा स्थिति से और दूसरा थोड़ी बदली हुई स्थिति से। महत्वपूर्ण रूप से, उन्होंने यह सुनिश्चित किया कि रोबोट को दोनों छवियों के लिए बिल्कुल समान क्रिया करने के लिए कहा जाए। दोनों दृश्यों के लिए गति के समान प्रवाह की भविष्यवाणी करने के लिए रोबोट को प्रशिक्षित करके, उन्होंने उसे कैमरे की स्थिति में बदलाव को अनदेखा करने और केवल कार्य पर ध्यान केंद्रित करने के लिए सिखाया।

शोधकर्ताओं ने इस विचार का परीक्षण एक सिम्युलेटेड वातावरण में LIBERO-Plus नामक एक बेंचमार्क का उपयोग करके किया, जिसे विशेष रूप से कैमरा शिफ्ट को संभालने की रोबोट की क्षमता देखने के लिए डिज़ाइन किया गया है। उन्होंने अपने नए तरीके की तुलना मानक प्रशिक्षण तकनीकों से की। जब कैमरा हिलाया गया, तो मानक तरीकों से प्रशिक्षित रोबोट केवल लगभग 17% प्रयासों में सफल रहा। एक रोबोट जिसे उनके विशेष निरंतरता नियम के बिना कई अलग-अलग कैमरा कोणों पर प्रशिक्षित किया गया था, उसकी सफलता दर बढ़कर लगभग 75% हो गई। हालांकि, उनके नए क्रॉस-व्यू कंसिस्टेंसी नियम के साथ प्रशिक्षित रोबोट ने 87.2% की सफलता दर प्राप्त की। यह सुधार महत्वपूर्ण था और प्रशिक्षण के विभिन्न यादृच्छिक (रैंडम) शुरुआती बिंदुओं पर सुसंगत था। शोधकर्ताओं ने यह भी सिद्ध किया कि सफलता पूरी तरह से इस तथ्य पर निर्भर थी कि दो छवियां एक ही भौतिक अवस्था को दिखाती थीं। जब उन्होंने प्रशिक्षण डेटा को अस्त-व्यस्त कर दिया ताकि रोबोट एक अलग अवस्था के लिए निर्धारित क्रिया को एक दृश्य के साथ मिलाने का प्रयास करे, तो प्रदर्शन गिरकर केवल 25.8% रह गया, जिससे पता चलता है कि रोबोट केवल अपने उत्तरों को सुचारू (स्मूथ) नहीं बना रहा था, बल्कि वास्तव में एक ही वास्तविकता के विभिन्न दृश्यों को एक ही क्रिया से जोड़ने के लिए सीख रहा था।

यह सुनिश्चित करने के लिए कि यह केवल कंप्यूटर सिमुलेशन का परिणाम नहीं है, टीम ने अपने तरीके को एक प्रयोगशाला में एक वास्तविक रोबोटिक आर्म तक पहुँचाया। उन्होंने एक ही मेज को देख रहे तीन सिंक्रोनाइज्ड कैमरों का उपयोग करके प्रशिक्षण डेटा एकत्र किया, जिससे वे वास्तविक दुनिया से दृश्यों के जोड़े बना सके। इसके बाद उन्होंने एक एकल कैमरे का उपयोग करके रोबोट का परीक्षण किया जिसे प्रशिक्षण के दौरान कभी नहीं देखा गया था। उनके नए तरीके से प्रशिक्षित रोबोट ने इन अनदेखे कैमरा परीक्षणों में 74.4% की सफलता दर हासिल की, जबकि मानक पद्धति केवल 53.3% सफल रही। सुधार सबसे कठिन कार्यों में सबसे नाटकीय था, जैसे कि स्टैंड से हेडफ़ोन हटाना, जहाँ मानक पद्धति नई कैमरा स्थितियों में पूरी तरह विफल रही, लेकिन नया तरीका लगभग आधे प्रयासों में सफल रहा। यह अध्ययन पुष्टि करता है कि रोबोट को विभिन्न कोणों से अपनी क्रियाओं की निरंतरता देखने के लिए सिखाकर, वह वास्तविक दुनिया में बहुत अधिक विश्वसनीय हो सकता है, और वह भी बिना किसी अतिरिक्त कैमरे, डेप्थ सेंसर या जटिल ज्यामितीय मानचित्रों के। रोबोट बस यह सीख जाता है कि कार्य वही रहता है, भले ही तस्वीर बदल जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →