← नवीनतम पेपर
🤖 AI

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0 एक हल्का, टेक्स्ट-असिस्टेड वीडियो एक्शन मॉडल है जो भविष्य के फ्रेमों को ऑब्जेक्ट-सेंट्रिक पार्टिकल डायनेमिक्स और डेंस अपीयरेंस में विभाजित करके रोबोट वीडियो प्रेडिक्शन में सुधार करता है, जो यह प्रदर्शित करता है कि स्पष्ट पार्टिकल मॉडलिंग भाषा ग्राउंडिंग और संवेदी गुणवत्ता की वर्तमान सीमाओं के बावजूद प्रक्षेपवक्र त्रुटि (ट्रैजेक्टरी एरर) को कम करती है।

मूल लेखक: Yafei Zhang, Nan Wu

प्रकाशित 2026-08-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yafei Zhang, Nan Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यह समझने के लिए कि एक रोबोट भविष्य को देखना कैसे सीख सकता है, हमें पहले यह समझना होगा कि वह वर्तमान को कैसे देखता है। भौतिक कृत्रिम बुद्धिमत्ता (फिजिकल एआई) की दुनिया में, एक रोबोट केवल एक स्थिर छवि को प्रोसेस नहीं करता है; उसे यह अनुमान भी लगाना चाहिए कि दुनिया के साथ परस्पर क्रिया करने पर वह छवि कैसे बदलेगी। यह वीडियो प्रेडिक्शन (वीडियो भविष्यवाणी) की चुनौती है: मशीन को एक दृश्य को देखना और यह अनुमान लगाना सिखाना कि अगले कुछ क्षणों में क्या होगा। एक इंसान के लिए, यह एक स्वाभाविक प्रवृत्ति है। यदि आप मेज के किनारे पर एक कप देखते हैं, तो आप जानते हैं कि धक्का लगने पर वह गिर जाएगा। हालाँकि, एक रोबोट के लिए, इसके लिए एक जटिल आंतरिक सिमुलेशन की आवश्यकता होती है। उसे दृश्य के उन हिस्सों को अलग करना होगा जो हिलेंगे और उन हिस्सों को जो स्थिर रहेंगे, और उसे यह समझना होगा कि "नीले घन को उठाओ" जैसा एक सरल निर्देश रोबोट के हाथ और वातावरण के आधार पर कई अलग-अलग दृश्य परिणामों की ओर ले जा सकता है। लक्ष्य केवल भविष्य की एक सुंदर तस्वीर बनाना नहीं है, बल्कि गति का एक विश्वसनीय मानचित्र बनाना है जिसका उपयोग रोबोट अपने कार्यों की योजना सुरक्षित और प्रभावी ढंग से बनाने के लिए कर सके।

एक्रॉस फिजिकल एआई (Across Physical AI) और चीनी विज्ञान अकादमी के शोधकर्ताओं ने इस समस्या के प्रति एक नया दृष्टिकोण अपनाया है जिसे वे 'एक्रॉसवीएएम 1.0' (AcrossVAM1.0) कहते हैं। एक वीडियो फ्रेम के हर एक पिक्सेल की एक साथ भविष्यवाणी करने के बजाय, जिससे अक्सर धुंधले या भ्रमित परिणाम मिलते हैं, उन्होंने इस कार्य को दो अलग-अलग कार्यों में विभाजित कर दिया। उन्होंने महसूस किया कि एक विशिष्ट रोबोट वीडियो में, अधिकांश छवि वास्तव में स्थिर होती है। मेज, दीवार और फर्श हिलते नहीं हैं; केवल रोबोट का हाथ, उसका ग्रिपर और उसके द्वारा पकड़ी गई वस्तु अपनी स्थिति बदलती है। टीम ने एक ऐसा मॉडल डिजाइन किया जो इन चलते हुए हिस्सों को विशिष्ट, अर्थपूर्ण कणों (सेमेंटिक पार्टिकल्स) के रूप में मानता है। कल्पना कीजिए कि रोबोट के हाथ और ग्रिपर को पिक्सेल की एक निरंतर धारा के रूप में नहीं, बल्कि कुछ विशिष्ट, ट्रैक किए गए ऑब्जेक्ट्स के रूप में देखा जा रहा है जिनके अपने स्थान, आकार और गति हैं। मॉडल अपनी गणनात्मक शक्ति को ठीक से यह अनुमान लगाने में केंद्रित करता है कि ये कुछ चलते हुए हिस्से अंतरिक्ष में कैसे यात्रा करेंगे, जबकि शेष दृश्य को एक स्थिर पृष्ठभूमि के रूप में मानता है।

यह प्रणाली पहले वीडियो के चार फ्रेम और एक लिखित निर्देश, जैसे कि "नीले घन को उठाओ," को देखकर काम करती है। यह रोबोट, उसके हाथ और उसके ग्रिपर की पहचान करने के लिए एक प्री-ट्रेन्ड, फ्रोजन विजन सिस्टम का उपयोग करती है, जिससे वे सरल डेटा बिंदुओं में बदल जाते हैं जो बताते हैं कि वे कहाँ हैं और कितने बड़े हैं। एक छोटा, कुशल मस्तिष्क, जिसमें केवल 0.28 मिलियन ट्रेन करने योग्य पैरामीटर हैं, फिर इन डेटा बिंदुओं को लेता है और गणना करता है कि अगले पांच क्षणों में वे कहाँ होंगे। मॉडल का यह हिस्सा पूरी तरह से गति पर केंद्रित है और टेक्स्ट निर्देश द्वारा निर्देशित होता है, यह सुनिश्चित करता है कि अनुमानित गति वास्तव में दिए गए कमांड के अनुरूप हो। एक बार जब मॉडल ने चलते हुए हिस्सों का पथ निर्धारित कर लिया होता है, तो एक दूसरी, अलग प्रक्रिया विवरणों को भर देती है। यह वीडियो के अंतिम ज्ञात फ्रेम को लेती है और स्थिर पृष्ठभूमि के बारीक टेक्सचर और रंगों को बहाल करने के लिए इसका उपयोग करती है, जिससे यह सुनिश्चित होता है कि दीवार और मेज स्पष्ट और वास्तविक दिखें। अंत में, एक स्मार्ट ब्लेंडिंग मैकेनिज्म रोबोट की अनुमानित गति को उच्च-गुणवत्ता वाली स्थिर पृष्ठभूमि के साथ जोड़ता है, जिससे भविष्य का एक पूर्ण वीडियो तैयार होता है।

इस दृष्टिकोण के परिणाम गति और छवि गुणवत्ता के बीच एक स्पष्ट ट्रेड-ऑफ (समझौता) दिखाते हैं। जब शोधकर्ताओं ने वास्तविक रोबोट आंदोलनों के एक बेंचमार्क पर मॉडल का परीक्षण किया, तो कण-आधारित भविष्यवाणी ने स्वयं गति की सटीकता में काफी सुधार किया। रोबोट के हाथ के पथ में त्रुटि, उस सरल विधि की तुलना में 21.0 प्रतिशत कम हो गई जो केवल यह मान लेती है कि कुछ भी नहीं हिलेगा। मॉडल ने पूरे चित्र का अनुमान लगाने की कोशिश करने वाली पिछली विधियों की तुलना में हाथ और ग्रिपर के प्रक्षेपवक्र (ट्रैजेक्टरी) की बहुत अधिक सटीकता के साथ भविष्यवाणी की। हालाँकि, मॉडल पूर्ण नहीं है। जबकि यह रोबोट के हिस्सों को सही ढंग से चलाने में उत्कृष्ट है, यह अभी भी अंतिम छवि की समग्र दृश्य गुणवत्ता के साथ थोड़ा संघर्ष करता है। उन परीक्षणों में जो यह मापते हैं कि अनुमानित वीडियो वास्तविक वीडियो के कितने समान दिखता है, नया मॉडल एक सरल विधि की तुलना में थोड़ा कम स्कोर करता है जो केवल अंतिम फ्रेम की नकल करती है, विशेष रूप से यह कि वह दृश्य के सूक्ष्म टेक्सचर को कैसे संभालता है। शोधकर्ताओं ने पाया कि हालांकि मॉडल रोबोट को चलाने के लिए टेक्स्ट निर्देश का पालन कर सकता है, लेकिन भाषा और लिए गए विशिष्ट पथ के बीच का संबंध अभी भी कमजोर है; निर्देश को थोड़ा बदलने पर भी अधिकांश मामलों में अनुमानित पथ में बहुत कम बदलाव आया।

यह कार्य रोबोट को देखना सिखाने के बारे में एक मौलिक अंतर्दृष्टि को उजागर करता है: यह अक्सर किसी दृश्य के हर पिक्सेल की भविष्यवाणी करने के बजाय विशिष्ट वस्तुओं की गति को समझने के बारे में होता है। गति की भविष्यवाणी करने के कार्य को छवि विवरण को बहाल करने के कार्य से अलग करके, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई जो हल्की (लाइटवेट) और व्याख्या योग्य है। वे आंतरिक "कणों" को देख सकते हैं और समझ सकते हैं कि रोबोट क्या सोचता है कि क्या हिल रहा है और वह कहाँ जाने का विचार कर रहा है। हालांकि यह प्रणाली अभी तक मौजूदा विधियों को बदलने के लिए तैयार नहीं है, क्योंकि इसे अभी भी यथार्थवादी छवियां उत्पन्न करने और जटिल भाषा आदेशों का सख्ती से पालन करने की आवश्यकता है, फिर भी यह एक आशाजनक नई दिशा प्रदान करती है। यह सुझाव देता है कि रोबोट दृष्टि का भविष्य सरल, संरचित मॉडलों में निहित हो सकता है जो चलते हुए हिस्सों के भौतिकी को समझते हैं, न कि उन विशाल, जटिल प्रणालियों में जो किसी दृश्य के हर विवरण को याद करने की कोशिश करती हैं। आगे का रास्ता सूचना के इन दो प्रवाहों—चलते हुए हिस्सों और स्थिर पृष्ठभूमि—को संयोजित करने के तरीके को परिष्कृत करने और रोबोट की भाषा की समझ को अधिक मजबूत और विश्वसनीय बनाने के तरीके खोजने में निहित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →