DynEoMT: Learning Object Dynamicity from Online Segmentation Queries
DynEoMT एक ऑनलाइन फ्रेमवर्क है जो ऑप्टिकल फ्लो, डेप्थ या कैमरा पोज़ की आवश्यकता के बिना क्षेत्र-स्तरीय वस्तु गतिशीलता (गतिशील बनाम स्थिर) की भविष्यवाणी करने के लिए क्वेरी-आधारित वीडियो सेगमेंटेशन को संवर्धित करता है, जो कैमरा-प्रतिपूरित (camera-compensated) ऑप्टिकल फ्लो पर प्रशिक्षित एक नवीन ऑफलाइन सुपरविजन पाइपलाइन के माध्यम से मजबूत प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कंप्यूटर विज़न की दुनिया में, मशीनें किसी तस्वीर में क्या है, इसे पहचानने में उल्लेखनीय रूप से कुशल होती जा रही हैं। वे एक कार, एक व्यक्ति या एक पेड़ की पहचान कर सकती हैं और उसके चारों ओर एक सटीक रूपरेखा बना सकती हैं। लेकिन किसी वस्तु को देखने और यह समझने के बीच एक सूक्ष्म अंतर है कि वह कैसे चलती है। जब कैमरा किसी दृश्य के माध्यम से घूमता है, तो दृश्य में मौजूद सब कुछ हिलता हुआ प्रतीत होता है। एक खड़ी हुई कार केवल इसलिए स्क्रीन पर फिसलती हुई लग सकती है क्योंकि कैमरा घूम रहा है, जबकि एक चलता हुआ पैदल यात्री अपने स्वयं के कारणों से चल रहा होता है। एक मशीन के लिए दृश्य को वास्तव में समझने के लिए, उसे उन वस्तुओं के बीच अंतर करना चाहिए जो अपने आप चल रही हैं और उन वस्तुओं के बीच जो केवल कैमरा हिलने के कारण चलती हुई प्रतीत हो रही हैं। यह अंतर करने की क्षमता उन रोबोटों के लिए अत्यंत महत्वपूर्ण है जिन्हें दुनिया में नेविगेट करने की आवश्यकता होती है या उन प्रणालियों के लिए जो अपने परिवेश का मानचित्र बनाती हैं। यदि कोई रोबोट एक स्थिर इमारत को चलते हुए अवरोध के रूप में समझ लेता है, या एक वास्तविक चलती कार को अनदेखा कर देता है क्योंकि वह सोचता है कि इमारत हिल रही है, तो दुनिया के प्रति उसकी समझ टूट जाती है।
शोधकर्ताओं ने लंबे समय से कंप्यूटर को समय के साथ वस्तुओं को ट्रैक करना सिखाया है, जिससे वीडियो में चलते हुए एक विशिष्ट कार या व्यक्ति पर एक सुसंगत लेबल बनाए रखा जा सके। हालाँकि, ये प्रणालियाँ आमतौर पर वस्तु और उसके स्थान की पहचान करने तक ही सीमित रहती हैं; वे स्पष्ट रूप से यह नहीं बतातीं कि वह वस्तु स्वतंत्र रूप से चल रही है या वह केवल पृष्ठभूमि का एक स्थिर हिस्सा है। एक नया अध्ययन DynEoMT नामक एक विधि पेश करता है, जो समझ की इस लुप्त परत को जोड़ता है। यह प्रणाली वीडियो फ्रेम और उस डेटा को देखना सीखती है जो उसने पहले ही वस्तुओं के बारे में एकत्र किया है, और फिर प्रत्येक ट्रैक किए गए क्षेत्र के लिए यह निर्णय लेती है कि वह गतिशील (dynamic) है या स्थिर (static)। यहाँ मुख्य उपलब्धि यह है कि यह प्रणाली जटिल गति पैटर्न की गणना किए बिना, गहराई को मापे बिना, या कैमरे की भौतिक स्थिति को जाने बिना यह कार्य करती है। यह सीधे वस्तु को ट्रैक करने के तरीके से ही गति की स्थिति का अनुमान लगाना सीख लेती है।
कंप्यूटर को यह कौशल सिखाने के लिए, शोधकर्ताओं को पहले डेटा को लेबल करने का एक तरीका बनाना पड़ा, क्योंकि मौजूदा वीडियो डेटासेट में यह विशिष्ट जानकारी शामिल नहीं थी। उन्होंने एक ऑफलाइन प्रक्रिया बनाई जो एक शिक्षक की तरह कार्य करती है। यह प्रक्रिया वीडियो फ्रेम के जोड़ों को देखती है और उनके बीच पिक्सेल कैसे चलते हैं, इसकी गणना करती है। इसके बाद यह अनुमान लगाती है कि उस हलचल का कितना हिस्सा स्वयं कैमरे के कारण है और उसे घटा देती है। जो शेष बचता है वह "अवशिष्ट" (residual) गति है, जो दुनिया में वस्तुओं की वास्तविक गति का प्रतिनिधित्व करती है। यदि कोई क्षेत्र कैमरे की गति को हटाने के बाद महत्वपूर्ण हलचल दिखाता है, तो उसे गतिशील के रूप में लेबल किया जाता है। यदि वह बहुत कम या कोई हलचल नहीं दिखाता है, तो उसे स्थिर के रूप में लेबल किया जाता है। शोधकर्ताओं ने इस तर्क को चार प्रमुख वीडियो डेटासेट्स पर लागू किया, जिसमें सिमेंटिक सेगमेंटेशन (जहाँ प्रत्येक पिक्सेल को एक श्रेणी दी जाती है) से लेकर इंस्टेंस सेगमेंटेशन (जहाँ व्यक्तिगत वस्तुओं को अलग से ट्रैक किया जाता है) तक सब कुछ शामिल था। इससे डेटासेट्स का एक विशाल समूह तैयार हुआ जहाँ प्रत्येक ऑब्जेक्ट मास्क के साथ एक लेबल आया जो यह दर्शाता था कि वह चल रहा है या स्थिर है।
इस नए प्रशिक्षण डेटा के साथ, शोधकर्ताओं ने एक मौजूदा वीडियो सेगमेंटेशन मॉडल में संशोधन किया। उन्होंने सिस्टम में एक छोटा, हल्का निर्णय लेने वाला घटक, या "हेड" जोड़ा। यह घटक मॉडल द्वारा ट्रैक की जा गई प्रत्येक वस्तु के आंतरिक प्रतिनिधित्व को देखता है और भविष्यवाणी करता है कि वह चल रही है या स्थिर है। महत्वपूर्ण बात यह है कि यह भविष्यवाणी वीडियो चलने के दौरान वास्तविक समय में होती है। यह प्रणाली केवल वर्तमान छवि और उस जानकारी का उपयोग करती है जो इसने पिछले फ्रेम से प्राप्त की है। यह पुराने चित्रों को नहीं देखती, यह ऑप्टिकल फ्लो की गणना नहीं करती है, और इसे किसी अतिरिक्त सेंसर की आवश्यकता नहीं होती है। मॉडल इस भविष्यवाणी को वस्तुओं के चारों ओर रूपरेखा बनाने के अपने प्राथमिक कार्य के साथ-साथ करना सीखता है, यह सुनिश्चित करते हुए कि नया कार्य इसकी देखने और ट्रैक करने की क्षमता में बाधा न डाले।
परिणाम दिखाते हैं कि यह दृष्टिकोण विभिन्न प्रकार के वीडियो डेटा पर प्रभावी ढंग से काम करता है। वीडियो पैनोप्टिक सेगमेंटेशन के एक बड़े डेटासेट पर, सिस्टम ने 84.3 प्रतिशत की सटीकता के साथ वस्तुओं की गति की स्थिति को सही ढंग से पहचाना। व्यक्तिगत इंस्टेंस को ट्रैक करने पर केंद्रित अन्य डेटासेट्स पर, सटीकता 68.0 से 87.6 प्रतिशत के बीच रही। शायद सबसे महत्वपूर्ण बात यह है कि इस नई क्षमता को जोड़ने से सिस्टम के मूल प्रदर्शन को नुकसान नहीं पहुँचा। सटीक मास्क बनाने और वस्तुओं की पहचान बनाए रखने की क्षमता पहले की तरह लगभग वैसी ही रही। शोधकर्ताओं ने पाया कि मॉडल द्वारा वस्तुओं को ट्रैक करने के लिए उपयोग किए जाने वाले आंतरिक संकेत पहले से ही यह निर्धारित करने के लिए पर्याप्त जानकारी रखते थे कि वे वस्तुएं चल रही हैं या नहीं। उन संकेतों की व्याख्या करने के लिए एक छोटा सा स्तर जोड़कर, सिस्टम ने बिना किसी अलग, जटिल मोशन-प्रोसेसिंग पाइपलाइन के, दुनिया की एक नई समझ प्राप्त कर ली।
यह कार्य प्रदर्शित करता है कि एक चलती हुई वस्तु और एक स्थिर वस्तु के बीच का अंतर वस्तुओं को समय के साथ ट्रैक करने के तरीके से सीधे सीखा जा सकता है। यह सुझाव देता है कि रोबोटिक्स या स्वायत्त नेविगेशन के लिए डिज़ाइन किए गए भविष्य के सिस्टम समर्पित मोशन-एनालिसिस टूल्स की भारी कम्प्यूटेशनल लागत के बिना अपने परिवेश की अधिक मजबूत समझ प्राप्त कर सकते हैं। यह विधि एक सरल सिद्धांत पर निर्भर करती है: यदि आप किसी वस्तु को ट्रैक कर सकते हैं, तो आप संभवतः यह भी बता सकते हैं कि क्या वह अपने आप चल रही है। शोधकर्ताओं ने अपना कोड सार्वजनिक रूप से उपलब्ध कराया है, जिससे अन्य लोग इन निष्कर्षों को दोहरा सकें और एक ऐसी प्रणाली का निर्माण कर सकें जो न केवल यह देखती है कि वहाँ क्या है, बल्कि यह भी कि वह कैसा व्यवहार करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।