← नवीनतम पेपर
💻 computer science

TrackMAE: Video Representation Learning via Track Mask and Predict

TrackMAE एक स्व-पर्यवेक्षित (self-supervised) वीडियो प्रतिनिधित्व शिक्षण विधि है जो मोशन-अवेयर मास्किंग को निर्देशित करने के लिए पॉइंट ट्रैकर्स से मोशन ट्रेजेक्टरीज का स्पष्ट रूप से लाभ उठाने और पुनर्निर्माण के लिए पूरक मोशन लक्ष्यों को प्रदान करने के माध्यम से पारंपरिक मास्क्ड वीडियो मॉडलिंग में सुधार करती है, जिसके परिणामस्वरूप मोशन-केंद्रित कार्यों पर बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Renaud Vandeghen, Fida Mohammad Thoker, Marc Van Droogenbroeck, Bernard Ghanem

प्रकाशित 2026-03-31
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Renaud Vandeghen, Fida Mohammad Thoker, Marc Van Droogenbroeck, Bernard Ghanem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक फिल्म समझना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका: "धुंधली तस्वीर" की समस्या
पहले, शोधकर्ता रोबोट को "मास्क्ड वीडियो मॉडलिंग" (Masked Video Modeling) नामक एक विधि से सिखाते थे। इसे एक फिल्म के साथ "मैड लिब्स" (Mad Libs) खेलने जैसा समझें। आप एक वीडियो लेते हैं, 90% फ्रेम को काले बक्सों से ढक देते हैं, और रोबट से पूछते हैं: "जो कुछ फ्रेम आप देख पा रहे हैं, उनके आधार पर आपको क्या लगता है कि छिपे हुए हिस्से कैसे दिखते होंगे?"

रोबोट रंगों और बनावट (textures) का अनुमान लगाने में तो अच्छा हो जाता है। यदि वह एक फ्रेम में लाल कार देखता है, तो वह अनुमान लगाता है कि छिपे हुए फ्रेम में भी लाल कार ही होगी। लेकिन समस्या यह है कि रोबोट अक्सर गति (movement) को अनदेखा कर देता है। वह यह तो सीख जाता है कि एक लाल कार कैसी दिखती है, लेकिन वह यह नहीं समझ पाता कि कार बाएं से दाएं चल रही है। यह किसी व्यक्ति को उसके चेहरे से पहचानने जैसा है, लेकिन यह न समझना कि वह कैसे चलता है या हाथ हिलाता है।

इस कारण, ये रोबोट वीडियो में क्या है (जैसे, "वह एक कुत्ता है") यह पहचानने में तो माहिर हैं, लेकिन उन क्रियाओं को समझने में बहुत खराब हैं जो गति पर निर्भर करती हैं (जैसे, "कुत्ता बाड़ के ऊपर से कूद रहा है" बनाम "कुत्ता बैठा हुआ है")।

नया समाधान: TrackMAE (द "स्टिकी नोट" तरीका)
इस पेपर के लेखकों ने, TrackMAE, एक नया टूल देकर इस समस्या को ठीक करने का निर्णय लिया: मोशन ट्रैकिंग (Motion Tracking)

कल्पना कीजिए कि आप एक व्यक्ति को करतब दिखाते हुए (juggling) देख रहे हैं।

  1. ट्रैकर (The Tracker): इससे पहले कि रोबोट छिपे हुए हिस्सों का अनुमान लगाए, सिस्टम एक सुपर-स्मार्ट "पॉइंट ट्रैकर" (एक डिजिटल स्टिकी नोट की तरह) का उपयोग करके वस्तुओं पर विशिष्ट बिंदुओं का पीछा करता है। यह गेंद पर एक बिंदु, जादूगर के हाथ पर एक बिंदु और फर्श पर एक बिंदु को देखता है।
  2. ट्रैजेक्टरी (The Trajectory): सिस्टम एक रेखा खींचता है जो दिखाती है कि वे बिंदु फ्रेम 1 से फ्रेम 10 तक कहाँ-कहाँ चले। यह "मोशन ट्रैजेक्टरी" (गति का पथ) है।

प्रशिक्षण का खेल कैसे बदलता है
अब, प्रशिक्षण का खेल दो भागों में बँटा है:

  1. विजुअल गेस (The Visual Guess): "छिपे हुए पिक्सेल कैसे दिखते थे?" (पुराना तरीका)।
  2. मोशन गेस (The Motion Guess): "दृश्यमान फ्रेमों के आधार पर, छिपे हुए फ्रेमों में स्टिकी नोट्स कहाँ चले गए?"

अब रोबोट को एक साथ दो चीजें सीखनी पड़ती हैं: वस्तु कैसी दिखती है? और वह कैसे चली?

"मोशन-अवेयर" मास्किंग ट्रिक
लेखकों ने यह भी बदला कि वीडियो को कैसे छिपाया जाता है।

  • पुराना तरीका: वे स्क्रीन के यादृच्छिक (random) हिस्सों को छिपा देते थे। कभी वे एक स्थिर दीवार को छिपाते थे; कभी एक चलती हुई कार को। यह एक सिक्के के उछलने (coin flip) जैसा था।
  • नया तरीका (Motion-Aware): वे पहले मोशन ट्रैकर को देखते हैं। वे सुनिश्चित करते हैं कि वे चलती हुई चीजों (जैसे करतब दिखाती गेंदें) और स्थिर चीजों (जैसे बैकग्राउंड की दीवार) का एक मिश्रण छिपाएं।
    • क्यों? यदि आप केवल बैकग्राउंड को छिपाते हैं, तो रोबोट आलसी हो जाता है। यदि आप केवल चलती हुई चीजों को छिपाते हैं, तो वह भ्रमित हो जाता है। दोनों तरह की चीजों के लिए पहेलियाँ हल करने के लिए मजबूर करके, यह उसे दृश्य की कहीं अधिक गहरी समझ विकसित करने में मदद करता है।

परिणाम: एक स्मार्ट रोबोट
क्योंकि रोबोट को केवल यह अनुमान लगाने के लिए मजबूर किया जाता है कि चीजें कैसी दिखती हैं, बल्कि यह भी कि चीजें कहाँ जाती हैं, वह इसमें बहुत बेहतर हो जाता है:

  • सूक्ष्म क्रियाएं (Fine-grained actions): "गेंद फेंकने" और "गेंद पकड़ने" के बीच अंतर करना।
  • सामान्यीकरण (Generalization): यदि वह एक जिम्नास्ट के वीडियो में गति को समझना सीख जाता है, तो वह एक डांसर के वीडियो को भी आसानी से समझ सकता है, भले ही उसने पहले कभी डांसर को न देखा हो।

संक्षेप में
सोचिए कि पुराने मॉडल उन छात्रों की तरह थे जिन्होंने नाटक की स्क्रिप्ट तो रट ली लेकिन कोरियोग्राफी भूल गए।
TrackMAE वह छात्र है जिसने स्क्रिप्ट भी रटी और डांस स्टेप्स का अभ्यास भी किया। जब लाइटें बंद हो जाती हैं (वीडियो मास्क हो जाता है), तो यह छात्र अभी भी आपको सटीक रूप से बता सकता है कि क्या हुआ क्योंकि वह केवल स्थिर छवियों को नहीं, बल्कि क्रिया के प्रवाह (flow) को समझता है।

यह AI को उन कार्यों के लिए बहुत बेहतर बनाता है जिनमें समय, गति और दिशा को समझना आवश्यक होता है, जो वास्तविक दुनिया की वीडियो समझ के लिए अत्यंत महत्वपूर्ण हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →