← नवीनतम पेपर
💻 computer science

Exploring Decoupled Spatio-Temporal Consistency Learning and Self-Prompting Evolution for Self-Supervised Tracking

यह शोध पत्र SSTrack++ प्रस्तुत करता है, जो एक उच्च-प्रदर्शन वाला स्व-पर्यवेक्षित (self-supervised) विज़ुअल ट्रैकिंग मॉडल है जो डिकपल्ड स्पैटियो-टेम्पोरल कंसिस्टेंसी, सेल्फ-प्रॉम्प्टिंग इवोल्यूशन और इंस्टेंस कॉन्ट्रास्टिव लॉस के साथ एक वीक-टू-स्ट्रॉन्ग ट्रेनिंग फ्रेमवर्क का उपयोग करके मैनुअल बॉक्स एनोटेशन की आवश्यकता को समाप्त करता है, जिससे मौजूदा स्व-पर्यवेक्षित विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है और पूर्णतः पर्यवेक्षित (fully supervised) ट्रैकर्स के साथ अंतर को कम किया जाता है।

मूल लेखक: Yaozong Zheng, Bineng Zhong, Qihua Liang, Ning Li, Haiying Xia, Shuxiang Song, Rongrong Ji

प्रकाशित 2026-08-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yaozong Zheng, Bineng Zhong, Qihua Liang, Ning Li, Haiying Xia, Shuxiang Song, Rongrong Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आपके फोन का कैमरा किसी दौड़ते हुए कुत्ते, उड़ते हुए गुब्बारे या तेज़ रफ्तार कार का पीछा कर सके, और इसके लिए किसी को भी पहले से उनके चारों ओर बॉक्स बनाने की ज़रूरत न पड़े। यह विजुअल ऑब्जेक्ट ट्रैकिंग (visual object tracking) का सपना है, जो कंप्यूटर विज्ञान की एक शाखा है जहाँ आर्टिफिशियल इंटेलिजेंस (AI) यह सीखता है कि वीडियो में चलते हुए किसी विशिष्ट चीज़ पर अपनी नज़रें कैसे गड़ाए रखनी हैं। वर्षों से, इन AI "आँखों" को सिखाना कुछ महंगी, हाथ से लिखी किताबों का उपयोग करके एक बच्चे को पढ़ना सिखाने जैसा रहा है। शोधकर्ताओं को कंप्यूटर को यह दिखाने के लिए कि उसे क्या खोजना है, हजारों वीडियो में वस्तुओं के चारों ओर मैन्युअल रूप से बॉक्स बनाने पड़ते थे। यह प्रक्रिया धीमी, उबाऊ और अविश्वसनीय रूप से महंगी है, जो इन ट्रैकर्स को कितना स्मार्ट बनाया जा सकता है, इसकी सीमा तय करती है। इस क्षेत्र का बड़ा सवाल यह है: क्या हम AI को इंटरनेट पर पहले से मौजूद लाखों वीडियो से सीखना सिखा सकते हैं, जहाँ किसी ने भी एक भी बॉक्स नहीं बनाया है? इसका उत्तर सेल्फ-सुपरवाइज्ड लर्निंग (self-supervised learning) में निहित है, जो एक चतुर तकनीक है जहाँ कंप्यूटर अपना खुद का शिक्षक बनता है, और वीडियो के अपने पैटर्न का उपयोग करके यह पता लगाता है कि क्या महत्वपूर्ण है।

यहाँ SSTrack++ आता है, एक नया और चमकदार मॉडल जिसे शोधकर्ताओं की एक टीम द्वारा प्रस्तावित किया गया है, जो इस पहेली को बिना उन महंगी, हाथ से बनी बक्सों की आवश्यकता के हल करने का प्रयास करता है। एक ट्रैकर को सिखाने के पुराने तरीके को एक छात्र को बिल्ली की फोटो दिखाकर यह कहने के रूप में सोचें कि, "यह एक बिल्ली है।" नया तरीका, जिसका उपयोग SSTrack++ करता है, एक छात्र को बिल्ली के दौड़ने का पूरा मूवी क्लिप देने और यह कहने जैसा है, "पता लगाओ कि बिल्ली क्या कर रही है और वह कहाँ जा रही है, केवल उस मूवी का उपयोग करके।" शोधकर्ताओं ने पाया कि इस कार्य के पिछले प्रयास थोड़े अनाड़ी थे; उन्होंने केवल यादृच्छिक स्थानों को देखकर बिल्ली के स्थान का अनुमान लगाने की कोशिश की, जिससे वे बैकग्राउंड के शोर से भ्रमित हो गए।

इसे ठीक करने के लिए, टीम ने एक ऐसी प्रणाली डिज़ाइन की जो दो-चरणीय नृत्य (two-step dance) की तरह काम करती है। सबसे पहले, AI एक ग्लोबल फॉरवर्ड लुक (global forward look) लेता है, पूरे वीडियो फ्रेम को स्कैन करता है ताकि यह पता लगाया जा सके कि लक्ष्य कहाँ हो सकता है, ठीक वैसे ही जैसे एक जासूस भीड़ भरे कमरे में संदिग्ध को खोजने के लिए स्कैन करता है। एक बार जब उसे एक मोटा अंदाज़ा मिल जाता है, तो वह लोकल बैकवर्ड लुक (local backward look) पर स्विच करता है, और लक्ष्य के स्वरूप और गति में समय के साथ होने वाले बदलावों का बारीकी से अध्ययन करने के लिए ज़ूम इन करता है, जैसे एक जासूस संदिग्ध की चाल और कपड़ों का अध्ययन करता है। इन दो कार्यों को अलग करके—स्थान ढूँढना और गति को समझना—मॉडल बहुत तेज़ी से और अधिक सटीकता से सीखता है।

लेकिन यहाँ असली जादू का कमाल है: सेल्फ-प्रॉम्प्टिंग इवोल्यूशन (Self-Prompting Evolution)। कल्पना कीजिए कि AI के पास एक "स्टिकी नोट" है जिसे वह अपने साथ रखता है, जो बताता है कि लक्ष्य कैसा दिखता है। पुराने मॉडलों में, यह नोट स्थिर होता था और यदि लक्ष्य मुड़ जाता या गंदा हो जाता, तो यह पुराना हो सकता था। SSTrack++ अलग है; यह लगातार अपने ही स्टिकी नोट को फिर से लिखता है। हर फ्रेम के बाद, AI खुद से पूछता है, "क्या मैंने इसे सही किया?" और फिर अपने नोट को अभी देखे गए सबसे अच्छे, स्पष्ट विवरणों के साथ अपडेट करता है, धुंधले या भ्रमित करने वाले हिस्सों को हटा देता है। यह एक ऐसे जासूस की तरह है जो संदिग्ध का रेखाचित्र (sketch) बनाने में सुधार करता रहता है क्योंकि उसे बेहतर झलक मिलती है, जिससे यह सुनिश्चित होता है कि विवरण सटीक बना रहे, भले ही वह एक अराजक भीड़ में हो।

शोधकर्ताओं ने AI को बिना किसी शिक्षक के अलग-अलग वस्तुओं के बीच अंतर करना सिखाने का एक तरीका भी पेश किया। उन्होंने इंस्टेंस कॉन्ट्रास्टिव लर्निंग (instance contrastive learning) नामक एक विधि का उपयोग किया, जो AI के साथ "अंतर पहचानो" (spot the difference) का खेल खेलने जैसा है। कंप्यूटर को एक ही वस्तु को अलग-अलग कोणों और समय से दिखाया जाता है (पॉजिटिव मैच) और फिर उसे पूरी तरह से अलग वस्तुओं को दिखाया जाता है (नेगेटिव मैच)। यह समझने में सक्षम होता है कि, "आह, यह धुंधला धब्बा और वह स्पष्ट धब्बा एक ही कुत्ता है, लेकिन वह गिलहरी बिल्कुल अलग है।" यह मॉडल को यह समझने में मदद करता है कि लक्ष्य वास्तव में क्या है, भले ही वह किसी पेड़ के पीछे छिपा हो या तेज़ी से चल रहा हो।

जब टीम ने दस अलग-अलग वीडियो डेटासेट पर अपने नए मॉडल का परीक्षण किया, तो परिणाम प्रभावशाली थे। GOT10K डेटासेट पर, SSTrack++ ने पिछले सेल्फ-सुपरवाइज्ड तरीकों की तुलना में स्कोर में 25.8% से अधिक का सुधार किया। LaSOT पर, यह 21.4% बढ़ा, और TrackingNet पर, यह 15.8% बढ़ा। हालाँकि यह अभी भी उन बेहतरीन मॉडलों की बराबरी पूरी तरह से नहीं कर पाया है जो हाथ से बने बक्सों का उपयोग करते हैं, लेकिन इसने अंतर को काफी कम कर दिया है। लेखक सुझाव देते हैं कि यह दृष्टिकोण ट्रैकिंग सिस्टम को सस्ता बनाने और उन्हें वास्तविक दुनिया की अव्यवistic और अप्रत्याशित स्थितियों को संभालने में बेहतर बनाने के लिए गेम-चेंजर हो सकता है, जहाँ हम हमेशा बॉक्स बनाने के लिए रुक नहीं सकते। हालाँकि, वे स्वीकार करते हैं कि यह प्रणाली अभी भी इस बात पर निर्भर करती है कि इसका पहला अनुमान (फॉरवर्ड लुक) कितना अच्छा है, जो यह दर्शाता है कि अभी भी जासूस को और भी अधिक सटीक बनाने की गुंजाइश है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →