← नवीनतम पेपर
💻 computer science

TAPNext++: What's Next for Tracking Any Point (TAP)?

TAPNext++ मूल TAPNext मॉडल को डेटा-संचालित प्रशिक्षण रणनीतियों, ज्यामितीय संवर्द्धन (geometric augmentations) और एक नए पुन: पता लगाने वाले मीट्रिक (re-detection metric) को पेश करके उन्नत करता है ताकि लंबी वीडियो अनुक्रमों पर बिंदुओं को ट्रैक करने और कम विलंबता (low latency) के साथ पुनरावर्ती बिंदुओं को संभालने में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

प्रकाशित 2026-04-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "वेयर्स वाल्डो?" (Where's Waldo?) का एक खेल खेल रहे हैं, लेकिन एक किताब के बजाय, आप एक अराजक, तेज़ गति वाला वीडियो देख रहे हैं। कभी वाल्डो एक पेड़ के पीछे भाग जाता है, कभी वह पूरी तरह से फ्रेम से बाहर कूद जाता है, और कभी वह एक अलग टोपी पहनकर वापस आता है।

ट्रैकिंग एनी पॉइंट (TAP) कंप्यूटर विज़न का एक ऐसा कार्य है जिसमें आपकी आँखें एक विशिष्ट बिंदु (या "पॉइंट") पर टिकी रहती हैं, चाहे कैमरा कितना भी पागलपन भरा क्यों न हो जाए या वह बिंदु कितनी भी बार गायब हो जाए।

यह पेपर TAPNext++ नामक एक नए AI मॉडल को पेश करता है, जो इस खेल में अविश्वसनीय रूप से माहिर है। यहाँ बताया गया है कि यह कैसे काम करता है, सरल भाषा में।

समस्या: "शॉर्ट-टर्म मेमोरी" वाला AI

पिछला चैंपियन, जिसे TAPNext कहा जाता था, एक बहुत तेज़ धावक की तरह था जिसकी पिछले कुछ सेकंडों की याददाश्त तो बहुत अच्छी थी, लेकिन पिछले कुछ मिनटों की याददाश्त बहुत खराब थी।

  • समस्या: यदि वीडियो छोटा था, तो TAPNext अद्भुत था। लेकिन यदि वीडियो लंबा था (जैसे कि एक पूरी फिल्म का दृश्य), तो AI "भ्रमित" हो जाता था। वह भूल जाता था कि बिंदु कहाँ से शुरू हुआ था।
  • "री-एंट्री" (पुनः प्रवेश) की विफलता: यदि कोई बिंदु दीवार के पीछे गायब हो जाता और फिर दूसरी ओर से वापस आ जाता, तो TAPNext अक्सर उसे पहचान नहीं पाता था। यह वैसा ही था जैसे आपका दोस्त कमरे से बाहर जाता है और फिर दूसरे दरवाजे से वापस अंदर आता है, लेकिन आप सोचते हैं, "यह अजनबी कौन है?"

समाधान: TAPNext++ (सुपर-रनर)

लेखकों ने उसी इंजन (यानी "ब्रेन" आर्किटेक्चर) का उपयोग किया जो TAPNext इस्तेमाल करता था, लेकिन इसे ट्रेनिंग में एक बड़ा अपग्रेड दिया। उन्होंने एक नई कार नहीं बनाई; उन्होंने बस पुरानी कार को बहुत लंबी और कठिन सड़कों पर गाड़ी चलाना सिखाया।

यहाँ वे तीन मुख्य तरकीबें दी गई हैं जिनका उन्होंने उपयोग किया:

1. "मैराथन ट्रेनिंग" (लंबे अनुक्रम/Long Sequences)

कल्पना कीजिए कि आप एक कुत्ते को गेंद लाने (fetch) के लिए प्रशिक्षित कर रहे हैं।

  • पुराना तरीका: आप गेंद को 50 बार फेंकते हैं, लेकिन केवल 10 फीट दूर। कुत्ता छोटी थ्रो में अच्छा हो जाता है लेकिन जब आप उसे 100 फीट दूर फेंकते हैं तो वह घबरा जाता है।
  • TAPNext++ का तरीका: शोधकर्ताओं ने AI को 1,000 फ्रेम लंबे वीडियो पर प्रशिक्षित किया (लगभग 30-40 सेकंड की निरंतर गति)।
  • तकनीकी जादू: इसे करने के लिए, वे पूरे वीडियो को एक कंप्यूटर की मेमोरी में नहीं डाल सकते थे। इसलिए, उन्होंने सीक्वेंस पैरेललिज्म (Sequence Parallelism) नामक तकनीक का उपयोग किया। इसे एक रिले रेस की तरह समझें जहाँ 8 धावक (GPUs) एक दूसरे को तुरंत बैटन (डेटा) सौंपते हैं। उन्होंने लंबे वीडियो को टुकड़ों में विभाजित किया, उन्हें एक साथ प्रोसेस किया, और उनकी मेमोरी को वापस जोड़ दिया। इसने AI को बिना थके लंबे समय तक चीजों को याद रखने में सक्षम बनाया।

2. "रोलर कोस्टर" ट्रेनिंग (री-एंट्री/Re-Entry)

सबसे बड़ी कमजोरी तब थी जब बिंदु स्क्रीन से बाहर निकल जाते और वापस आते थे।

  • उपमा: कल्पना कीजिए कि आप एक सॉकर बॉल देख रहे हैं। वह स्क्रीन के बाईं ओर से लुढ़क कर बाहर जाती है। एक सामान्य वीडियो में, वह जा चुकी है। लेकिन वास्तविक दुनिया में, यदि कैमरा दाईं ओर मुड़ता है, तो वह गेंद दाईं ओर से पुनः प्रवेश कर सकती है।
  • सुधार: शोधकर्ताओं ने एक विशेष "रोल" ऑग्मेंटेशन (Roll augmentation) बनाया। उन्होंने प्रशिक्षण वीडियो लिए और उन्हें भौतिक रूप से घुमाया और लपेटा (wrapped around)। यदि कोई बिंदु दाईं ओर के किनारे से बाहर लुढ़कता, तो वह तुरंत बाईं ओर से पुनः प्रकट हो जाता।
  • परिणाम: AI को यह सीखने के लिए मजबूर किया गया कि "ओह, सिर्फ इसलिए कि वह गायब हो गया, इसका मतलब यह नहीं है कि वह हमेशा के लिए चला गया; वह दुनिया के दूसरी ओर हो सकता है।" इसने इसे उन बिंदुओं को खोजने में माहिर बना दिया जो छिपने के बाद फिर से दिखाई देते हैं।

3. "अदृश्य मित्र" ट्रेनिंग (ऑक्लूजन/Occlusion)

कभी-कभी बिंदु अन्य वस्तुओं के पीछे छिपे होते हैं (ऑक्लूजन)।

  • पुराना तरीका: AI को केवल तभी दंडित किया जाता था जब बिंदु दिखाई दे रहा हो और वह उसे खो देता था। यदि बिंदु छिपा हुआ था, तो AI बेतरतीब ढंग से अनुमान लगा सकता था और बच सकता था।
  • नया तरीका: उन्होंने AI को बताया, "भले ही बिंदु छिपा हुआ हो, आपको अनुमान लगाना होगा कि वह कहाँ होता यदि आप उसे देख पाते।" उन्होंने AI को एक छोटा सा "होमवर्क असाइनमेंट" दिया ताकि वह अदृश्य बिंदु को ट्रैक करना जारी रखे। इस तरह, जब बिंदु वापस बाहर आता है, तो AI पहले से ही सही स्थान पर उसका इंतज़ार कर रहा होता है।

नया स्कोरबोर्ड: AJRD

लेखकों ने महसूस किया कि पुराने स्कोरिंग सिस्टम धोखाधड़ी कर रहे थे। वे यह मापते थे कि एक बिंदु कितनी देर तक दिखाई दे रहा था, लेकिन उन्हें इस बात से फर्क नहीं पड़ता था कि AI ने उसे खो दिया और फिर से ढूंढ लिया।

उन्होंने एक नया स्कोर बनाया जिसे AJRD (Re-Detection Average Jaccard) कहा जाता है।

  • इसे ऐसे समझें: टैग (पकड़ने) के खेल में, यदि आप टैगर को खो देते हैं, भाग जाते हैं, और फिर वह आपको फिर से पकड़ लेता है, तो एक अच्छे खिलाड़ी को अभी भी पता होना चाहिए कि आप कौन हैं। AJRD ठीक यही मापता है कि AI यह कहने में कितना अच्छा है कि, "आहा! मैं तुम्हें जानता हूँ, भले ही तुम कुछ समय के लिए छिपे हुए थे!"

परिणाम: तेज़, हल्का और मजबूत

सबसे अच्छी बात? TAPNext++ भारी या धीमा नहीं हुआ।

  • गति: यह 60+ फ्रेम प्रति सेकंड (रियल-टाइम स्पीड) पर चलता है।
  • मेमोरी: यह बहुत कम कंप्यूटर मेमोरी का उपयोग करता है, जिसका अर्थ है कि यह एक फोन या रोबोट पर चल सकता है।
  • प्रदर्शन: यह लंबे वीडियो पर हर अन्य विधि को पछाड़ देता है और एकमात्र ऐसा है जो लगातार उन बिंदुओं को खोजता है जो छिपे हुए या स्क्रीन से बाहर गए हैं।

सारांश

TAPNext++ एक स्मार्ट, तेज़ धावक को बाधाओं, आँखों पर पट्टी और टेलीपोर्टेशन वाले मैराथन कोर्स पर प्रशिक्षित करने जैसा है। अब, यह धावक एक अराजक वीडियो के माध्यम से एक बिंदु को ट्रैक कर सकता है, भले ही वह बिंदु लंबे समय तक गायब रहे, अलग कोण से वापस आए, या किसी दीवार के पीछे छिप जाए। यह साबित करता है कि इन समस्याओं को हल करने के लिए आपको एक बड़े, भारी दिमाग की आवश्यकता नहीं है; आपको बस बेहतर ट्रेनिंग की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →