← नवीनतम पेपर
💻 computer science

Improving Visual Object Tracking through Visual Prompting

यह शोध पत्र PiVOT का प्रस्ताव करता है, जो एक विजुअल प्रॉम्प्टिंग तंत्र है जो ऑनलाइन विजुअल प्रॉम्प्ट्स को स्वचालित रूप से उत्पन्न और परिष्कृत करने के लिए एक प्रीट्रेंड CLIP फाउंडेशन मॉडल का लाभ उठाता है, जिससे कंट्रास्टिव गाइडेंस के माध्यम से डिस्ट्रैक्टर्स को प्रभावी ढंग से दबाकर जेनेरिक ऑब्जेक्ट ट्रैकिंग को बढ़ाया जा सकता है।

मूल लेखक: Shih-Fang Chen, Jun-Cheng Chen, I-Hong Jhuo, Yen-Yu Lin

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shih-Fang Chen, Jun-Cheng Chen, I-Hong Jhuo, Yen-Yu Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "वेयर्स वाल्डो?" (Where's Waldo?) का एक खेल खेल रहे हैं, लेकिन एक स्थिर किताब के बजाय, पन्ने एक तेज़ चलती हुई वीडियो हैं। आपका काम अपनी आँखों को वाल्डो पर टिकाए रखना है जब वह भीड़ में दौड़ता है, पेड़ों के पीछे छिपता है, कपड़े बदलता है, या लोगों द्वारा अवरुद्ध होता है। यह विजुअल ऑब्जेक्ट ट्रैकिंग (Visual Object Tracking) की चुनौती है।

अधिकांश कंप्यूटर प्रोग्राम जो ऐसा करने की कोशिश करते हैं, वे आसानी से भ्रमित हो जाते हैं। यदि वाल्डो उसके बगल वाले व्यक्ति जैसा दिखने लगे, या रोशनी बदल जाए, तो कंप्यूटर उसे खो सकता है और गलत व्यक्ति को ट्रैक करने लग सकता है।

यह पेपर एक नया सिस्टम पेश करता है जिसे PiVOT (प्रॉम्प्टेबल विजुअल ऑब्जेक्ट ट्रैकिंग) कहा जाता है, जो इस समस्या को हल करता है। यह कंप्यूटर को एक "सुपरपावर" देकर: एक अंतर्निहित, अत्यधिक बुद्धिमान सहायक जो जानता है कि चीज़ें सामान्य रूप से कैसी दिखती हैं, भले ही उसने पहले कभी इस विशिष्ट वाल्डो को न देखा हो।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: कंप्यूटर विचलित हो जाता है

एक मानक ट्रैकर को एक गेंद के साथ एक कुत्ते के रूप में सोचें। आप गेंद (लक्ष्य) फेंकते हैं, और कुत्ता उसके पीछे भागता है। लेकिन अगर एक गिलहरी (एक विचलित करने वाली वस्तु) सामने आ जाए, तो कुत्ता उत्साहित हो सकता है और गिलहरी के पीछे भागने लग सकता है। कुत्ते को वास्तव में गेंद और गिलहरी के बीच अंतर का पता नहीं होता; वह केवल गति और आकार पर प्रतिक्रिया करता है।

2. समाधान: "स्मार्ट असिस्टेंट" (फाउंडेशन मॉडल्स)

लेखकों ने महसूस किया कि कुत्ते को शुरू से प्रशिक्षित करने के बजाय, वे एक स्मार्ट असिस्टेंट को काम पर रख सकते हैं जिसने दुनिया की हर किताब पढ़ी है और हर तस्वीर देखी है। तकनीकी दुनिया में, यह सहायक एक विशाल AI मॉडल है जिसे CLIP कहा जाता है।

  • CLIP एक लाइब्रेरियन की तरह है जिसने "एक लाल गेंद," "एक कुत्ता," या "एक कार" के दृश्य विवरण को याद कर लिया है। इसे विशेष रूप से आपकी लाल गेंद के बारे में सिखाने की आवश्यकता नहीं है; यह पहले से ही जानता है कि एक गिलहरी की तुलना में लाल गेंद कैसी दिखती है।

3. PiVOT कैसे काम करता है: तीन-चरणीय नृत्य

PiVOT ट्रैकर को ध्यान केंद्रित रखने में मदद करने के लिए इस स्मार्ट असिस्टेंट का उपयोग करता है। यहाँ प्रक्रिया दी गई है:

चरण A: "पहला अनुमान" (प्रॉम्प्ट जनरेशन)

जब वीडियो शुरू होता है, तो ट्रैकर वर्तमान फ्रेम और लक्ष्य की शुरुआती तस्वीर को देखता है। यह एक त्वरित, मोटा अनुमान लगाता है: "ठीक है, लक्ष्य शायद इन चमकीले स्थानों में कहीं है।"

  • उपमा: यह कुत्ते द्वारा गेंद की दिशा में अपनी नाक घुमाने जैसा है। यह थोड़ा धुंधला है, लेकिन यह एक शुरुआत है।

चरण B: "स्मार्ट चेक" (टेस्ट-टाइम प्रॉम्प्ट रिफाइनमेंट)

यह जादुई हिस्सा है। ट्रैकर उस स्थान का पीछा करने के लिए प्रतिबद्ध होने से पहले, वह स्मार्ट असिस्टेंट (CLIP) से पूछता है।

  • सिस्टम चरण A से प्राप्त "चमकीले स्थानों" को लेता है और CLIP से पूछता है: "हे, क्या यह हमारे द्वारा ट्रैक किए जा रहे लक्ष्य जैसा दिखता है, या यह एक विचलित करने वाली वस्तु है?"
  • CLIP लक्ष्य के दृश्य गुणों की तुलना परिवेश के साथ करता है। क्योंकि CLIP बहुत स्मार्ट है, इसलिए वह कह सकता है, "नहीं, वह चमकीला स्थान वास्तव में एक चमकदार कार है, लाल गेंद नहीं। इसे अनदेखा करें। वहाँ मौजूद लाल धब्बे पर ध्यान दें।"
  • परिणाम: सिस्टम एक परिष्कृत "हाइलाइटर" (जिसे विजुअल प्रॉम्प्ट कहा जाता है) बनाता है जो केवल वास्तविक लक्ष्य पर एक उज्ज्वल रोशनी डालता है और बाकी सब पर रोशनी कम कर देता है।

चरण C: "फॉलो-थ्रू" (रिलेशन मॉडलिंग)

अब, ट्रैकर वीडियो को फिर से देखता है, लेकिन इस बार, उसे चरण B में बनाए गए उस उज्ज्वल "हाइलाइटर" द्वारा निर्देशित किया जाता है।

  • उपमा: कल्पना करें कि कुत्ता अब धूप का चश्मा पहने हुए है जो केवल लाल गेंद को देखने देता है और बाकी सब कुछ काला कर देता है। अब वह बिना विचलित हुए सीधे लक्ष्य की ओर दौड़ सकता है।

4. यह एक बड़ी बात क्यों है

  • यह तुरंत सीखता है: आपको कंप्यूटर को इस विशिष्ट वस्तु के हजारों उदाहरण दिखाने की आवश्यकता नहीं है। यदि आप एक विशिष्ट प्रकार के भृंग (beetle) को ट्रैक करना चाहते हैं, तो PiVOT अपने सामान्य ज्ञान का उपयोग करके इसे तुरंत समझ लेता है।
  • यह ऊर्जा बचाता है: आमतौर पर, कंप्यूटर को स्मार्ट बनाने के लिए, आपको उसके पूरे मस्तिष्क को फिर से प्रशिक्षित करना पड़ता है, जिसमें बहुत अधिक शक्ति और समय लगता है। PiVOT "मस्तिष्क" (फाउंडेशन मॉडल) को स्थिर रखता है और बस एक छोटा, हल्का "अडैप्टर" (एक छोटे प्लग-इन की तरह) जोड़ता है जो मस्तिष्क को कार्य से जोड़ता है। यह एक स्मार्ट व्यक्ति को नई भाषा सिखाने के बजाय उसे चश्मे की एक नई जोड़ी देने जैसा है।
  • यह कठिन चीजों को संभालता है: पेपर दिखाता है कि PiVOT निम्नलिखित मामलों में बहुत बेहतर है:
    • ओक्लूजन (Occlusion): जब लक्ष्य किसी चीज़ के पीछे छिप जाता है।
    • एक जैसी दिखने वाली वस्तुएं (Look-alikes): जब समान दिखने वाली कई वस्तुएं हों।
    • परिवर्तन: जब वस्तु का आकार या रोशनी बदल जाती है।

सारांश

PiVOT एक वीडियो ट्रैकर को एक सुपर-इंटेलिजेंट लाइब्रेरियन द्वारा संचालित स्मार्ट चश्मे देने जैसा है। केवल गति के पीछे भागने के बजाय, ट्रैकर लाइब्रेरियन से पूछता है, "क्या मैं इसी चीज़ को ढूंढ रहा हूँ?" लाइब्रेरियन अपने विशाल मानसिक डेटाबेस की जांच करता है, सही वस्तु को हाइलाइट करता है, और ट्रैकर को बताता है, "वहाँ जाओ, बाकी को अनदेखा करो।"

यह ट्रैकर को अराजक, भीड़भाड़ वाले या भ्रमित करने वाले वातावरण में भी अपने लक्ष्य पर टिके रहने की अनुमति देता है, जिससे यह पिछले तरीकों की तुलना में बहुत अधिक विश्वसनीय बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →