← नवीनतम पेपर
💻 computer science

Track Anything Behind Everything: Zero-Shot Amodal Video Object Segmentation

यह शोध पत्र 'ट्रैक एनीथिंग बिहाइंड एवरीथिंग' (TABE) को प्रस्तुत करता है, जो एक ज़ीरो-शॉट पाइपलाइन है जो केवल एक दृश्य क्वेरी मास्क का उपयोग करके एमोडल वीडियो ऑब्जेक्ट सेगमेंटेशन करने के लिए एक प्रीट्रेन वीडियो डिफ्यूज़न मॉडल के टेस्ट-टाइम फाइन-ट्यूनिंग का लाभ उठाता है, जिससे क्लास-विशिष्ट प्रीट्रेनिंग या रिट्रेनिंग की आवश्यकता समाप्त हो जाती है।

मूल लेखक: Finlay G. C. Hudson, William A. P. Smith

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Finlay G. C. Hudson, William A. P. Smith

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जादू का शो देख रहे हैं। एक जादूगर मेज पर एक गेंद रखता है और फिर उसे एक बड़े, अपारदर्शी कप से ढक देता है। आपकी आँखों के लिए, गेंद गायब हो गई है। लेकिन आपका मस्तिष्क जानता है कि गेंद अभी भी वहीं है, उसके नीचे छिपी हुई। आप उसके आकार और स्थिति का भी अनुमान लगा सकते हैं, भले ही आप उसे देख नहीं पा रहे हों। इस मानसिक प्रक्रिया को ऑब्जेक्ट परमानेंस (वस्तु स्थायित्व) कहा जाता है, और किसी वस्तु के "लुप्त हिस्सों को भरने" के विशिष्ट कार्य को अमोडल कंप्लीशन (amodal completion) कहा जाता है।

लंबे समय तक, कंप्यूटर इसमें बहुत खराब रहे हैं। यदि एक वीडियो में एक कार पेड़ के पीछे जाती है, तो एक मानक कंप्यूटर विज़न सिस्टम या तो उसे ट्रैक करना बंद कर देता है या गलत अनुमान लगाने लगता है। इसमें उस मानवीय अंतर्ज्ञान की कमी होती है जो यह कह सके, "आह, कार अभी भी वहीं है, बस वह छिपी हुई है।"

यह पेपर एक नई प्रणाली पेश करता है जिसे TABE (ट्रैक एनीथिंग बिहाइंड एवरीथिंग) कहा जाता है, जो कंप्यूटर को ठीक वही करने के लिए प्रशिक्षित करती है जो इंसान करते हैं: किसी वस्तु की पूरी कल्पना करना, तब भी जब उसके कुछ हिस्से अदृश्य हों।

TABE कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: कंप्यूटर विज़न में "ब्लाइंड स्पॉट" (अंध बिंदु)

अधिकांश वर्तमान AI उपकरण एक सुरक्षा कैमरे की तरह हैं जो केवल लेंस के सामने सीधे दिखने वाली चीजों को रिकॉर्ड करता है। यदि कोई व्यक्ति खंभे के पीछे जाता है, तो कैमरा उसे खो देता है। इसे ठीक करने के लिए, पुराने AI तरीकों ने विशिष्ट प्रकार की वस्तुओं (जैसे "केवल कारें" या "केवल कुत्ते") को याद करने की कोशिश की। लेकिन यह एक ऐसे लाइब्रेरियन की तरह है जो केवल बिल्लियों के बारे में किताबें खोजने के लिए जाना जाता है; यदि आप उससे कुत्तों के बारे में किताब मांगते हैं, तो वह मदद नहीं कर सकता।

TABE अलग है। यह ज़ीरो-शॉट (Zero-Shot) है, जिसका अर्थ है कि इसे पहले से यह सिखाने की आवश्यकता नहीं है कि "कुत्ता" या "कार" क्या है। आप बस एक वीडियो के पहले फ्रेम में किसी वस्तु की ओर इशारा करते हैं, और यह कहता है, "समझ गया। मैं उस चीज़ को ट्रैक करूँगा, भले ही वह दीवार के पीछे गायब हो जाए।"

2. समाधान: "जेनरेटिव आर्टिस्ट" (सृजनात्मक कलाकार)

केवल यह अनुमान लगाने के बजाय कि वस्तु कहाँ हो सकती है, TABE एक वीडियो डिफ्यूजन मॉडल (Video Diffusion Model) का उपयोग करता है। इस मॉडल को एक अत्यधिक कुशल, कल्पनाशील कलाकार के रूप में सोचें जिसने लाखों वीडियो देखे हैं।

  • इनपुट (Input): आप कलाकार को एक वीडियो और एक "क्वेरी मास्क" (उस वस्तु की एक साधारण रूपरेखा जिसे आप ट्रैक करना चाहते हैं) देते हैं।
  • प्रक्रिया (Process): कलाकार वस्तु के दृश्य भागों को देखता है। फिर, चीजों के हिलने और बदलने के अपने विशाल ज्ञान का उपयोग करते हुए, वे लुप्त हिस्सों को पेंट करते हैं (या "आउटपेंट" करते) हैं।
  • जादू (Magic): यदि एक गेंद बॉक्स के पीछे लुढ़कती है, तो कलाकार केवल एक खाली जगह नहीं छोड़ता। वे शेष गेंद को "हैलुसिनेट" (अच्छे अर्थ में कल्पना) करते हैं, उसे इस तरह से चित्रित करते हैं जैसे कि वह बॉक्स के ठीक पीछे स्थित हो, उसका आकार और गति बनाए रखते हुए।

3. गुप्त मंत्र: "टेस्ट-टाइम फाइन-ट्यूनिंग" (Test-Time Fine-Tuning)

यहाँ दिलचस्प बात है। आमतौर पर, ये "कलाकार" मॉडल सामान्य होते हैं। वे एक सामान्य गेंद को पेंट करना जानते हैं, लेकिन शायद उन्हें आपकी विशिष्ट गेंद के खरोंच या अनूठे रंग का पता न हो।

TABE कुछ विशेष करता है जिसे टेस्ट-टाइम फाइन-ट्यूनिंग कहा जाता है।

  • कल्पना कीजिए कि आपने एक विशिष्ट पेंटिंग की नकल करने के लिए एक चित्रकार को काम पर रखा है। उन्हें केवल एक सामान्य निर्देश देने के बजाय, आप पहले उन्हें आपकी विशिष्ट गेंद की कुछ तस्वीरें दिखाते हैं।
  • चित्रकार तेजी से आपकी विशिष्ट गेंद की बनावट और आकार को सीख जाता है।
  • फिर, वे वीडियो पर वापस जाते हैं और उस विशिष्ट ज्ञान का उपयोग करके छिपे हुए हिस्सों को भरते हैं।

यह वीडियो चलते समय ("टेस्ट टाइम" पर) तुरंत होता है, इसलिए मॉडल उस विशिष्ट वीडियो में उस विशिष्ट वस्तु के लिए एक विशेषज्ञ बन जाता है।

4. कलाकार को ईमानदार रखना: "टारगेट रीजन" (लक्ष्य क्षेत्र)

इन रचनात्मक कलाकारों के साथ एक जोखिम होता है: वे बहुत अधिक कल्पनाशील हो सकते हैं। यदि आप उन्हें एक छिपे हुए व्यक्ति को भरने के लिए कहते हैं, तो वे गलती से दूसरा व्यक्ति या कुछ रैंडम बैकग्राउंड शोर बना सकते हैं।

इसे रोकने के लिए, TABE टारगेट रीजन मास्क (Target Region Masks) का उपयोग करता है।

  • इसे कैनवास पर एक स्टेंसिल रखने के रूप में समझें। कलाकार को केवल उसी क्षेत्र में पेंट करने की अनुमति है जहाँ वस्तु तार्किक रूप से हो सकती है।
  • वे गहराई सेंसर (जैसे 3D मैप) का उपयोग यह पता लगाने के लिए करते हैं: "पेड़ आगे है, इसलिए वस्तु इसके पीछे होनी चाहिए, लेकिन आसमान में तैरती हुई नहीं।"
  • यह "हैलुसिनेशन" को केंद्रित और सटीक रखता है, यह सुनिश्चित करता है कि कंप्यूटर केवल गायब वस्तु को ही भरे, न कि कोई रैंडम कचरा।

5. परिणाम: अदृश्य को देखना

अंतिम आउटपुट एक ऐसा वीडियो है जहाँ कंप्यूटर ने हर एक फ्रेम के लिए पूर्ण वस्तु को चित्रित किया है, यहाँ तक कि उन फ्रेम्स के लिए भी जहाँ वस्तु 100% छिपी हुई थी।

यह क्यों मायने रखता है?

  • बेहतर सेल्फ-ड्राइविंग कारें: यदि एक कार ट्रक के पीछे छिपी है, तो AI जानता है कि वह बिल्कुल कहाँ है और कब वापस दिखाई देगी, जिससे ड्राइविंग सुरक्षित होती है।
  • रोबोटिक्स: एक रोबोट किसी वस्तु को उठा सकता है भले ही वह किसी अन्य वस्तु द्वारा आंशिक रूप से बाधित हो, क्योंकि वह पूरे आकार को "देख" सकता है।
  • वीडियो एडिटिंग: आप आसानी से एक वीडियो से किसी वस्तु को हटा सकते हैं, और AI बैकग्राउंड को पूरी तरह से भर देगा क्योंकि वह दृश्य की पूर्ण 3D संरचना को समझता है।

सारांश

संक्षेप में, TABE एक ऐसी प्रणाली है जो एक "स्मार्ट ट्रैकर" को एक "रचनात्मक चित्रकार" के साथ जोड़ती है। यह एक वीडियो को देखता है, एक वस्तु की पहचान करता है, और फिर बाधाओं के पीछे चलते समय उस वस्तु के अदृश्य हिस्सों को बनाने के लिए अपनी कल्पना (कड़े नियमों द्वारा निर्देशित) का उपयोग करता है। यह कंप्यूटरों को अंततः यह समझने की अनुमति देता है कि सिर्फ इसलिए कि आप किसी चीज़ को देख नहीं पा रहे हैं, इसका मतलब यह नहीं है कि वह गायब हो गई है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →