← नवीनतम पेपर
💻 computer science

Weakly-Supervised Referring Video Object Segmentation through Text Supervision

यह शोध पत्र WSRVOS प्रस्तुत करता है, जो एक नवीन वीकली-सुपरवाइज्ड रेफरिंग वीडियो ऑब्जेक्ट सेगमेंटेशन विधि है जो कंट्रास्टिव एक्सप्रेशन ऑग्मेंटेशन, द्वि-दिशीय फीचर इंटरैक्शन और टेम्पोरल रैंकिंग बाधाओं के माध्यम से उच्च गुणवत्ता वाले सूडो-मास्क उत्पन्न करने के लिए केवल टेक्स्ट एक्सप्रेशन पर प्रशिक्षण देकर महंगे पिक्सेल-स्तरीय या यहाँ तक कि बॉक्स एनोटेशन की आवश्यकता को समाप्त करता है।

मूल लेखक: Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अव्यवस्थित जन्मदिन की पार्टी का एक होम वीडियो है। आप उस विशिष्ट क्लिप को खोजना चाहते हैं जहाँ "लाल ड्रेस वाली छोटी बच्ची मोमबत्तियाँ बुझा रही है।"

कंप्यूटर विज़न की दुनिया में, इस कार्य को रेफरिंग वीडियो ऑब्जेक्ट सेगमेंटेशन (RVOS) कहा जाता है। कंप्यूटर को वीडियो के हर एक फ्रेम में उस विशेष लड़की के चारों ओर एक सटीक रूपरेखा (outline) बनानी होगी।

समस्या: महंगी "आर्ट क्लास"

पारंपरिक रूप से, कंप्यूटर को यह सिखाना एक सेना के कलाकारों को काम पर रखने जैसा है। आपको उन्हें बिठाना होगा और उनसे वीडियो के हर एक फ्रेम में उस लड़की की रूपरेखा को मैन्युअल रूप से ट्रेस करने के लिए कहना होगा। यह अविश्वसनीय रूप से महंगा, धीमा और उबाऊ है।

कुछ नए तरीकों ने इसे आसान बनाने की कोशिश की, जैसे कि केवल लड़की के चारों ओर एक बॉक्स बनाना या उसकी नाक पर एक बिंदु रखना। लेकिन वह भी अभी भी बहुत अधिक मैन्युअल काम है।

समाधान: "केवल टेक्स्ट वाला" जासूस

यह पेपर एक नई विधि पेश करता है जिसे WSRVOS कहा जाता है। यह कंप्यूटर को एक जासूस बनने की शिक्षा देने जैसा है जिसे खोजने के लिए केवल एक मौखिक विवरण (एक टेक्स्ट वाक्य) की आवश्यकता होती है। इसे किसी ड्राइंग, बॉक्स या बिंदु की आवश्यकता नहीं है। इसे बस इस वाक्य की आवश्यकता है: "लाल ड्रेस वाली छोटी बच्ची।"

यहाँ बताया गया है कि WSRVOS कैसे काम करता है, जिसे पांच सरल चरणों में एक रचनात्मक उपमा (analogy) का उपयोग करके समझाया गया है:

1. क्रिएटिव राइटिंग कोच (कॉन्ट्रास्टिव ऑग्मेंटेशन)

वीडियो डेटासेट में मूल टेक्स्ट विवरण अक्सर बहुत सरल होते हैं, जैसे केवल "एक लड़की" कहना। इससे कंप्यूटर भ्रमित हो जाता है।

  • WSRVOS क्या करता है: यह एक सुपर-स्मार्ट AI (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल) का उपयोग करता है जो एक क्रिएटिव राइटिंग कोच की तरह काम करता है।
  • उपमा: कल्पना कीजिए कि आप कोच को "एक लड़की" वाक्य देते हैं। कोच आपके लिए इसके बेहतर संस्करण लिखता है: "मोमबत्तियाँ बुझाती लाल ड्रेस वाली एक लड़की" (पॉजिटिव)। लेकिन कंप्यूटर को स्मार्ट बनाने के लिए, कोच कुछ चालाकी भरे संस्करण भी लिखता है: "नीली शर्ट में एक लड़का" या "केक खाती एक लड़की" (नेगेटिव)।
  • क्यों? सही विवरण और गलत-लेकिन-समान दिखने वाले विवरणों दोनों को दिखाकर, यह कंप्यूटर को उन सूक्ष्म विवरणों को पहचानने में मदद करता है जो महत्वपूर्ण हैं।

2. फ़िल्टर और अनुवादक (फीचर सिलेक्शन एंड इंटरैक्शन)

वीडियो अव्यवस्थित होते हैं। एक 10 सेकंड का क्लिप एक लड़की, एक केक, एक कुत्ते और एक जोकर का हो सकता है। टेक्स्ट केवल लड़की के बारे में है।

  • WSRVOS क्या करता है: यह एक क्लब के बाउंसर और एक अनुवादक दोनों की तरह कार्य करता है।
  • उपमा:
    • बाउंसर: यह वीडियो को देखता है और कहता है, "हे, जोकर और कुत्ता टेक्स्ट में नहीं हैं। बाहर जाओ!" यह विजुअल शोर (visual noise) को फ़िल्टर कर देता है।
    • अनुवादक: यह टेक्स्ट को देखता है और कहता है, "'लाल' शब्द महत्वपूर्ण है, लेकिन 'द' शब्द बेकार है।" यह टेक्स्ट के शोर को फ़िल्टर कर देता है।
    • इंटरैक्शन: फिर, यह "फ़िल्टर्ड वीडियो" और "फ़िल्टर्ड टेक्स्ट" को आपस में बात करने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि वे पूरी तरह से सिंक्रोनाइज़्ड हैं।

3. क्विज़ मास्टर (इंस्टेंस-अवेयर क्लासिफिकेशन)

अब कंप्यूटर को यह साबित करना होगा कि वह "सही लड़की" और "गलत लड़की" के बीच अंतर समझता है।

  • WSRVOS क्या करता है: यह एक क्विज़ आयोजित करता है।
  • उपमा: कंप्यूटर को एक वीडियो फ्रेम और वाक्यों की एक सूची दिखाई जाती है (कुछ सही, कुछ गलत)। इसे उस वाक्य की ओर इशारा करना होता है जो वीडियो से मेल खाता है। यदि यह गलत चुनता है, तो इसे "लाल पेन" से सुधार मिलता है। यह मॉडल को समान दिखने वाली वस्तुओं के बीच विशिष्ट अंतर सीखने के लिए मजबूर करता है।

4. क्राउड-सोर्स्ड मैप (पॉजिटिव-प्रेडिक्शन फ्यूजन)

याद है वे "बेहतर" विवरण जो कोच ने स्टेप 1 में लिखे थे?

  • WSRVOS क्या करता है: यह उन सभी अलग-अलग तरीकों को लेता है जिनसे कंप्यूटर ने उन विभिन्न विवरणों का उपयोग करके लड़की को खोजा था, और उन्हें आपस में मिला देता है।
  • उपमा: कल्पना कीजिए कि तीन अलग-अलग जासूस लड़की की तलाश कर रहे हैं। जासूस A कहता है, "वह केक के पास है।" जासूस B कहता है, "उसने लाल रंग पहना है।" जासूस C कहता है, "वह हवा बुझा रही है।"
    • WSRVOS उन तीनों सुरागों को लेता है और लड़की कहाँ है, इसका एक एकल, सुपर-सटीक मानचित्र (एक "स्यूडो-मास्क") बनाता है। यह इस मानचित्र का उपयोग कंप्यूटर को और प्रशिक्षित करने के लिए एक "शिक्षक" के रूप में करता है, भले ही मूल रूप से किसी इंसान ने वह मानचित्र नहीं बनाया था।

5. स्मूथ-ऑपरेटर (टेम्पोरल सेगमेंट रैंकिंग)

वीडियो चलते हैं। यदि लड़की सुचारू रूप से चलती है, तो फ्रेम 10 में उसकी स्थिति फ्रेम 11 में उसकी स्थिति के बहुत करीब होनी चाहिए, लेकिन फ्रेम 100 से दूर होनी चाहिए।

  • WSRVOS क्या करता है: यह गति को तार्किक बनाए रखने के लिए एक नियम जोड़ता है।
  • उपमा: यह एक डांस इंस्ट्रक्टर की तरह है। यदि कंप्यूटर लड़की की रूपरेखा को लड़खड़ाते या कूदते हुए तरीके से (एक ग्लिच वाले वीडियो की तरह) बनाता है, तो इंस्ट्रक्टर उसके हाथ पर थप्पड़ मारकर कहता है, "नहीं! यदि वह फ्रेम 1 में यहाँ है, तो वह फ्रेम 2 में कमरे के दूसरी ओर टेलीपोर्ट नहीं हो सकती। इसे स्मूथ रखो!" यह सुनिश्चित करता है कि वीडियो सेगमेंटेशन स्वाभाविक और स्थिर दिखे।

परिणाम

केवल टेक्स्ट और इन चालाक ट्रिक्स का उपयोग करके, WSRVOS उन तरीकों के लगभग बराबर प्रदर्शन कर सकता है जिन्हें महंगे मानवीय रेखाचित्रों (drawings) की आवश्यकता होती है। यह तेज़ है, सस्ता है, और यह साबित करता है कि यदि आपके पास कहानी समझने के लिए पर्याप्त स्मार्ट AI है, तो आपको हर फ्रेम के लिए मानव कलाकार की आवश्यकता नहीं है।

संक्षेप में: यह कंप्यूटर को एक "डम्ब ट्रेसर" से एक "स्मार्ट रीडर" में बदल देता है जो वीडियो देख सकता है, एक विवरण सुन सकता है, और आपके लिए चित्र बना सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →