← नवीनतम पेपर
💻 computer science

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

YOSE, DiT-आधारित वीडियो ऑब्जेक्ट रिमूवल के लिए एक कुशल फाइन-ट्यूनिंग फ्रेमवर्क है जो बैच वेरिएबल-लेंथ इंडेक्सिंग के माध्यम से आवश्यक टोकन को अनुकूल रूप से चुनकर और डिफ्यूजन प्रोसेस सिम्युलेटर के साथ अनमास्क्ड क्षेत्रों का अनुकरण करके इन्फरेंस को तेज करता है, जिससे विजुअल क्वालिटी बनाए रखते हुए 2.5X तक की गति वृद्धि प्राप्त होती है।

मूल लेखक: Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक व्यस्त सड़क का वीडियो है, और आप फ्रेम में चलते हुए एक विशिष्ट व्यक्ति को हटाना चाहते हैं। अतीत में, किसी व्यक्ति को हटाने की कोशिश करने वाले AI मॉडल ऐसे पेंटरों की एक टीम की तरह थे जो, केवल उस व्यक्ति के ऊपर पेंट करने के बजाय, हर बार बदलाव करते समय पूरी सड़क, आकाश और पृष्ठभूमि में प्रत्येक कार को फिर से पेंट करने का निर्णय लेते थे। यह अविश्वसनीय रूप से धीमा और बर्बादी भरा था क्योंकि वीडियो का 90% हिस्सा छूने की भी आवश्यकता नहीं थी।

यह पेपर YOSE (You Only Select Essential Tokens) पेश करता है, जो एक नया तरीका है जो एक स्मार्ट, सर्जिकल एडिटर (सटीक संपादक) की तरह काम करता है। पूरे कैनवास को फिर से पेंट करने के बजाय, YOSE केवल उन विशिष्ट स्थानों को पेंट करता है जिन्हें ठीक करने की आवश्यकता है, जबकि यह भी सुनिश्चित करता है कि नया पेंट बिना छुए गए हिस्सों के साथ पूरी तरह से मिल जाए।

यहाँ बताया गया है कि YOSE कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "पूरा कैनवास" वाला दृष्टिकोण

वर्तमान AI वीडियो उपकरण (जो "DiT" नामक चीज़ पर आधारित हैं) वस्तुओं को हटाने में बहुत अच्छे हैं, लेकिन वे धीमे हैं। भले ही आप एक वीडियो से केवल एक छोटा पक्षी हटाना चाहते हों, कंप्यूटर पूरे वीडियो के प्रत्येक पिक्सेल को प्रोसेस करता है। यह अखरोट तोड़ने के लिए हथौड़े का उपयोग करने जैसा है। पेपर नोट करता है कि मौजूदा सर्वोत्तम उपकरण भी केवल 10 फ्रेम प्रति सेकंड (FPS) पर चलते हैं, जो रीयल-टाइम उपयोग के लिए बहुत धीमा है।

2. समाधान: दो स्मार्ट टूल्स

YOSE गुणवत्ता को खराब किए बिना मौजूदा AI को तेज़ बनाने के लिए दो विशेष "गैजेट्स" जोड़ता है।

गैजेट A: "स्मार्ट क्लिपर" (Batch Variable-length Indexing)

  • उपमा: कल्पना कीजिए कि आपके पास 100 होमवर्क पेपरों का एक ढेर है, लेकिन उनमें से केवल 5 में गलतियाँ हैं। एक सामान्य शिक्षक सभी 100 पेपरों को एक-एक करके चेक करता है। YOSE एक ऐसे शिक्षक की तरह है जो तुरंत उन 5 पेपरों को काट निकालता है जिनमें गलतियाँ हैं, केवल उन्हीं को चेक करता है, और फिर उन्हें वापस ढेर में रख देता है।
  • यह कैसे काम करता है: AI "मास्क" (वह क्षेत्र जिसे आप बदलना चाहते हैं) को देखता है। यह केवल उस डेटा को चुनने के लिए BVI नामक तकनीक का उपयोग करता है जो उस मास्क के अंदर है। यह भारी काम के दौरान बाकी वीडियो को अनदेखा कर देता है। यह कंप्यूटर को एक निश्चित, विशाल संख्या के बजाय, वस्तुओं की संख्या के आधार पर परिवर्तनीय (variable) मात्रा में काम करने की अनुमति देता है।

गैजेट B: "घोस्ट व्हिस्परर" (Diffusion Process Simulator)

  • उपमा: यदि आप केवल उस छोटे से हिस्से को पेंट करते हैं जहाँ व्यक्ति था, तो नया पेंट ऐसा लग सकता है जैसे वह सड़क की रोशनी या बनावट के साथ मेल न खाने वाला एक स्टिकर हो। आपको यह जानने की आवश्यकता है कि बाकी सड़क कैसी दिखती है ताकि आप नए पेंट को अच्छी तरह से मिला सकें।
  • समस्या: यदि आप समय बचाने के लिए "बुरे" हिस्सों को काट देते हैं, तो AI भूल जाता है कि "अच्छे" हिस्से कैसे दिखते थे। यह संदर्भ (context) खो देता है।
  • समाधान: YOSE एक मॉड्यूल का उपयोग करता है जिसे DiffSim कहा जाता है। यह वास्तव में वीडियो के "अच्छे" हिस्सों को प्रोसेस नहीं करता है (जो धीमा होगा)। इसके बजाय, यह उन अच्छे हिस्सों का एक सिमुलेशन या "भूत" (ghost) बनाता है कि वे क्या कर रहे हैं। यह AI को फुसफुसाकर बताता है, "हे, यहाँ का आकाश नीला है, और वह कार बाईं ओर चल रही है," ताकि AI उस नए पैच को सहजता से मिला सके। यह पूरे शहर के नक्शे के साथ एक ही मोहल्ले में चलने जैसा है।

3. "सीमलेस स्टिच" (Seamless Stitch - निर्बाध जोड़)

भले ही "घोस्ट व्हिस्परर" के साथ भी, पुराने वीडियो और नए वीडियो के मिलन स्थल पर एक बहुत ही सूक्ष्म रेखा दिखाई दे सकती है। YOSE एक अंतिम ट्रिक का उपयोग करता है: यह किनारों को थोड़ा ओवरलैप करता है और चमक (brightness) तथा रंग के सांख्यिकी (mean and variance) को समायोजित करता है ताकि संक्रमण अदृश्य हो जाए। यह एक फोटो कटआउट के किनारों को बैकग्राउंड में मिलाने जैसा है ताकि वह गायब हो जाए।

परिणाम: तेज़ और साफ

पेपर दावा करता है कि इन ट्रिक्स का उपयोग करके:

  • गति (Speed): YOSE पिछले सर्वोत्तम तरीकों की तुलना में 2.5 गुना तेज़ है। यदि पुराने तरीके में 10 सेकंड लगते, तो YOSE लगभग 4 सेकंड लेता है।
  • स्केलेबिलिटी (Scalability): इसकी गति इस बात पर निर्भर करती है कि आप किस आकार की वस्तु को हटा रहे हैं। यदि आप एक छोटा सा कण हटाते हैं, तो यह बहुत तेज़ होता है। यदि आप एक बड़ी इमारत हटाते हैं, तो यह धीमा हो जाता है, लेकिन यह पुराने तरीके से कभी भी धीमा नहीं होता।
  • गुणवत्ता (Quality): वीडियो की गुणवत्ता उतनी ही अच्छी बनी रहती है जितनी कि धीमी, पूर्ण-प्रोसेसिंग विधियों की होती है। वास्तव में, क्योंकि यह गलती से बैकग्राउंड को खराब नहीं करता (क्योंकि यह उसे अनदेखा करता है), बैकग्राउंड अक्सर अधिक स्थिर दिखता है।

सारांश

YOSE एक "स्मार्ट एडिटर" है जो यह समझता है कि किसी एक वस्तु को हटाने के लिए आपको पूरे ब्रह्मांड को फिर से सिम्युलेट करने की आवश्यकता नहीं है। यह उस काम को काट देता है जिसकी उसे आवश्यकता नहीं है, संदर्भ को याद रखने के लिए एक चतुर सिमुलेशन का उपयोग करता है जिसे उसने अनदेखा किया था, और सब कुछ इतनी पूर्णता से वापस जोड़ता है कि आप अंतर नहीं बता सकते। यह एक धीमी, भारी प्रक्रिया को एक तेज़, सर्जिकल प्रक्रिया में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →