← नवीनतम पेपर
🤖 AI

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation

यह शोधपत्र Argus को प्रस्तुत करता है, जो एक Wan-आधारित फ्रेमवर्क है जो स्टैक्ड मल्टी-व्यू आइडेंटिटी मोज़ेक इंजेक्शन (SMII) और काउंटरफैक्टुअल सेल्फ-सुपरविजन का उपयोग करके विविध गतियों, दृश्य कोणों के परिवर्तनों और अवरोधों (occlusions) में अत्याधुनिक मजबूती प्राप्त करने के लिए पॉइंट-रेफरेंस प्रतिमानों की सीमाओं को दूर करता है।

मूल लेखक: Zijie Meng, Jiwen Liu, Yufei Liu, Chengzhuo Tong, Xiaoqiang Liu, Yuanxing Zhang, Yulong Xu, Pengfei Wan

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zijie Meng, Jiwen Liu, Yufei Liu, Chengzhuo Tong, Xiaoqiang Liu, Yuanxing Zhang, Yulong Xu, Pengfei Wan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को आपके सबसे अच्छे दोस्त, "एलेक्स" का वीडियो बनाने के लिए सिखाने की कोशिश कर रहे हैं, जो केवल एक फोटो और "एलेक्स कुत्ता घुमा रहा है" जैसे विवरण पर आधारित हो।

इसे करने का पुराना तरीका ऐसा था जैसे आप रोबोट को एलेक्स की एक अकेली तस्वीर थमा देते। रोबोट उस एक फोटो को देखता और उसे पूरी तरह से कॉपी करने की कोशिश करता। लेकिन यहाँ समस्या यह है: यदि फोटो में एलेक्स धूप का चश्मा पहने हुए एक धूप वाले दिन का है, तो रोबोट भ्रमित हो सकता है और यह सोच सकता है कि "धूप का चश्मा" और "धूप" एलेक्स के चेहरे का हिस्सा हैं। यदि आप रोबोट को एलेक्स को बारिश में चलते हुए या अपना सिर एक तरफ घुमाते हुए दिखाने के लिए कहते हैं, तो रोबोट अक्सर विफल हो जाता है। या तो वह भूल जाता है कि एलेक्स कैसा दिखता है, या वह ज़िद पर अड़ा रहता है कि जब जरूरत नहीं है तब भी धूप का चश्मा पहने रहे। वह एलेक्स की पहचान को समय के एक एकल, स्थिर बिंदु के रूप में मानता है।

Argus एक नया सिस्टम है जो खेल बदल देता है। एक फोटो देने के बजाय, Argus रोबोट को एक डायनेमिक मेमोरी बैंक (गतिशील स्मृति बैंक) देता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. "आइडेंटिटी डायरेक्टर" (स्मार्ट लाइब्रेरियन)

रोबोट द्वारा ड्राइंग शुरू करने से पहले, एक स्मार्ट AI लाइब्रेरियन (जिसे MLLM Identity Director कहा जाता है) एलेक्स के फोटो और वीडियो के पूरे एल्बम को देखता है।

  • काम: यह केवल एक "सबसे अच्छी" फोटो नहीं चुनता। यह एलेक्स के पलों का एक विविध सेट चुनता है: एलेक्स मुस्कुरा रहा है, एलेक्स बगल में देख रहा है, एलेक्स अंधेरे में है, एलेक्स ने टोपी पहनी है, और एलेक्स ने टोपी नहीं पहनी है।
  • विवाद सुलझाने वाला (Conflict Resolver): यदि यूजर का प्रॉम्प्ट कहता है "लाल शर्ट में एलेक्स" लेकिन फोटो में एलेक्स नीली शर्ट में है, तो लाइब्रेरियन जानता कि शर्ट के रंग के लिए यूजर के टेक्स्ट को फोटो पर प्राथमिकता देनी है, लेकिन चेहरे को फोटो से बनाए रखना है। यह एक फिल्म सेट पर निर्देशक की तरह काम करता है, यह सुनिश्चित करता है कि स्क्रिप्ट (प्रॉम्प्ट) और अभिनेता का लुक (पहचान) आपस में लड़ें नहीं।

2. "मोज़ेक इंजेक्शन" (3D मेमोरी ब्लॉक)

यह एक मुख्य जादुई ट्रिक है, जिसे SMII कहा जाता है।

  • पुराना तरीका: कल्पना कीजिए कि आप एक वीडियो स्ट्रीम पर फोटो चिपकाने की कोशिश कर रहे हैं। यह अक्सर एक स्टिकर की तरह दिखता है जो प्रवाह में ठीक से फिट नहीं बैठता।
  • Argus का तरीका: लाइब्रेरियन उन चुने गए 9 पलों को एक 3x3 ग्रिड मोज़ेक (जैसे टिक-टैक-टो बोर्ड) में व्यवस्थित करता है।
  • "टाइम ट्रैवल" ट्रिक: इस ग्रिड को वीडियो में डालने के बजाय, Argus इसे कंप्यूटर की मेमोरी में वीडियो शुरू होने से पहले रखता है। इसे "नेगेटिव टाइम" मेमोरी की तरह समझें। वीडियो जनरेशन प्रक्रिया एलेक्स के दिखने के तरीके को याद रखने के लिए इस ग्रिड को देख सकती है, लेकिन ग्रिड खुद नए बनाए जा रहे वीडियो के साथ कभी भी मिक्स या "दूषित" नहीं होता है। यह एक रीड-ओनली मेमोरी है जिसे रोबोट एलेक्स की नाक की बनावट या आंखों का रंग याद करने के लिए जब चाहे देख सकता है, चाहे एलेक्स किसी भी स्थिति में क्यों न हो।

3. "काउंटरफैक्चुअल ट्रेनिंग" (क्या होगा अगर - द जिम)

आमतौर पर, रोबोट को किसी व्यक्ति को पहचानने के लिए सिखाने के लिए, आपको वीडियो के जोड़ों की आवश्यकता होती है: एक जिसमें व्यक्ति स्थिर खड़ा है, और एक उसी व्यक्ति का दौड़ता हुआ। ये मिलना कठिन है।

  • Argus का रहस्य: इसे उन जोड़ों की आवश्यकता नहीं है। इसके बजाय, यह एलेक्स का एक वीडियो लेता है और उसके हजारों "नकली" संस्करण बनाता है। यह रैंडम तरीके से बैकग्राउंड बदल देता है, डिजिटल शोर (noise) जोड़ देता है, लाइटिंग बदल देता है, या डिजिटल रूप से टोपी या चश्मा जोड़ देता है।
  • सबक: रोबोट को इन सभी रैंडम बदलावों के बावजूद एलेक्स को पहचानने के लिए मजबूर करके, रोबोट यह सीख जाता है कि वास्तव में "एलेक्स" क्या है (चेहरे की संरचना) और क्या केवल "शोर" है (बैकग्राउंड या एक्सेसरीज)। वह विकर्षणों (distractions) को अनदेखा करना सीख जाता है।

4. "एडेप्टिव गाइडेंस" (वॉल्यूम नॉब)

जब रोबोट वास्तव में वीडियो बना रहा होता है, तो उसे दो चीजों के बीच संतुलन बनाना होता है: टेक्स्ट निर्देशों का पालन करना और चेहरे को एलेक्स जैसा बनाए रखना।

  • समस्या: यदि आप "चेहरा बनाए रखने" वाले बटन को बहुत ज़ोर से दबाते हैं, तो वीडियो स्थिर और जकड़ा हुआ दिखता है। यदि आप इसे बहुत हल्का रखते हैं, तो चेहरा किसी और जैसा दिखने लगता है।
  • समाधान: Argus एक स्मार्ट "वॉल्यूम नॉब" का उपयोग करता है जिसे Adaptive Self-Likeness Guidance कहा जाता है।
    • वीडियो की शुरुआत में: यह बड़े चित्र (लेआउट, मूवमेंट) पर ध्यान केंद्रित करता है।
    • वीडियो के बीच में: यह पहचान (identity) पर वॉल्यूम बढ़ा देता है ताकि चेहरा सही रहे।
    • वीडियो के अंत में: यह इसे थोड़ा कम कर देता है ताकि टेक्सचर प्राकृतिक दिखे और बहुत अधिक शार्प या प्लास्टिक जैसा न लगे।

परिणाम

पेपर ने Argus का परीक्षण एक "स्ट्रेस टेस्ट" पर किया जिसे HardID-Celeb कहा जाता है, जिसमें कठिन परिदृश्य शामिल हैं जैसे:

  • लार्ज यॉ (Large Yaw): व्यक्ति अपना सिर लगभग 90 डिग्री घुमाता है (प्रोफाइल दिखाता है)।
  • ऑक्लूजन (Occlusion): पहले फ्रेम में व्यक्ति का चेहरा आंशिक रूप से ढका हुआ है।

इन कठिन परीक्षणों में, Argus ने अन्य सभी तरीकों को पीछे छोड़ दिया। जहाँ अन्य सिस्टम व्यक्ति का सिर घुमाने पर या चेहरा ढके जाने पर उसकी पहचान खो देते थे, वहीं Argus ने व्यक्ति को पहचानने योग्य बनाए रखा, उनकी अनूठी विशेषताओं को कठिन कोणों और लाइटिंग में भी सुरक्षित रखा।

संक्षेप में: Argus किसी व्यक्ति की पहचान को एक एकल, स्थिर फोटो के रूप में नहीं, बल्कि एक जीवंत, सांस लेती स्मृति के रूप में देखता है जिसे किसी भी कोण से, किसी भी समय एक्सेस किया जा सकता है, बिना बैकग्राउंड या लाइटिंग से भ्रमित हुए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →