← नवीनतम पेपर
💻 computer science

AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References

AnyID एक नवीन ढांचा है जो अल्ट्रा-फिडेलिटी आइडेंटिटी-प्रिजर्विंग वीडियो जनरेशन के लिए है, जो एक स्केलेबल ओम्नी-रेफरेंस्ड आर्किटेक्चर के माध्यम से विषम विजुअल इनपुट्स को एकीकृत करके और सटीक एट्रीब्यूट-लेवल कंट्रोलेबिलिटी प्राप्त करने के लिए डिफरेंशियल प्रॉम्प्टिंग के साथ एक प्राइमरी-रेफरेंस्ड जनरेशन प्रतिमान को नियोजित करके सिंगल-रेफरेंस विधियों की सीमाओं को दूर करता है।

मूल लेखक: Jiahao Wang, Hualian Sheng, Sijia Cai, Yuxiao Yang, Weizhan Zhang, Caixia Yan, Bing Deng, Jieping Ye

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahao Wang, Hualian Sheng, Sijia Cai, Yuxiao Yang, Weizhan Zhang, Caixia Yan, Bing Deng, Jieping Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने पसंदीदा अभिनेता को स्टार बनाकर एक छोटी फिल्म बनाना चाहते हैं, लेकिन आपके पास केवल उनकी कुछ बिखरी हुई तस्वीरें और एक पुराना होम वीडियो है। आप चाहते हैं कि वे बिल्कुल अपने जैसे दिखें, लेकिन आप चाहते हैं कि वे नए काम कर रहे हों, अलग कपड़े पहने हों और अलग जगहों पर खड़े हों।

पुराने तरीकों के साथ समस्या:
पिछले AI टूल्स एक सख्त, एक ही ट्रैक पर चलने वाले निर्देशक की तरह थे। वे कहते थे, "ठीक है, मेरे पास आपकी अभिनेता की केवल एक फोटो है। मैं अंदाज़ा लगाऊँगा कि वे बगल से कैसे दिखते हैं, उनकी आवाज़ कैसी है, और वे कैसे चलते हैं।" क्योंकि उनके पास केवल एक सुराग था, वे अक्सर गलत हो जाते थे। अभिनेता अक्सर अजनबी जैसा दिखने लगता था, या सिर घुमाने पर उनका चेहरा बिगड़ जाता था। यह एक "सबसे अच्छा अनुमान" था जो अक्सर विफल हो जाता था।

समाधान: AnyID
यह पेपर AnyID को पेश करता है, जो एक नया AI सिस्टम है जो एक अत्यंत सूक्ष्म अवलोकन करने वाले निर्देशक की तरह काम करता है जो फिल्म बनाने से पहले आपके सभी सुराग इकट्ठा करता है। यह इस प्रकार काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "फोटो एल्बम" दृष्टिकोण (ओम्नी-रेफरेंस्ड)

AI को केवल एक फोटो के आधार पर अंदाज़ा लगाने के लिए मजबूर करने के बजाय, AnyID आपको कुछ भी डालने की अनुमति देता है: एक सेल्फी, एक पोर्ट्रेट, एक वीडियो क्लिप, या इन तीनों का मिश्रण।

  • उपमा: कल्पना कीजिए कि आप एक चित्रकार को अपने दोस्त का वर्णन करने की कोशिश कर रहे हैं। यदि आप चित्रकार को केवल अपने दोस्त के चेहरे की एक फोटो दिखाते हैं, तो चित्रकार नाक तो सही बना सकता है लेकिन कान बिगाड़ सकता है। लेकिन यदि आप उन्हें एक फोटो एल्बम दिखाते हैं जिसमें आपका दोस्त मुस्कुरा रहा है, गुस्सा कर रहा है, बाईं ओर देख रहा है और दाईं ओर देख रहा है, तो चित्रकार आपके दोस्त का एक सटीक 3D मानसिक मॉडल बना सकता है। AnyID डिजिटल रूप से ऐसा ही करता है, आपके सभी संदर्भों को मिलाकर व्यक्ति की एक "परफेक्ट 3D याद" बनाता है।

2. "एंकर और एडिट" रणनीति (प्राइमरी रेफरेंस और डिफरेंशियल प्रॉम्प्ट्स)

यही इस सिस्टम का सबसे स्मार्ट हिस्सा है। जब आप कुछ बदलना चाहते हैं (जैसे बैकग्राउंड या कपड़े), तो पुराने AI अक्सर अनजाने में व्यक्ति का चेहरा या बाल भी बदल देते हैं।

  • उपमा: प्राइमरी रेफरेंस को "एंकर" के रूप में सोचें। यह वह एक फोटो है जिसे आप कहते हैं, "उनके बाल और चेहरा बिल्कुल ऐसे ही दिखने चाहिए।"
  • डिफरेंशियल प्रॉम्प्ट: AI को पूरी नई दृश्य का विवरण लिखने के बजाय (जो AI को भ्रमित कर सकता है), आप बस उसे बताते हैं कि क्या बदलना है।
    • पुराना तरीका: "एक आदमी जिसके छोटे काले बाल हैं, लाल जैकेट पहने हुए समुद्र तट पर खड़ा है।" (AI गलती से उसके बाल लाल कर सकता है या उसका चेहरा बदल सकता है)।
    • AnyID का तरीका: "जैकेट को लाल रंग में बदलें और बैकग्राउंड को समुद्र तट पर ले जाएं।" (AI जानता है कि उसे "एंकर" फोटो के बालों और चेहरे को बिल्कुल वैसा ही रखना है, केवल उन्हीं विशिष्ट चीजों को बदलना है जिन्हें आपने मांगा है)।

3. "मानवीय आलोचक" (रीइन्फोर्समेंट लर्निंग)

AI को वीडियो बनाना सिखाना एक कुत्ते को प्रशिक्षित करने जैसा है। आप इसे हजारों उदाहरण दिखा सकते हैं, लेकिन फिर भी कभी-कभी यह विवरणों में गलत हो जाता है (जैसे बालों को प्लास्टिक जैसा दिखाना या हलचल को झटकेदार बनाना)।

  • उपमा: बुनियादी बातें सीखने के बाद, शोधकर्ता मनुष्यों के एक समूह को "जज" की भूमिका निभाने देते हैं। वे AI को दो वीडियो दिखाते हैं: एक जो अच्छा दिखता है और एक जो थोड़ा सा अलग/गलत है। मनुष्य विजेता को चुनते हैं। AI फिर सीखता है, "ओह, इंसान उस वीडियो को पसंद करते हैं जिसमें बालों की चमक अधिक स्मूथ है।" यह हजारों बार दोहराता है, वास्तव में "परीक्षा के लिए पढ़ाई" करता है जब तक कि यह मानवीय पसंद से पूरी तरह मेल न खा जाए।

यह क्यों महत्वपूर्ण है

  • क्रिएटर्स के लिए: आप आखिरकार हॉलीवुड बजट या एनिमेटरों की टीम के बिना कहानियों, गेम या सोशल मीडिया के लिए निरंतर पात्र (consistent characters) बना सकते हैं।
  • सभी के लिए: यह "अनकैनी वैली" (uncanny valley) की समस्या को हल करता है। पात्र अजीब, ग्लिच वाले रोबोट नहीं लगते; वे स्वाभाविक रूप से चलते हुए वास्तविक लोग दिखते हैं।

संक्षेप में:
AnyID एक जादुई मूवी स्टूडियो की तरह है जो आपके फोटो और वीडियो के बिखरे हुए संग्रह को लेता है, उस व्यक्ति का एक सटीक 3D मॉडल बनाता है, और फिर आपको उन्हें कुछ भी करने के लिए निर्देशित करने की अनुमति देता है, जबकि यह गारंटी देता है कि वे अभी भी बिल्कुल अपने जैसे ही दिखेंगे। यह एक धुंधले अनुमान और एक हाई-डेफिनिशन वास्तविकता के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →