Archon: A Unified Multimodal Model for Holistic Digital Human Generation
यह शोधपत्र आर्चोन (Archon) को प्रस्तुत करता है, जो एक पूर्णतः पूर्व-प्रशिक्षित एकीकृत बहुविध मॉडल (unified multimodal model) है जो सात विधाओं (modalities) को एकीकृत करता है और विविध कार्यों में उच्च-सटीक, नियंत्रणीय और समग्र डिजिटल मानव निर्माण प्राप्त करने के लिए मेमोरी-कुशल वीडियो रीपैरामीट्राइजेशन (memory-efficient video reparameterization) और "मोडैलिटी में सोचना" (Thinking in Modality) जैसी नवीन तकनीकों का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक डिजिटल मानव बनाना चाहते हैं—एक आभासी अभिनेता जो बिल्कुल वैसे ही बोल सके, हिल-डुल सके और दिख सके जैसा आप चाहते हैं। आमतौर पर, इसे बनाना एक जटिल रोबोट को जोड़ने जैसा है जिसके लिए आपको हर एक हिस्से के लिए एक अलग विशेषज्ञ को काम पर रखना पड़ता है: एक व्यक्ति आवाज़ के लिए, दूसरा चेहरे के लिए, तीसरा शरीर की गतिविधियों के लिए, और चौथा बैकग्राउंड के लिए। ये विशेषज्ञ अक्सर एक ही भाषा नहीं बोल पाते, जिससे अंतिम रोबोट अजीब, त्रुटिपूर्ण या नियंत्रित करने में कठिन हो जाता है।
यह शोध पत्र Archon को पेश करता है, जो एक नया "ऑल-इन-वन" डिजिटल मस्तिष्क है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। Archon को विशेषज्ञों की एक टीम के रूप में नहीं, बल्कि एक यूनिवर्सल ट्रांसलेटर और कंडक्टर (सार्वभौमिक अनुवादक और संचालक) के रूप में सोचें जो एक साथ मानव प्रदर्शन के हर पहलू को समझता है।
यहाँ बताया गया है कि Archon कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. "यूनिवर्सल ट्रांसलेटर" (एकीकृत मल्टीमॉडल मॉडल)
अधिकांश AI मॉडल ऐसे विशेषज्ञों की तरह होते हैं जो केवल एक ही भाषा बोलते हैं। यदि आप टेक्स्ट से वीडियो में बदलना चाहते हैं, तो आपको एक मॉडल की आवश्यकता होगी; यदि आप ऑडियो से चेहरा बनाना चाहते हैं, तो आपको दूसरे की आवश्यकता होगी। Archon अलग है। इसे एक साथ सात अलग-अलग "भाषाओं" (मोडालिटीज) पर प्रशिक्षित किया गया है:
- टेक्स्ट (विवरण और स्क्रिप्ट)
- ऑडियो (भाषण/आवाज़)
- एनिमेशन (3D चेहरे की गतिविधियाँ)
- इमेज और वीडियो
- सिमेंटिक मैप्स (वीडियो का एक सरलीकृत "कंकाल" जो दिखाता है कि आँखें, नाक और मुँह कहाँ हैं)
चूँकि यह इन सभी भाषाओं को एक साथ सीखता है, Archon किसी-से-किसी भी चीज़ (any-to-any) के निर्माण में सक्षम है। आप इसे एक स्क्रिप्ट दे सकते हैं, और यह भाषण लिखता है, चेहरे को एनिमेट करता है, और वीडियो बनाता है। या, आप इसे एक वीडियो दे सकते हैं, और यह लिख सकता है कि वह व्यक्ति कैसा दिखता है और क्या कह रहा है। यह एक ऐसे एकल कलाकार की तरह है जो बिना औज़ार बदले तुरंत पेंटिंग, गायन और अभिनय के बीच स्विच कर सकता है।
2. "स्मार्ट स्केच" (सिमेंटिक वीडियो)
उच्च गुणवत्ता वाले वीडियो AI के साथ सबसे बड़ी समस्याओं में से एक यह है कि वीडियो फ़ाइलें बहुत बड़ी होती हैं। कल्पना कीजिए कि आप अपने किसी मित्र को 5 सेकंड के वीडियो का वर्णन करने की कोशिश कर रहे हैं और आप हर एक पिक्सेल के रंग को सूचीबद्ध कर रहे हैं; इसमें बहुत समय लगेगा और यह आपके मस्तिष्क को अभिभूत कर देगा।
Archon "सिमेंटिक वीडियो" नामक एक चतुर तकनीक का उपयोग करता है। वीडियो के हर पिक्सेल को प्रोसेस करने के बजाय, यह पहले वीडियो को एक "स्मार्ट स्केच" में बदल देता है।
- इस स्केच को एक सरलीकृत मानचित्र के रूप में सोचें जहाँ आँखें केवल नीले बिंदु हैं, मुँह एक लाल आकार है, और बाल एक भूरा धब्बा हैं।
- यह "स्केच" सभी महत्वपूर्ण गतिविधियों (पलक झपकना, बात करना, मुस्कुराना) को कैप्चर करता है लेकिन अनावश्यक विवरणों (जैसे त्वचा की बनावट) को हटा देता है।
- यह डेटा की मात्रा को 4 गुना कम कर देता है जिसे AI को प्रोसेस करने की आवश्यकता होती है, जिससे यह चलाना बहुत तेज़ और सस्ता हो जाता है।
- एक बार जब AI इस "स्केच" को तैयार कर लेता है, तो एक अलग, उच्च-गुणवत्ता वाला "पेंटर" (एक वीडियो डिफ्यूजन मॉडल) यथार्थवादी विवरणों को भरकर अंतिम, फोटो-रियलिस्टिक वीडियो बनाता है।
3. "स्टेप-बाय-स्टेप थिंकर" (मोडालिटी में सोचना)
कभी-कभी, AI से सीधे "ऑडियो" से "वीडियो" में जाने के लिए कहना बहुत कठिन होता है, जैसे किसी को व्याकरण समझे बिना चीनी से फ्रेंच में कविता का अनुवाद करने के लिए कहना। परिणाम अक्सर धुंधला या अजीब होता है।
Archon "थिंकिंग इन मोडालिटी" (मोडालिटी में सोचने) की रणनीति का उपयोग करता है। सीधे उत्तर पर कूदने के बजाय, यह कार्य को छोटे, तार्किक चरणों में तोड़ देता है।
- उदाहरण: यदि आप इसे एक वॉयस रिकॉर्डिंग देते हैं और एक वीडियो मांगते हैं, तो Archon केवल वीडियो का अनुमान नहीं लगाता। यह पहले आवाज़ के आधार पर व्यक्ति के आकार और अभिव्यक्ति के बारे में "सोचता" है, फिर उस व्यक्ति का विवरण बनाता है, और फिर वीडियो जेनरेट करता है।
- यह स्टेप-बाय-स्टेप दृष्टिकोण एक पुल की तरह काम करता है, यह सुनिश्चित करता है कि अंतिम वीडियो स्वाभाविक दिखे और आवाज़ के साथ पूरी तरह मेल खाए, न कि एक भ्रमित करने वाला ढेर बने।
4. "मैजिक एडिटर" (एनी मोडालिटी एडिटिंग)
Archon अविश्वसनीय रूप से लचीला है। कल्पना कीजिए कि आपके पास एक डिजिटल मानव के बोलने का वीडियो है। Archon के साथ, आप बाकी हिस्से को खराब किए बिना उस वीडियो के किसी भी भाग को एडिट कर सकते हैं:
- स्क्रिप्ट बदलें: आप एक नया वाक्य टाइप कर सकते हैं, और AI आवाज़ और होंठों की गतिविधियों को फिर से सिंथेसाइज करेगा ताकि वे मेल खा सकें, जबकि व्यक्ति का चेहरा और स्टाइल बिल्कुल वैसा ही रहेगा।
- दिखावट बदलें: आप AI को कह सकते हैं, "इस व्यक्ति को उम्रदराज दिखाओ," या "इसका लिंग बदल दो," और यह मूल आवाज़ और स्क्रिप्ट को बरकरार रखते हुए वीडियो को अपडेट कर देगा।
- गति बदलें: आप डिजिटल मानव को नए तरीके से सिर या शरीर हिलाने के लिए एक अलग वीडियो का संदर्भ (रेफरेंस) उपयोग कर सकते हैं।
सारांश
संक्षेप में, Archon एक एकल, शक्तिशाली AI सिस्टम है जो डिजिटल मानव के निर्माण को एकीकृत करता है। यह अलग-अलग उपकरणों के बिखरे हुए संग्रह को एक सुसंगत मस्तिष्क से बदल देता है जो टेक्स्ट, ध्वनि और वीडियो को एक साथ समझ सकता है। "स्मार्ट स्केच" का उपयोग करके मेमोरी बचाने और गुणवत्ता सुनिश्चित करने के लिए "स्टेप-बाय-स्टेप थिंकिंग" का उपयोग करके, यह लगभग किसी भी शुरुआती बिंदु से—चाहे वह एक वाक्य हो, एक वॉयस रिकॉर्डिंग हो, या एक वीडियो क्लिप हो—यथार्थवादी डिजिटल लोगों को जेनरेट और एडिट कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।