LongCat-Video-Avatar 1.5 Technical Report
LongCat-Video-Avatar 1.5 एक उन्नत ओपन-सोर्स फ्रेमवर्क है जो उत्पादन तत्परता और व्यवस्थित इंजीनियरिंग को प्राथमिकता देता है ताकि त्वरित अनुमान के साथ व्यावसायिक-ग्रेड, स्थिर और पहचान-सुसंगत लंबे वीडियो निर्माण को वितरित किया जा सके, जो विविध परिदृश्यों में अग्रणी क्लोज्ड-सोर्स सिस्टम से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक डिजिटल पात्र बनाना चाहते हैं जो बिल्कुल एक असली इंसान की तरह बात कर सके, गा सके और अभिनय कर सके, लेकिन आपके पास केवल उनकी एक फोटो और उनकी आवाज़ की एक रिकॉर्डिंग है। लंबे समय तक, इन पात्रों को कुछ सेकंड से अधिक समय के लिए "वास्तविक" दिखाना ताश के पत्तों के घर को तेज हवा में संतुलित करने जैसा था: वे एक पल के लिए तो अच्छे दिख सकते हैं, लेकिन फिर उनके चेहरे अजीब होने लगते हैं, उनके होंठ शब्दों से मेल नहीं खाते, या उनके शरीर अजीब तरह से हिलने लगते हैं।
LongCat-Video-Avatar 1.5 पेपर, जो Meituan LongCat टीम का है, एक नए, ओपन-सोर्स "रेसिपी" (विधि) के बारे में एक तकनीकी रिपोर्ट है जिसका उपयोग इन डिजिटल पात्रों को बनाने के लिए किया जाता है। एक बिल्कुल नया प्रकार का जादू आविष्कार करने के बजाय, उन्होंने इंजीनियरिंग को इतना सटीक बनाने पर ध्यान केंद्रित किया जिससे परिणाम वास्तविक दुनिया के उपयोग (जैसे फिल्में, समाचार या ग्राहक सेवा) के लिए पर्याप्त स्थिर हो सके।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) के साथ:
1. "कान" का अपग्रेड: Whisper Large
पुराने संस्करण में, मॉडल एक मानक "कान" (एक ऑडियो एनकोडर जिसे Wav2Vec2 कहा जाता है) का उपयोग करता था जो आवाज़ को सुनता था। यह ठीक था, लेकिन कभी-कभी यह बोलने की सूक्ष्म बारीकियों को पकड़ने में चूक जाता था।
- अपग्रेड: उन्होंने इसे Whisper Large के साथ बदल दिया, जो एक बहुत अधिक शक्तिशाली ऑडियो सिस्टम है।
- उपमा: पुराने कान को एक शोर भरे कमरे में ईयरप्लग लगाकर गाना सुनने वाले व्यक्ति की तरह समझें। नया Whisper Large एक शांत स्टूडियो में हाई-एंड नॉइज़-कैंसलिंग हेडफ़ोन पहनने जैसा है। यह आवाज़ की हर छोटी बारीकी को सुनता है, जिससे पात्र के होंठ पूरी सटीकता के साथ चलते हैं, जो लंबे वीडियो में भी ध्वनि के साथ बिल्कुल सटीक मेल खाते हैं।
2. डेटा के लिए "जिम": ट्रेनिंग सेट को व्यवस्थित करना
आप एक डिजिटल अभिनेता को केवल रैंडम वीडियो दिखाकर नहीं सिखा सकते। यदि आप उन्हें एक ऐसा वीडियो दिखाते हैं जिसमें चेहरा धुंधला है, कोई व्यक्ति साइन पकड़े हुए है, या दो लोग एक साथ बात कर रहे हैं, तो मॉडल भ्रमित हो जाता है।
- समाधान: उन्होंने एक कठोर "डेटा जिम" बनाया। उन्होंने सिस्टम में हजारों वीडियो बस डाले नहीं। उन्होंने उन्हें एक लाइब्रेरियन की तरह व्यवस्थित किया जो लाइब्रेरी को व्यवस्थित करता है:
- साइलेंट डेटा (Silent Data): उन्होंने मॉडल को सिखाया कि जब कोई भी बोल नहीं रहा हो (जैसे पलक झपकना, सांस लेना, इधर-उधर देखना) तो क्या करना है, ताकि ऑडियो रुकने पर पात्र जम न जाए या अजीब न दिखने लगे।
- इमोशन डेटा (Emotion Data): उन्होंने विशेष रूप से मॉडल को अलग-अलग भावनाओं (हँसते हुए, रोते हुए, प्रतिक्रिया देते हुए) को दर्शाने वाले लोगों के वीडियो खिलाए, ताकि पात्र केवल स्क्रिप्ट पढ़ने वाले रोबोट की तरह न दिखे।
- मल्टी-पर्सन डेटा (Multi-Person Data): उन्होंने मॉडल को सिखाया कि दो लोगों के बीच बातचीत वाले दृश्य को कैसे संभालना है। उन्होंने एक विशेष ट्रिक का उपयोग किया (बैकग्राउंड के पात्रों को एक "साइलेंट" ऑडियो ट्रैक देना) ताकि केवल वही व्यक्ति अपना मुँह हिलाए जो बोलने वाला है, जबकि अन्य स्थिर रहें।
3. "कोच" (RLHF): मानवीय फीडबैक से सीखना
अच्छे डेटा के बावजूद, मॉडल अभी भी छोटी गलतियाँ कर सकता है, जैसे कि हाथ का थोड़ा मुड़ा हुआ दिखना, या चेहरे का अस्वाभाविक रूप से हिलना।
- विधि: उन्होंने Group-Relative Policy Optimization (GRPO) का उपयोग किया।
- उपमा: एक डांस इंस्ट्रक्टर की कल्पना करें जो एक छात्र को देख रहा है। केवल "अच्छा काम किया" या "बुरा काम किया" कहने के बजाय, इंस्ट्रक्टर छात्र के डांस की तुलना अन्य डांसर्स के एक समूह से करता है और कहता है, "आपका हाथ का मूवमेंट औसत से 10% बेहतर है, लेकिन आपके पैरों का मूवमेंट 5% खराब है।" मॉडल इन तुलनाओं से सीखता है ताकि वह फ्रेम-दर-फ्रेम अपनी गतिविधियों को बारीक रूप से सुधार सके, जिससे हाथ वास्तविक लगें और शरीर स्वाभाविक रूप से हिले।
4. "टर्बो मोड": इसे तेज़ बनाना
आमतौर पर, उच्च गुणवत्ता वाला वीडियो जनरेशन धीमा होता है। यह केक बेक करने जैसा है जहाँ आपको एक घंटे में हर 5 मिनट में ओवन चेक करना पड़ता है।
- नवाचार: उन्होंने प्रक्रिया को कंप्रेस करने के लिए Distillation नामक तकनीक का उपयोग किया।
- उपमा: उन्होंने मॉडल को सामान्य 50 छोटे, धीमे कदमों के बजाय 8 बड़े कदमों में पूरी दौड़ पूरी करने के लिए प्रशिक्षित किया। यह एक धावक को 50 छोटे कदमों के बजाय 8 लंबी छलांगों में पूरी रेस स्प्रिंट करने के लिए प्रशिक्षित करने जैसा है। परिणाम एक ऐसा वीडियो है जो उतना ही अच्छा दिखता है लेकिन बहुत तेज़ी से जेनरेट होता है, जिससे यह वास्तविक समय (real-time) के उपयोग के लिए व्यावहारिक बन जाता है।
5. परिणाम: यह तुलना में कैसा है?
टीम ने अपने नए मॉडल का परीक्षण बाजार में मौजूद सबसे अच्छे "क्लोज्ड-बॉक्स" (गुप्त, सशुल्क) सिस्टम के खिलाफ किया, जैसे कि HeyGen और Kling Avatar।
- निर्णय: 500 से अधिक विभिन्न परिदृश्यों (जिसमें टॉकिंग हेड्स, गायन, एनिमे स्टाइल और यहाँ तक कि जानवर भी शामिल थे) के साथ एक ब्लाइंड टेस्ट में, LongCat-Video-Avatar 1.5 को अक्सर इन महंगे व्यावसायिक सिस्टमों से बेहतर या उनके बराबर माना गया।
- मुख्य जीत:
- लिप सिंक (Lip Sync): होंठों की हरकतें ऑडियो के साथ पूरी तरह मेल खाती थीं।
- स्थिरता (Stability): लंबे वीडियो के दौरान पात्र झपझपाता नहीं था या चेहरा बदलता नहीं था।
- पहचान (Identity): पात्र शुरुआत से अंत तक एक ही व्यक्ति जैसा दिखता था।
- जटिलता (Complexity): इसने पेचीदा स्थितियों को संभाला, जैसे कि गिटार पकड़े हुए व्यक्ति या दो लोगों की बातचीत, बिना बैकग्राउंड के पात्रों के होंठों को गलती से हिलाए।
सारांश
LongCat-Video-Avatar 1.5 अनिवार्य रूप से एक "प्रोडक्शन-रेडी" टूलकिट है। यह AI वीडियो जनरेशन की अव्यवस्थित, प्रयोगात्मक प्रकृति को बेहतर कानों (Whisper), बेहतर ट्रेनिंग डेटा (Silent/Emotion/Multi-person), एक सख्त कोच (RLHF) और एक स्पीड बूस्ट (Distillation) के साथ पॉलिश करता है। लक्ष्य केवल एक शानदार डेमो बनाना नहीं था, बल्कि एक ऐसा सिस्टम बनाना था जो वास्तविक व्यवसायों में विश्वसनीय रूप से उपयोग किया जा सके, और उन्होंने साबित किया कि यह आज उपलब्ध शीर्ष सशुल्क उपकरणों के समान या उनसे बेहतर काम करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।