DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary
यह शोध पत्र DISPLAY को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो स्पार्स मोशन गाइडेंस (कलाई के निर्देशांक और ऑब्जेक्ट बाउंडिंग बॉक्स) का उपयोग करके नियंत्रित और भौतिक रूप से सुसंगत मानव-वस्तु संपर्क वीडियो उत्पन्न करने के लिए, लचीलेपन, सामान्यीकरण और डेटा की कमी की सीमाओं को दूर करने हेतु एक ऑब्जेक्ट-स्ट्रेस्ड अटेंशन मैकेनिज्म और एक मल्टी-टास्क ऑक्सिलरी ट्रेनिंग स्ट्रैटेजी का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक फिल्म निर्देशक हैं। आपके पास एक स्क्रिप्ट (एक टेक्स्ट प्रॉम्प्ट) है और आप एक दृश्य फिल्माना चाहते हैं जहाँ एक अभिनेता एक विशिष्ट प्रॉप, जैसे कि कॉफी मग, उठाता है और एक घूँट लेता है।
अतीत में, कंप्यूटर को ऐसा करने के लिए कहना एक अनियंत्रित इंटर्न को अस्पष्ट निर्देश देने जैसा था: "एक आदमी को कॉफी पीते हुए वीडियो बनाओ।" कंप्यूटर आपको एक आदमी को विशाल सोडा पीते हुए, या अंतरिक्ष में तैरते हुए आदमी का वीडियो दे सकता था, या ऐसा वीडियो जिसमें आदमी का हाथ मग के आर-पार किसी भूत की तरह निकल जाता था। यह बिल्कुल नियंत्रित करना कठिन था कि वास्तव में क्या हो रहा है।
अन्य तरीकों ने इसे ठीक करने की कोशिश की, जिसमें वे एक "टेम्पलेट" वीडियो (एक संदर्भ फिल्म) देते थे और कंप्यूटर को उन गतिविधियों की नकल करने के लिए कहते थे। लेकिन यह एक पुरानी पेंटिंग के ऊपर ट्रेस करने की अनुमति मिलने जैसा था। आप कॉफी मग को टोस्टर से आसानी से नहीं बदल सकते थे, या अभिनेता की गतिविधियों को बदले बिना पूरा वीडियो खराब किए बिना बदलाव नहीं कर सकते थे।
पेश है DISPLAY।
यह पेपर DISPLAY को पेश करता है, जो एक सुपर-स्मार्ट, आज्ञाकारी निर्देशक के सहायक की तरह काम करता है। यह ऐसी वीडियो बनाने की समस्या को हल करता है जहाँ इंसान वस्तुओं के साथ इस तरह से इंटरैक्ट करते हैं जो वास्तविक लगे, भौतिक रूप से सही महसूस हो और आपके सटीक निर्देशों का पालन करे।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. "स्पार्स मोशन गाइडेंस" (द मिनिमलिस्ट स्केच)
अधिकांश पिछले सिस्टम पूरे शरीर के लिए एक जटिल कंकाल (skeleton) और वस्तु के लिए एक 3D मैप बनाकर वीडियो को नियंत्रित करने की कोशिश करते थे। यह एक नाटक को निर्देशित करने के लिए हर एक मांसपेशी की हरकत के लिए 50 पन्नों की स्क्रिप्ट लिखने जैसा था।
DISPLAY एक अलग दृष्टिकोण अपनाता है। यह स्पार्स मोशन गाइडेंस (Sparse Motion Guidance) का उपयोग करता है।
- उपमा: कल्पना कीजिए कि आप एक कठपुतली का खेल निर्देशित कर रहे हैं। कठपुतली चलाने वाले को हर उंगली की हरकत बताने के बजाय, आप उसे बस दो सरल निर्देश देते हैं:
- कलाई कहाँ जाएगी: आप स्क्रीन पर एक साधारण रेखा खींचते हैं जो दिखाती है कि अभिनेता का हाथ कहाँ जाना चाहिए (यहाँ से शुरू करें, वहाँ समाप्त करें)।
- वस्तु कहाँ है: आप उस वस्तु (जैसे मग) के चारों ओर एक साधारण बॉक्स बनाते हैं जहाँ उसे होना चाहिए।
- यह क्यों शानदार है: यह "शेप-एग्नोस्टिक" (आकार से स्वतंत्र) है। इससे कोई फर्क नहीं पड़ता कि वस्तु एक गोल मग है, एक सपाट iPad है, या एक अजीब आकार का केला है। AI बस जानता है, "हाथ बॉक्स की ओर जाता है।" यह बाकी विवरण (कैसे उंगलियां मुड़ती हैं, प्रकाश वस्तु पर कैसे पड़ता है) खुद ही भर देता है। यह आपको बिना AI को फिर से प्रशिक्षित किए वस्तुओं को बदलने की पूर्ण स्वतंत्रता देता है।
2. "ऑब्जेक्ट-स्ट्रेस्ड अटेंशन" (द ऑब्जेक्ट्स बॉडीगार्ड)
जब आप AI को वीडियो जेनरेट करने के लिए कहते हैं, तो वह अक्सर विचलित हो जाता है। वह इंसान के चेहरे या बैकग्राउंड पर इतना ध्यान केंद्रित कर देता है कि उनके हाथ में पकड़ी हुई वस्तु अजीब दिखने लगती है, पिघल जाती है, या गायब हो जाती है।
DISPLAY एक तंत्र पेश करता है जिसे ऑब्जेक्ट-स्ट्रेस्ड अटेंशन (Object-Stressed Attention) कहा जाता है।
- उपमा: कल्पना कीजिए कि AI एक छात्र है जो परीक्षा दे रहा है। आमतौर पर, छात्र "वस्तु" के बारे में कठिन प्रश्नों को अनदेखा कर देता है और बस अनुमान लगा लेता है। ऑब्जेक्ट-स्ट्रेस्ड अटेंशन एक सख्त शिक्षक की तरह है जो छात्र के कंधे पर थपथपाता है और कहता है, "हे, वस्तु पर ध्यान दो! सुनिश्चित करो कि यह ठोस रहे, संदर्भ फोटो की तरह दिखे, और हाथ के आर-पार न जाए।"
- परिणाम: AI वस्तु पर अतिरिक्त ध्यान देता है, यह सुनिश्चित करता है कि वह वास्तविक दिखे और मानव हाथ के साथ भौतिक रूप से सही ढंग से इंटरैक्ट करे।
3. "मल्टी-टास्क ऑक्जिलरी ट्रेनिंग" (द इंटर्न्स इंटर्नशिप)
AI को ह्यूमन-ऑब्जेक्ट इंटरैक्शन (HOI) सिखाने की सबसे बड़ी समस्या यह है कि विशिष्ट चीजों को पकड़े हुए लोगों के पर्याप्त उच्च-गुणवत्ता वाले वीडियो उपलब्ध नहीं हैं। यह एक शेफ को एक विशिष्ट दुर्लभ व्यंजन बनाना सिखाने जैसा है, लेकिन आपके पास पूरी दुनिया में उस व्यंजन के केवल 10 उदाहरण हैं।
DISPLAY इसे मल्टी-टास्क ऑक्जिलरी ट्रेनिंग (Multi-Task Auxiliary Training) के साथ हल करता है।
- उपमा: केवल 10 दुर्लभ व्यंजनों का अध्ययन करने के बजाय, AI एक विशाल पाक विद्यालय में जाता है जहाँ वह सब कुछ बनाना सीखता है। वह सब्जियां काटना, पानी उबालना और भोजन परोसना (सामान्य मानव गति) सीखता है।
- रणनीति: यह सिस्टम इनके मिश्रण पर प्रशिक्षित होता है:
- वस्तुओं को पकड़े हुए लोगों के दुर्लभ, पूर्ण वीडियो (विशिष्ट कार्य)।
- हजारों वीडियो जिनमें लोग बिना किसी विशिष्ट वस्तु के बस इधर-उधर घूम रहे हैं (सामान्य कार्य)।
- परिणाम: बड़ी मात्रा में डेटासेट से गति के सामान्य नियमों को सीखकर, AI वस्तुओं को पकड़ने के विशिष्ट कार्य में बहुत बेहतर हो जाता है, भले ही उसने उस सटीक वस्तु को पहले न देखा हो।
आप वास्तव में इसके साथ क्या कर सकते हैं?
यह पेपर तीन मुख्य महाशक्तियाँ दिखाता है:
- ऑब्जेक्ट रिप्लेसमेंट (वस्तु बदलना): आपके पास एक आदमी का वीडियो है जो iPad पकड़े हुए है। आप चाहते हैं कि वह iPad के बजाय टोस्टर पकड़े। आप टोस्टर की एक तस्वीर अपलोड करते हैं, और DISPLAY iPad को टोस्टर से बदल देता है, जिससे उसके हाथ स्वाभाविक रूप से उसे पकड़ते हैं।
- ऑब्जेक्ट इंसर्शन (वस्तु डालना): आपके पास एक खाली मेज पर बैठे आदमी का वीडियो है। आप चाहते हैं कि वह एक मग उठाए जो वहां पहले मौजूद नहीं था। आप एक बॉक्स खींचते हैं जहाँ मग होना चाहिए और उसके हाथ के पहुँचने के लिए एक रेखा खींचते हैं। AI उस मग और उसकी क्रिया को शून्य से बनाता है।
- एनवायरनमेंटल इंटरैक्शन (पर्यावरण के साथ संवाद): आपके पास एक आदमी का वीडियो है जो एक कुर्सी के पास से गुजर रहा है। आप चाहते हैं कि वह रुक जाए और बैठ जाए। आप उसके हाथ के छूने के लिए एक पथ (path) खींचते हैं, और AI बैठने की पूरी प्रक्रिया को एनिमेट करता है।
निष्कर्ष
DISPLAY एक निर्देशक को जादुई छड़ी देने जैसा है। एक पूर्ण स्क्रिप्ट, 3D मॉडल और टेम्पलेट वीडियो की आवश्यकता के बजाय, आपको बस एक सरल स्केच की आवश्यकता है कि हाथ कहाँ जाएगा और वस्तु की एक तस्वीर की। AI भौतिकी, लाइटिंग और वास्तविक विवरणों को भर देता है, जिससे आप लोगों के दुनिया के साथ इंटरैक्ट करने के उच्च-गुणवत्ता वाले, नियंत्रणीय वीडियो बना सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।