MARRS: Masked Autoregressive Unit-based Reaction Synthesis
यह शोध पत्र MARRS का प्रस्ताव करता है, जो एक नवीन ढांचा है जो वेक्टर क्वांटिज़ेशन की सीमाओं को दूर करने और इंटर-यूनिट इंटरेक्शन को बढ़ाने के लिए एक यूनिट-डिस्टिंग्विश्ड मोशन VAE, टोकन मास्किंग के साथ एक्शन-कंडीशन्ड फ्यूजन और एडेप्टिव यूनिट मॉड्यूलेशन को संयोजित करके समन्वित और सूक्ष्म मानव प्रतिक्रिया गतियां उत्पन्न करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक डांस पार्टी में हैं। एक व्यक्ति (एक्टर) एक जटिल मूव शुरू करता है, जैसे कि स्पिन या हाई-फाइव। आपको (रिएक्टर) तुरंत प्रतिक्रिया देनी है। यदि आप बस वहीं खड़े रहते हैं, तो यह अजीब लगेगा। यदि आप अपने हाथ-पैर बेतरतीब ढंग से हिलाते हैं, तो यह मूर्खतापूर्ण लगेगा। आपको कुछ ऐसा करना होगा जो स्वाभाविक, समन्वित और दूसरे व्यक्ति द्वारा किए गए काम के साथ पूरी तरह से समयबद्ध (टाइमिंग के साथ) लगे।
यह पेपर MARRS को पेश करता है, जो एक नया AI सिस्टम है जिसे वह आदर्श डांस पार्टनर बनने के लिए डिज़ाइन किया गया है। इसका काम किसी व्यक्ति को कोई क्रिया करते हुए देखते हुए एक वास्तविक, मानव जैसा रिएक्शन जेनरेट करना है।
यहाँ बताया गया है कि MARRS कैसे काम करता है, सरल उपमाओं के माध्यम से:
1. समस्या: "पिक्सेलेटेड" रोबोट
पिछले AI तरीकों ने कंप्यूटर को मूवमेंट सिखाने की कोशिश की, जिसमें वे मूवमेंट को छोटे, अलग-अलग "ब्लॉक्स" (जैसे लेगो ब्रिक्स) में तोड़ देते थे। इसे वेक्टर क्वांटाइजेशन (VQ) कहा जाता है।
- समस्या: कल्पना कीजिए कि आप एक बहती हुई नदी को केवल कुछ चौकोर लेगो ब्रिक्स का उपयोग करके वर्णित करने की कोशिश कर रहे हैं। आप उसकी सहजता खो देते हैं; पानी ब्लॉक जैसा और झटकेदार दिखता है। इसके अलावा, AI अक्सर इस बात को लेकर भ्रमित हो जाता है कि किस "ब्रिक" का उपयोग करना है, जिससे हरकतें अनाड़ी हो जाती हैं।
- MARRS का समाधान: लेगो ब्रिक्स का उपयोग करने के बजाय, MARRS मूवमेंट को वॉटरकलर पेंट की तरह मानता है। यह कंटीन्यूअस रिप्रेजेंटेशन (निरंतर प्रतिनिधित्व) का उपयोग करता है, जिसका अर्थ है कि AI मानव गति की सहज, तरल प्रकृति को बिना किसी विवरण को खोए समझता है।
2. रणनीति: शरीर को विभाजित करना (द "शेफ नाइफ")
पुराने AI मॉडल अक्सर पूरे मानव शरीर को एक विशाल, अव्यवस्थित ढेर के रूप में देखते थे।
- समस्या: यदि आप AI से कहें कि "अपना हाथ हिलाओ," तो यह गलती से आपके पैर हिला सकता है या आपकी रीढ़ को मरोड़ सकता है क्योंकि इसे अंतर नहीं पता।
- MARRS का समाधान (UD-VAE): MARS एक कुशल शेफ की तरह काम करता है जिसे पता है कि कहाँ कट लगाना है। यह शरीर को दो अलग-अलग "यूनिट्स" में विभाजित करता है: शरीर (धड़/पैर) और हाथ।
- यह "शरीर" के डांस को "हाथ" के डांस से अलग सीखता है।
- इससे AI यह समझने में सक्षम होता है कि हाथ हिलाना पैर की लात मारने से अलग है, जिससे बहुत अधिक सटीक मूवमेंट मिलते हैं।
3. जादुई ट्रिक: "आंखों पर पट्टी बांधकर अनुमान लगाना" (मास्क्ड ऑटोरेग्रेशन)
AI भविष्य की भविष्यवाणी करना कैसे सीखता है? यह "खाली स्थान भरने" का खेल खेलता है।
- प्रक्रिया: कल्पना कीजिए कि AI एक्टर के मूव को देखता है। फिर यह रिएक्टर के मूव का अनुमान लगाने की कोशिश करता है, लेकिन यह रिएक्टर के भविष्य के मूवमेंट के कुछ हिस्सों को छिपा (मास्क) देता है।
- अनुमान: AI उन हिस्सों को देखता है जिन्हें वह देख सकता है और एक्टर के मूव को देखता है, फिर वह छिपे हुए हिस्सों का अनुमान लगाने की कोशिश करता है।
- सुधार: यह इसे बार-बार करता है, और हर बार बेहतर होता जाता है। इसे मास्क्ड ऑटोरेग्रेसिव जनरेशन कहा जाता है। यह एक वाक्य को पढ़ने, अंतिम शब्द को ढकने और संदर्भ के आधार पर उसका अनुमान लगाने, फिर उसे प्रकट करने और अगले शब्द पर जाने जैसा है।
4. बातचीत: एक-दूसरे से बात करना (एडेप्टिव यूनिट मॉड्यूलेशन)
यही असली सीक्रेट सॉस है। भले ही AI जानता हो कि शरीर को कैसे हिलाना है और हाथों को कैसे हिलाना है, लेकिन इसका मतलब यह नहीं है कि वे एक साथ काम करेंगे।
- समस्या: संचार के बिना, AI शरीर को बाईं ओर झुका सकता है जबकि हाथ दाईं ओर पहुँच रहे होते हैं, जिससे यह एक ग्लिच वाले रोबोट जैसा दिखता है।
- MARRS का समाधान (AUM): MARRS "बॉडी यूनिट" और "हैंड यूनिट" को आपस में बातचीत करने के लिए मजबूर करता है।
- शरीर हाथों को बताता है: "मैं आगे की ओर झुक रहा हूँ, इसलिए तुम्हें बाहर की ओर हाथ बढ़ाना चाहिए!"
- हाथ शरीर को बताते हैं: "मैं हाथ हिला रहा हूँ, इसलिए तुम्हें थोड़ा मुड़ना चाहिए!"
- वे एक पूर्ण इकाई के रूप में हिलने के लिए वास्तविक समय में एक-दूसरे को लगातार एडजस्ट करते हैं।
5. अंतिम पॉलिश: "नॉइज़ क्लीनर" (डिफ्यूजन)
अंत में, AI डिफ्यूजन नामक तकनीक का उपयोग करता है।
- उपमा: कल्पना कीजिए कि भारी धुंध में खींचा गया एक स्केच। शुरू में, यह केवल शोर (नॉइज़) का एक धुंधला सा मिश्रण है। MARRS एक मास्टर कलाकार की तरह कार्य करता है जो धीरे-धीरे उस धुंध को हटाता है, और नीचे स्पष्ट, शार्प इमेज को प्रकट करता है।
- अंतिम मूव का तुरंत अनुमान लगाने के बजाय, यह यादृच्छिक अराजकता (रैंडम केओस) से शुरू होता है और तब तक "डिनोइज़" करता रहता है जब तक कि सटीक रिएक्शन उभर न आए।
यह एक बड़ी बात क्यों है?
- एनिमेटर्स के लिए: एक वीडियो गेम बनाने की कल्पना करें। हर एनपीसी (नॉन-प्लेयर कैरेक्टर) को खिलाड़ी की प्रतिक्रिया देने के लिए मैन्युअल रूप से एनिमेट करने के बजाय, आप बस खिलाड़ी को एनिमेट करते हैं, और MARRS भीड़ की प्रतिक्रियाएं स्वतः जेनरेट कर देता है। यह घंटों का काम बचाता है।
- रोबोटिक्स के लिए: यह रोबोट को मनुष्यों के प्रति स्वाभाविक रूप से प्रतिक्रिया करने में मदद करता है, जिससे वे कम डरावने और अधिक सहायक बनते हैं।
- परिणाम: पेपर दिखाता है कि MARRS ऐसे रिएक्शन बनाता है जो पिछले तरीकों की तुलना में अधिक सहज, अधिक सटीक और अधिक वास्तविक हैं। यूजर टेस्ट में, लोगों ने कहा कि AI-जेनरेटेड रिएक्शन पिछले तरीकों की तुलना में "अधिक प्राकृतिक" और "भौतिक रूप से यथार्थवादी" दिखते हैं।
संक्षेप में: MARRS एक स्मार्ट डांस पार्टनर है जो शरीर को प्रबंधनीय भागों में विभाजित करता है, उन भागों को आपस में बात करने देता है, और एक "अनुमान और सुधार" के खेल का उपयोग करके ऐसे मानवीय रिएक्शन बनाता है जो इतने अच्छे हैं कि आपको लगेगा कि कोई वास्तविक व्यक्ति उन्हें कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।