MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive Orchestration
यह शोधपत्र MUSE प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो एक क्लोज्ड-लूप कॉग्निटिव ऑर्केस्ट्रेशन प्रक्रिया को नियोजित करके लंबे ऑडियो-विजुअल कहानियों को उत्पन्न करने की चुनौतियों का समाधान करता है ताकि सामग्री की योजना बनाने, निष्पादित करने, सत्यापित करने और संशोधित करने के लिए पुनरावृत्ति की जा सके, जिससे विस्तारित अनुक्रमों में नैरेटिव सुसंगतता और पहचान निरंतरता सुनिश्चित की जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने एक दोस्त को एक लंबी, जटिल कहानी सुनाना चाहते हैं, लेकिन आपके पास शुरू करने के लिए केवल एक ही वाक्य है: "एक लड़का जंगल में रोमांच पर जाता है।"
यदि आप एक मानक AI से उस वाक्य को एक फिल्म में बदलने के लिए कहते हैं, तो वह एक सुंदर पहला दृश्य बना सकता है। लेकिन जब तक वह पांचवें या दसवें दृश्य तक पहुँचता है, लड़के का चेहरा किसी दूसरे व्यक्ति जैसा दिख सकता है, जंगल अचानक रेगिस्तान में बदल सकता है, या कहानी पहले दृश्य में जो हुआ था उसे भूल सकती है। AI अगले चित्र को बनाने के तात्कालिक कार्य में "नशे में" हो जाता है, और पूरी कहानी के बड़े चित्र (big picture) को खो देता है।
MUSE एक नया सिस्टम है जिसे इस समस्या को ठीक करने के लिए डिज़ाइन किया गया है। MUSE को एक एकल कलाकार के रूप में नहीं, बल्कि एक अत्यधिक संगठित फिल्म निर्माण दल (film production crew) के रूप में समझें, जो यह सुनिश्चित करने के लिए मिलकर काम करता है कि कहानी पहले फ्रेम से लेकर अंतिम फ्रेम तक सुसंगत बनी रहे।
यहाँ बताया गया है कि MUSE कैसे काम करता है, जिसे सरल भागों में विभाजित किया गया है:
1. समस्या: "नशे में धुत कलाकार" (The "Drunk Artist")
वर्तमान AI वीडियो जनरेटर एक प्रतिभाशाली लेकिन अल्पदृष्टि वाले कलाकार की तरह हैं। वे एक प्रॉम्प्ट के आधार पर एक सुंदर चित्र बनाने में माहिर हैं। लेकिन यदि आप उनसे पूरी फिल्म बनाने के लिए कहते हैं, तो वे नियम भूल जाते हैं। मुख्य पात्र के कपड़े बदल सकते हैं, रोशनी अचानक दिन से रात में बदल सकती है, या अगले दृश्य में पात्र की आवाज़ किसी अलग व्यक्ति जैसी लग सकती है। इसे "सिमेंटिक ड्रिफ्ट" (semantic drift) कहा जाता है।
2. समाधान: एक "क्लोज्ड-लूप" फिल्म क्रू
MUSE इसे एकतरफा रास्ते के बजाय एक क्लोज्ड-लूप फैक्ट्री की तरह मानकर हल करता है। यह विशेषज्ञ AI एजेंटों (डिजिटल वर्कर्स) की एक टीम का उपयोग करता है जो लगातार एक-दूसरे की जाँच और सुधार करते हैं।
यह प्रक्रिया तीन मुख्य चरणों में होती है, जैसे एक वास्तविक फिल्म निर्माण:
प्री-प्रोडक्शन (कास्टिंग डायरेक्टर और स्क्रिप्ट राइटर):
कोई भी वीडियो बनाने से पहले, MUSE एक "कैरेक्टर बाइबिल" (Character Bible) बनाता है। यह लॉक कर देता है कि मुख्य पात्र कैसा दिखता है (आयु, कपड़े, शैली) और उसकी आवाज़ कैसी है (आवाज का उतार-चढ़ाव, टोन)। यह पात्र के लिए एक डिजिटल "आईडी कार्ड" बनाता है। यह आईडी कार्ड वह नियम पुस्तिका है जिसका पूरे मूवी के दौरान पालन किया जाना चाहिए।- उपमा: कल्पना कीजिए कि एक कास्टिंग डायरेक्टर एक अभिनेता की एक आदर्श फोटो और वॉयस रिकॉर्डिंग लेता है और कहता है, "हम इसी का उपयोग करेंगे। इसमें कोई बदलाव न करें।"
प्रोडक्शन (डायरेक्टर और सेट डिजाइनर):
अब, सिस्टम दृश्य बनाना शुरू करता है। लेकिन यह केवल अनुमान नहीं लगाता। यह सुनिश्चित करने के लिए "आईडी कार्ड" का उपयोग करता है कि पात्र एक जैसा दिखे। यदि स्क्रिप्ट कहती है कि पात्र ने तलवार पकड़ी हुई है, तो MUSE लेआउट की जाँच करता है ताकि यह सुनिश्चित हो सके कि तलवार वास्तव में वहीं है और हवा में तैर नहीं रही है।- उपमा: डायरेक्टर लगातार चिल्ला रहा है, "रुको! वह अभिनेता अलग दिख रहा है! इसे ठीक करो!" इससे पहले कि कैमरा रोल हो।
पोस्ट-प्रोडक्शन (एडिटर और कंटीन्यूटी सुपरवाइजर):
एक बार दृश्य बन जाने के बाद, MUSE उनके बीच के "जोड़ों" (seams) की जाँच करता है। क्या पिछले शॉट से इस शॉट तक पात्र का हाथ सुचारू रूप से हिला? क्या कहानी तार्किक रूप से आगे बढ़ी? यदि AI ने गलती से पात्र को दीवार के आर-पार चलते हुए दिखा दिया या यदि दुखद दृश्य के लिए आवाज़ बहुत खुशमिजाज लग रही है, तो MUSE इसे पकड़ लेता है।- उपमा: एक एडिटर जो फिल्म देखता है और कहता है, "यह दृश्य पिछले वाले से मेल नहीं खाता। दर्शकों को दिखाने से पहले आइए इस ट्रांजिशन को ठीक करें।"
3. "प्लान-एक्जीक्यूट-वेरिफाई-रिवाइज" लूप
MUSE का असली मंत्र (secret sauce) यह है कि यह केवल निर्माण करके और बेहतर की उम्मीद नहीं करता है। यह एक सख्त चक्र का पालन करता है:
- प्लान (Plan): तय करना कि आगे क्या होना चाहिए।
- एक्जीक्यूट (Execute): वीडियो/ऑडियो बनाना।
- वेरिफाई (Verify): एक "क्रिटिक" एजेंट जाँच करता है कि क्या परिणाम योजना और कैरेक्टर आईडी से मेल खाता है।
- रिवाइज (Revise): यदि कुछ गलत है (जैसे, पात्र की टोपी गायब है), तो MUSE पूरे दृश्य को फेंकने और फिर से शुरू करने के बजाय केवल उस विशिष्ट भाग को ठीक करता है।
4. नया टेस्ट: MUSEBench
आप कैसे जानेंगे कि एक कहानी अच्छी है यदि कोई "सही" उत्तर नहीं है? लेखकों ने MUSEBench नामक एक नया परीक्षण क्षेत्र बनाया है।
रचनात्मक कहानियों के लिए किसी आदर्श संदर्भ वीडियो (जो मौजूद नहीं है) से तुलना करने के बजाय, MUSEBench एक स्मार्ट AI जज का उपयोग करके कहानी को इन चीजों पर ग्रेड देता है:
- निरंतरता (Consistency): क्या पात्र एक जैसा रहा?
- कहानी का प्रवाह (Story Flow): क्या कथानक समझ में आया?
- ऑडियो-विजुअल हार्मनी (Audio-Visual Harmony): क्या आवाज दृश्य के मूड से मेल खाती थी?
परिणाम
पेपर दिखाता है कि MUSE पिछले तरीकों की तुलना में लंबी कहानियों को सुसंगत बनाए रखने में बहुत बेहतर है। यह पात्रों के दिखने और सुनने के तरीके को समान रखता है, सही मूड बनाए रखता है, और यह सुनिश्चित करता है कि कहानी लंबी होने के साथ बिखर न जाए।
संक्षेप में: MUSE एक अत्यधिक संगठित फिल्म क्रू की तरह है जो कहानी को अस्त-व्यस्त होने देने से इनकार करता है। यह पहले से योजना बनाता है, लगातार अपने काम की जाँच करता है, और गलतियों को तुरंत ठीक करता है, जिससे यह सुनिश्चित होता है कि एक साधारण प्रॉम्प्ट एक लंबी, इमर्सिव और सुसंगत फिल्म में बदल सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।