The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report
GEST-Engine एक नियत (deterministic) प्रणाली है जो प्राकृतिक भाषा को पूर्णतः एनोटेटेड, बहु-पात्र सिंथेटिक वीडियो में अनुवादित करती है, जो एक वाणिज्यिक गेम इंजन को संचालित करने के लिए पहले एक स्पष्ट, निरीक्षण योग्य "स्पेस और टाइम में इवेंट्स के ग्राफ" (GEST) को उत्पन्न करती है, जिससे टेम्पोरल कंसिस्टेंसी (temporal consistency) और ऑब्जेक्ट परमानेंस (object permanence) की गारंटी मिलती है और शून्य सीमांत एनोटेशन लागत पर समृद्ध ग्राउंड-ट्रुथ डेटा का उत्पादन होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ऐसी फिल्म बनाना चाहते हैं जहाँ दो लोग एक रसोई में मिलते हैं, एक व्यक्ति बैठ जाता है, और वे बातें करना शुरू करते हैं। यदि आप किसी आधुनिक AI वीडियो जनरेटर (जैसे वे जो टेक्स्ट से शानदार, काल्पनिक क्लिप बनाते हैं) से पूछते हैं, तो वह कुछ ऐसा दे सकता है जो दिखने में तो असली लगता है लेकिन वास्तव में एक झूठ है। कुर्सी व्यक्ति के बैठते ही गायब हो सकती है, दूसरा व्यक्ति अचानक हवा से प्रकट हो सकता है, या बातचीत कमरे में प्रवेश करने से पहले ही शुरू हो सकती है। ये AI मॉडल सपने देखने वालों की तरह हैं: वे पैटर्न के आधार पर अनुमान लगाते हैं कि दुनिया को कैसा दिखना चाहिए, लेकिन वे वास्तव में यह नहीं जानते कि वस्तुएं कहाँ हैं या समय कैसे काम करता है।
GEST-Engine इसके विपरीत है। यह कोई स्वप्नद्रष्टा नहीं है; यह एक ब्लूप्रिंट वाला सख्त निर्देशक है।
अनुमान लगाने के बजाय, यह सिस्टम एक पूर्ण, अदृश्य "विश्व मानचित्र" बनाता है जो एक औपचारिक ग्राफ से बना है जिसे GEST (Space and Time में Events का Graph) कहा जाता है। इस ग्राफ को एक अत्यंत विस्तृत स्क्रिप्ट की तरह समझें जो सटीक रूप से कहती है: "अभिनेता A मेज पर है, अभिनेता B दरवाजे पर है, कुर्सी अभिनेता A के नीचे है, और हैंडशेक होने के बाद गले मिलना होता है।" इंजन फिर इस ब्लूप्रिंट को लेता है और इसे एक वीडियो गेम Grand Theft Auto: San Andreas के भीतर चलाता है।
जादू का खेल: एक मूवी स्टूडियो के रूप में गेम इंजन
एक 20 साल पुराना वीडियो गेम क्यों? शोधकर्ताओं ने महसूस किया कि शून्य से एक नकली दुनिया बनाने में वर्षों और लाखों डॉलर लगते हैं। इसके बजाय, उन्होंने एक मौजूदा गेम का उपयोग किया जिसमें पहले से ही मौजूद है:
- 733 अलग-अलग वस्तुएं (बिस्तरों और लैपटॉप से लेकर कारों और पेड़ों तक)।
- 2,500 से अधिक एनिमेशन (नाचना, सोना, धूम्रपान करना, व्यायाम करना)।
- 312 अलग-अलग कैरेक्टर स्किन्स (विभिन्न उम्र, नस्ल और कपड़ों के लोग)।
- 70 से अधिक अलग-अलग स्थान (घर, जिम, बगीचे, सड़कें)।
उन्होंने गेम से बात करने के लिए Multi Theft Auto नामक टूल का उपयोग किया। यह एक रिमोट कंट्रोल रखने जैसा है जो गेम को बता सकता है: "एलिस नाम का एक पात्र उत्पन्न करें, उसे रसोई की ओर ले जाएं, उसे कुर्सी पर बिठाएं, और फिर बॉब से बात करने के लिए कहें।" क्योंकि गेम इंजन पहले से ही भौतिकी (physics) और एनिमेशन के नियमों को जानता है, इसलिए परिणाम 100% सुसंगत होता है। यदि स्क्रिप्ट कहती है कि एलिस बैठती है, तो वह बैठती है। यदि स्क्रिप्ट कहती है कि कुर्सी वहां है, तो कुर्सी वहीं रहती है। कुछ भी गायब नहीं होता, कुछ भी ग्लिच नहीं होता, और समय कभी पीछे नहीं कूदता।
यह कैसे काम करता है: चार-चरणों वाली असेंबली लाइन
सिस्टम केवल गेम को "चलाता" नहीं है; यह इसे एक सटीक चार-चरणीय फैक्ट्री लाइन के माध्यम से चलाता है:
- ब्लूप्रिंट चेक (Graph Parsing): कुछ भी होने से पहले, सिस्टम स्क्रिप्ट (GEST) को पढ़ता है और जांचता है कि क्या गेम की दुनिया में वास्तव में उन कमरों, कुर्सियों और अभिनेताओं की आवश्यकता है। यह कहानी के अनुकूल गेम लेवल के सही संयोजन को खोजने के लिए एक स्मार्ट एल्गोरिदम का उपयोग करता है।
- कास्टिंग कॉल (Grounding): सिस्टम वास्तविक गेम पात्रों को भूमिकाओं के लिए असाइन करता है। यदि स्क्रिप्ट कहती है "एक महिला," तो यह गेम की लाइब्रेरी से एक रैंडम महिला कैरेक्टर स्किन चुनता है। यह स्क्रिप्ट की जरूरतों से मेल खाने के लिए गेम की दुनिया में विशिष्ट कुर्सियों और मेजों को भी ढूंढता है।
- टाइमिंग मास्टर (Temporal Orchestration): यह मस्तिष्क है। यह गणित (विशेष रूप से Floyd–Warshall) का उपयोग करता है ताकि यह सुनिश्चित हो सके कि हर कोई सही समय पर सही जगह पर है। यदि स्क्रिप्ट कहती है कि "एलिस को बॉब के बोलने से पहले बैठना चाहिए," तो सिस्टम टाइमलाइन को लॉक कर देता है ताकि बॉब वास्तवвतः तब तक बोलना शुरू न कर सके जब तक एलिस बैठी न हो। यह उन जटिल दृश्यों को भी संभालता है जहाँ तीन लोग एक साथ अलग-अलग चीजें कर रहे होते हैं, यह सुनिश्चित करते हुए कि वे एक-दूसरे से टकरा न जाएं।
- कैमरा और कैप्चर (Execution): सिस्टम सिमुलेशन चलाता है। लेकिन दिलचस्प बात यह है कि जब गेम चलता है, तो यह केवल वीडियो रिकॉर्ड नहीं करता है। यह साथ-साथ सब कुछ मुफ्त में रिकॉर्ड करता है। यह कैप्चर करता है:
- वीडियो (RGB)।
- एक "मास्क" जो दिखाता है कि कौन सा पिक्सेल किस वस्तु का है (Instance Segmentation)।
- दृश्य की गहराई (depth) (चीजें कितनी दूर हैं)।
- प्रत्येक अभिनेता का सटीक कंकाल पोज़ (skeleton pose) (उनकी हर हड्डी कहाँ है)।
- एक नक्शा कि कौन किसके सापेक्ष कहाँ खड़ा है।
- क्या हुआ इसका एक प्राकृतिक भाषा विवरण।
यह सब डिटरमिनिस्टिकली (deterministically) कैप्चर किया जाता है। इसका मतलब है कि यदि आप एक ही स्क्रिप्ट को दो बार चलाते हैं, तो आपको एक ही कहानी मिलती है, लेकिन सिस्टम कहानी को बिल्कुल समान रखते हुए विशिष्ट कुर्सी मॉडल या चरित्र की शर्ट को बदल सकता है।
"नो-गो" ज़ोन: जिसे यह सिस्टम अस्वीकार करता है
पेपर बहुत स्पष्ट है कि यह सिस्टम क्या नहीं है। यह स्पष्ट रूप से इस विचार का खंडन करता है कि हमें उन कार्यों के लिए "इम्प्लिसिट" (implicit) AI मॉडल (जैसे बड़े न्यूरल नेटवर्क जो टेक्स्ट से वीडियो जेनरेट करते हैं) पर निर्भर होना चाहिए जिनमें सख्त तर्क की आवश्यकता होती है।
- यह इस विचार को खारिज करता है कि AI सही उत्तर का "अनुमान" लगा सकता है। पेपर दिखाता है कि ये AI मॉडल "ऑब्जेक्ट परमानेंस" (वस्तुओं का गायब होना), "मल्टी-एक्टर कोआर्डिनेशन" (लोगों का आपस में टकराना या गलत क्रम में चीजें करना), और "टेम्पोरल कंसिस्टेंसी" (समय का आगे-पीछे कूदना) में संघर्ष करते हैं।
- यह इस विचार को खारिज करता है कि आपको एक पूरी तरह से नए, कस्टम-निर्मित 3D विश्व की आवश्यकता है। एक नया इंजन बनाने में वर्षों बिताने के बजाय, उन्होंने साबित किया कि यदि आपके पास इसे नियंत्रित करने के लिए सही "एडाप्टर" है, तो आप एक पुराने गेम इंजन का उपयोग कर सकते हैं।
पैमाना और प्रमाण
शोधकर्ताओं ने केवल एक खिलौना नहीं बनाया; उन्होंने एक प्रोडक्शन लाइन बनाई है।
- उन्होंने इसे चलाने के लिए लगभग 100,000 लाइनों का कोड (मुख्य रूप से Lua, Python और C++ में) विकसित किया।
- उन्होंने इस काम को करने के लिए 25 समानांतर वर्चुअल मशीनों पर इसे चलाया।
- उन्होंने गेम के भीतर एक "वर्ल्ड एडिटर" बनाया जो उन्हें बिना नया कोड लिखे लगभग 1 से 2 घंटे में नए कमरे और वस्तुएं परिभाषित करने की अनुमति देता है।
परिणाम यह है कि यह सिस्टम सैकड़ों वीडियो को सटीक, पिक्सेल-स्तरीय एनोटेशन के साथ उत्पन्न कर सकता है। पेपर बताता है कि यह डेटा अन्य AI मॉडल को प्रशिक्षित करने के लिए अविश्वसनीय रूप से मूल्यवान है। इन परफेक्ट, "ग्राउंड ट्रुथ" वीडियो को न्यूरल नेटवर्क में फीड करके, आप उस AI को दुनिया को सही ढंग से समझने के बारे में सिखा सकते हैं, जिससे उसकी सामान्य गलतियों को ठीक किया जा सके।
निचोड़
GEST-Engine, AI जनरेशन की अव्यवस्थपूर्ण, अप्रत्याशित दुनिया और गेम लॉजिक की कठोर, सटीक दुनिया के बीच एक सेतु है। यह टोपी से खरगोश निकालने वाला जादूगर बनने की कोशिश नहीं करता है; यह एक कुशल बढ़ई है जो खरगोश, टोपी और मंच को ठीक वैसे ही बनाता है जैसा ब्लूप्रिंट मांगता है। यह साबित करता है कि एक पुराने गेम इंजन और एक सख्त "इवेंट ग्राफ" स्क्रिप्ट का उपयोग करके, आप ऐसा सिंथेटिक वीडियो डेटा बना सकते हैं जो गारंटीड रूप से तार्किक रूप से सुसंगत, कालानुक्रमिक रूप से सही और पूरी तरह से एनोटेटेड है—कुछ ऐसा जिसे वर्तमान "सपनों वाले" AI मॉडल अकेले नहीं कर सकते।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।