← नवीनतम पेपर
💻 computer science

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST-Engine एक नियत (deterministic) प्रणाली है जो प्राकृतिक भाषा को पूर्णतः एनोटेटेड, बहु-पात्र सिंथेटिक वीडियो में अनुवादित करती है, जो एक वाणिज्यिक गेम इंजन को संचालित करने के लिए पहले एक स्पष्ट, निरीक्षण योग्य "स्पेस और टाइम में इवेंट्स के ग्राफ" (GEST) को उत्पन्न करती है, जिससे टेम्पोरल कंसिस्टेंसी (temporal consistency) और ऑब्जेक्ट परमानेंस (object permanence) की गारंटी मिलती है और शून्य सीमांत एनोटेशन लागत पर समृद्ध ग्राउंड-ट्रुथ डेटा का उत्पादन होता है।

मूल लेखक: Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

प्रकाशित 2026-07-15
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी फिल्म बनाना चाहते हैं जहाँ दो लोग एक रसोई में मिलते हैं, एक व्यक्ति बैठ जाता है, और वे बातें करना शुरू करते हैं। यदि आप किसी आधुनिक AI वीडियो जनरेटर (जैसे वे जो टेक्स्ट से शानदार, काल्पनिक क्लिप बनाते हैं) से पूछते हैं, तो वह कुछ ऐसा दे सकता है जो दिखने में तो असली लगता है लेकिन वास्तव में एक झूठ है। कुर्सी व्यक्ति के बैठते ही गायब हो सकती है, दूसरा व्यक्ति अचानक हवा से प्रकट हो सकता है, या बातचीत कमरे में प्रवेश करने से पहले ही शुरू हो सकती है। ये AI मॉडल सपने देखने वालों की तरह हैं: वे पैटर्न के आधार पर अनुमान लगाते हैं कि दुनिया को कैसा दिखना चाहिए, लेकिन वे वास्तव में यह नहीं जानते कि वस्तुएं कहाँ हैं या समय कैसे काम करता है।

GEST-Engine इसके विपरीत है। यह कोई स्वप्नद्रष्टा नहीं है; यह एक ब्लूप्रिंट वाला सख्त निर्देशक है।

अनुमान लगाने के बजाय, यह सिस्टम एक पूर्ण, अदृश्य "विश्व मानचित्र" बनाता है जो एक औपचारिक ग्राफ से बना है जिसे GEST (Space and Time में Events का Graph) कहा जाता है। इस ग्राफ को एक अत्यंत विस्तृत स्क्रिप्ट की तरह समझें जो सटीक रूप से कहती है: "अभिनेता A मेज पर है, अभिनेता B दरवाजे पर है, कुर्सी अभिनेता A के नीचे है, और हैंडशेक होने के बाद गले मिलना होता है।" इंजन फिर इस ब्लूप्रिंट को लेता है और इसे एक वीडियो गेम Grand Theft Auto: San Andreas के भीतर चलाता है।

जादू का खेल: एक मूवी स्टूडियो के रूप में गेम इंजन

एक 20 साल पुराना वीडियो गेम क्यों? शोधकर्ताओं ने महसूस किया कि शून्य से एक नकली दुनिया बनाने में वर्षों और लाखों डॉलर लगते हैं। इसके बजाय, उन्होंने एक मौजूदा गेम का उपयोग किया जिसमें पहले से ही मौजूद है:

  • 733 अलग-अलग वस्तुएं (बिस्तरों और लैपटॉप से लेकर कारों और पेड़ों तक)।
  • 2,500 से अधिक एनिमेशन (नाचना, सोना, धूम्रपान करना, व्यायाम करना)।
  • 312 अलग-अलग कैरेक्टर स्किन्स (विभिन्न उम्र, नस्ल और कपड़ों के लोग)।
  • 70 से अधिक अलग-अलग स्थान (घर, जिम, बगीचे, सड़कें)।

उन्होंने गेम से बात करने के लिए Multi Theft Auto नामक टूल का उपयोग किया। यह एक रिमोट कंट्रोल रखने जैसा है जो गेम को बता सकता है: "एलिस नाम का एक पात्र उत्पन्न करें, उसे रसोई की ओर ले जाएं, उसे कुर्सी पर बिठाएं, और फिर बॉब से बात करने के लिए कहें।" क्योंकि गेम इंजन पहले से ही भौतिकी (physics) और एनिमेशन के नियमों को जानता है, इसलिए परिणाम 100% सुसंगत होता है। यदि स्क्रिप्ट कहती है कि एलिस बैठती है, तो वह बैठती है। यदि स्क्रिप्ट कहती है कि कुर्सी वहां है, तो कुर्सी वहीं रहती है। कुछ भी गायब नहीं होता, कुछ भी ग्लिच नहीं होता, और समय कभी पीछे नहीं कूदता।

यह कैसे काम करता है: चार-चरणों वाली असेंबली लाइन

सिस्टम केवल गेम को "चलाता" नहीं है; यह इसे एक सटीक चार-चरणीय फैक्ट्री लाइन के माध्यम से चलाता है:

  1. ब्लूप्रिंट चेक (Graph Parsing): कुछ भी होने से पहले, सिस्टम स्क्रिप्ट (GEST) को पढ़ता है और जांचता है कि क्या गेम की दुनिया में वास्तव में उन कमरों, कुर्सियों और अभिनेताओं की आवश्यकता है। यह कहानी के अनुकूल गेम लेवल के सही संयोजन को खोजने के लिए एक स्मार्ट एल्गोरिदम का उपयोग करता है।
  2. कास्टिंग कॉल (Grounding): सिस्टम वास्तविक गेम पात्रों को भूमिकाओं के लिए असाइन करता है। यदि स्क्रिप्ट कहती है "एक महिला," तो यह गेम की लाइब्रेरी से एक रैंडम महिला कैरेक्टर स्किन चुनता है। यह स्क्रिप्ट की जरूरतों से मेल खाने के लिए गेम की दुनिया में विशिष्ट कुर्सियों और मेजों को भी ढूंढता है।
  3. टाइमिंग मास्टर (Temporal Orchestration): यह मस्तिष्क है। यह गणित (विशेष रूप से Floyd–Warshall) का उपयोग करता है ताकि यह सुनिश्चित हो सके कि हर कोई सही समय पर सही जगह पर है। यदि स्क्रिप्ट कहती है कि "एलिस को बॉब के बोलने से पहले बैठना चाहिए," तो सिस्टम टाइमलाइन को लॉक कर देता है ताकि बॉब वास्तवвतः तब तक बोलना शुरू न कर सके जब तक एलिस बैठी न हो। यह उन जटिल दृश्यों को भी संभालता है जहाँ तीन लोग एक साथ अलग-अलग चीजें कर रहे होते हैं, यह सुनिश्चित करते हुए कि वे एक-दूसरे से टकरा न जाएं।
  4. कैमरा और कैप्चर (Execution): सिस्टम सिमुलेशन चलाता है। लेकिन दिलचस्प बात यह है कि जब गेम चलता है, तो यह केवल वीडियो रिकॉर्ड नहीं करता है। यह साथ-साथ सब कुछ मुफ्त में रिकॉर्ड करता है। यह कैप्चर करता है:
    • वीडियो (RGB)।
    • एक "मास्क" जो दिखाता है कि कौन सा पिक्सेल किस वस्तु का है (Instance Segmentation)।
    • दृश्य की गहराई (depth) (चीजें कितनी दूर हैं)।
    • प्रत्येक अभिनेता का सटीक कंकाल पोज़ (skeleton pose) (उनकी हर हड्डी कहाँ है)।
    • एक नक्शा कि कौन किसके सापेक्ष कहाँ खड़ा है।
    • क्या हुआ इसका एक प्राकृतिक भाषा विवरण।
      यह सब डिटरमिनिस्टिकली (deterministically) कैप्चर किया जाता है। इसका मतलब है कि यदि आप एक ही स्क्रिप्ट को दो बार चलाते हैं, तो आपको एक ही कहानी मिलती है, लेकिन सिस्टम कहानी को बिल्कुल समान रखते हुए विशिष्ट कुर्सी मॉडल या चरित्र की शर्ट को बदल सकता है।

"नो-गो" ज़ोन: जिसे यह सिस्टम अस्वीकार करता है

पेपर बहुत स्पष्ट है कि यह सिस्टम क्या नहीं है। यह स्पष्ट रूप से इस विचार का खंडन करता है कि हमें उन कार्यों के लिए "इम्प्लिसिट" (implicit) AI मॉडल (जैसे बड़े न्यूरल नेटवर्क जो टेक्स्ट से वीडियो जेनरेट करते हैं) पर निर्भर होना चाहिए जिनमें सख्त तर्क की आवश्यकता होती है।

  • यह इस विचार को खारिज करता है कि AI सही उत्तर का "अनुमान" लगा सकता है। पेपर दिखाता है कि ये AI मॉडल "ऑब्जेक्ट परमानेंस" (वस्तुओं का गायब होना), "मल्टी-एक्टर कोआर्डिनेशन" (लोगों का आपस में टकराना या गलत क्रम में चीजें करना), और "टेम्पोरल कंसिस्टेंसी" (समय का आगे-पीछे कूदना) में संघर्ष करते हैं।
  • यह इस विचार को खारिज करता है कि आपको एक पूरी तरह से नए, कस्टम-निर्मित 3D विश्व की आवश्यकता है। एक नया इंजन बनाने में वर्षों बिताने के बजाय, उन्होंने साबित किया कि यदि आपके पास इसे नियंत्रित करने के लिए सही "एडाप्टर" है, तो आप एक पुराने गेम इंजन का उपयोग कर सकते हैं।

पैमाना और प्रमाण

शोधकर्ताओं ने केवल एक खिलौना नहीं बनाया; उन्होंने एक प्रोडक्शन लाइन बनाई है।

  • उन्होंने इसे चलाने के लिए लगभग 100,000 लाइनों का कोड (मुख्य रूप से Lua, Python और C++ में) विकसित किया।
  • उन्होंने इस काम को करने के लिए 25 समानांतर वर्चुअल मशीनों पर इसे चलाया।
  • उन्होंने गेम के भीतर एक "वर्ल्ड एडिटर" बनाया जो उन्हें बिना नया कोड लिखे लगभग 1 से 2 घंटे में नए कमरे और वस्तुएं परिभाषित करने की अनुमति देता है।

परिणाम यह है कि यह सिस्टम सैकड़ों वीडियो को सटीक, पिक्सेल-स्तरीय एनोटेशन के साथ उत्पन्न कर सकता है। पेपर बताता है कि यह डेटा अन्य AI मॉडल को प्रशिक्षित करने के लिए अविश्वसनीय रूप से मूल्यवान है। इन परफेक्ट, "ग्राउंड ट्रुथ" वीडियो को न्यूरल नेटवर्क में फीड करके, आप उस AI को दुनिया को सही ढंग से समझने के बारे में सिखा सकते हैं, जिससे उसकी सामान्य गलतियों को ठीक किया जा सके।

निचोड़

GEST-Engine, AI जनरेशन की अव्यवस्थपूर्ण, अप्रत्याशित दुनिया और गेम लॉजिक की कठोर, सटीक दुनिया के बीच एक सेतु है। यह टोपी से खरगोश निकालने वाला जादूगर बनने की कोशिश नहीं करता है; यह एक कुशल बढ़ई है जो खरगोश, टोपी और मंच को ठीक वैसे ही बनाता है जैसा ब्लूप्रिंट मांगता है। यह साबित करता है कि एक पुराने गेम इंजन और एक सख्त "इवेंट ग्राफ" स्क्रिप्ट का उपयोग करके, आप ऐसा सिंथेटिक वीडियो डेटा बना सकते हैं जो गारंटीड रूप से तार्किक रूप से सुसंगत, कालानुक्रमिक रूप से सही और पूरी तरह से एनोटेटेड है—कुछ ऐसा जिसे वर्तमान "सपनों वाले" AI मॉडल अकेले नहीं कर सकते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →