← नवीनतम पेपर
💻 computer science

SPIRAL: A Closed-Loop Framework for Self-Improving Action World Models via Reflective Planning Agents

SPIRAL एक क्लोज्ड-लूप फ्रेमवर्क है जो रिफ्लेक्टिव प्लानिंग प्रक्रिया को इटरेटिव एक्शन वर्ल्ड मॉडलिंग के साथ एकीकृत करके कंट्रोलेबल लॉन्ग-होरिजन वीडियो जनरेशन को बढ़ाता है, जिससे स्पष्ट योजना (explicit planning), ऑब्जेक्ट-सेंट्रिक डिकंपोज़िशन और फीडबैक-ड्रिवन रिफाइनमेंट के माध्यम से आत्म-सुधार सक्षम होता है।

मूल लेखक: Yu Yang, Yue Liao, Jianbiao Mei, Baisen Wang, Xuemeng Yang, Licheng Wen, Jiangning Zhang, Xiangtai Li, Hanlin Chen, Botian Shi, Yong Liu, Shuicheng Yan, Gim Hee Lee

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yu Yang, Yue Liao, Jianbiao Mei, Baisen Wang, Xuemeng Yang, Licheng Wen, Jiangning Zhang, Xiangtai Li, Hanlin Chen, Botian Shi, Yong Liu, Shuicheng Yan, Gim Hee Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली, लेकिन थोड़े भुलक्कड़ कलाकार को एक मौखिक विवरण के आधार पर एक जटिल दृश्य पेंट करना सिखाने की कोशिश कर रहे हैं।

यदि आप बस कहते हैं, "एक सॉकर खिलाड़ी को डिफेंडर को छकाते हुए और गोल करते हुए पेंट करो," तो कलाकार ऐसा कर सकता है:

  1. खिलाड़ी को ड्रिबल करते हुए पेंट करेगा, फिर अचानक बीच में ही रुक जाएगा।
  2. खिलाड़ी को डिफेंडर के ऊपर से कूदने जैसा बना देगा (क्योंकि सॉकर इस तरह से काम नहीं करता)।
  3. गोल को पूरी तरह भूल जाएगा और बस एक रैंडम मैदान पेंट कर देगा।

यह बिल्कुल वही समस्या है जिसका सामना वर्तमान AI वीडियो जनरेटर करते हैं। वे छोटे, सुंदर क्लिप बनाने में माहिर हैं, लेकिन जब आप उनसे कोई लंबी, बहु-चरणीय क्रिया (multi-step action) करने को कहते हैं, तो वे रास्ता भटक जाते हैं, भौतिकी (physics) के साथ छेड़छाड़ करते हैं, या बीच में ही हार मान लेते हैं।

पेश है SPIRAL। SPIRAL को केवल एक अकेले कलाकार के रूप में नहीं, बल्कि इन गलतियों को ठीक करने के लिए मिलकर काम करने वाले एक अत्यधिक संगठित फिल्म प्रोडक्शन क्रू के रूप में सोचें।

यहाँ बताया गया है कि यह "क्रू" कैसे काम करता है, जिसे सरल भूमिकाओं में विभाजित किया गया है:

1. निर्देशक (The PlanAgent)

AI को एक बार में ही पूरा मूवी "अनुमान" लगाने देने के बजाय, SPIRAL एक निर्देशक पेश करता है।

  • वे क्या करते हैं: एक भी फ्रेम बनाने से पहले, निर्देशक आपके अनुरोध को पढ़ता है ("ड्रिबल करें, क्रॉस ओवर करें, शूट करें") और इसे एक सख्त स्क्रिप्ट में तोड़ देता है।
  • उपमा (Analogy): कल्पना कीजिए कि एक शेफ रेसिपी पढ़ रहा है। वे बस सामग्री को बर्तन में नहीं फेंकते; वे कहते हैं, "पहले, प्याज काटें। फिर उन्हें भूनें। फिर टमाटर डालें।" निर्देशक AI के पालन करने के लिए एक स्टेप-बाय-स्टेप चेकलिस्ट बनाता है।

2. कैमरा क्रू (The World Model)

यह वास्तविक AI है जो वीडियो पिक्सेल बनाता है।

  • वे क्या करते हैं: वे निर्देशक की स्क्रिप्ट का पालन करते हैं। लेकिन पूरी फिल्म को एक ही टेक में फिल्माने के बजाय, वे इसे सीन दर सीन फिल्माते हैं।
  • उपमा: वे एक कैमरा ऑपरेटर की तरह हैं जो केवल वर्तमान चरण पर ध्यान केंद्रित करते हैं। "ठीक है, निर्देशक कहता है 'प्याज काटें', इसलिए मैं प्याज काटने को फिल्माऊंगा।" एक बार जब वह हो जाता है, तो वे रुक जाते हैं और अगले निर्देश का इंतजार करते हैं।

3. स्क्रिप्ट सुपरवाइजर (The CriticAgent)

यह सबसे महत्वपूर्ण नया जुड़ाव है। सामान्य AI में, कैमरा क्रू फिल्म बनाता है, और आप केवल अंतिम फिल्म देखते हैं। यदि कोई गलती होती है, तो बहुत देर हो चुकी होती है। SPIRAL में, हमारे पास वास्तविक समय में मॉनिटर देखते हुए एक स्क्रिप्ट सुपरवाइजर है।

  • वे क्या करते हैं: जैसे ही कैमरा क्रू एक सीन (जैसे, "प्याज काटने वाला" हिस्सा) पूरा करता है, सुपरवाइजर उसकी जांच करता है।
    • क्या उन्होंने वास्तव में प्याज काटे? (एक्शन कम्पलीटनेस/कार्य पूर्णता)
    • क्या चाकू कटिंग बोर्ड से टकराया, या वह हवा में तैर रहा था? (फिजिकल फिडेलिटी/भौतिक सटीकता)
    • क्या उन्होंने कोई स्टेप छोड़ दिया?
  • फीडबैक लूप: यदि सुपरवाइजर कोई गलती देखता है (जैसे, "चाकू बोर्ड से नहीं टकराया!"), तो वे फिल्म को आगे नहीं बढ़ने देते। वे चिल्लाते हैं, "कट! इसे फिर से करो, लेकिन सुनिश्चित करो कि चाकू बोर्ड से टकराए!" कैमरा क्रू तब तक उस विशिष्ट सीन को दोबारा शूट करता है जब तक कि वह परफेक्ट न हो जाए।

4. मेमोरी बैंक (World Memory)

लंबी फिल्मों में एक समस्या होती है: पात्र भूल जाते हैं कि वे कौन हैं या वे पांच मिनट पहले क्या कर रहे थे।

  • उपमा: SPIRAL अब तक जो कुछ भी हुआ है उसका एक फोटो एल्बम रखता है। अगले सीन को फिल्माते समय, कैमरा क्रू एल्बम को देखता है ताकि याद रख सके, "ओह सही, खिलाड़ी ने लाल शर्ट पहनी है और वह वर्तमान में मैदान के बाईं ओर है।" यह वीडियो को बेतुकी चीजों में बदलने से रोकता है।

5. "स्वयं-सुधारने वाला" कोच (GRPO Training)

यह वह सीक्रेट सॉस है जो इस सिस्टम को समय के साथ स्मार्ट बनाता है।

  • उपमा: कल्पना कीजिए कि निर्देशक, कैमरा क्रू और सुपरवाइजर इस मूवी का 100 बार अभ्यास करते हैं। हर बार जब वे कोई गलती करते हैं, तो सुपरवाइजर उन्हें एक स्कोर देता है।
  • परिणाम: AI इन स्कोर से सीखता है। यह नियमों को "आंतरिक रूप से" आत्मसात करना शुरू कर देता है। अंततः, कैमरा क्रू को अब सुपरवाइजर की "कट!" चिल्लाने की जरूरत नहीं पड़ती क्योंकि उन्होंने पहली बार में ही सही काम करना सीख लिया है। वे एक नौसिखिए अभिनेता से एक पेशेवर में विकसित हो जाते हैं।

यह एक बड़ी बात क्यों है?

पिछले AI वीडियो टूल्स वन-शॉट फोटोग्राफर्स की तरह थे: वे एक प्रॉम्प्ट के आधार पर एक तस्वीर लेते थे। यदि प्रॉम्प्ट जटिल था, तो तस्वीर आमतौर पर गलत होती थी।

SPIRAL एक सेफ्टी नेट के साथ फिल्म स्टूडियो की तरह है।

  • यह पहले सोचता है: यह चरणों की योजना बनाता है।
  • यह कार्य करता है: यह वीडियो जेनरेट करता है।
  • यह विचार करता है: यह त्रुटियों की जांच करता है और उन्हें तुरंत ठीक करता है।

यह AI को लंबे, जटिल वीडियो (जैसे कि एक पूरा कुकिंग ट्यूटोरियल या स्पोर्ट्स प्ले) जेनरेट करने की अनुमति देता है जहाँ भौतिकी समझ में आती है, चरणों को पूरा किया जाता है, और कहानी बीच में ही टूटती नहीं है। यह वीडियो जनरेशन को "अनुमान लगाने" से "योजना बनाने और निष्पादित करने" में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →