← नवीनतम पेपर
🤖 AI

Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory

यह शोध पत्र Infinite-World को प्रस्तुत करता है, जो एक सुदृढ़ इंटरैक्टिव वर्ल्ड मॉडल है जो शोर वाले पोज़ अनुमानों (pose estimations) और दृश्य दृष्टिकोण पुनरावृत्ति (viewpoint revisits) की कमी से उत्पन्न चुनौतियों को दूर करने के लिए एक पदानुक्रमित पोज़-मुक्त मेमोरी कंप्रेसर (hierarchical pose-free memory compressor), एक अनिश्चितता-जागरूक एक्शन लेबलिंग मॉड्यूल (uncertainty-aware action labeling module), और एक रीविज़िट-सघन फाइनट्यूनिंग रणनीति (revisit-dense finetuning strategy) का उपयोग करके वास्तविक दुनिया के वातावरण में सुसंगत 1000+ फ्रेम विजुअल जनरेशन प्राप्त करता है।

मूल लेखक: Ruiqi Wu, Xuanhua He, Meng Cheng, Tianyu Yang, Yong Zhang, Zhuoliang Kang, Xunliang Cai, Xiaoming Wei, Chunle Guo, Chongyi Li, Ming-Ming Cheng

प्रकाशित 2026-02-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruiqi Wu, Xuanhua He, Meng Cheng, Tianyu Yang, Yong Zhang, Zhuoliang Kang, Xunliang Cai, Xiaoming Wei, Chunle Guo, Chongyi Li, Ming-Ming Cheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ आप एक कमरे में घूम सकते हैं, खिड़की से बाहर देख सकते हैं और कोनों को मुड़ सकते हैं। अधिकांश "वर्ल्ड मॉडल्स" (AI सिस्टम जो यह समझने की कोशिश करते हैं कि आपके चलने पर दुनिया कैसी दिखती है) एक अल्पकालिक स्मृति (short-term memory) उपकरण की तरह होते हैं। वे आपको कुछ सेकंड के लिए दिखा सकते हैं कि क्या होता है, लेकिन यदि आप लंबे समय तक, जैसे कि 1,000 कदम चलते हैं, तो वे भ्रमित होने लगते हैं। वे भूल सकते हैं कि दरवाजा कैसा दिखता था, या अचानक दीवारें गायब हो सकती हैं।

"Infinite-World" पेपर एक नया AI सिस्टम पेश करता है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। यह बिना अपना मानसिक संतुलन खोए या कमरे के लेआउट को भूले बिना, 1,000 फ्रेम (लगभग 30-40 सेकंड का निरंतर वीडियो) से अधिक के लिए एक दुनिया का अनुकरण (simulate) कर सकता है।

उन्होंने इसे कैसे किया, यहाँ सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "धुंधला मानचित्र" और "थरथराता कैमरा"

वास्तविक दुनिया के वीडियो अव्यवस्थित होते हैं।

  • द जिटर (The Jitter): जब आप हैंडहेल्ड कैमरे से वीडियो शूट करते हैं, तो आपका हाथ हिलता है। AI को यह नहीं पता होता कि आपने कैमरा हिलाया या कैमरा बस थरथराया। यह AI को दुनिया को सटीक रूप से कैसे संचालित किया जाए, यह सिखाने में कठिन बनाता है।
  • मेमोरी की सीमा: अधिकांश AI हर उस फ्रेम को याद रखने की कोशिश करते हैं जो उन्होंने कभी देखा है। यदि आप उनसे 1,000 फ्रेम याद रखने के लिए कहते हैं, तो उनका "दिमाग" बहुत भर जाता है, और वे क्रैश हो जाते हैं या मतिभ्रम (hallucinating) करने लगते हैं (ऐसी चीजें बनाने लगते हैं जो वहां नहीं हैं)।

2. समाधान: तीन स्मार्ट तरकीबें

तरकीब A: "सारांश लिखने वाला लाइब्रेरियन" (Hierarchical Pose-Free Memory Compressor)

कल्पना कीजिए कि आप एक बहुत लंबी किताब पढ़ रहे हैं। यदि आप हर एक शब्द याद रखने की कोशिश करते हैं, तो आप अंत तक पहुँचते-पहुँचते शुरुआत भूल जाएंगे।

  • अन्य AI क्या करते हैं: वे पूरी किताब को मेज पर खुला रखने की कोशिश करते हैं। यह अव्यवस्थित और भारी हो जाता है।
  • Infinite-World क्या करता है: यह एक "सारांश लिखने वाले लाइब्रेरियन" का उपयोग करता है।
    • अल्पकालिक (Short term): पिछले कुछ पन्नों के लिए, लाइब्रेरियन विवरणों को स्पष्ट रखता है।
    • दीर्घकालिक (Long term): जैसे-जैसे आप पीछे जाते हैं, लाइब्रेरियन हर शब्द को याद रखना बंद कर देता है। इसके बजाय, वे पिछले अध्यायों का एक सारांश (summary) लिखते हैं।
    • जादू: इस सारांश को एक निश्चित आकार में संकुचित (compress) किया जाता है। चाहे आपने 10 पन्ने पढ़े हों या 1,000, लाइब्रेरियन को अपनी जेब में केवल एक छोटा सा सारांश कार्ड रखने की आवश्यकता होती है। यह AI को कमरे का "सार" (कि खिड़की कहाँ है, डेस्क कहाँ है) याद रखने की अनुमति देता है, बिना डेटा से अभिभूत हुए। यह इसे बिना किसी GPS या कैमरा मैप (pose-free) के करता है; यह बस महत्वपूर्ण चीजों का सारांश बनाना सीख जाता है।

तरकीब B: गति के लिए "ट्रैफिक लाइट" (Uncertainty-Aware Action Labeling)

वास्तविक दुनिया का वीडियो डेटा शोर भरा होता है। कभी-कभी कैमरा इसलिए हिलता है क्योंकि आप चले थे; अन्य बार यह इसलिए हिलता है क्योंकि आपका हाथ हिला था।

  • समस्या: यदि आप एक कांपते हुए वीडियो के आधार पर AI को "बाएं चलें" सिखाते हैं, तो वह सीख सकता है कि "बाएं चलें" का अर्थ वास्तव में "कैमरे को हिलाना" है।
  • समाधान: लेखकों ने गति के लिए एक ट्रैफिक लाइट सिस्टम बनाया है:
    • हरा (Go): गति स्पष्ट और मजबूत है। AI इसे एक वास्तविक क्रिया के रूप में सीखता है।
    • लाल (Stop): गति बहुत छोटी या केवल शोर है। AI इसे अनदेखा कर देता है।
    • पीला (Uncertain): गति धुंधली या भ्रमित करने वाली है। AI को अनुमान लगाने के लिए मजबूर करने के बजाय, सिस्टम इसे "अनिश्चित" के रूप में लेबल करता है और AI को बताता है, "इस विशिष्ट क्षण से न सीखें।"
    • परिणाम: AI केवल स्पष्ट और मजबूत गतिविधियों से सीखता है, जिससे यह कैमरा शेक के कारण भ्रमित हुए बिना आपके नियंत्रणों पर प्रतिक्रिया देने में बहुत बेहतर हो जाता है।

तरकीब C: "अभ्यास सत्र" (Revisit-Dense Finetuning)

लेखकों ने महसूस किया कि AI को लंबा रास्ता याद रखने के लिए सिखाने के लिए, आपको लाखों घंटों के रैंडम वीडियो की आवश्यकता नहीं है। आपको एक विशिष्ट प्रकार के अभ्यास की आवश्यकता है।

  • अंतर्दृष्टि: यदि आप 10 मील सीधी रेखा में चलते हैं, तो आप कभी भी वहां नहीं देखते जहां से आपने शुरुआत की थी। लेकिन यदि आप एक घेरे में चलते हैं और वापस उसी स्थान पर आते हैं, तो आप दुनिया के आकार को सीखते हैं।
  • रणनीति: उन्होंने एक बहुत छोटे डेटासेट (केवल 30 मिनट लंबा) का उपयोग किया जहाँ कैमरा घेरे में घूमता था और बार-बार उन्हीं स्थानों पर वापस आता था। उन्होंने इसका उपयोग AI की दीर्घकालिक स्मृति को "जगाने" के लिए किया। यह एक छात्र को एक विशिष्ट अवधारणा पर त्वरित, केंद्रित क्विज़ देने जैसा है ताकि यह सुनिश्चित हो सके कि वे वास्तव में उसे समझते हैं, बजाय इसके कि उन्हें पूरी लाइब्रेरी की रैंडम किताबें पढ़ने के लिए कहा जाए।

परिणाम

जब आप इन तीनों तरकीबों को एक साथ रखते हैं, तो Infinite-World एक मास्टर स्टोरीटेलर बन जाता है।

  • यह आपको कमरे में लंबे समय तक घूमते हुए देख सकता है।
  • यह याद रखता है कि खिड़की बाईं ओर थी, भले ही आपने खिड़की के पास से गुजरने के बाद चक्कर लगाकर वापस आ गए हों।
  • यह आपके "बाएं चलें" कमांड पर सटीक रूप से प्रतिक्रिया देता है, भले ही प्रशिक्षण वीडियो थोड़ा हिलता हुआ (shaky) रहा हो।
  • यह यह सब बिना किसी सुपर-कंप्यूटर के डेटा को एक साथ अपनी मेमोरी में रखने के, कर सकता है।

संक्षेप में, उन्होंने एक ऐसा AI बनाया है जो बिना खोए, भूले या क्रैश हुए लंबे समय तक "दुनिया का अन्वेषण करने" का खेल खेल सकता है, जो स्मार्ट सारांशीकरण और अस्त-व्यस्त डेटा के सावधानीपूर्वक फ़िल्टरिंग का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →