← नवीनतम पेपर
💻 computer science

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

यह शोध पत्र ABot-3DWorld 0 को प्रस्तुत करता है, जो एक सार्वभौमिक मल्टीमॉडल 3D वर्ल्ड मॉडल है जो टेक्स्ट, इमेज और वीडियो को एक स्पेशियल जनरेटिव प्रिमिटिव में एकीकृत करके, 3D-सुसंगत पैनोरमिक वीडियो जेनरेट करके, और उन्हें फोटोरियलिस्टिक 3D गॉसियन स्प्लेटिंग दृश्यों में पुनर्गठित करके उन्हें उच्च-सटीक, अन्वेषण योग्य 3D वातावरण में परिवर्तित करता है।

मूल लेखक: Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen
प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen, Shixing Yang, Nianfei Fan, Guodong Sun, Huan Li, Zheng Zhou, Yongze Li, Yingliang Peng, Mengmeng Du, Yuan Liu, Haozhe Shi, Chunnuo Gong, Chengzhen Yu, Chunxue Jia, Yang Liu, Shiying Zeng, Junnan Lai, Hang Zhang, Ning Guo, Baoquan Chen, Mu Xu, Hongyu Pan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई कैमरा है जो एक साधारण वाक्य, एक त्वरित सेल्फी, या आपके फोन से बनाए गए एक हिलते हुए वीडियो को एक पूरी तरह से खोज योग्य (explorable) 3D दुनिया में बदल सकता है जिसे आप घूमकर देख सकते हैं। Alibaba के AMAP CV Lab की टीम ने ABot-3DWorld 0 के साथ बिल्कुल यही बनाया है। इसे वास्तविकता के लिए एक "यूनिवर्सल ट्रांसलेटर" की तरह समझें: यह जो कुछ भी आप इसमें डालेंगे—टेक्स्ट, एक फोटो, या कई वीडियो—उसे एक हाई-डेफिनिशन, नेविगेबल 3D ब्रह्मांड में बदल देता है।

यह डिजिटल जादू कैसे काम करता है, यहाँ इसके सबसे शानदार हिस्सों में विभाजित है।

गुप्त सामग्री: "स्पेशियल जेनेरेटिव प्रिमिटिव" (SGP)

अधिकांश 3D निर्माता दुनिया को टुकड़ों में बनाने की कोशिश करते हैं, जैसे LEGO ब्लॉक्स को एक के ऊपर एक रखना। लेकिन यह सिस्टम स्पेशियल जेनेरेटिव प्रिमिटिव (SGP) नामक एक स्मार्ट शॉर्टकट का उपयोग करता है। कल्पना कीजिए कि SGP एक "जादुई स्नैपशॉट" है जिसमें दो चीजें शामिल हैं:

  1. एक 360-डिग्री पैनोरमा (एक फोटो जो आपके चारों ओर पूरी तरह से घूमती है)।
  2. एक पॉइंट क्लाउड जो उस फोटो में मौजूद हर चीज़ के आकार और दूरी को मैप करता है।

यह छोटा सा पैकेज दुनिया का "DNA" है। चाहे आप "एक आरामदायक केबिन" जैसा टेक्स्ट प्रॉम्प्ट दें या किसी वास्तविक सड़क का वीडियो, सिस्टम पहले इसे इस SGP में बदल देता है। यदि आप इसे एक समृद्ध वीडियो देते हैं, तो यह वास्तविक ज्यामिति (geometry) को सावधानीपूर्वक मापकर Sगबी (SGP) बनाता है (बिना किसी अनुमान के!)। यदि आप इसे केवल एक वाक्य देते हैं, तो यह शून्य से SGP बनाने के लिए रचनात्मक रूप से कमियों को भर देता है।

यात्रा: चलने की योजना बनाना

एक बार जब सिस्टम के पास SGP होता है, तो उसे इसे एक्सप्लोर करने का तरीका पता लगाना होता है। केवल कैमरे को गोल घुमाने के बजाय, एक "एजेंट" (एक स्मार्ट डिजिटल प्लानर) पॉइंट क्लाउड को देखता है और पूछता है: "मैं कहाँ चल सकता हूँ? क्या दिलचस्प लग रहा है?"
यह एक ऐसा मार्ग तैयार करता है जो तीन चीजें एक साथ करता है:

  • सब कुछ कवर करना: यह सुनिश्चित करता है कि कोई भी कोना या छिपा हुआ दरवाजा छूट न जाए।
  • शानदार चीजों को खोजना: यह दिलचस्प वस्तुओं (जैसे एक बढ़िया साइन बोर्ड या एक पेड़) को पहचानता है और उन पर ज़ूम करता है।
  • स्थिरता बनाए रखना: यह सुनिश्चित करता है कि रास्ता सुचारू हो ताकि अंतिम वीडियो झटकेदार (jittery) न लगे।

जादू का शो: वीडियो बनाना

अब भारी काम शुरू होता है। सिस्टम उस नियोजित मार्ग को लेता है और एक 360-डिग्री पैनोरमिक वीडियो बनाता है, जैसे कि कैमरा वास्तव में उस मार्ग पर उड़ रहा हो।

  • समस्या: मानक वीडियो जनरेटर अक्सर ऐसी 3D दुनिया बनाते हैं जो फ्रेम-दर-फ्रेम तो अच्छी दिखती है, लेकिन जब आप अपना सिर हिलाते हैं तो बिखर जाती है (जैसे एक सपाट पेंटिंग जो बगल से देखने पर अजीब लगती है)।
  • समाधान: लेखकों ने अपने वीडियो जनरेटर को 3D रिइन्फोर्समेंट लर्निंग (3DRL) नामक एक विशेष तकनीक के साथ प्रशिक्षित किया है। इसे एक "रियलिटी चेक" कोच की तरह समझें। कोच वीडियो को देखता है और कहता है, "हे, अगर मैं कैमरा इस तरह घुमाता हूँ, तो वह इमारत जेली की तरह क्यों नहीं मुड़नी चाहिए।" इस फीडबैक पर प्रशिक्षण देकर, सिस्टम ऐसे वीडियो बनाना सीख जाता है जो कैमरा हिलने पर भी ज्यामितीय रूप से सुसंगत (geometrically consistent) रहते हैं।

अंतिम पॉलिश: वीडियो को दुनिया में बदलना

वीडियो बहुत अच्छा है, लेकिन यह अभी भी केवल एक वीडियो है। इसे एक वास्तविक 3D दुनिया में बदलने के लिए जिसे आप घूमकर देख सकें, सिस्टम ABot-3DGS नामक एक रिकंस्ट्रक्शन इंजन का उपयोग करता है।

  • रिपेयर क्रू: कभी-कभी, उत्पन्न वीडियो में धुंधले स्थान या अजीब आर्टिफैक्ट्स होते हैं। सिस्टम एक "रिपेयर क्रू" का उपयोग करता है (जो FLUX नामक टूल द्वारा संचालित है) जो उन स्थानों पर ज़ूम करता है, विवरणों को ठीक करता है और बनावट (textures) को तेज करता है। यह इसे दो राउंड में करता है, जिससे दुनिया स्पष्ट और वास्तविक दिखती है।
  • परिणाम: अंतिम उत्पाद एक 3D गॉसियन स्प्लेटिंग (3DGS) दुनिया है। यह कहने का एक शानदार तरीका है कि यह लाखों छोटे, रंगीन, चमकते बिंदुओं का एक क्लाउड है जो 3D स्पेस में पिक्सेल की तरह काम करते हैं। आप उनके बीच से उड़ सकते हैं, और वे फोटोरियलिस्टिक दिखते हैं।

यह सिस्टम क्या नहीं करता (और यह क्यों महत्वपूर्ण है)

पेपर स्पष्ट रूप से बताता है कि यह किन चीजों से बचता है। यह स्पष्ट रूप से केवल फ्लैट इमेज को जोड़ने या मूल ज्यामिति को अनदेखा करने वाले "हैलुसिनेशन-हैवी" तरीकों को अस्वीकार करता है।

  • यदि आप इसे किसी वास्तविक कमरे का वीडियो देते हैं, तो यह केवल यह अनुमान नहीं लगाता कि कमरे के पीछे क्या है। यह सुनिश्चित करने के लिए कि 3D दुनिया वास्तविक अवलोकनों से मेल खाती है, यह एक कठोर ज्यामिति पाइपलाइन का उपयोग करता है।
  • यह उन अस्थिर, वास्तविक 360-डिग्री कैमरों पर निर्भर नहीं है जिनमें लोग या ट्रिपॉड फ्रेम में हों। इसके बजाय, यह अपनी ट्रेनिंग डेटा को शुरुआत से ही पूर्ण, स्वच्छ 3D दुनिया रेंडर करके बनाता है, ताकि AI बिना किसी वास्तविक दुनिया की गड़बड़ी के "परफेक्ट" उदाहरणों से सीख सके।

प्रमाण: यह कितना अच्छा है?

लेखकों ने केवल यह नहीं कहा कि यह कूल दिखता है; उन्होंने इसे मापा भी।

  • प्रतियोगियों से बेहतर: Marble और HY-World 2.0 जैसे अन्य शीर्ष सिस्टम के मुकाबले परीक्षण करने पर, ABot-3DWorld 0 ने वीडियो या कई फोटो जैसे समृद्ध इनपुट मिलने पर मजबूत "सीन फिडेलिटी" (यह वास्तविक चीज़ के कितने करीब है) दिखाई।
  • आंकड़े: 3DRL "रियलिटी चेक" जोड़ने के बाद, सिस्टम की 3D निरंतरता (consistency) में काफी सुधार हुआ। उदाहरण के लिए, PSNR (जो मापता है कि छवि मूल के कितने करीब है) नामक एक मीट्रिक 34.11 से बढ़कर 35.30 हो गया। SSIM (संरचनात्मक समानता) 0.942 से बढ़कर 0.951 हो गया।
  • गति: चार उच्च-स्तरीय ग्राफिक्स कार्ड (4×4090) वाले एक शक्तिशाली कंप्यूटर पर, पूरी प्रक्रिया—वीडियो से अंतिम 3D दुनिया तक—लगभग 10 मिनट लेती है।

बड़ी तस्वीर

यह केवल एक खिलौना नहीं है; यह एक नए प्रकार के मानचित्र की ओर एक सेतु है। चूंकि यह AMAP की टीम द्वारा बनाया गया है (जो एक प्रमुख मैपिंग सेवा है), इसके द्वारा बनाई गई हर दुनिया को पृथ्वी पर एक वास्तविक स्थान से जोड़ा जा सकता है। आप किसी रेस्टोरेंट की फोटो देखकर तुरंत उसके अंदर "चल" सकते हैं, या किसी लैंडमार्क को देखकर एक "टाइम-ट्रैवल पोर्टल" देख सकते हैं जो आपको दिखा सकता है कि वह अतीत में कैसा दिखता था।

लेखक सुझाव देते हैं कि यह दृष्टिकोण—टेक्स्ट से वीडियो तक सब कुछ संभालने के लिए एक एकीकृत "प्रिमिटिव" का उपयोग करना—3D कंटेंट क्रिएशन को सेल्फी लेने जितना आसान बनाने की कुंजी हो सकता है, जबकि दुनिया को इतना सटीक रखना भी संभव है कि वास्तव में उसे एक्सप्लोर किया जा सके। यह एक ऐसे भविष्य की ओर एक कदम है जहाँ आप केवल कुछ शब्दों या एक सिंगल क्लिक के साथ किसी भी 3D स्थान को, वास्तविक या काल्पनिक, एक्सप्लोर कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →