← नवीनतम पेपर
💻 computer science

LiDARDraft: Generating LiDAR Point Cloud from Versatile Inputs

LiDARDraft एक नवीन ढांचा है जो टेक्स्ट, इमेज और स्केच जैसे बहुमुखी इनपुट्स को 3D लेआउट में एकीकृत करके उन्हें एक रेंजमैप-आधारित ControlNet को निर्देशित करने के लिए उपयोग करता है, जिससे टेक्स्ट, इमेज और स्केच जैसे विविध इनपुट्स से यथार्थवादी और विविध LiDAR पॉइंट क्लाउड्स उत्पन्न किए जा सकते हैं, और इस प्रकार स्वायत्त ड्राइविंग वातावरण के लिए नियंत्रणीय "शून्य से सिमुलेशन" (simulation from scratch) को सक्षम किया जा सकता है।

मूल लेखक: Haiyun Wei, Fan Lu, Yunwei Zhu, Zehan Zheng, Weiyi Xue, Lin Shao, Xudong Zhang, Ya Wu, Guang Chen

प्रकाशित 2026-07-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haiyun Wei, Fan Lu, Yunwei Zhu, Zehan Zheng, Weiyi Xue, Lin Shao, Xudong Zhang, Ya Wu, Guang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, रोबोट को असली स्टीयरिंग व्हील छूने से पहले एक आभासी दुनिया (वर्चुअल वर्ल्ड) में लाखों मील का अभ्यास करने की आवश्यकता है। लेकिन इन आभासी दुनियाओं को बनाना अविश्वसनीय रूप से कठिन और महंगा है। आमतौर पर, इंजीनियरों को एक 3D कंप्यूटर प्रोग्राम में हर पेड़, इमारत और अन्य कार को मैन्युअल रूप से रखना पड़ता है, जिसमें बहुत समय लगता है। यहीं पर "जेनरेटिव एआई" (generative AI) नामक कंप्यूटर विज्ञान का एक विशेष प्रकार काम आता है। इसे एक सुपर-स्मार्ट कलाकार की तरह समझें जिसने लाखों तस्वीरों को देखा है और अब वह नई तस्वीरें बना सकता है जो वास्तविक दिखती हैं। वैज्ञानिक इस कलाकार को लेजर स्कैनर्स (जिन्हें LiDAR कहा जाता है, जो सेल्फ-ड्राइविंग कारों की "आंखें" हैं और 3D में देखती हैं) का उपयोग करके दुनिया के 3D मानचित्र बनाने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। बड़ी चुनौती यह रही है कि हालांकि यह कलाकार चित्र बनाने में बहुत अच्छा है, लेकिन विशिष्ट निर्देशों का पालन करने में बहुत खराब है। यदि आप इसे "एक व्यस्त चौराहा बनाओ" कहते हैं, तो यह एक जंगल बना सकता है, या कारों को आसमान में रख सकता है। यह एक ऐसे शेफ को रेसिपी देने जैसा है जो एक अलग भाषा बोलता है; परिणाम अक्सर एक गड़बड़ी होता है।

यही वह समस्या है जिसे टोंगजी यूनिवर्सिटी (Tongji University) के शोधकर्ताओं की एक टीम ने LiDARDraft नामक एक नए टूल के साथ हल किया। वे एक ऐसा तरीका खोजना चाहते थे जिससे लोग एक वाक्य के टेक्स्ट, एक साधारण फोटो, या यहाँ तक कि एक रफ स्केच जैसे सरल इनपुट का उपयोग करके यथार्थवादी 3D ड्राइविंग दृश्य बना सकें, बिना 3D मॉडलिंग विशेषज्ञ बने। उनका गुप्त हथियार एक चतुर मध्यस्थ है जिसे वे "3D लेआउट" कहते हैं। कल्पना कीजिए कि आप लेगो (Lego) ब्रिक्स से एक शहर बना रहे हैं। हर एक ईंट को असली कार या पेड़ जैसा दिखने के लिए तराशने के बजाय, आप बस सरल ब्लॉकों का उपयोग करते हैं: एक कार के लिए लाल बॉक्स, एक झाड़ी के लिए हरा अंडाकार, और सड़क के लिए एक सपाट ग्रे प्लेन। यह सरल "लेगो ब्लूप्रिंट" बनाना आसान है, लेकिन इसमें सभी महत्वपूर्ण जानकारी होती है कि चीजें कहाँ और क्या हैं। LiDARDraft इस लेगो ब्लूप्रिंट को एक पुल के रूप में उपयोग करता है। यह आपके सरल इनपुट (जैसे कि टेक्स्ट विवरण) को लेता है, उसे इस लेगो लेआउट में बदल देता है, और फिर एक विशेष गाइड (जिसे ControlNet कहा जाता है) का उपयोग करता है ताकि वह एआई कलाकार को ठीक से बता सके कि उन सरल ब्लॉकों को एक विस्तृत, यथार्थवादी 3D लेजर स्कैन में कैसे बदलना है।

शोधकर्ताओं ने पाया कि यह दृष्टिकोण आश्चर्यजनक रूप से अच्छा काम करता है। एआई को "लेगो ब्लूप्रिंट" का पालन करने के लिए मजबूर करके, वे उच्च-गुणवत्ता वाले 3D पॉइंट क्लाउड (डिजिटल 3D मानचित्र) उत्पन्न कर सके जो उनके निर्देशों से पूरी तरह मेल खाते थे। उदाहरण के लिए, यदि आपने "मेरे सामने एक कार और बाईं ओर एक पेड़" टाइप किया, तो सिस्टम ने बिल्कुल उसी व्यवस्था के साथ, सही आकार और स्थिति के साथ एक दृश्य बनाया। उन्होंने इसका परीक्षण टेक्स्ट, छवियों और यहाँ तक कि मौजूदा 3D स्कैन के साथ किया, और हर मामले में, उनकी विधि ने पिछले प्रयासों की तुलना में बेहतर परिणाम दिए, जो अक्सर यादृच्छिक, नकली कारें जोड़ देते थे या सड़क के लेआउट को गलत कर देते थे। टीम ने दिखाया कि यह सिस्टम एक सड़क की एक एकल फोटो लेकर उसे पूर्ण 3D ड्राइविंग सिमुलेशन में भी बदल सकता है, या एक रफ स्केच लेकर उसमें यथार्थवादी विवरण भर सकता है।

जो चीज़ इसे विशेष रूप से रोमांचक बनाती है, वह है इसकी लचीलापन। शोधकर्ताओं ने प्रदर्शित किया कि आप लेआउट में "लेगो ब्लॉक्स" को हिलाकर दृश्य को संपादित कर सकते हैं। यदि आप सिमुलेशन से एक कार हटाना चाहते हैं, तो आपको ब्लूप्रिंट से बस लाल बॉक्स को हटाना होगा, और एआई तुरंत उस कार के बिना दृश्य को फिर से बना देगा, जिससे बाकी सब कुछ सुसंगत बना रहेगा। उन्होंने यह भी पाया कि यह विधि कुशल है; इसे हर बार शून्य से फिर से प्रशिक्षित करने की आवश्यकता नहीं थी, जिससे कंप्यूटर की शक्ति की भारी बचत हुई। अपने परीक्षणों में, सिस्टम केवल 5,000 स्टेप्स में लेआउट निर्देशों का पालन करना सीख सकता था, जो शून्य से शुरू होने की तुलना में एक बड़ा सुधार है। परिणाम बताते हैं कि हम एक ऐसे भविष्य के करीब पहुँच रहे हैं जहाँ हम केवल साधारण अंग्रेजी में वर्णन करके या एक त्वरित फोटो दिखाकर पूरे सेल्फ-ड्राइविंग प्रशिक्षण जगत का निर्माण कर सकते हैं, जिससे इस प्रक्रिया को रोबोटों को सिखाना बहुत तेज़, सस्ता और सुरक्षित हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →