← नवीनतम पेपर
🤖 machine learning

Generation of High-Level Concepts in 3D Scene Graphs via Autoregressive Diffusion

यह शोध पत्र एक एकीकृत ऑटोरेग्रेसिव डिफ्यूजन-आधारित मॉडल प्रस्तावित करता है जो प्रेक्षित ज्यामितीय प्रिमिटिव्स (geometric primitives) से पूर्ण, पदानुक्रमित इनडोर 3D सीन ग्राफ उत्पन्न करने के लिए ग्राफ संरचना और स्थानिक विशेषताओं को संयुक्त रूप से सीखता है, जो विविध डेटासेट पर मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है और सिद्धांतपूर्ण मूल्यांकन के लिए एक नवीन फ्यूज्ड ग्रोमोव-वासरस्टीन (Fused Gromov-Wasserstein) मीट्रिक प्रस्तुत करता है।

मूल लेखक: Jose Andres Millan-Romera, Samuel Cognolato, Holger Voos, Jose Luis Sanchez-Lopez, Luciano Serafini

प्रकाशित 2026-09-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jose Andres Millan-Romera, Samuel Cognolato, Holger Voos, Jose Luis Sanchez-Lopez, Luciano Serafini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इमारत के भीतर घूमते रोबोटों को एक मौलिक चुनौती का सामना करना पड़ता है: वे दुनिया को कच्चे डेटा बिंदुओं के एक अराजक संग्रह के रूप में देखते हैं। एक लेजर स्कैनर हजारों सपाट सतहों—दीवारों, छतों और फर्शों—का पता लगा सकता है, लेकिन एक मशीन के लिए, ये केवल ज्यामितीय आकार हैं जिनका कोई अर्थ नहीं है। प्रभावी ढंग से नेविगेट करने के लिए, एक रोबोट को यह समझने की आवश्यकता है कि ये आकार मिलकर एक कमरा बनाते हैं, कमरे मिलकर एक मंजिल बनाते हैं, और मंजिलें मिलकर एक इमारत बनाती हैं। यह मानसिक मानचित्र, जिसे 3D सीन ग्राफ (3D Scene Graph) कहा जाता है, कच्चे संवेदी इनपुट और उच्च-स्तरीय अवधारणाओं के बीच एक सेतु का कार्य करता है जिसका उपयोग मनुष्य अपने परिवेश का वर्णन करने के लिए करते हैं। वर्षों से, शोधकर्ता रोबोट को स्वचालित रूप से ये मानचित्र बनाना सिखाने के लिए संघर्ष कर रहे हैं। पारंपरिक तरीके कठोर, हस्तलिखित नियमों पर निर्भर थे जो केवल आयताकार कमरों जैसे सरल आकारों को पहचान सकते थे, जबकि नए सीखने पर आधारित दृष्टिकोणों को अक्सर संरचना और वस्तुओं के स्थान का पता लगाने के लिए अलग-अलग प्रणालियों की आवश्यकता होती थी, जिससे जटिल, बहु-मंजिला वातावरण तक विस्तार करना कठिन हो जाता था।

शोधकर्ताओं की एक टीम ने अब एक नया दृष्टिकोण पेश किया है जो रोबोट को बुनियादी दीवारों से लेकर पूरी इमारतों और शहरों तक, ज़मीन से ऊपर की ओर जटिल, बहु-स्तरीय मानचित्र बनाने की अनुमति देता है। लेआउट का अनुमान लगाने और फिर कमरों को रखने के लिए अलग-अलग उपकरणों का उपयोग करने के बजाय, उनका सिस्टम एक एकल, एकीकृत प्रक्रिया का उपयोग करता है जो एक ही बार में संपूर्ण पदानुक्रम (hierarchy) बनाना सीखती है। यह विधि उन शुरुआती सपाट सतहों को लेकर काम करती है जिन्हें एक रोबोट देखता है और धीरे-धीरे अर्थ की नई परतें जोड़ती है। यह तय करता है कि कितने नए तत्व, जैसे कि एक नया कमरा या एक नई मंजिल, जोड़े जाने चाहिए, यह निर्धारित करता है कि उन तत्वों को क्या कहा जाना चाहिए, और यह गणना करता है कि उन्हें 3D स्थान में ठीक कहाँ स्थित किया जाना चाहिए। यह प्रक्रिया चरण-दर-चरण होती है, जिसमें सिस्टम अपने अनुमानों को तब तक परिष्कृत करता है जब तक कि पूरा मानचित्र तैयार न हो जाए।

शोधकर्ताओं ने इस प्रणाली का परीक्षण कंप्यूटर-जनित कृत्रिम दृश्यों, वास्तविक वास्तुशिल्प फ्लोर प्लान और लेजर सेंसर से लैस रोबोटों द्वारा रिकॉर्ड किए गए वास्तविक डेटा सहित विभिन्न प्रकार के वातावरणों पर किया। उन्होंने अपने नए तरीके की तुलना मौजूदा तकनीकों से की जो निश्चित नियमों या विभिन्न कार्यों के लिए अलग-अलग मॉडलों पर निर्भर करती हैं। परिणामों ने दिखाया कि उनके एकीकृत दृष्टिकोण ने पिछले तरीकों की तुलना में लगातार अधिक सटीक और पूर्ण मानचित्र तैयार किए। इसने जटिल लेआउट को सफलतापूर्वक संभाला जो पूरी तरह से आयताकार नहीं थे और ऐसे मानचित्र उत्पन्न किए जो शहर के स्तर तक विस्तृत थे, जो कि पहले के लर्निंग-बेस्ड सिस्टम नहीं कर सके थे। वास्तव में, पूरी इमारतों और शहरों से जुड़े सबसे जटिल डेटासेट पर, उनके सिस्टम ने एक शक्तिशाली 'वन-शॉट' मॉडल को भी पीछे छोड़ दिया, जिसे एक गुप्त लाभ दिया गया था: मानचित्र बनाना शुरू करने से पहले ही कमरों और मंजिलों की सटीक संख्या जानना।

इस कार्य का सबसे महत्वपूर्ण पहलू यह है कि यह वास्तविक दुनिया की अनिश्चितता को कैसे संभालता है। एक विशिष्ट परिदृश्य में, एक रोबोट को यह नहीं पता होता कि किसी इमारत में कितने कमरे या मंजिलें मौजूद हैं। पुराने तरीके अक्सर इसमें संघर्ष करते थे क्योंकि उन्हें पहले से ज्ञात होना आवश्यक था कि मानचित्र का अंतिम आकार क्या होगा। हालाँकि, नया सिस्टम खुद यह तय करना सीखता है कि मानचित्र कब समाप्त हुआ है। यह तब तक संरचना की नई परतें जोड़ना जारी रखता है जब तक कि यह निर्धारित न कर ले कि अब और जानकारी की आवश्यकता नहीं है, जिससे यह मानचित्र बनाते समय वातावरण के पैमाने को प्रभावी ढंग से समझ लेता है। यह क्षमता इस तकनीक को वास्तविक दुनिया की रोबोटिक्स के लिए बहुत अधिक व्यावहारिक बनाती है, जहाँ इमारत का आकार और जटिलता पहले से ज्ञात नहीं होती है।

यह सुनिश्चित करने के लिए कि उनका सिस्टम वास्तव में काम कर रहा है, शोधकर्ताओं ने सफलता को मापने का एक नया तरीका विकसित किया। केवल यह जाँचने के बजाय कि रोबोट ने कमरों की संख्या सही पाई या नहीं, उन्होंने एक ऐसा मीट्रिक बनाया जो यह मूल्यांकन करता है कि उत्पन्न मानचित्र आकार, स्थान और विभिन्न भागों के बीच संबंधों के मामले में वास्तविक मानचित्र से कितनी अच्छी तरह मेल खाता है। यह नया मापन उपकरण, जो ज्यामितीय दूरी को संरचनात्मक समानता के साथ जोड़ता है, इस बात की पुष्टि करता है कि उनके सिस्टम द्वारा निर्मित मानचित्र अन्य तरीकों द्वारा निर्मित मानचित्रों की तुलना में सत्य के काफी करीब थे। टीम ने अपने डेटा और कोड को सार्वजनिक रूप से उपलब्ध कराया, जिससे अन्य वैज्ञानिकों को इस कार्य पर आगे बढ़ने के लिए एक आधार प्राप्त हुआ। यह प्रदर्शित करके कि एक एकल, एकीकृत मॉडल जटिल, बहु-स्तरीय स्थानिक पदानुक्रम उत्पन्न करना सीख सकता है, यह शोध उन रोबोटों की ओर एक आशाजनक मार्ग प्रदान करता है जो मानव दुनिया की जटिल संरचनाओं को वास्तव में समझ और नेविगेट कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →