← नवीनतम पेपर
💻 computer science

Look Up and Look Back: Hidden Attention and Latent Orientation in a Frozen Foundation Model for Panoramic SLAM

यह शोध पत्र HALO-SLAM प्रस्तुत करता है, जो एक नवीन मोनोकुलर पैनोरमिक SLAM प्रणाली है जो IMU-मुक्त गुरुत्वाकर्षण संरेखण और सुदृढ़ लूप क्लोजर प्राप्त करने के लिए एक फ्रोजन फाउंडेशन मॉडल से हिडन अटेंशन और लेटेंट ओरिएंटेशन संकेतों का लाभ उठाती है, जिसके परिणामस्वरूप पांच वास्तविक-विश्व बेंचमार्क में 100% सफलता और अत्याधुनिक सटीकता प्राप्त होती है।

मूल लेखक: Zhuang Xiong, Guohao Zhang, Chen Zhang, Zheyu Jiang, Yuchao Mei, Qingshan Xu, Wenbing Tao

प्रकाशित 2026-08-04
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zhuang Xiong, Guohao Zhang, Chen Zhang, Zheyu Jiang, Yuchao Mei, Qingshan Xu, Wenbing Tao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप केवल एक अकेले कैमरे का उपयोग करके दुनिया का एक विशाल, 3D मानचित्र बनाने की कोशिश कर रहे हैं जो अपने चारों ओर की हर चीज़ को एक साथ देख सकता है, जैसे कि स्टेरॉयड वाला फिश-आई लेंस। यह "पैनोरैमिक SLAM" (Simultaneous Localization and Mapping) की चुनौती है। यह वह तकनीक है जो रोबोट और बिना जीपीएस के यह जानने में मदद करती है कि वे कहाँ हैं और दुनिया कैसी दिखती है। पेचीदा हिस्सा यह है कि ये कैमरे पूरी दुनिया को एक विकृत, सपाट आयत (जैसे कि विश्व मानचित्र) के रूप में देखते हैं, और यदि कैमरा थोड़ा भी झुक जाए, तो पूरी तस्वीर बिखर जाती है। लंबे समय तक, कंप्यूटर कैमरे के घूमने या झुकने पर अपना संतुलन बनाए रखने में संघर्ष करते रहे, जिससे वे अक्सर रास्ता भटक जाते थे या ऐसे मानचित्र बनाते थे जो पिघली हुई मोम की तरह खिंचे हुए और विकृत दिखाई देते थे। उन्हें यह समझने का तरीका चाहिए था कि "ऊपर" की दिशा कौन सी है और यह पहचानने का तरीका चाहिए था कि वे कब किसी ऐसी जगह पर वापस आए हैं जहाँ वे पहले जा चुके हैं, और यह सब करते हुए मानचित्र को सुसंगत रखना था।

अब, HALO-SLAM से मिलिए, एक नया सिस्टम जो इन पैनोरैमिक कैमरों के लिए एक सुपर-स्मार्ट जासूस की तरह काम करता है। शून्य से सब कुछ सीखने के बजाय, HALO-SLAM एक "फ्रीज़्ड" (जमे हुए) विशाल AI मस्तिष्क (एक फाउंडेशन मॉडल जिसे PanoVGGT कहा जाता है) का उपयोग करता है जिसे पहले से ही 3D आकृतियों को समझने के लिए प्रशिक्षित किया गया था। चालाकी भरी तकनीक यह है कि HALO-SLAM केवल AI द्वारा दिए गए अंतिम उत्तर को नहीं देखता; बल्कि यह AI की "सोचने की प्रक्रिया" (इसके हिडन लेयर्स) के अंदर झाँकता है ताकि गुप्त सुराग खोज सके। सबसे पहले, यह नीचे की दिशा का अनुमान लगाने के लिए AI के आंतरिक टोकन को पढ़ता है, जिससे इसे भौतिक जायरोस्कोप की आवश्यकता के बिना कैमरे के दृश्य को सीधा करने में मदद मिलती है। दूसरा, यह AI के 'अटेंशन मैकेनिज्म' का उपयोग करता है—जो अनिवार्य रूप से यह देखना है कि एक फोटो के बारे में सोचते समय AI दूसरी फोटो को कितना "देखता" है—यह तय करने के लिए कि क्या दो तस्वीरें वास्तव में एक ही स्थान की हैं या वे केवल संयोग से समान दिख रही हैं। इन छिपे हुए सुरागों को एक कठोर तीन-चरणीय जांच के साथ जोड़कर, HALO-SLAM ने 125 अलग-अलग वास्तविक दुनिया के अनुक्रमों को सफलतापूर्वक मैप करने में सफलता प्राप्त की, जिससे 100% सफलता दर हासिल हुई और पिछले सर्वोत्तम तरीकों की तुलना में माप त्रुटियों को 88% तक कम किया गया। यह साबित करता है कि एक पूर्व-प्रशिक्षित AI के भीतर की शांत फुसफुसाहटों को सुनकर, हम रोबोट और वर्चुअल रियलिटी के लिए बहुत अधिक विश्वसनीय मानचित्र बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →