← नवीनतम पेपर
🤖 AI

MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation

मोज़ेकथिंकर (MosaicThinker) संसाधन-सीमित एम्बॉडीड एआई (embodied AI) के लिए एक इन्फरेंस-टाइम कंप्यूटिंग तकनीक है जो विज़ुअल प्रॉम्प्टिंग के लिए उपयोग किए जाने वाले एक एकीकृत वैश्विक सिमेंटिक मैप में कई वीडियो फ्रेमों से खंडित जानकारी को एकीकृत करके छोटे VLMs की स्थानिक तर्क क्षमताओं को बढ़ाता है।

मूल लेखक: Haoming Wang, Qiyao Xue, Weichen Liu, Wei Gao

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haoming Wang, Qiyao Xue, Weichen Liu, Wei Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटा सा रोबोट हैं जो एक बड़े, बिखरे हुए घर में एक विशिष्ट नीली किताब खोजने की कोशिश कर रहा है। आपके पास केवल एक आँख (एक कैमरा) है, और जैसे-जैसे आप इधर-उधर घूमते हैं, आप चीज़ों के टुकड़े-टुकड़े देखते हैं: यहाँ एक मेज़ का कोना, वहाँ एक बुकशेल्फ़ का एक हिस्सा।

समस्या क्या है? आपका "दिमाग" (AI) बैटरी और जगह बचाने के लिए बहुत छोटा है। यह चीज़ों को पहचानने में बहुत अच्छा है—यह कह सकता है, "वह एक मेज़ है!"—लेकिन यह समझने में बहुत बुरा है कि चीज़ें एक-दूसरे के संबंध में कहाँ हैं। यदि आप एक कमरे में कुर्सी देखते हैं और दूसरे कमरे में एक लैंप देखते हैं, तो आपका दिमाग भूल जाता है कि वे एक ही घर का हिस्सा हैं। यह एक जिग्सॉ पहेली (jigsaw puzzle) को हल करने जैसा है, लेकिन हर बार जब आप एक टुकड़ा उठाते हैं, तो आप भूल जाते हैं कि बाकी तस्वीर कैसी दिखती थी।

MosaicThinker इन "छोटे दिमाग" वाले रोबोटों को एक विशाल, भारी-भरकम सुपरकंप्यूटर दिमाग दिए बिना, उन्हें स्थान (space) का बहुत बेहतर बोध देने का एक नया तरीका है।

"मानसिक मानचित्र" वाली तरकीब (मुख्य विचार)

रोबोट को एक साथ सब कुछ याद रखने के लिए मजबूर करने के बजाय, MosaicThinker एक स्केचपैड की तरह काम करता है।

जैसे-जैसे रोबोट चलता है, वह केवल वीडियो नहीं देखता; वह जल्दी से एक "चीट शीट" (cheat sheet) तैयार करता है। वह महत्वपूर्ण वस्तुओं (लक्ष्य वाली किताब और लैंडमार्क बुकशेल्फ़) की पहचान करता है और उन्हें एक सरल, ऊपर से नीचे की ओर दिखने वाले मानचित्र पर अंकित करता है—बिल्कुल एक सरल खजाने के नक्शे की तरह।

उपमा: कल्पना कीजिए कि आप टॉर्च के साथ एक अंधेरी गुफा की खोज कर रहे हैं। पूरी गुफा को याद करने के बजाय, आप अपने साथ कागज का एक टुकड़ा रखते हैं। हर बार जब आपकी रोशनी किसी महत्वपूर्ण चीज़ पर पड़ती है, तो आप कागज पर एक छोटा सा बिंदु बनाते हैं और उस पर लेबल लगाते हैं। जब तक आप समाप्त करते हैं, आपको गुफा को याद रखने की आवश्यकता नहीं होती; आपको बस अपने कागज को देखने की आवश्यकता है ताकि आप जान सकें कि निकास (exit) कहाँ है।

यह कैसे काम करता है: तीन चरण

1. स्मार्ट स्काउट (Key Frame Selection)
एक वीडियो हजारों छोटी तस्वीरों से बना होता है। उन सभी को देखना थकाऊ और धीमा होगा। MosaicThinker एक स्काउट की तरह काम करता है, जो केवल उन "सुनहरे क्षणों" को खोजने के लिए वीडियो को तेज़ी से स्कैन करता है जहाँ महत्वपूर्ण वस्तुएं वास्तव में दिखाई देती हैं। यह ऊर्जा बचाने के लिए खाली दीवार जैसे उबाऊ हिस्सों को अनदेखा कर देता है।

2. मास्टर आर्किटेक्ट (Iterative Construction)
यही वह चतुर हिस्सा है। जब रोबोट दो अलग-अलग कोणों से एक ही कुर्सी को देखता है, तो वह इसे दो अलग-अलग कुर्सियाँ नहीं समझता। यह उन विभिन्न दृष्टिकोणों को एक ही एकीकृत 3D मानचित्र में "स्टिच" (stitch) करने के लिए गणित का उपयोग करता है। यह विभिन्न दृष्टिकोणों को एक एकल, एकीकृत 3D मानचित्र में संरेखित करता है। यह एक इमारत की कई अलग-अलग तस्वीरों को लेकर उनसे एक सटीक 3D मॉडल बनाने जैसा है।

3. विजुअल हिंट (The Visual Prompt)
अंत में, रोबोट से 3D स्थान के बारे में "सोचने" के लिए कहने के बजाय (जिसमें वह बुरा है), MosaicThinker उसे प्रश्न के साथ "चीट शीट" (semantic map) दिखाता है। यह एक छात्र को बहुविकल्पीय परीक्षा देने जैसा है, लेकिन साथ ही उन्हें कक्षा का एक आरेख (diagram) भी थमा देना। अचानक, "छोटा दिमाग" आसानी से उत्तर दे सकता है: "किताब लैंप के दाईं ओर है!"

यह क्यों मायने रखता है?

आज का अधिकांश AI "क्लाउड" में रहता है—विशाल, दूर स्थित सर्वर। लेकिन एक रोबोट को आपकी रसोई में आपकी मदद करने या ड्रोन को ढही हुई इमारत में किसी को खोजने के लिए, इसे ऑन-डिवाइस (स्थानीय रूप से), तुरंत और निजी तौर पर सोचने की आवश्यकता है।

MosaicThinker यह साबित करता है कि अंतरिक्ष के बारे में स्मार्ट होने के लिए आपको एक विशाल, महंगे दिमाग की आवश्यकता नहीं है। आपको बस जो आप देखते हैं उसे व्यवस्थित करने का एक बेहतर तरीका चाहिए। यह छोटे, कुशल रोबोटों को हमारी जटिल, 3D दुनिया में नेविगेट करने और बातचीत करने के लिए बहुत अधिक सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →