← नवीनतम पेपर
💻 computer science

FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand

यह शोध पत्र FOUND-IT को प्रस्तुत करता है, जो एक रियल-टाइम, टास्क-ड्रिवन फ्रेमवर्क है जो अनकैलिब्रेटेड मोनोकुलर वातावरण में विकसित होते लोको-मैनिप्युलेशन कार्यों के लिए एडजस्टेबल ग्रैनुलैरिटी के साथ डायनामिकली पदानुक्रमित (hierarchical) 3D सीन ग्राफ बनाने के लिए ज्यामितीय फाउंडेशन मॉडल्स का लाभ उठाता है।

मूल लेखक: Dominic Maggio, Nicolas Gorlo, Luca Carlone

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dominic Maggio, Nicolas Gorlo, Luca Carlone

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर में नेविगेट करना सिखा रहे हैं। आज के अधिकांश रोबोट उन छात्रों की तरह हैं जो एक निश्चित स्तर के विवरण के साथ एक मानचित्र (मैप) को रट लेते हैं। यदि उन्हें रसोई में जाने की आवश्यकता है, तो वे पूरे कमरे को देखते हैं। लेकिन यदि उन्हें चूल्हे का एक विशिष्ट नॉब घुमाना है, तो वे फंस जाते हैं क्योंकि उनका मैप या तो नॉब को देखने के लिए बहुत धुंधला है, या पूरे कमरे को एक साथ देखने के लिए बहुत अव्यवस्थित है। उन्हें अपना यह मैप बनाने के लिए महंगे, विशेषीकृत 3D कैमरों की भी आवश्यकता होती है।

यह पेपर FOUND-IT को पेश करता है, जो एक रोबोट की याददाश्त के लिए एक स्मार्ट, अनुकूलन योग्य लाइब्रेरियन की तरह काम करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "ज़ूम लेंस" मेमोरी (Granularity on Demand)

FOUND-IT को एक स्थिर मैप के रूप में नहीं, बल्कि एक स्मार्ट कैमरा लेंस के रूप में सोचें जो रोबोट को दिए गए कार्य के आधार पर अपना फोकस बदलता है।

  • समस्या: पारंपरिक प्रणालियाँ पहली बार कमरे को देखते समय ही वस्तुओं के "आकार" का निर्णय ले लेती हैं। वे शायद यह तय कर लें कि एक चूल्हा केवल एक बड़ा ऑब्जेक्ट है। बाद में, यदि रोबोट को नॉब घुमाने की आवश्यकता होती है, तो वह नॉब को नहीं देख पाता क्योंकि मैप बहुत अधिक ज़ूम-आउट है।
  • FOUND-IT का समाधान: यह कच्चे वीडियो फ्रेम की "विजुअल मेमोरी" रखता है लेकिन उन्हें अभी तक विशिष्ट वस्तु के आकार में लॉक नहीं करता है। जब रोबोट को कोई कार्य दिया जाता है, तो यह तुरंत ज़ूम इन या ज़ूम आउट हो जाता है।
    • कार्य: "रसोई में जाओ।" -> सिस्टम ज़ूम आउट होता है और पूरे कमरे को एक बड़े क्षेत्र के रूप में देखता है।
    • कार्य: "चूल्हा बंद करो।" -> सिस्टम ज़ूम इन होता है और चूल्हे पर विशिष्ट नॉब की पहचान करता है।
    • कार्य: "केतली ढूँढो।" -> यह केतली को देखने के लिए पर्याप्त ज़ूम इन होता है।
    • उपमा: यह एक गूगल मैप की तरह है जो आपकी खोज क्वेरी के आधार पर तुरंत आपको पूरे शहर, एक विशिष्ट पड़ोस, या एक एकल सड़क पता दिखाने के बीच स्विच कर सकता है, बिना हर बार मैप को फिर से बनाए।

2. "एक आँख वाला" कैमरा (Uncalibrated Monocular)

अधिकांश उन्नत रोबोटों को 3D स्पेस को समझने के लिए दो कैमरों (स्टीरियो विजन) या एक डेप्थ सेंसर (जैसे लेजर स्कैनर) की आवश्यकता होती है। यह भारी, महंगा और सेटअप करने में कठिन होता है।

  • FOUND-IT का समाधान: यह एक एकल, मानक कैमरे (जैसे आपके फोन पर लगा कैमरा) और एक शक्तिशाली AI "फाउंडेशन मॉडल" (एक प्री-ट्रेंड मस्तिष्क जो पहले से जानता है कि 3D स्पेस कैसे काम करता है) का उपयोग करता है ताकि कमरे की गहराई और संरचना का अनुमान लगाया जा सके।
  • उपमा: यह वैसा ही है जैसे हम इंसान एक अंधेरे कमरे में चलते समय फर्नीचर की स्थिति जान सकते हैं, सिर्फ अपनी एक आँख से देखने और अपने मस्तिष्क के अनुभव का उपयोग करने से। FOUND-IT इसे एक एकल कैमरा फीड के साथ गणितीय रूप से करता है।

3. "फ्लोर प्लान" जनरेटर (Places Layer)

घूमने-फिरने के लिए, एक रोबोट को यह जानने की आवश्यकता होती है कि वह कहाँ चल सकता है (traversable space) और कहाँ नहीं (दीवारें, मेज)।

  • FOUND-IT का समाधान: जटिल ज्यामितीय गणनाओं के बजाय, यह सिस्टम मुख्य कैमरा मस्तिष्क में एक विशेष "हेड" (एक छोटा अतिरिक्त AI टूल) जोड़ता है। यह टूल वीडियो को देखता है और तुरंत जमीन पर एक "फ्लोर प्लान" पेंट करता है, जिससे उन टाइल्स की पहचान होती है जहाँ रोबोट चल सकता है।
  • उपमा: कल्पना कीजिए कि एक रोबोट एक अस्त-व्यस्त लिविंग रूम का वीडियो देख रहा है। जहाँ अन्य सिस्टम यह समझने में संघर्ष करते हैं कि फर्श कहाँ समाप्त होता है और कालीन कहाँ शुरू होता है, वहीं FOUND-IT तुरंत दीवारों और फर्नीचर को अनदेखा करते हुए, चलने योग्य फर्श की टाइल्स को हरे रंग में हाइलाइट कर देता है, जिससे रोबोट के अनुसरण के लिए एक सुरक्षित पथ बनता है।

4. "स्मार्ट ग्रुपिंग" सिस्टम (Regions)

रोबोटों को अक्सर "रसोई" या "गलियारा" जैसी अवधारणाओं को समझने की आवश्यकता होती है, जो केवल एक एकल वस्तु नहीं बल्कि स्थानों के समूह हैं।

  • FOUND-IT का समाधान: यह उन "फ्लोर टाइल्स" को लेता है जिन्हें उसने पाया है और रोबोट द्वारा पूछे गए आधार पर उन्हें क्षेत्रों (regions) में समूहित करता है। यदि रोबोट "रसोई" के लिए पूछता है, तो सिस्टम उन सभी फर्श टाइल्स को इकट्ठा करता है जो रसोई की तरह दिखती हैं और उन्हें जोड़ता है।
  • उपमा: यदि आप किसी इंसान से पूछते हैं, "रसोई कहाँ है?", तो वे एक विशिष्ट क्षेत्र की ओर इशारा कर सकते हैं। यदि आप पूछते हैं, "खेलने का क्षेत्र कहाँ है?", तो वे उसी कमरे के एक अलग कोने की ओर इशारा कर सकते हैं। FOUND-IT इसे गतिशील रूप से करता है, पूरे घर को पहले से निर्धारित कमरों में मजबूर करने के बजाय, केवल पूछे जाने पर फर्श की टाइल्स को "कमरों" में समूहित करता है।

5. "एजेंट" (मस्तिष्क)

सिस्टम में एक AI एजेंट (एक डिजिटल सहायक) शामिल है जो रोबोट से बात करता है।

  • यह कैसे काम करता है: जब रोबोट को एक कमांड मिलता है (जैसे, "मेरे लिए तौलिया लाओ"), तो एजेंट केवल एक पूर्व-निर्मित सूची की खोज नहीं करता है। यह सक्रिय रूप से काम करते हुए मैप बनाता है, तौलिए की तलाश करता है, जाँच करता है कि क्या वे मौजूद हैं, और यदि नहीं, तो यह महसूस करता है कि तौलिया वहाँ नहीं है और शायद किसी अन्य वस्तु की तलाश करता है।
  • उपमा: यह एक जासूस की तरह है जो केवल एक फाइल नहीं पढ़ता; वे सक्रिय रूप से दृश्य की जांच करते हैं, विशिष्ट मामले (कार्य) से संबंधित सुराग (वस्तुएं) ढूंढते हैं, और वास्तविक समय में अपने मानसिक मानचित्र को अपडेट करते हैं।

उन्होंने वास्तव में क्या सिद्ध किया

लेखकों ने इस प्रणाली को कई तरीकों से परीक्षण किया ताकि यह दिखाया जा सके कि यह काम करती है:

  • सटीकता: यह मानक बेंचमार्क पर पिछले तरीकों की तुलना में वस्तुओं को खोजने और कार्यों को समझने में काफी बेहतर (79% सुधार) था।
  • गति: यह एक शक्तिशाली ऑनबोर्ड कंप्यूटर (Jetson Thor) का उपयोग करके एक रोबोट (विशेष रूप से एक "स्पॉट" रोबोट डॉग) पर वास्तविक समय में चलता है।
  • वास्तविक दुनिया का उपयोग: उन्होंने सफलतापूर्वक YouTube पर रियल एस्टेट एजेंटों द्वारा लिए गए साधारण वीडियो का उपयोग करके इन 3D मैप्स को बनाया, जिससे यह सिद्ध हुआ कि यह इंटरनेट से प्राप्त अव्यवस्थित, अनियंत्रित वीडियो पर भी काम करता है, न कि केवल लैब के आदर्श डेटा पर।

संक्षेप में: FOUND-IT एक ऐसा सिस्टम है जो एक रोबोट को केवल एक कैमरे का उपयोग करके कमरे का 3D मैप बनाने में सक्षम बनाता है, और फिर यह तुरंत ज़ूम इन या ज़ूम आउट कर सकता है ताकि वह ठीक वही देख सके जो उसे काम करने के लिए चाहिए, चाहे वह गलियारे में नेविगेट करना हो या एक छोटे से नॉब को घुमाना हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →