← नवीनतम पेपर
💻 computer science

Boxer: Robust Lifting of Open-World 2D Bounding Boxes to 3D

यह शोध पत्र Boxer का प्रस्ताव करता है, जो एक ट्रांसफॉर्मर-आधारित फ्रेमवर्क है जो मौजूदा 2D डिटेक्टरों का लाभ उठाकर और स्पार्स (sparse) या डेंस (dense) डेप्थ इनपुट के साथ अनिश्चितता-जागरूक रिग्रेशन (uncertainty-aware regression) को शामिल करके, 2D ओपन-वोकैबुलरी ऑब्जेक्ट डिटेक्शन को वैश्विक रूप से सुसंगत, मीट्रिक 3D बाउंडिंग बॉक्स में मजबूती से लिफ्ट करता है, जिससे ओपन-वर्ल्ड 3D लोकलाइजेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Daniel DeTone, Tianwei Shen, Fan Zhang, Lingni Ma, Julian Straub, Richard Newcombe, Jakob Engel

प्रकाशित 2026-04-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniel DeTone, Tianwei Shen, Fan Zhang, Lingni Ma, Julian Straub, Richard Newcombe, Jakob Engel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप स्मार्ट चश्मे पहनकर अपने लिविंग रूम में टहल रहे हैं। आप एक कॉफी मग, एक टीवी रिमोट और एक गमले वाले पौधे को देखते हैं। आपके चश्मे आसानी से यह बता सकते हैं कि वे चीज़ें क्या हैं (एक "मग", एक "रिमोट", एक "पौधा") और वे आपकी 2D दृष्टि में कहाँ हैं (ऊपर-बाएँ, नीचे-दाएँ)। यह एक बहुत ही तेज़ आँखों वाले चश्मे की तरह है जो लेबल पढ़ सकता है।

लेकिन यहाँ एक समस्या है: आपके चश्मे को यह नहीं पता कि वे चीज़ें कितनी दूर हैं, उनका वास्तविक आकार क्या है, या 3D स्पेस में उनकी दिशा क्या है। एक कंप्यूटर के लिए, मेज पर रखा कॉफी मग बिल्कुल वैसा ही दिखता है जैसा कि आसमान में तैरता हुआ कॉफी मग या कार के आकार का एक विशाल मग, जब तक कि कंप्यूटर के पास उस सपाट छवि को एक वास्तविक, भौतिक 3D वस्तु में "लिफ्ट" करने का कोई तरीका न हो।

यहीं पर Boxer काम आता है।

बड़ा विचार: "लिफ्टिंग" मशीन

यह पेपर Boxer को पेश करता है, जो एक नए AI सिस्टम के रूप में एक जादुई क्रेन की तरह काम करता है। इसका काम वस्तुओं की सपाट, 2D तस्वीरों को लेना और उन्हें सटीक माप के साथ वास्तविक, 3D दुनिया में "लिफ्ट" करना है।

इसे इस तरह सोचें:

  • इनपुट (Input): आप Boxer को एक फोटो (या वीडियो) देते हैं और उन चीज़ों की एक सूची देते हैं जिन्हें आप खोजना चाहते हैं (जैसे, "सभी कुर्सियों को खोजें")।
  • जादू (The Magic): Boxer केवल अंदाज़ा नहीं लगाता; यह गहराई (depth), आकार और उन कुर्सियों के रोटेशन को समझने के लिए एक विशेष मस्तिष्क (BoxerNet) का उपयोग करता है, जिससे वह एक सपाट ड्राइंग को एक ठोस, मापने योग्य 3D बॉक्स में बदल देता है।
  • आउटपुट (Output): यह आपको कमरे में वस्तुओं के सटीक स्थान के साथ 3D वस्तुओं की एक सूची देता है, जो किसी रोबोट द्वारा उन्हें उठाने या ऑगमेंटेड रियलिटी (AR) गेम में एक आभासी ड्रैगन को उनके ऊपर रखने के लिए तैयार होती है।

यह कैसे काम करता है: तीन-चरणीय नृत्य (Three-Step Dance)

1. "आंखें" (2D डिटेक्शन)
सबसे पहले, Boxer मौजूदा, अत्यंत स्मार्ट AI आंखों (जैसे OWLv2 या DETIC) का उपयोग करके छवि को स्कैन करता है। ये आंखें यह कहने में माहिर हैं कि, "अरे, ऊपर दाईं ओर एक मसाला जार है!" वे एक ऐसे लाइब्रेरियन की तरह हैं जो शेल्फ पर किताब के शीर्षक से उसे तुरंत ढूंढ सकता है। वे पहले से ही पूरे इंटरनेट पर प्रशिक्षित हैं, इसलिए वे लाखों अलग-अलग वस्तुओं के बारे में जानते हैं।

2. "मस्तिष्क" (BoxerNet - द लिफ्टर)
यही असली सफलता का मंत्र है। एक बार जब आँखें जार को देख लेती हैं, तो BoxerNet काम संभाल लेता है। यह पूछता है: "ठीक है, मैं तस्वीर में जार देख रहा हूँ। लेकिन यह कितना बड़ा है? क्या यह 2 इंच दूर है या 2 फीट? क्या यह झुका हुआ है?"

  • ट्रिक: जार को खोजने की कोशिश करने के बजाय (जो कठिन है और जिसके लिए लाखों 3D फोटो की आवश्यकता होती है), BoxerNet केवल उसे लिफ्ट करने के गणित पर ध्यान केंद्रित करता है। यह उन सुरागों का उपयोग करता है जो आँखों द्वारा पाए गए फ्लैट बॉक्स और कैमरा एंगल या वैकल्पिक डेप्थ सेंसर (जैसे LiDAR या डेप्थ कैमरा) से मिलते हैं, ताकि 3D आकार की गणना की जा सके।
  • उपमा: कल्पना कीजिए कि आपके पास एक घर का सपाट कागज़ का कटआउट है। BoxerNet वह इंजीनियर है जो जानता है कि उस कागज़ को सटीक रूप से एक 3D मॉडल में कैसे मोड़ा जाए, यह जानते हुए कि छाया और सूरज के कोण के आधार पर छत कितनी ऊँची होनी चाहिए।

3. "संपादक" (फ्यूजन/Fusion)
यदि आप एक वीडियो लेते हैं, तो कैमरा हिलता है, और AI एक ही वस्तु को अलग-अलग कोणों से देखता है। कभी-कभी इसे लग सकता है कि वस्तु एक ही समय में दो जगहों पर है। Boxer के पास एक अंतिम चरण है जिसे Multi-View Fusion कहा जाता है। यह अलग-अलग गवाहों से सुराग इकट्ठा करने वाले एक जासूस की तरह है। यह कहता है, "ठीक है, फ्रेम 1 कहता है कि रिमोट यहाँ है, फ्रेम 2 कहता है कि वह वहाँ है। आइए उन सुरागों को मिलाएँ ताकि रिमोट का एक सच्चा स्थान मिल सके।" यह डुप्लिकेट्स को हटाता है और कमरे का एक एकल, साफ मानचित्र बनाता है।

यह एक बड़ी बात क्यों है?

1. यह "ओपन-वर्ल्ड" है (कोई "क्लोज्ड सेट" नहीं)
पुराने 3D सिस्टम एक ऐसे रेस्टोरेंट के मेनू की तरह थे जिसमें केवल 10 आइटम थे। यदि आपने "मसाला जार" या "हेयरड्रायर" के बारे में पूछा, तो वे कहेंगे, "मुझे नहीं पता।" वे केवल कुर्सियों, मेजों और कारों को जानते थे।
Boxer अलग है। क्योंकि यह आधुनिक AI से "आंखें" उधार लेता है जिसने पूरे इंटरनेट को देखा है, यह कुछ भी ढूंढ सकता है। यह एक "मसाला जार," "टीवी रिमोट," या यहाँ तक कि "हेयरड्रायर" को भी 3D में लिफ्ट कर सकता है, भले ही इसे उन विशिष्ट वस्तुओं पर विशेष रूप से प्रशिक्षित न किया गया हो।

2. इसे हर चीज़ का 3D मैप बनाने की ज़रूरत नहीं है
एक रोबोट को 3D समझने के लिए प्रशिक्षित करने के लिए विशाल, महंगे डेटासेट की आवश्यकता होती है जहाँ मनुष्यों ने मैन्युअल रूप से प्रत्येक वस्तु को मापा हो। यह एक शहर की हर ईंट को मापने के लिए सर्वेक्षक को काम पर रखने जैसा है।
Boxer चतुर है: यह सस्ते, आसानी से उपलब्ध 2D डेटा (जो इंटरनेट पर हर जगह है) का उपयोग करता है और केवल "लिफ्टिंग" गणित को सीखता है। इसका मतलब है कि इसे हर वस्तु के लिए महंगे 3D सर्वेक्षणों की आवश्यकता के बिना बड़े पैमाने पर प्रशिक्षित किया जा सकता है।

3. यह मजबूत है (यह अव्यवस्थित डेटा को संभालता है)
वास्तविक जीवन अव्यवस्थित होता है। कभी-कभी आपके पास सटीक डेप्थ सेंसर नहीं होता; कभी-कभी आपके पास केवल कुछ बिखरे हुए बिंदु (स्पार्स पॉइंट्स) या धुंधला कैमरा होता है। Boxer को इस तरह डिज़ाइन किया गया है कि यह अधूरे डेटा के साथ भी काम कर सके। यह एक बढ़ई की तरह है जो एक मज़बूत मेज बना सकता है भले ही उसके पास केवल लकड़ी के कुछ तख्ते और एक टेप माप हो, न कि पूरी 3D ब्लूप्रिंट की आवश्यकता हो।

परिणाम

पेपर दिखाता है कि Boxer पिछले तरीकों की तुलना में काफी बेहतर है। परीक्षणों में, यह "एगोसेंट्रिक" (egocentric) दृश्यों (जैसे कि एक व्यक्ति के चलने के दौरान जो देखता है) में 3D स्पेस में वस्तुओं को खोजने और मापने में बहुत अधिक सटीकता के साथ सक्षम था।

संक्षेप में: Boxer, फोटो की सपाट दुनिया और 3D की वास्तविक, भौतिक दुनिया के बीच का सेतु है। यह हमारी 2D छवियों से "क्या" और "कहाँ" लेता है और उसमें "कितना बड़ा" और "कितना दूर" जोड़ देता है, जिससे रोबोट और AR ऐप्स दुनिया के साथ वास्तव में बातचीत करने और उसे समझने में सक्षम होते हैं, चाहे वे कितनी भी अजीब या अद्भुत वस्तु का सामना क्यों न करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →