← नवीनतम पेपर
💻 computer science

WildDet3D: Scaling Promptable 3D Detection in the Wild

यह शोध पत्र WildDet3D को प्रस्तुत करता है, जो विविध प्रॉम्प्ट मोडैलिटीज़ और सहायक डेप्थ संकेतों को संभालने में सक्षम एक एकीकृत ज्यामिति-जागरूक (geometry-aware) आर्किटेक्चर है, साथ ही WildDet3D-Data का निर्माण करता है, जो अब तक का सबसे बड़ा ओपन 3D डिटेक्शन डेटासेट है, जो मिलकर ओपन-वर्ल्ड मोनोकुलर 3D ऑब्जेक्ट डिटेक्शन में नया स्टेट-ऑफ-द-आर्ट प्रदर्शन स्थापित करता है।

मूल लेखक: Weikai Huang, Jieyu Zhang, Sijun Li, Taoyang Jia, Jiafei Duan, Yunqian Cheng, Jaemin Cho, Mattew Wallingford, Rustin Soraki, Chris Dongjoo Kim, Donovan Clay, Taira Anderson, Winson Han, Ali Farhadi, B
प्रकाशित 2026-04-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weikai Huang, Jieyu Zhang, Sijun Li, Taoyang Jia, Jiafei Duan, Yunqian Cheng, Jaemin Cho, Mattew Wallingford, Rustin Soraki, Chris Dongjoo Kim, Donovan Clay, Taira Anderson, Winson Han, Ali Farhadi, Bharath Hariharan, Zhongzheng Ren, Ranjay Krishna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिखरे हुए लिविंग रूम की तस्वीर देख रहे हैं। आप एक कॉफी टेबल, एक बिल्ली और एक लैंप देख सकते हैं। एक सामान्य कंप्यूटर प्रोग्राम आपको बता सकता है, "यह एक बिल्ली है" और "यह एक लैंप है।" लेकिन उसे वास्तव में यह नहीं पता होता कि बिल्ली कितनी दूर है, मेज वास्तव में कितनी बड़ी है, या लैंप किस दिशा में है। वह एक 3D दुनिया को नहीं, बल्कि एक सपाट तस्वीर को देखता है।

WildDet3D एक नया AI सिस्टम है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यह कंप्यूटर को "स्पेशियल विजन" (स्थानिक दृष्टि) देने जैसा है ताकि वह दुनिया को 3D में समझ सके, ठीक वैसे ही जैसे हम और आप समझते हैं, लेकिन इसके पास हजारों अलग-अलग वस्तुओं को तुरंत समझने की सुपरपावर है।

यहाँ इसका एक सरल विवरण दिया गया है कि यह कैसे काम करता है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "फ्लैट वर्ल्ड" का जाल

अधिकांश वर्तमान AI डिटेक्टर ऐसे लोगों की तरह हैं जो आंखों पर पट्टी बांधे हुए हैं। वे दुनिया को केवल एक विशिष्ट तरीके से देख सकते हैं:

  • टेक्स्ट-ओनली डिटेक्टिव (केवल टेक्स्ट वाला जासूस): यह केवल तभी चीजें ढूंढ सकता है जब आप पूछें, "कुत्ता कहाँ है?"
  • बॉक्स-ओनली डिटेक्टिव (केवल बॉक्स वाला जासूस): यह केवल तभी चीजें ढूंढ सकता है जब आप पहले उनके चारों ओर एक वर्ग (square) बना दें।
  • 2D-ओनली डिटेक्टिव (केवल 2D वाला जासूस): यह आपको बता सकता है कि कोई चीज़ क्या है, लेकिन यह नहीं कि वह 3D स्पेस में कहाँ है (कितनी गहरी, कितनी बड़ी, या वह किस ओर मुड़ी हुई है)।

असली जीवन बिखरा हुआ है। कभी-कभी आप एक रोबोट से कहना चाहते हैं, "लाल मग उठाओ।" कभी-कभी आप स्क्रीन पर किसी चीज़ की ओर इशारा करने के लिए टैप करना चाहते हैं। कभी-कभी आपके पास डेप्थ सेंसर (जैसे iPhone में) होता है, और कभी-कभी नहीं। मौजूदा AI सिस्टम आमतौर पर विफल हो जाते हैं यदि आप नियम बदल देते हैं।

2. समाधान: "स्विस आर्मी नाइफ" AI

शोधकर्ताओं ने WildDet3D बनाया है, जो 3D विजन के लिए एक स्विस आर्मी नाइफ की तरह है। इसे इस बात की परवाह नहीं है कि आप इसे कैसे देखने के लिए कहते हैं; यह खुद को ढाल लेता है।

  • इससे बात करें: आप कह सकते हैं, "कुर्सी ढूंढो।"
  • इसकी ओर इशारा करें: आप स्क्रीन पर एक जगह टैप कर सकते हैं, और यह उस वस्तु को ढूंढ लेता है।
  • इसे बॉक्स करें: आप इसके चारों ओर एक वर्ग बना सकते हैं, और यह उस वर्ग को 3D स्पेस में उठा लेता है।

यह पहला सिस्टम है जो एक साथ ये तीनों चीजें कर सकता है, जो इसे रोबोट, ऑगमेंटेड रियलिटी (AR) चश्मे और मोबाइल ऐप्स के लिए एकदम सही बनाता है।

3. सीक्रेट सॉस: "ऑप्शनल चश्मा"

इसका एक सबसे शानदार फीचर यह है कि यह डेप्थ (चीजें कितनी दूर हैं) को कैसे संभालता है।

  • डेप्थ के बिना: यह एक पेंटिंग को देखने जैसा है। इसे अनुभव के आधार पर अनुमान लगाना पड़ता है कि चीजें कितनी दूर हैं।
  • डेप्थ के साथ: यह 3D चश्मा पहनने जैसा है। यदि कैमरा एक डेप्थ मैप प्रदान करता है (जैसे फोन पर LiDAR सेंसर), तो WildDet3D सटीक माप प्राप्त करने के लिए इसका उपयोग करता है।

सबसे बड़ी बात क्या है? यदि आपके पास वे 3D चश्मे नहीं हैं, तो AI क्रैश नहीं होता या काम करना बंद नहीं करता। यह बस "अनुमान लगाने वाले मोड" में स्विच हो जाता है और फिर भी काम करता है, हालांकि उतना सटीक नहीं। यह बहुत ही सहजता से अपनी क्षमता कम कर लेता है (degrade gracefully), जैसे एक कार जो हाईवे और कच्ची सड़कों दोनों पर चल सकती है।

4. ट्रेनिंग डेटा: "विशाल लाइब्रेरी"

एक AI को 3D वस्तुओं को पहचानना सिखाने के लिए, आपको लाखों उदाहरणों की आवश्यकता होती है। लेकिन 3D डेटा को लेबल करना कठिन और महंगा है—यह एक शहर की हर ईंट को मापने के लिए स्केल का उपयोग करने जैसा है।

टीम ने WildDet3D-Data बनाया, जो 13,500 अलग-अलग श्रेणियों (जैसे "टोस्टर" से लेकर "जंगली भालू" तक) को कवर करने वाली 10 लाख से अधिक छवियों की एक विशाल नई लाइब्रेरी है।

  • उन्होंने यह कैसे किया: उन्होंने केवल इंसानों को सब कुछ मापने के लिए नहीं रखा। उन्होंने एक "विशेषज्ञों की टीम" वाला दृष्टिकोण अपनाया। उन्होंने पांच अलग-अलग AI मॉडल को 2D तस्वीरों में वस्तुओं के 3D आकार का अनुमान लगाने की कोशिश करने दी। फिर, उन्होंने खराब अनुमानों को छानने के लिए एक बहुत ही स्मार्ट AI (एक विजन-लैंग्वेज मॉडल) का उपयोग किया। अंत में, मानव श्रमिकों ने यह सुनिश्चित करने के लिए सबसे अच्छे उम्मीदवारों की जांच की कि वे एकदम सही हों।
  • परिणाम: एक ऐसा डेटासेट जो पिछले डेटासेट्स की तुलना में 138 गुना बड़ा है, और लगभग हर उस वस्तु को कवर करता है जिसकी आप वास्तविक दुनिया में कल्पना कर सकते हैं।

5. यह क्या कर सकता है? (रियल-वर्ल्ड मैजिक)

पेपर कुछ मजेदार डेमो दिखाता है:

  • आपके iPhone पर: आप एक ऐप खोल सकते हैं, अपने कैमरे को अपने ऑफिस की ओर मोड़ सकते हैं, और पूछ सकते हैं, "स्टेपलर कहाँ है?" ऐप आपकी स्क्रीन पर उसके चारों ओर एक 3D बॉक्स बना देता है।
  • ऑगमेंटेड रियलिटी (AR) में: Meta Quest चश्मा पहनें, एक बिखरी हुई डेस्क को देखें, और AI हर चीज़ के चारों ओर 3D बॉक्स बना देता है, जिससे आपको कमरे के "वॉल्यूम" (आयतन) को देखने में मदद मिलती है।
  • रोबोट के लिए: एक रोबोटिक हाथ को कहा जा सकता है, "हरे रंग के चिप्स उठाओ," और WildDet3D रोबोट को बताता है कि चिप्स 3D स्पेस में वास्तव में कहाँ हैं ताकि वह उन्हें बिना गिराए उठा सके।
  • "दिमाग" का कॉम्बो: उन्होंने इसे एक स्मार्ट लैंग्वेज AI के साथ जोड़ा। आप पूछ सकते हैं, "इस कमरे में सबसे महंगी चीज़ क्या है?" लैंग्वेज AI यह पता लगा लेगा कि वह लैपटॉप है, और WildDet3D तुरंत उसके चारों ओर एक 3D बॉक्स बना देगा।

निष्कर्ष

WildDet3D एक बड़ी छलांग है। यह आधुनिक चैटबॉट्स (जो टेक्स्ट समझते हैं) की लचीलेपन को मानवीय स्थानिक जागरूकता (spatial awareness) के साथ जोड़ता है। यह एक सामान्य-उद्देश्य वाला टूल है जिसे रोबोट, फोन और चश्मों में लगाया जा सकता है ताकि वे केवल तस्वीरों को ही नहीं, बल्कि भौतिक दुनिया को भी समझ सकें।

इसे कंप्यूटर को यह सिखाने के रूप में सोचें कि वे दुनिया को एक सपाट मूवी स्क्रीन के रूप में देखना बंद करें और इसे एक वास्तविक, तीन-आयामी स्थान के रूप में देखना शुरू करें जिसके साथ वे बातचीत कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →