← नवीनतम पेपर
💻 computer science

Identifying the Unknown: Prompt-Free Open Vocabulary Anomaly Recognition for Robot-Object Interaction

यह शोध पत्र AnomNOVIC को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो विसंगति-आधारित क्षेत्र प्रस्ताव (anomaly-based region proposal) के लिए एक मास्क्ड ऑटोएन्कोडर को एक प्रॉम्प्ट-मुक्त ओपन वोकैबुलरी क्लासिफायर (NOVIC) के साथ जोड़ता है ताकि पूर्व-निर्धारित क्लास सूचियों की आवश्यकता के बिना रोबोट-वस्तु अंतःक्रियाओं में अनदेखी वस्तुओं की अत्याधुनिक वास्तविक समय पहचान प्राप्त की जा सके।

मूल लेखक: Philipp Allgeuer, Jan-Gerrit Habekost, Stefan Wermter

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Philipp Allgeuer, Jan-Gerrit Habekost, Stefan Wermter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि NICOL नाम का एक रोबोट एक मेज के पास बैठा है, जो आपकी मदद करने के लिए तैयार है। लेकिन एक समस्या है: NICOL ने पहले कभी "टोस्टर" (toaster), "कराबिनर" (karabiner), या "जेलो मोल्ड" (jello mold) नहीं देखा है। अधिकांश रोबोट उन छात्रों की तरह होते हैं जो केवल उन उत्तरों को जानते हैं जिन्हें उन्होंने पहले से रटा हुआ है। यदि आप उनसे कुछ ऐसा खोजने के लिए कहते हैं जो उन्हें सिखाया नहीं गया है, तो वे जम जाते हैं या गलत अनुमान लगाने लगते हैं।

यह शोध पत्र AnomNOVIC नामक एक नई प्रणाली पेश करता है जो रोबोट को सोचने का एक अलग तरीका सिखाती है। चीजों की एक सूची याद करने के बजाय, यह सीखता है कि "कुछ नहीं" (nothing) कैसा दिखता है, ताकि जब भी "कुछ" दिखाई दे, तो वह उसे पहचान सके।

यह कैसे काम करता है, इसे दो सरल चरणों में विभाजित किया गया है:

चरण 1: "खाली कैनवास" का जासूस (The "Blank Canvas" Detective)

सबसे पहले, रोबोट यह सीखता है कि उसका कार्यक्षेत्र पूरी तरह से खाली होने पर कैसा दिखता है।

  • उपमा: कल्पना कीजिए कि आपके पास एक खाली डाइनिंग टेबल की फोटो है। आप ठीक से याद कर लेते हैं कि टेबल कहाँ है, लकड़ी का रंग क्या है, और छाया (shadows) कैसी है।
  • चाल: यह सिस्टम एक विशेष AI (जिसे Masked Autoencoder कहा जाता है) का उपयोग करता है जो उस खाली टेबल की छवि को "पुनर्निर्मित" (reconstruct) करने की कोशिश करता है। इसे स्मार्ट बनाने के लिए, शोधकर्ताओं ने इसे प्रशिक्षण के दौरान टेबल पर बेतरतीब ढंग से वस्तुएं चिपकाकर और AI को यह कहकर सिखाया, "इन्हें अनदेखा करो! टेबल को ऐसे फिर से बनाओ जैसे कि वे वहाँ हों ही नहीं।"
  • परिणाम: जब रोबोट बाद में वास्तविक टेबल को देखता है, तो यदि वहाँ कोई कप या खिलौना होता है, तो AI उस खाली टेबल को फिर से बनाने की कोशिश करता है। क्योंकि कप वहाँ मौजूद है, इसलिए AI उस विशिष्ट स्थान को फिर से बनाने में विफल हो जाता है। यह एक "ग्लिच" (glitch) या त्रुटि मानचित्र (error map) बनाता है।
  • आउटपुट: यह ग्लिच एक स्पॉटलाइट की तरह काम करता है। यह नहीं जानता कि वस्तु क्या है, लेकिन यह जानता है कि "जो चीज़ वहां नहीं होनी चाहिए" वह ठीक कहाँ बैठी है। यह अज्ञात वस्तु के चारों ओर एक बॉक्स बनाता है।

चरण 2: "डिक्शनरी मास्टर" (The "Dictionary Master")

अब जब रोबोट को पता है कि वस्तु कहाँ है, तो उसे यह जानने की आवश्यकता है कि वह क्या है।

  • उपमा: कल्पना कीजिए कि आपके पास एक ऐसा जासूस है जो संदिग्धों को खोजने में बहुत बुरा है लेकिन एक विशाल, अनंत शब्दकोश (dictionary) से नाम पढ़ने में जीनियस है।
  • उपकरण: यहीं पर NOVIC काम आता है। यह एक शक्तिशाली क्लासिफायर है जिसे संदिग्धों की पहले से लिखी गई सूची की आवश्यकता नहीं है। यह एक तस्वीर देख सकता है और कह सकता है, "यह एक 'सिल्वर मेडल' या 'बारीक दांतों वाली कंघी' जैसा दिखता है।"
  • प्रक्रिया: "जासूस" (चरण 1) ग्लिच में मिली वस्तु की कटी हुई तस्वीर "डिक्शनरी मास्टर" (चरण 2) को सौंप देता है। इसके बाद NOVIC उस वस्तु को पढ़ता है और उसे एक नाम देता है, भले ही वह कोई अजीब या दुर्लभ वस्तु हो जिसे रोबोट ने पहले कभी नहीं देखा हो।

यह एक बड़ी बात क्यों है?

आज के अधिकांश उन्नत रोबोट विज़न सिस्टम बहुविकल्पीय परीक्षाओं (multiple-choice tests) की तरह हैं। आपको रोबोट को उत्तरों की एक सूची देनी होती है (जैसे, "कप, चम्मच या कांटा खोजो")। यदि रोबोट को एक "स्पैटुला" (spatula) दिखता है, और "स्पैटुला" आपकी सूची में नहीं था, तो रोबोट या तो उसे अनदेखा कर देगा या गलत तरीके से उसे "चम्मच" कह देगा।

AnomNOVIC एक मुक्त-रूप निबंध परीक्षा (free-form essay test) की तरह है।

  • इसे उम्मीदवारों की सूची की आवश्यकता नहीं है।
  • यह खाली कमरे के पैटर्न को तोड़ने वाली किसी भी चीज़ को ढूंढ लेता है।
  • यह अंग्रेजी भाषा के विशाल भंडार से किसी भी चीज़ को पहचान कर उसका नाम बता सकता है।

परिणाम

शोधकर्ताओं ने इसका परीक्षण NICOL रोबोट पर विभिन्न कठिन वस्तुओं के साथ किया, जिसमें ऑडियो एम्पलीफायर और कराबिनर जैसी दुर्लभ वस्तुएं शामिल थीं, और यहाँ तक कि वास्तविक दुनिया की अव्यवस्थपूर्ण रोशनी में भी।

  • स्कोर: जब रोबोट को बिना किसी मदद (नामों की सूची के बिना) के अनुमान लगाना था, तो AnomNOVIC लगभग 82.6% बार सही रहा।
  • प्रतिस्पर्धा: मौजूदा सर्वश्रेष्ठ रोबोट (जैसे YOLOE या OWLv2) इसी "कोई सूची अनुमति नहीं" वाले परिदृश्य में केवल लगभग 14% सही थे।
  • "प्रॉम्प्टेड" टेस्ट: यहाँ तक कि जब शोधकर्ताओं ने रोबोट को चुनने के लिए नामों की एक सूची दी (इसे आसान बनाने के लिए), तब भी AnomNOVIC ने प्रतिस्पर्धा को काफी पीछे छोड़ दिया।

सारांश में

यह शोध पत्र दावा करता है कि एक "ग्लिच डिटेक्टर" (जो यह देखकर अज्ञात वस्तुओं को पहचानता है कि क्या फिट नहीं बैठ रहा है) को एक "डिक्शनरी मास्टर" (जो उन्हें स्वतंत्र रूप से नाम देता है) के साथ जोड़कर, रोबोट अंततः बिना किसी पूर्व-प्रोग्रामित मेनू के खुली दुनिया में काम कर सकते हैं। यह एक रोबोट को यह कहने की अनुमति देता है, "मैं मेज पर एक अजीब चीज़ देख रहा हूँ, और मुझे लगता है कि यह एक 'जेलो मोल्ड' है," बिना यह जाने कि उसे कभी भी जेलो मोल्ड को खोजने के लिए स्पष्ट रूप से नहीं बताया गया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →