← नवीनतम पेपर
🤖 AI

UNCOM: Zero-shot Context-Aware Command Understanding for Tabletop Scenarios

यह शोध पत्र UNCOM को प्रस्तुत करता है, जो एक नवीन ज़ीरो-शॉट हाइब्रिड फ्रेमवर्क है जो विविध घरेलू वातावरणों में टेबलटॉप रोबोटों के लिए बिना किसी कार्य-विशिष्ट प्रशिक्षण के सुदृढ़, व्याख्या योग्य कमांड समझ को सक्षम करने के लिए स्पीच, जेस्चर और सीन कॉन्टेक्स्ट को एकीकृत करता है।

मूल लेखक: Antonio Galiza Cerdeira Gonzalez, Paweł Gajewski, Bipin Indurkhya

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Antonio Galiza Cerdeira Gonzalez, Paweł Gajewski, Bipin Indurkhya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपनी रसोई में मदद करने के लिए सिखाने की कोशिश कर रहे हैं। अतीत में, आपको शायद रोबोट को वस्तुओं की एक विशिष्ट सूची (जैसे "कप," "चम्मच," या "सेब") के साथ प्रोग्राम करना पड़ता और उसे ठीक से बताना पड़ता कि उसे कैसे हिलना-डुलना है। यदि आप उससे एक "अजीब आकार के कटोरे" को हिलाने के लिए कहते जो उसने पहले कभी नहीं देखा था, तो वह भ्रमित हो जाता और काम करना बंद कर देता।

यह शोध पत्र UNCOM को पेश करता है, जो मानव निर्देशों को समझने का एक नया तरीका है जो एक मददगार दोस्त से बात करने जैसा महसूस होता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ तोड़कर समझाया गया है:

"सुपर-हेल्पर" टीम

एक विशाल, कठोर मस्तिष्क के बजाय जो सब कुछ एक साथ करने की कोशिश करता है, UNCOM एक विशेषज्ञों की टीम की तरह काम करता है जो मिलकर काम करते हैं। इसे एक छोटी रसोई टीम के रूप में सोचें जहाँ हर किसी के पास एक विशिष्ट कार्य है:

  1. कान (Whisper): इस टीम के सदस्य आपकी बात सुनते हैं और आपकी आवाज़ को टेक्स्ट (पाठ) में बदल देते हैं। यह एक बहुत ही तेज़, सटीक स्टेनोग्राफर की तरह है।
  2. अनुवादक (Phi-4): यह व्यक्ति टेक्स्ट को पढ़ता है और इसके अर्थ को समझता है। वे आपके वाक्य को तीन भागों में तोड़ते हैं: क्या वस्तु? क्या क्रिया? कहाँ जाना है? (जैसे, "[केले] को [उठाओ], [इसे] [पैन में] [रखो]")।
  3. आँखें (GroundingDINO और DINOv2): ये विजुअल विशेषज्ञ हैं। वे मेज को देखते हैं और लगभग किसी भी चीज़ को पहचान सकते हैं, भले ही उन्होंने उस विशिष्ट वस्तु को पहले कभी न देखा हो। उन्हें वस्तुओं की पूर्व-लिखित सूची की आवश्यकता नहीं होती; वे बस "जानते" हैं कि चीजें कैसी दिखती हैं।
  4. पॉइंटिंग डिटेक्टर (MediaPipe): यह एकमात्र टीम सदस्य है जिसे विशिष्ट प्रशिक्षण की आवश्यकता है। यह आपके हाथों पर नज़र रखता है ताकि यह देख सके कि क्या आप स्पष्ट करने के लिए किसी चीज़ की ओर इशारा कर रहे हैं।
  5. कटर (Segment Anything): एक बार जब टीम किसी वस्तु को पकड़ने पर सहमत हो जाती है, तो यह सदस्य उस वस्तु के चारों ओर एक सटीक रूपरेखा (आउटलाइन) बनाता है ताकि रोबोट को पता चल सके कि उसके किनारे कहाँ हैं।

"ज़ीरो-शॉट" जादू

शोध पत्र इस बात पर जोर देता है कि UNCOM "ज़ीरो-शॉट" है। रोज़मर्रा की भाषा में, इसका मतलब है कि रोबोट को आपकी विशिष्ट रसोई या आपके विशिष्ट केले के बारे में सीखने के लिए "स्कूल" जाने की आवश्यकता नहीं है।

  • पुराना तरीका: आपको रोबोट को केला समझने के लिए 1,000 केले की तस्वीरें दिखानी पड़ती थीं।
  • UNCOM का तरीका: रोबोट दुनिया के बारे में अपने "मौलिक मॉडल्स" (सामान्य ज्ञान) का उपयोग करके "केला" को तुरंत समझ लेता है, भले ही उसने आपका केला पहले कभी न देखा हो। यह "आउट ऑफ द बॉक्स" काम करता है।

यह भ्रम को कैसे संभालता है

इंसान संचार करने में थोड़े अव्यवस्थित होते हैं। हम "इस चीज़ को यहाँ रख दो" कहते हैं जबकि हम अस्पष्ट रूप से इशारा कर रहे होते हैं।

  • अनिश्चितता का समाधान: यदि आप कहते हैं "इसे उस पर रख दो," तो रोबोट आपके हाथ को देखता है। यदि आप किसी विशिष्ट प्लेट की ओर इशारा कर रहे हैं, तो वह प्लेट को पकड़ लेता है। यदि आप मेज पर खाली जगह की ओर इशारा कर रहे हैं, तो वह समझ जाता है कि वह खाली जगह ही लक्ष्य है।
  • मैप मेकर: खाली स्थानों को खोजने के लिए, रोबोट मेज का एक मानसिक मानचित्र (मानसिक मैप) बनाता है (जिसे वोरोनोई आरेख कहा जाता है, जो पिज्जा को स्लाइस में विभाजित करने जैसा है ताकि पता चल सके कि केंद्र के सबसे करीब कौन है)। वह खाली स्लाइस को ढूंढता है और कहता है, "आह, आप चाहते हैं कि मैं इसे वहाँ रख दूँ।"

परिणाम

शोधकर्ताओं ने इस प्रणाली का परीक्षण TIAGo नामक एक रोबोट पर किया (जो पहियों पर एक मानव धड़ जैसा दिखता है) एक टेबलटॉप सेटिंग में।

  • उन्होंने इसे प्लेटों को रखने, फल हटाने या अनाज डालने जैसे 159 अलग-अलग कमांड दिए।
  • सिस्टम ने 82.39% समय सही क्रिया को सफलतापूर्वक समझा और निष्पादित किया।

जहाँ यह लड़खड़ाता है

शोध पत्र इस बारे में ईमानदार है कि सिस्टम कहाँ अटक जाता है, बिल्कुल वैसे ही जैसे एक इंसान भी हो सकता है:

  • धुंधले हाथ: यदि आप इशारा करते समय अपने हाथ को बहुत तेज़ी से हिलाते हैं, तो "पॉइंटिंग डिटेक्टर" भ्रमित हो जाता है और इशारे को मिस कर देता है।
  • लहजे (Accent) की समस्याएँ: यदि बोलने वाले का लहजा बहुत भारी है, तो "कान" (स्पीच रिकग्निशन) शब्द "bowl" (कटोरा) को "ball" (गेंद) समझ सकता है, जिससे एक मज़ेदार गलती हो सकती है।
  • जटिल आकार: हालांकि यह केंद्र ढूंढकर साधारण वस्तुओं को पकड़ सकता है, लेकिन यह बहुत अजीब और जटिल आकारों के साथ संघर्ष करता है।

निचोड़

UNCOM मानव प्राकृतिक भाषा और रोबोटिक क्रियाओं के बीच एक सेतु (पुल) है। यह एक "ब्लैक बॉक्स" बनने की कोशिश नहीं करता जो केवल अंदाज़ा लगाता है कि क्या करना है; इसके बजाय, यह कमांड को स्पष्ट, व्याख्या योग्य चरणों (वस्तु + क्रिया + लक्ष्य) में तोड़ता है। यह इसे पारदर्शी बनाता है और यदि कुछ गलत हो जाए तो इसे ठीक करना आसान बनाता है। शोधकर्ताओं ने अपना कोड और डेटा सार्वजनिक किया है ताकि अन्य लोग इस "विशेषज्ञों की टीम" के दृष्टिकोण पर निर्माण कर सकें और ऐसे रोबोट बना सकें जो वास्तव में हमारे घरों में हमारी मदद कर सकें, बिना सेटअप के लिए पीएचडी स्तर की प्रोग्रामिंग की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →