← नवीनतम पेपर
💻 computer science

LEGS-POMDP: Language and Gesture-Guided Object Search in Partially Observable Environments

यह शोध पत्र LEGS-POMDP को प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो रोबोटिक ओपन-वर्ल्ड सर्च के लिए वस्तु की पहचान और स्थान की अनिश्चितता को प्रभावी ढंग से संभालने हेतु एक पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेस (Partially Observable Markov Decision Process) के भीतर भाषा, जेस्चर और विजुअल अवलोकनों को एकीकृत करता है।

मूल लेखक: Ivy Xiao He, Stefanie Tellex, Jason Xinyu Liu

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ivy Xiao He, Stefanie Tellex, Jason Xinyu Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, धुंधले गोदाम में हैं जो सैकड़ों एक जैसे दिखने वाले बक्सों से भरा हुआ है। आपका दोस्त, काफी दूर खड़ा होकर, चिल्लाता है, "मुझे लाल वाला दे दो!" और आपकी दिशा में अस्पष्ट रूप से इशारा करता है।

यहाँ समस्या है:

  1. धुंध: आप सब कुछ स्पष्ट रूप से नहीं देख सकते (आंशिक दृश्यता/Partial Observability)।
  2. अस्पष्ट आवाज़: "लाल वाला" उन 50 लाल बक्सों में से कोई भी हो सकता है।
  3. लड़खड़ाता इशारा: आपके दोस्त का हाथ हिल रहा है, या शायद वह उस लाल बॉक्स की ओर इशारा कर रहा है जो वह लाल बॉक्स नहीं है जिसे वह चाहता है।

यदि आप केवल अनुमान लगाते हैं, तो आप गलत चीज़ उठा सकते हैं। यदि आप केवल स्पष्टीकरण मांगते हैं, तो इसमें बहुत समय लगता है। आपको आवाज़, हाथ के इशारे और अपनी आँखों को मिलाने का एक तरीका चाहिए ताकि आप यह पता लगा सकें कि ठीक कौन सा बॉक्स उठाना है, भले ही आप 100% निश्चित न हों।

यह बिल्कुल LEGS-POMDP पेपर के बारे में है। यह रोबोटों के लिए एक नया "दिमाग" है जो उन्हें मानव भाषा को सुनते हुए और मानव इशारों को देखते हुए एक साथ, अव्यवस्थित और अनिश्चित दुनिया में वस्तुओं को खोजने में मदद करता है।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. रोबोट की "अंतरात्मा की भावना" (The POMDP)

आज के अधिकांश रोबोट उन छात्रों की तरह हैं जो उत्तर रट लेते हैं। यदि वे एक विशिष्ट पैटर्न देखते हैं, तो वे एक विशिष्ट कार्य करते हैं। लेकिन एक अव्यवस्थित दुनिया में, पैटर्न बदलते रहते हैं।

LEGS-POMDP रोबोट एक जासूस की तरह है। तुरंत उत्तर जानने के बजाय, यह एक "विश्वास मानचित्र" (belief map) बनाए रखता है।

  • कल्पना कीजिए कि गोदाम का एक नक्शा है जहाँ हर बॉक्स पर एक छोटा प्रतिशत लिखा है (जैसे, "बॉक्स A: इस बात की 10% संभावना है कि यह वही है," "बॉक्स B: 80% संभावना")।
  • इसे POMDP (पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेस) कहा जाता है। यह यह कहने का एक गणितीय तरीका है कि, "मैं पक्के तौर पर नहीं जानता, लेकिन जो मैंने देखा है उसके आधार पर मेरा सबसे अच्छा अनुमान यह है।"

2. तीन सुराग (Multimodal Fusion)

रोबोट को तीन स्रोतों से सुराग मिलते हैं, और यह उन्हें एक पहेली के टुकड़ों की तरह मानता है:

  • आवाज़ (भाषा): इंसान कहता है, "नीली पट्टी वाला कप।"
  • हाथ (इशारा): इंसान एक कोने की ओर इशारा करता है।
  • आँखें (दृष्टि): रोबोट कई वस्तुओं को देखता है।

जादुई ट्रिक:
पुराने रोबोट शायद केवल आवाज़ या केवल हाथ का उपयोग करने की कोशिश करेंगे। यदि आवाज़ अस्पष्ट है ("कप") और हाथ हिल रहा है, तो रोबोट भ्रमित हो जाता है।
LEGS-POMDP इन्हें जोड़ता है। यह एक कमरे में तीन विशेषज्ञों की एक टीम होने जैसा है:

  • आवाज़ विशेषज्ञ कहता है, "मुझे लगता है कि यह नीली पट्टी वाला कप है, लेकिन मैं केवल 60% निश्चित हूँ।"
  • हाथ विशेषज्ञ कहता है, "मैं बाईं ओर इशारा कर रहा हूँ, लेकिन मेरा हाथ हिल रहा है, इसलिए यह इस शंकु (cone) आकार में कहीं भी हो सकता है। मैं 70% निश्चित हूँ कि यह उस शंकु के भीतर है।"
  • आँख विशेषज्ञ कहता है, "मैं उस शंकु के भीतर एक नीली पट्टी वाला कप देख रहा हूँ।"

रोबोट इन संभावनाओं को आपस में गुणा करता है। अचानक, "बाएं शंकु में नीला पट्टी वाला कप" 10% के अनुमान से बढ़कर 90% की निश्चितता में बदल जाता है। इसे मल्टीमॉडल फ्यूजन कहा जाता है।

3. "पंख" और "शंकु" (The Fan and the Cone)

यह पेपर मानवीय अनिश्चितता को मॉडल करने के दो चतुर तरीके पेश करता है:

  • विज़न फैन (Vision Fan): रोबोट जानता है कि उसका कैमरा एक टॉर्च की तरह है। वह केंद्र में चीजों को स्पष्ट रूप से देखता है लेकिन किनारों और दूर जाने पर धुंधला हो जाता है। यह एक "पंख" (fan) आकार के रूप में मॉडल किया जाता है जहाँ बीच का हिस्सा उज्ज्वल (उच्च विश्वास) है और किनारे मंद (कम विश्वास) हैं।
  • जेस्चर कोन (Gesture Cone): जब कोई इंसान इशारा करता है, तो वे लेजर जैसी सटीकता से इशारा नहीं करते। वे अपने पूरे हाथ, आँखों और कंधे का उपयोग करते हैं। रोबोट इसे इंसान की कलाई से निकलने वाले एक शंकु (जैसे आइसक्रीम कोन) के रूप में मॉडल करता है। शंकु का सिरा सबसे संभावित स्थान है, लेकिन चौड़ा खुला हिस्सा यह स्वीकार करता है कि इंसान थोड़ा गलत हो सकता है।

4. निर्णय लेने वाला (The Solver)

एक बार जब रोबोट इन नए सुरागों के साथ अपने "विश्वास मानचित्र" को अपडेट कर लेता है, तो उसे निर्णय लेना होता है कि आगे क्या करना है। क्या उसे आगे बढ़ना चाहिए? क्या उसे करीब से देखना चाहिए? क्या उसे वस्तु उठानी चाहिए?

पेपर एक स्मार्ट एल्गोरिदम का उपयोग करता है जिसे PO-UCT कहा जाता है। इसे एक सुपर-फास्ट सिम्युलेटर समझें।

  • वास्तव में चलने से पहले, यह अपने दिमाग में एक सेकंड के भीतर हजारों "क्या होगा अगर" वाले परिदृश्य चलाता है।
  • परिदृश्य A: "यदि मैं बाईं ओर चलता हूँ, तो मुझे लक्ष्य मिल सकता है।"
  • परिदृश्य B: "यदि मैं करीब से देखता हूँ, तो मैं नीली पट्टी की पुष्टि कर सकता हूँ।"
  • यह उस पथ को चुनता है जो कम ऊर्जा बर्बाद किए बिना सफलता की उच्चतम संभावना देता है।

5. परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने इसे एक वास्तविक रोबोट (एक चार पैरों वाला कुत्ता जैसा रोबोट जिसे "स्पॉट" कहा जाता है) और सिमुलेशन पर परखा।

  • परिणाम: जब रोबोट ने आवाज़ और इशारों दोनों का उपयोग किया, तो उसने 89% बार वस्तु को ढूँढ लिया।
  • तुलना: यदि इसने केवल आवाज़ का उपयोग किया, या केवल इशारों का उपयोग किया, तो यह बहुत अधिक बार विफल हुआ।
  • "गलत" सुराग: यहाँ तक कि जब इंसान ने गलत जानकारी दी (जैसे, लाल कप की ओर इशारा करते हुए "नीला कप" कहना), रोबोट का गणित इतना स्मार्ट था कि वह पहचान सका कि सुराग आपस में टकरा रहे हैं और वह केवल गलत चीज़ का आँख मूंदकर पीछा नहीं करता। वह शांत रहा और खोज जारी रखी।

बड़ी तस्वीर

अतीत में, रोबोट तोते की तरह थे: वे जो उन्हें बताया जाता था उसे दोहराते थे या सख्त नियमों का पालन करते थे। यदि नियम अव्यवस्थित वास्तविक दुनिया में फिट नहीं बैठते थे, तो वे क्रैश हो जाते थे।

LEGS-POMDP रोबोट को एक मानवीय साथी की तरह बनाता है। यह समझता है कि इंसान अव्यवस्थित होते हैं, भाषा अस्पष्ट होती है, और इशारे सटीक नहीं होते। इन अपूर्ण सुरागों को गणितीय रूप से जोड़कर, यह एक अराजक दुनिया में नेविगेट कर सकता है, यह पता लगा सकता है कि आप वास्तव में क्या चाहते हैं, और बिना किसी पूर्ण निर्देश पुस्तिका की आवश्यकता के इसे आपके लिए ला सकता है।

यह उस रोबोट के बीच का अंतर है जो कहता है, "मुझे समझ नहीं आया, कृपया दोहराएं," और उस रोबोट के बीच है जो कहता है, "आपने बाईं ओर इशारा किया और 'लाल कप' कहा, इसलिए मुझे पूरा यकीन है कि आप उस लाल कप की बात कर रहे हैं जो वहाँ है। चलिए मैं इसे लेकर आता हूँ।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →