← नवीनतम पेपर
🤖 machine learning

Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities

मूल लेखक: Hassan Ismkhan, Hamid Bouchahcia

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hassan Ismkhan, Hamid Bouchahcia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखा रहे हैं। आमतौर पर, आप उसे सब्जियों को काटने वाले शेफ का एक वीडियो (विजुअल डेटा) दिखाते हैं और उसे एक मौखिक रेसिपी (लैंग्वेज डेटा) देते हैं। रोबोट शेफ को देखकर और सुनकर सीखता है, और फिर उसके मूव्स की नकल करने की कोशिश करता है।

लेकिन क्या होता है अगर काम के बीच में ही कैमरा टूट जाए, या माइक्रोफ़ोन बंद हो जाए? वास्तविक दुनिया में, सेंसर विफल हो जाते हैं, वस्तुओं द्वारा ब्लॉक कर दिए जाते हैं, या बस सिग्नल भेजना बंद कर देते हैं। वर्तमान रोबोट लर्निंग के अधिकांश तरीके इस स्थिति में घबरा जाते हैं; वे यह मान लेते हैं कि कैमरा और माइक्रोफ़ोन हमेशा पूरी तरह से काम करेंगे। यदि एक भी विफल होता है, तो रोबोट अक्सर रुक जाता है या गलती कर देता है।

यह पेपर एक नई विधि पेश करता है जिसे RL4IL कहा जाता है, जो रोबोट के लिए एक सुपर-स्मार्ट लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह काम करता है। यह रोबोट को तब भी पूरी तरह से काम करने की अनुमति देता है जब कैमरा या सेंसर बंद हो जाए, और इसके लिए उसे दोबारा ट्रेनिंग देने या नए सबक सिखाने की आवश्यकता नहीं होती है।

यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. "स्मार्ट लाइब्रेरियन" (रीइन्फोर्समेंट लर्निंग)

आमतौर पर, जब रोबोट को यह समझने की ज़रूरत होती है कि क्या करना है, तो वह अपने पिछले प्रदर्शनों (विशेषज्ञों द्वारा किए गए कार्यों के वीडियो) के पुस्तकालय को देखता है और उस चीज़ को चुनता है जो अभी वह देख रहा है उससे सबसे अधिक मिलती-जुलती हो। यह एक छात्र की तरह है जो चित्रों को देखकर अपनी पाठ्यपुस्तक का सही पृष्ठ खोजने की कोशिश कर रहा है।

समस्या यह है कि, यदि चित्र गायब है (क्योंकि कैमरा टूट गया है), तो छात्र गलत पृष्ठ चुन सकता है।

RL4IL इस साधारण "झलक" को एक स्मार्ट लाइब्रेरियन से बदल देता है। यह लाइब्रेरियन एक रीइन्फोर्समेंट लर्निंग एजेंट (एक प्रकार का AI जो परीक्षण और त्रुटि से सीखता है) है। केवल "निकटतम" मिलान चुनने के बजाय, लाइब्रेरियन लाइब्रेरी में मौजूद शीर्ष उम्मीदवारों को इस आधार पर रैंक करना सीखता है कि वे वर्तमान स्थिति के लिए कितने उपयोगी हैं। यह एक ऐसे लाइब्रेरियन की तरह है जो न केवल सबसे मिलते-जुलते कवर वाली किताब ढूंढता है, बल्कि वह किताब ढूंढता है जिसमें वास्तव में आपकी विशिष्ट समस्या के लिए सही निर्देश हों, भले ही कवर क्षतिग्रस्त हो।

2. "ग्रुप चैट" (सॉफ्ट फ्यूजन)

पुराने तरीके अक्सर लाइब्रेरी से केवल एक सबसे अच्छा मिलान चुनते हैं और कहते हैं, "ठीक है, हम इस विशिष्ट वीडियो की नकल कर रहे हैं।" यदि वह एक वीडियो थोड़ा शोर वाला या अपूर्ण है, तो रोबक विफल हो जाता है।

RL4IL एक सॉफ्ट फ्यूजन दृष्टिकोण का उपयोग करता है। कल्पना कीजिए कि केवल एक विशेषज्ञ को सुनने के बजाय, रोबोट सलाह के लिए शीर्ष 5 या 10 सबसे प्रासंगिक विशेषज्ञों से पूछता है। वह केवल एक को नहीं चुनता; वह उन सभी की सलाह सुनता है और उनकी सलाह को आपस में मिला देता है, और उन विशेषज्ञों को अधिक महत्व देता जो सबसे अधिक आत्मविश्वासी दिखते हैं। यह एक "ग्रुप चैट" की तरह है जहाँ रोबोट शोर (noise) को औसत निकाल देता है। यदि एक विशेषज्ञ थोड़ा गलत है, तो अन्य उसे सुधार लेते हैं, जिससे परिणाम बहुत अधिक सुचारू और विश्वसनीय होता है।

3. "मैजिक फिल-इन" (मिसिंग मोडैलिटी इम्प्यूटेशन)

यह इस पेपर की सबसे बड़ी चाल है। क्या होगा यदि कैमरा पूरी तरह से बंद हो गया है? रोबोट के पास कोई विजुअल डेटा नहीं है।

हार मानने के बजाय, RL4IL में एक मैजिक फिल-इन तंत्र है।

  1. डिटेक्टिव (जासूस): एक विशेष AI डिटेक्टिव उन अन्य चीजों को देखता है जो रोबोट के पास उपलब्ध हैं (जैसे भाषा निर्देश या हाथ का कैमरा) और कहता है, "इन सुरागों के आधार पर, लाइब्रेरी में किस विशेषज्ञ की स्थिति इससे मिलती-जुलती थी?"
  2. रिकंस्ट्रक्शन (पुनर्निर्माण): एक बार जब यह उन विशेषज्ञों को ढूंढ लेता है, तो यह केवल उनके वीडियो की नकल नहीं करता है। यह एक "क्रॉस-अटेंशन" तंत्र का उपयोग करता है ताकि उन विशेषज्ञों के लुप्त हिस्सों को देख सके और गणितीय रूप से पुनर्निर्मित कर सके कि टूटा हुआ कैमरा क्या देखता
  3. परिणाम: यह गायब कैमरा फीड का एक नकली, लेकिन अत्यधिक सटीक संस्करण बनाता है। रोबोट फिर उस पुनर्निर्मित फीड का उपयोग सही एक्शन खोजने के लिए करता है, ठीक वैसे ही जैसे कि कैमरा कभी टूटा ही न हो।

यह एक बड़ी बात क्यों है?

  • कोई रीट्रेनिंग नहीं: अधिकांश तरीकों के लिए आपको हर बार रोबोट को नए सिरे से प्रशिक्षित करने की आवश्यकता होती है जब आप चाहते हैं कि वह टूटे हुए सेंसर को संभाल सके। RL4IL "जीरो-शॉट" है। आप इसे एक बार प्रशिक्षित करते हैं, और यदि कल कैमरा टूट जाता है, तो यह बिना किसी नए सबक के तुरंत इसे संभाल लेता है।
  • बाकियों से बेहतर: लेखकों ने तीन अलग-अलग प्रकार के रोबोट कार्यों (वस्तुओं को हिलाना, लक्ष्यों का पालन करना और स्थानिक तर्क) पर इसका परीक्षण किया। जब उन्होंने कैमरों के विफल होने का अनुकरण किया, तो उनकी विधि (RL4IL) लगभग 70% से 73% बार सफल रही। अगली सबसे अच्छी विधि केवल लगभग 29% बार सफल हुई।
  • मजबूती (Robustness): यह तब भी काम करता है जब रोबोट एक अराजक वातावरण में होता है जहाँ सेंसर ब्लॉक हो सकते हैं या पूरी तरह से विफल हो सकते हैं।

सारांश

सोचिए कि RL4IL एक ऐसा रोबोट है जो केवल स्क्रिप्ट को रटता नहीं है। इसके पास सबसे अच्छी मदद खोजने के लिए एक स्मार्ट लाइब्रेरियन है, कई विशेषज्ञों से सलाह लेने के लिए एक ग्रुप चैट है, और यह अनुमान लगाने के लिए एक मैजिक फिल-इन टूल है कि टूटा हुआ कैमरा क्या देखता। यह रोबोट को वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित स्थितियों में भी सुचारू रूप से काम करने की अनुमति देता है जहाँ सेंसर अक्सर विफल हो जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →