LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation
यह शोध पत्र LH-AVLN पेश करता है, जो लॉन्ग-होरिज़ोन ऑडियो-विजुअल-लैंग्वेज नेविगेशन के लिए एक नया बेंचमार्क है जो एजेंटों को ध्वनिक रूप से समृद्ध इनडोर वातावरण में मल्टी-गोल मिशनों के साथ चुनौती देता है, और PAG-Nav का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री एजेंट है जो खोज के लिए बाइनोरल ऑडियो का प्रभावी ढंग से लाभ उठाता है जबकि लक्ष्य पूर्णता के लिए विजुअल-सिमेंटिक सत्यापन पर निर्भर रहता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक बेहतरीन हाउस डिटेक्टिव (घर का जासूस) बनने के लिए सिखा रहे हैं। आमतौर पर, जब हम रोबोट को घर में घूमना सिखाते हैं, तो हम उन्हें एक सरल मिशन देते हैं: "लाल गेंद ढूंढो।" वे अपने कैमरा आंखों से चारों ओर देखते हैं, शायद याद रखते हैं कि वे कहाँ गए थे, और तब तक चलते हैं जब तक कि उन्हें वह वस्तु दिख न जाए। विज्ञान का यह क्षेत्र "एम्बोडीड नेविगेशन" (embodied navigation) कहलाता है, जहाँ एक रोबोट वास्तविक दुनिया में किसी कार्य को पूरा करने के लिए आगे बढ़ना सीखता है। लेकिन इसमें एक पेंच है: प्रशिक्षण के अधिकांश खेल पूरी तरह से शांत होते हैं। रोबोट केवल वही देख सकता है जो उसके लेंस के ठीक सामने होता है। यदि गेंद एक बंद दरवाजे के पीछे या किसी अंधेरे कोने में छिपी है, तो रोबोट वहीं रुक जाता है, क्योंकि वह अपनी वर्तमान दृष्टि के बाहर की किसी भी चीज़ के प्रति अंधा होता है।
अब, कल्पना कीजिए कि आप उस रोबोट को एक सुपरपावर देते हैं: कान। वास्तविक दुनिया में, ध्वनि केवल एक सीधी रेखा में नहीं चलती; यह कोनों के चारों ओर टकराती है और दरारों से रिसती है। अच्छे कानों वाला रोबोट अगले कमरे में कुत्ते के भौंकने या दीवार के पीछे नल के टपकने की आवाज़ सुन सकता है, जो उसे संकेत दे सकता है कि उसे कहाँ जाना है, भले ही वह वस्तु अभी उसे दिखाई न दे रही हो। यह शोध पत्र एक बड़ा, पेचीदा सवाल पूछता है: क्या होगा यदि हम इन दो सुपरपावर्स को मिला दें—देखना और सुनना—लेकिन मिशन को बहुत कठिन बना दें? केवल एक चीज़ खोजने के बजाय, क्या होगा यदि रोबोट को अलग-अलग वस्तुओं की एक पूरी सूची खोजनी हो, जिनमें से कुछ शब्दों द्वारा वर्णित हों, कुछ चित्रों द्वारा, और कुछ केवल उनके नाम द्वारा, और यह सब करते समय घर में ध्वनियाँ लगातार बदलती रहें?
इस अध्ययन के पीछे के शोधकर्ताओं ने, जिनका नेतृत्व रुफेंग चेन और हांगकांग यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी तथा जिलिन यूनिवर्सिटी के सहयोगियों ने किया है, एक नया चैलेंज बनाया है जिसे LH-AVLN कहा गया है। इसे एक हाई-स्टेक्स, मल्टी-लेवल वीडियो गेम की तरह समझें जिसे रोबोट के लिए बनाया गया है। इस खेल में, रोबोट को एक 3D घर में छोड़ दिया जाता है और उसे दो से चार अलग-अलग लक्ष्यों वाली एक "ग्लोबल मिशन" दी जाती है। ये लक्ष्य पेचीदा हैं: एक "सोफा ढूंढो" (एक श्रेणी) हो सकता है, दूसरा "पारदर्शी पर्दों के पास वाला हल्का ग्रे सोफा ढूंढो" (एक विवरण) हो सकता है, और तीसरा "बिस्तर की इस विशिष्ट तस्वीर को ढूंढो" (एक इमेज रेफरेंस) हो सकता है।
असली मोड़, हालांकि, ध्वनि है। इस खेल में, हर वह वस्तु जिसे रोबोट ढूंढ रहा है, एक शोर करती है। लेकिन यहाँ पेंच यह है: ध्वनियाँ निश्चित लक्ष्यों के रूप में नहीं होती हैं। जैसे ही रोबोट एक लक्ष्य को ढूंढ लेता है और उसे पूरा करता है, उस वस्तु का शोर बंद हो जाता है। इस बीच, वे वस्तुएं जिन्हें उसने अभी तक नहीं ढूंढा है, वे शोर करती रहती हैं, और बारी-बारी से सबसे तेज़ आवाज़ करती हैं। यह एक भ्रमित करने वाली स्थिति पैदा करता है। यदि रोबोट एक सोफे की तलाश कर रहा है, लेकिन वह शौचालय के फ्लश होने की आवाज़ सुनता है (क्योंकि उसने अभी तक शौचालय नहीं ढूंढा है), तो वह ध्वनि एक व्याकुलता बन जाती है। रोबोट को यह समझना होगा: "क्या यह आवाज़ मुझे मेरे वर्तमान लक्ष्य को खोजने में मदद कर रही है, या यह एक रेड हेरिंग (भटकाने वाला संकेत) है जो मुझे किसी दूसरे, अधूरे कार्य की ओर ले जा रहा है?"
इसका परीक्षण करने के लिए, लेखकों ने 1,5{0,000} से अधिक एपिसोड वाला एक विशाल डेटासेट बनाया जहाँ रोबोट को इन शोर भरे, मल्टी-गोल मिशनों में नेविगेट करना होता है। उन्होंने पाया कि मौजूदा रोबोट, यहाँ तक कि वे भी जो निर्देशों का पालन करने या विजुअल मैप याद रखने में माहिर हैं, बुरी तरह संघर्ष करते हैं। जब ध्वनि भ्रमित करने वाली हो जाती है या मिशन लंबा होता है, तो ये रोबोट रास्ता भटक जाते हैं या हार मान लेते हैं। वे एक सहायक संकेत और एक भटकाने वाले शोर के बीच अंतर नहीं कर पाते हैं।
यह दिखाने के लिए कि यह कितना कठिन है, टीम ने अपना खुद का रोबोट एजेंट PAG-Nav बनाया। यह रोबोट सीखने के लिए जटिल प्रशिक्षण का उपयोग नहीं करता है; इसके बजाय, यह एक चतुर रणनीति का उपयोग करता है। यह पूरे घर का एक मानसिक मानचित्र रखता है, ट्रैक करता है कि वह कहाँ गया है, उसने क्या देखा है, और ध्वनियाँ कहाँ से आ रही हैं। वह दृश्य से ओझल चीजों को खोजने के लिए ध्वनि का उपयोग करता है, लेकिन वह तब तक "मैंने इसे ढूंढ लिया!" कहने से इनकार कर देता है जब तक कि वह सही वस्तु को सुनिश्चित करने के लिए उसे स्पष्ट रूप से देख न ले। इस स्मार्ट रणनीति के बावजूद, रोबोट केवल लगभग 2% से 3% क्रमबद्ध (ordered) मिशनों और 3% से 5% असंबद्ध (unordered) मिशनों में सफल होता है।
इस शोध पत्र का मुख्य निष्कर्ष यह है कि लंबी, जटिल मिशनों में ध्वनि जोड़ना वर्तमान तकनीक के लिए इसे आसान बनाने के बजाय काफी कठिन बना देता है। लेखक सुझाव देते हैं कि जबकि ध्वनि छिपी हुई चीजों को खोजने के लिए एक शक्तिशाली उपकरण है, यह एक दुःस्वप्न बन जाती है यदि रोबोट यह नहीं समझ पाता कि कौन सी ध्वनि किस कार्य से संबंधित है। उनका तर्क है कि भविष्य का रोबोट नेविगेशन केवल बेहतर देखने या बेहतर सुनने के बारे में नहीं है, बल्कि शोर को अनदेखा करने और सही समय पर सही संकेत पर ध्यान केंद्रित करने के बारे में है। यह शोध पत्र निष्कर्ष निकालता है कि हम इस पहेली को सुलझाने से अभी बहुत दूर हैं, जो भविष्य के आविष्कारकों के लिए बहुत सारी जगह छोड़ता है ताकि वे ऐसे रोबोट बना सकें जो वास्तव में एक शोर भरे, मल्टी-टास्क दुनिया में नेविगेट कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।