← नवीनतम पेपर
💻 computer science

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

यह शोध पत्र LH-AVLN पेश करता है, जो लॉन्ग-होरिज़ोन ऑडियो-विजुअल-लैंग्वेज नेविगेशन के लिए एक नया बेंचमार्क है जो एजेंटों को ध्वनिक रूप से समृद्ध इनडोर वातावरण में मल्टी-गोल मिशनों के साथ चुनौती देता है, और PAG-Nav का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री एजेंट है जो खोज के लिए बाइनोरल ऑडियो का प्रभावी ढंग से लाभ उठाता है जबकि लक्ष्य पूर्णता के लिए विजुअल-सिमेंटिक सत्यापन पर निर्भर रहता है।

मूल लेखक: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बेहतरीन हाउस डिटेक्टिव (घर का जासूस) बनने के लिए सिखा रहे हैं। आमतौर पर, जब हम रोबोट को घर में घूमना सिखाते हैं, तो हम उन्हें एक सरल मिशन देते हैं: "लाल गेंद ढूंढो।" वे अपने कैमरा आंखों से चारों ओर देखते हैं, शायद याद रखते हैं कि वे कहाँ गए थे, और तब तक चलते हैं जब तक कि उन्हें वह वस्तु दिख न जाए। विज्ञान का यह क्षेत्र "एम्बोडीड नेविगेशन" (embodied navigation) कहलाता है, जहाँ एक रोबोट वास्तविक दुनिया में किसी कार्य को पूरा करने के लिए आगे बढ़ना सीखता है। लेकिन इसमें एक पेंच है: प्रशिक्षण के अधिकांश खेल पूरी तरह से शांत होते हैं। रोबोट केवल वही देख सकता है जो उसके लेंस के ठीक सामने होता है। यदि गेंद एक बंद दरवाजे के पीछे या किसी अंधेरे कोने में छिपी है, तो रोबोट वहीं रुक जाता है, क्योंकि वह अपनी वर्तमान दृष्टि के बाहर की किसी भी चीज़ के प्रति अंधा होता है।

अब, कल्पना कीजिए कि आप उस रोबोट को एक सुपरपावर देते हैं: कान। वास्तविक दुनिया में, ध्वनि केवल एक सीधी रेखा में नहीं चलती; यह कोनों के चारों ओर टकराती है और दरारों से रिसती है। अच्छे कानों वाला रोबोट अगले कमरे में कुत्ते के भौंकने या दीवार के पीछे नल के टपकने की आवाज़ सुन सकता है, जो उसे संकेत दे सकता है कि उसे कहाँ जाना है, भले ही वह वस्तु अभी उसे दिखाई न दे रही हो। यह शोध पत्र एक बड़ा, पेचीदा सवाल पूछता है: क्या होगा यदि हम इन दो सुपरपावर्स को मिला दें—देखना और सुनना—लेकिन मिशन को बहुत कठिन बना दें? केवल एक चीज़ खोजने के बजाय, क्या होगा यदि रोबोट को अलग-अलग वस्तुओं की एक पूरी सूची खोजनी हो, जिनमें से कुछ शब्दों द्वारा वर्णित हों, कुछ चित्रों द्वारा, और कुछ केवल उनके नाम द्वारा, और यह सब करते समय घर में ध्वनियाँ लगातार बदलती रहें?

इस अध्ययन के पीछे के शोधकर्ताओं ने, जिनका नेतृत्व रुफेंग चेन और हांगकांग यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी तथा जिलिन यूनिवर्सिटी के सहयोगियों ने किया है, एक नया चैलेंज बनाया है जिसे LH-AVLN कहा गया है। इसे एक हाई-स्टेक्स, मल्टी-लेवल वीडियो गेम की तरह समझें जिसे रोबोट के लिए बनाया गया है। इस खेल में, रोबोट को एक 3D घर में छोड़ दिया जाता है और उसे दो से चार अलग-अलग लक्ष्यों वाली एक "ग्लोबल मिशन" दी जाती है। ये लक्ष्य पेचीदा हैं: एक "सोफा ढूंढो" (एक श्रेणी) हो सकता है, दूसरा "पारदर्शी पर्दों के पास वाला हल्का ग्रे सोफा ढूंढो" (एक विवरण) हो सकता है, और तीसरा "बिस्तर की इस विशिष्ट तस्वीर को ढूंढो" (एक इमेज रेफरेंस) हो सकता है।

असली मोड़, हालांकि, ध्वनि है। इस खेल में, हर वह वस्तु जिसे रोबोट ढूंढ रहा है, एक शोर करती है। लेकिन यहाँ पेंच यह है: ध्वनियाँ निश्चित लक्ष्यों के रूप में नहीं होती हैं। जैसे ही रोबोट एक लक्ष्य को ढूंढ लेता है और उसे पूरा करता है, उस वस्तु का शोर बंद हो जाता है। इस बीच, वे वस्तुएं जिन्हें उसने अभी तक नहीं ढूंढा है, वे शोर करती रहती हैं, और बारी-बारी से सबसे तेज़ आवाज़ करती हैं। यह एक भ्रमित करने वाली स्थिति पैदा करता है। यदि रोबोट एक सोफे की तलाश कर रहा है, लेकिन वह शौचालय के फ्लश होने की आवाज़ सुनता है (क्योंकि उसने अभी तक शौचालय नहीं ढूंढा है), तो वह ध्वनि एक व्याकुलता बन जाती है। रोबोट को यह समझना होगा: "क्या यह आवाज़ मुझे मेरे वर्तमान लक्ष्य को खोजने में मदद कर रही है, या यह एक रेड हेरिंग (भटकाने वाला संकेत) है जो मुझे किसी दूसरे, अधूरे कार्य की ओर ले जा रहा है?"

इसका परीक्षण करने के लिए, लेखकों ने 1,5{0,000} से अधिक एपिसोड वाला एक विशाल डेटासेट बनाया जहाँ रोबोट को इन शोर भरे, मल्टी-गोल मिशनों में नेविगेट करना होता है। उन्होंने पाया कि मौजूदा रोबोट, यहाँ तक कि वे भी जो निर्देशों का पालन करने या विजुअल मैप याद रखने में माहिर हैं, बुरी तरह संघर्ष करते हैं। जब ध्वनि भ्रमित करने वाली हो जाती है या मिशन लंबा होता है, तो ये रोबोट रास्ता भटक जाते हैं या हार मान लेते हैं। वे एक सहायक संकेत और एक भटकाने वाले शोर के बीच अंतर नहीं कर पाते हैं।

यह दिखाने के लिए कि यह कितना कठिन है, टीम ने अपना खुद का रोबोट एजेंट PAG-Nav बनाया। यह रोबोट सीखने के लिए जटिल प्रशिक्षण का उपयोग नहीं करता है; इसके बजाय, यह एक चतुर रणनीति का उपयोग करता है। यह पूरे घर का एक मानसिक मानचित्र रखता है, ट्रैक करता है कि वह कहाँ गया है, उसने क्या देखा है, और ध्वनियाँ कहाँ से आ रही हैं। वह दृश्य से ओझल चीजों को खोजने के लिए ध्वनि का उपयोग करता है, लेकिन वह तब तक "मैंने इसे ढूंढ लिया!" कहने से इनकार कर देता है जब तक कि वह सही वस्तु को सुनिश्चित करने के लिए उसे स्पष्ट रूप से देख न ले। इस स्मार्ट रणनीति के बावजूद, रोबोट केवल लगभग 2% से 3% क्रमबद्ध (ordered) मिशनों और 3% से 5% असंबद्ध (unordered) मिशनों में सफल होता है।

इस शोध पत्र का मुख्य निष्कर्ष यह है कि लंबी, जटिल मिशनों में ध्वनि जोड़ना वर्तमान तकनीक के लिए इसे आसान बनाने के बजाय काफी कठिन बना देता है। लेखक सुझाव देते हैं कि जबकि ध्वनि छिपी हुई चीजों को खोजने के लिए एक शक्तिशाली उपकरण है, यह एक दुःस्वप्न बन जाती है यदि रोबोट यह नहीं समझ पाता कि कौन सी ध्वनि किस कार्य से संबंधित है। उनका तर्क है कि भविष्य का रोबोट नेविगेशन केवल बेहतर देखने या बेहतर सुनने के बारे में नहीं है, बल्कि शोर को अनदेखा करने और सही समय पर सही संकेत पर ध्यान केंद्रित करने के बारे में है। यह शोध पत्र निष्कर्ष निकालता है कि हम इस पहेली को सुलझाने से अभी बहुत दूर हैं, जो भविष्य के आविष्कारकों के लिए बहुत सारी जगह छोड़ता है ताकि वे ऐसे रोबोट बना सकें जो वास्तव में एक शोर भरे, मल्टी-टास्क दुनिया में नेविगेट कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →