← नवीनतम पेपर
💻 computer science

Assessing Vision-Language Models for Perception in Autonomous Underwater Robotic Software

यह शोध पत्र ऑटोनॉमस अंडरवॉटर रोबोट (AUR) सॉफ्टवेयर के भीतर पानी के नीचे के कचरे का पता लगाने के लिए विजन-लैंग्वेज मॉडल्स (VLMs) का एक अनुभवजन्य मूल्यांकन प्रस्तुत करता है, जो चुनौतीपूर्ण समुद्री वातावरण के लिए मजबूत धारणा मॉड्यूल चुनने में सॉफ्टवेयर इंजीनियरों का मार्गदर्शन करने हेतु उनके प्रदर्शन और अनिश्चितता का आकलन करता है।

मूल लेखक: Muhammad Yousaf, Aitor Arrieta, Shaukat Ali, Paolo Arcaini, Shuai Wang

प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Yousaf, Aitor Arrieta, Shaukat Ali, Paolo Arcaini, Shuai Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट सबमरीन के लिए अंडरवॉटर डिटेक्टिव्स (पानी के नीचे के जासूसों) की एक नई टीम को काम पर रख रहे हैं। उनका काम समुद्र के तल के आसपास तैरना, कचरे (जैसे प्लास्टिक की बोतलें या जाल) को ढूंढना और रोबोट को बताना है कि क्या उठाना है।

समस्या क्या है? समुद्र एक ऐसी जगह है जहाँ इंसानी आँखें बहुत कम देख पाती हैं, और कंप्यूटर की आँखों के लिए तो यह और भी बुरा है। वहाँ अंधेरा है, धुंधलापन है, और बहुत सारी भ्रमित करने वाली चीजें जैसे समुद्री घास और मछलियाँ हैं। पारंपरिक कंप्यूटर प्रोग्राम (पुराने जासूस) बहुत अच्छे होते हैं यदि उन्होंने किसी विशिष्ट कचरे को लाखों बार देखा हो, लेकिन अगर वे कुछ नया या अजीब देखते हैं, तो वे भ्रमित हो जाते हैं और उसे पूरी तरह से मिस कर सकते हैं।

यहाँ प्रवेश होता है विज़न-लैंग्वेज मॉडल्स (VLMs) का। इन्हें सुपर-स्मार्ट जासूस मानिए जो पढ़ और बात कर सकते हैं। केवल तस्वीरों को रटने के बजाय, वे "कचरे" या "जानवर" की अवधारणा (concept) को समझते हैं और भले ही उन्होंने पहले कभी वह विशिष्ट बोतल न देखी हो, तो भी वे संदर्भ के संकेतों (context clues) का उपयोग करके सही अनुमान लगा सकते हैं।

यह शोध पत्र वास्तव में इन नए सुपर-जासूसों में से चार का बैकग्राउंड चेक है, यह देखने के लिए कि क्या वे एक वास्तविक अंडरवॉटर रोबोट जॉब के लिए सुरक्षित रूप से नियुक्त किए जा सकते हैं।

प्रयोग: जासूसों का एक "तनाव परीक्षण" (Stress Test)

शोधकर्ताओं ने एक सिमुलेशन सेट किया जहाँ उन्होंने चार अलग-अलग AI मॉडलों (जिन्हें BLIP, DeepSeek, LLaVA, और QWen नाम दिया गया है) को पानी के नीचे ली गई हजारों तस्वीरें दिखाईं। उन्होंने मॉडलों से एक सरल प्रश्न पूछा: "आप यहाँ क्या देख रहे हैं? जानवरों, पौधों, वस्तुओं और कचरे की सूची बनाएं।"

उन्होंने उन्हें दो अलग-अलग "क्राइम सीन" (डेटासेट) पर परखा:

  1. TrashCan1.0: एक डेटासेट जो कचरे और समुद्री जीवन पर केंद्रित है।
  2. SeaClear: एक डेटासेट जिसमें गहरा, अधिक धुंधला पानी और मिश्रित अव्यवस्था है।

परिणाम: किसे नौकरी मिली?

यहाँ चारों उम्मीदवारों का प्रदर्शन सरल भाषा में समझाया गया है:

1. "अति-आत्मविश्वासी" वाला: LLaVA

  • व्यक्तित्व: LLaVA एक ऐसे जासूस की तरह है जो हर चीज़ के बारे में 100% निश्चित होता है, भले ही वह गलत हो। वे चिल्लाकर कहते हैं, "वह एक कचरे का डिब्बा है!" 90% आत्मविश्वास के साथ, भले ही वह वास्तव में एक पत्थर हो।
  • समस्या: वास्तविक दुनिया में, गलत होना लेकिन बहुत आश्वस्त होना खतरनाक है। यदि रोबोट सोचता है कि पत्थर कचरा है और उसे उठाने की कोशिश करता है, तो वह अपना हाथ तोड़ सकता है। LLaVA सबसे आत्मविश्वासी था लेकिन सबसे कम सटीक भी था।
  • फैसला: काम पर न रखें। बहुत जोखिम भरा है।

2. "संघर्ष करते नए लोग": QWen

  • व्यक्तित्व: Qwen ठीक-ठाक है लेकिन अक्सर भ्रमित हो जाता है। यह LLaVA जितना शोर नहीं मचाता, लेकिन फिर भी गलतियाँ करता है, खासकर मछली और प्लास्टिक के टुकड़े के बीच अंतर करने में।
  • फैसला: अभी तैयार नहीं है।

3. "प्रमुख दावेदार": BLIP और DeepSeek

  • व्यक्तित्व: ये दोनों सबसे स्मार्ट और सतर्क हैं। ये उन जासूसों की तरह हैं जो कहते हैं, "मुझे लगता है कि वह कचरा है, लेकिन मैं 100% सुनिश्चित नहीं हूँ, इसलिए मुझे दोबारा जांच करने दें।"
  • अच्छी खबर: वे कचरे और वस्तुओं को खोजने में सबसे सटीक थे। महत्वपूर्ण बात यह है कि वे अपनी अनिश्चितता के बारे में ईमानदार थे। जब वे सुनिश्चित नहीं थे, तो उन्होंने इसे स्वीकार किया।
  • फैसला: इन्हें काम पर रखें। विशेष रूप से, BLIP थोड़ा विजेता रहा। यह जानने में सबसे अच्छा था कि वह कब सही था और कब गलत।

सबसे बड़ा आश्चर्य: आत्मविश्वास बनाम क्षमता (Confidence vs. Competence)

इस शोध पत्र का सबसे महत्वपूर्ण सबक एक विरोधाभासी सबक है: ज़ोर से बोलना और आत्मविश्वास दिखाना इसका मतलब यह नहीं है कि आप अच्छे हैं।

  • LLaVA ज़ोर से बोलता था और आत्मविश्वासी था लेकिन काम में बुरा था।
  • BLIP शांत था, इसने स्वीकार किया कि यह अनिश्चित था, और वास्तव में काम को बेहतर तरीके से किया।

सुरक्षा-महत्वपूर्ण रोबोट्स (जैसे सबमरीन) की दुनिया में, आप ऐसा रोबोट नहीं चाहते जो आत्मविश्वास से गलत हो। आप एक ऐसा रोबोट चाहते हैं जो कैलिब्रेटेड (calibrated) हो—यानी उसका आत्मविश्वास उसके वास्तविक कौशल से मेल खाता हो। यदि BLIP कहता है "90% पक्का," तो इसकी 90% संभावना है कि वह सही होगा। यदि LLaVA कहता है "90% पक्का," तो वह शायद केवल 50% ही सही होगा।

पेच: वे अभी भी पूर्ण नहीं हैं

यहाँ तक कि सर्वश्रेष्ठ जासूसों (BLIP और DeepSeek) को भी जानवरों और पौधों के साथ समस्या हुई।

  • वे कचरे और मानव निर्मित वस्तुओं को पहचानने में बेहतरीन थे (F1 स्कोर लगभग 0.76–0.87)।
  • वे मछली और समुद्री घास के बीच अंतर करने में बहुत खराब थे (F1 स्कोर गिरकर 0.17–0.28 हो गया)।

उपमा: कल्पना कीजिए कि एक सुरक्षा गार्ड को काम पर रखना जो चोरी हुए टीवी को पकड़ने में माहिर है, लेकिन वह एक चोर समझकर परिवार के कुत्ते को गिरफ्तार करने की कोशिश करता रहता है।

अंतिम सिफारिश

शोधकर्ता निष्कर्ष निकालते हैं कि हमें इन AI मॉडलों को सीधे रोबोट में नहीं डाल देना चाहिए और उम्मीद नहीं करनी चाहिए कि सब ठीक होगा। इसके बजाय, हमें उन्हें विशेषज्ञ सहायकों के रूप में उपयोग करना चाहिए:

  1. कचरे के लिए उपयोग करें: वे प्लास्टिक की बोतलों और जालों को खोजने के लिए उत्कृष्ट हैं।
  2. प्रकृति के लिए उपयोग न करें: उन्हें अभी भी मछली या पौधों की पहचान करने न दें; वे भ्रमित हो जाएंगे।
  3. "डिजिटल ट्विन" का विचार: AI को सीधे रोबोट में डालने के बजाय (जिसमें सीमित बैटरी और शक्ति होती है), एक जहाज या क्लाउड पर स्थित एक शक्तिशाली कंप्यूटर (एक "डिजिटल ट्विन") पर AI चलाएं। रोबोट एक तस्वीर भेजता है, ट्विन कहता है, "वह कचरा है, जाओ उसे उठाओ," और रोबोट कार्य करता है। यह रोबोट को सुरक्षित रखता है और AI को अधिक स्मार्ट बनाता है।

सारांश

यह शोध पत्र हमें बताता है कि विज़न-लैंग्वेज मॉडल्स अंडरवॉटर रोबोट के लिए आशाजनक उपकरण हैं, लेकिन हमें सावधान रहने की आवश्यकता है। हमें उन मॉडलों को चुनना चाहिए जो विनम्र और सटीक (जैसे BLIP) हैं, न कि उन्हें जो ज़ोर से बोलने वाले और अति-आत्मविश्वासी (जैसे LLaVA) हैं। और जब तक वे मछली और कचरे के बीच अंतर करने में बेहतर नहीं हो जाते, तब तक हमें उनका उपयोग केवल हमारे महासागरों की सफाई के विशिष्ट कार्य के लिए ही करना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →