← नवीनतम पेपर
💻 computer science

RoboFind: Multi-Agent Personalized Object Search for People Who Are Blind or Have Low Vision

रोबोफाइंड (RoboFind) एक मल्टी-एजेंट फ्रेमवर्क है जो स्मार्टफोन-आधारित टीचिंग इंटरफेस को एक चतुष्पाद रोबोट (quadruped robot) की स्वायत्त खोज और सत्यापन क्षमताओं के साथ जोड़कर दृष्टिबाधित और अल्पदृष्टि वाले उपयोगकर्ताओं को विशिष्ट व्यक्तिगत वस्तुओं को खोजने में सक्षम बनाता है, जिससे बेसलाइन विधियों की तुलना में काफी उच्च सफलता और विश्वसनीयता दर प्राप्त होती है।

मूल लेखक: Ruiping Liu, Shaofang Quan, Qian Yin, Jingqi Zhang, Junwei Zheng, Yufan Chen, Di Wen, Weijia Fan, Kailun Yang, M. Saquib Sarfraz, Tamim Asfour, Kunyu Peng, Rainer Stiefelhagen

प्रकाशित 2026-09-18
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruiping Liu, Shaofang Quan, Qian Yin, Jingqi Zhang, Junwei Zheng, Yufan Chen, Di Wen, Weijia Fan, Kailun Yang, M. Saquib Sarfraz, Tamim Asfour, Kunyu Peng, Rainer Stiefelhagen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

दृष्टिबाधित या कम दृष्टि वाले लोगों के लिए, दुनिया को अक्सर ध्वनि, स्पर्श और स्मृति के माध्यम से नेविगेट किया जाता है। हालांकि तकनीक ने आवाजाही में मदद करने के लिए गाइड डॉग या छड़ी जैसे उपकरण लंबे समय से प्रदान किए हैं, फिर भी एक अलग तरह की चुनौती बनी रहती है: कमरे में किसी विशिष्ट वस्तु को ढूँढना। वर्तमान समाधान अक्सर उपयोगकर्ता के घूमने, कैमरा पकड़ने और इस उम्मीद पर निर्भर करते हैं कि वे जिस चीज़ की तलाश कर रहे हैं उसे देख लेंगे। यदि वस्तु किसी कुर्सी के पीछे छिपी है या किसी कोने में दबी हुई है, तो कैमरा उसे नहीं देख पाता है, और खोज विफल हो जाती है। शोधकर्ता यह सवाल पूछ रहे हैं कि क्या एक रोबोट खोज का शारीरिक कार्य अपने हाथ में ले सकता है, जो उपयोगकर्ता के सुरक्षित स्थान पर रहने के दौरान, बिना स्वयं परिणाम देखे, वस्तु को खोजने के लिए स्थान में घूम सके।

यह 'रोबोफाइंड' (RoboFind) नामक एक नए सिस्टम द्वारा संबोधित मुख्य समस्या है। जर्मनी के कार्ल्सरूहे इंस्टीट्यूट ऑफ टेक्नोलॉजी में काम करने वाले शोधकर्ताओं ने एक ऐसा ढांचा बनाया है जो उपयोगकर्ता द्वारा पकड़े जाने वाले स्मार्टफोन को एक चार पैरों वाले रोबोट से जोड़ता है जो खोज करने का काम करता है। यह प्रणाली एक बहुत ही विशिष्ट कठिनाई को संभालने के लिए डिज़ाइन की गई है: किसी विशेष वस्तु को खोजना, जैसे कि उनका पसंदीदा नीला बैकपैक या चश्मे की एक विशिष्ट जोड़ी, न कि केवल उस प्रकार की कोई भी वस्तु। एक रोबॉइड जो केवल "एक बैकपैक" ढूंढ सकता है, वह गलत बैग ला सकता है, जिससे उपयोगकर्ता निराश हो सकता है। रोबोफाइंड इस कार्य को दो अलग-अलग चरणों में विभाजित करके इसे हल करता है: रोबोट को यह सिखाना कि उसे क्या खोजना है, और फिर यह सत्यापित करना कि उसने बिल्कुल सही चीज़ ढूँढ ली है, इससे पहले कि वह उपयोगकर्ता को सूचित करे कि काम पूरा हो गया है।

प्रक्रिया उपयोगकर्ता द्वारा रोबोट को सिखाने से शुरू होती है। आवाज और स्पर्श के माध्यम से सुलभ डिज़ाइन किए गए एक स्मार्टफोन ऐप का उपयोग करके, उपयोगकर्ता उस वस्तु के छोटे वीडियो रिकॉर्ड करता है जिसे वह खोजना चाहता है। ऐप उपयोगकर्ता को फोन को वस्तु के चारों ओर घुमाने के लिए निर्देशित करता है, जिससे सामने, बगल और ऊपर से, साथ ही एक अलग बैकग्राउंड के विरुद्ध भी दृश्य कैप्चर किया जा सके। यह केवल एक साधारण फोटो नहीं है; सिस्टम इन वीडियोों का विश्लेषण करके वस्तु की एक विस्तृत डिजिटल प्रोफाइल बनाने के लिए इनका उपयोग करता है। यह विजुअल संदर्भों का एक संग्रह संग्रहीत करता है जो ठीक से बताते हैं कि वह विशिष्ट बैकपैक कैसा दिखता है, जो इसे घर के किसी अन्य बैग से अलग करता है। एक बार जब यह प्रोफाइल सहेज लिया जाता है, तो उपयोगकर्ता इसे सूची से चुन सकता है और रोबोट को इसे खोजने के लिए कह सकता है।

जब खोज शुरू होती है, तो एक चतुष्पाद (क्वाड्रुपेड) रोबोट, जो आकार में कुत्ते जैसा होता है, कमरे में प्रवेश करता है। उसे नहीं पता कि वस्तु कहाँ है, इसलिए वह वातावरण का पता लगाने के लिए एक नेविगेशन सिस्टम का उपयोग करता है, जिसमें आगे बढ़ना, मुड़ना और स्थान को स्कैन करना शामिल है। जब रोबोट का नेविगेशन सिस्टम सोचता है कि उसने एक संभावित मिलान पा लिया है, तो वह रुक जाता है। हालाँकि, यहीं पर यह सिस्टम पिछले प्रयासों से भिन्न है। तुरंत यह घोषणा करने के बजाय कि वस्तु मिल गई है, रोबोट रुकता है और दूसरे चेक के लिए स्मार्टफोन पर जो वह देख रहा है उसकी एक तस्वीर भेजता है। सॉफ्टवेयर का एक अलग हिस्सा इस नई तस्वीर की तुलना शिक्षण चरण के दौरान बनाए गए मूल संदर्भ बैंक से करता है। यह एक सरल प्रश्न पूछता है: क्या यह बिल्कुल वैसा ही है जैसा उपयोगकर्ता ने मुझे सिखाया था?

यदि तस्वीर संग्रहीत संदर्भों से पर्याप्त रूप से मेल खाती है, तो रोबोट खोज की पुष्टि करता है और उपयोगकर्ता को सफलता की रिपोर्ट देता है। यदि तस्वीर मेल नहीं खाती है—उदाहरण के लिए, यदि रोबोट एक अलग काले बैग के सामने रुक जाता है जो समान दिखता है लेकिन सही वाला नहीं है—तो सिस्टम उस उम्मीदवार को अस्वीकार कर देता है। रोबोट हार नहीं मानता; वह उस स्थान की अपनी मेमोरी को साफ़ करता है, मुड़ता है, और सही वस्तु मिलने तक खोज जारी रखता है। यह खोजने, रुकने, जाँचने और या तो स्वीकार करने या जारी रखने का चक्र इस प्रणाली का हृदय है। यह सुनिश्चित करता है कि रोबोट केवल एक सामान्य विवरण के आधार पर अनुमान न लगाए बल्कि मिशन पूरा घोषित करने से पहले वस्तु की पहचान को सत्यापित करे।

शोधकर्ताओं ने इस प्रणाली का वास्तविक दुनिया के परिवेश में परीक्षण किया, जिसमें बेडरूम, लिविंग रूम, किचन और यहाँ तक कि बगीचे भी शामिल थे। उन्होंने दस अलग-अलग लक्ष्य वस्तुओं के साथ तैंतीस अलग-अलग मिशन चलाए, जिनमें छाते और तौलिये जैसी चलने-फिरल वाली वस्तुओं से लेकर कुर्सी और शौचालय जैसी स्थिर वस्तुएं भी शामिल थीं। इन परीक्षणों में, प्रणाली ने ८५ प्रतिशत प्रयासों में सही वस्तु खोजने में सफलता प्राप्त की। यह समझने के लिए कि यह कितना प्रभावी था, शोधकर्ताओं ने इसकी तुलना एक सरल दृष्टिकोण से की जहाँ रोबोट पहले ऐसे ऑब्जेक्ट पर रुक जाता है जो कुछ हद तक सही दिखता है और जीत की घोषणा कर देता है। वह सरल तरीका केवल २५ प्रतिशत समय सफल हुआ और तीन चौथाई बार गलत साबित हुआ, जो अक्सर उपयोगकर्ता को गलत वस्तु देकर छोड़ देता था। यह नया सिस्टम एक ऐसे संस्करण से भी बेहतर प्रदर्शन करता था जो केवल एक शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल पर निर्भर था जिसमें विशिष्ट सत्यापन चरण नहीं था, जो साझा किए गए आधे से भी कम परीक्षणों में सफल रहा।

डेटा ने दिखाया कि जाँच और पुन: खोज में बिताया गया अतिरिक्त समय सार्थक था। जबकि सफल मिशनों में औसतन लगभग तीन मिनट पैंतालीस सेकंड लगे, यह प्रणाली शायद ही कभी गलती करती थी। इसके विपरीत, सरल तरीके तेज़ थे लेकिन अक्सर गलत सफलताओं की ओर ले जाते थे, जहाँ रोबोट ने दावा किया कि उसने वस्तु पा ली है जबकि उसने नहीं पाई थी। सत्यापन चरण महत्वपूर्ण था; इसने लगभग सभी गलत ठहरावों को फ़िल्टर कर दिया। जब रोबोट गलत जगह पर रुकता था, तो सिस्टम त्रुटि को पकड़ लेता था, रोबोट को वापस भेज देता था, और अंततः सही वस्तु को खोज लेता था। गलती से उबरने और सही मिलान मिलने तक खोज जारी रखने की यह क्षमता ही इस प्रणाली को विश्वसनीय बनाती है, जो कि उन उपयोगकर्ताओं के लिए आवश्यक है जो परिणाम की दृश्य पुष्टि नहीं कर सकते।

अध्ययन ने यह भी देखा कि सिस्टम विभिन्न प्रकार की वस्तुओं के साथ कैसे व्यवहार करता है। उन वस्तुओं के लिए जिन्हें हिलाया जा सकता है, जैसे कप या बैकपैक, सिस्टम वस्तु की दृश्य उपस्थिति पर निर्भर करता है। उन वस्तुओं के लिए जो एक स्थान पर रहती हैं, जैसे डेस्क पर रखी एक विशिष्ट कुर्सी, सिस्टम ने यह सुनिश्चित करने के लिए परिवेश की भी जाँच की कि वस्तु अपेक्षित संदर्भ में है। इस अंतर ने रोबोट को एक वास्तविक घर की जटिलता को संभालने की अनुमति दी, जहाँ कई समान वस्तुएं मौजूद हो सकती हैं। शोधकर्ताओं ने उल्लेख किया कि हालांकि यह प्रणाली अत्यधिक प्रभावी है, फिर भी यह पूर्ण नहीं है; कुछ दुर्लभ मामलों में, रोबोट बहुत समान वस्तुओं के बीच अंतर करने में संघर्ष करता है या तकनीकी व्यवधानों का सामना करता है, लेकिन ये अपवाद थे न कि नियम।

अंततः, यह कार्य यह प्रदर्शित करता है कि एक रोबोट दृष्टिबाधित लोगों के लिए एक भरोसेमंद साथी बन सकता है, न केवल उन्हें एक स्थान से दूसरे स्थान तक ले जाने के लिए, बल्कि उनकी व्यक्तिगत वस्तुओं को सक्रिय रूप से खोजने के लिए भी। मुख्य नवाचार खोज को पुष्टि से अलग करना है। रोबोट को स्थान में घूमने का भारी काम करने देने और फिर यह सुनिश्चित करने के लिए एक कठोर जाँच का उपयोग करने के माध्यम से कि सही वस्तु मिल गई है, यह प्रणाली उस अंतर को पाटती है जो रोबोट जो देखता है और उपयोगकर्ता जिसे चाहिए उसके बीच होता है। परिणाम बताते हैं कि इस तरह के बहु-चरणीय सत्यापन के साथ, रोबोट सरल नेविगेशन से आगे बढ़कर रोजमर्रा के कार्यों के लिए विश्वसनीय सहायक बन सकते हैं, जिससे उपयोगकर्ताओं को यह विश्वास मिलता है कि जब रोबोट कहता है कि उसने उनकी वस्तु ढूंढ ली है, तो वास्तव में उसने ढूंढ ली है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →