When Should a Failing Robot Ask? Initiating Corrective Human-Robot Dialogue from Audited Sensor Evidence
यह शोध पत्र प्रदर्शित करता है कि ओपन विजन-लैंग्वेज मॉडल वास्तविक सेंसर साक्ष्य के बजाय प्रॉम्प्ट फॉर्मेटिंग पर अपनी निर्भरता के कारण यह निर्णय लेने में विफल रहते हैं कि मनुष्यों से कब सहायता मांगनी है, लेकिन विविध सेंसर डेटा को शामिल करके और अपने कार्यों को मापी गई विश्वसनीयता एवं कार्य लागतों में ग्राउंड करके उनकी नैदानिक सटीकता और निर्णय लेने की क्षमता में महत्वपूर्ण सुधार किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
जब एक इंसान के साथ काम करने वाला रोबोट कोई कप गिरा देता है या किसी औज़ार को उठाने में विफल हो जाता है, तो कोई भी बोलने से पहले एक महत्वपूर्ण क्षण आता है। मशीन को यह तय करना होता है कि उसका अगला कदम क्या होना चाहिए: क्या उसे समस्या को अपने आप ठीक करने की कोशिश करनी चाहिए, सुराग खोजने के लिए अपने आंतरिक सेंसरों की जांच करनी चाहिए, या रुककर इंसान से मदद मांगनी चाहिए? यह निर्णय केवल शिष्टाचार के बारे में नहीं है; यह जोखिम का एक गणित है। मदद मांगना समय लेता है और इंसान के ध्यान में बाधा डालता है, लेकिन गलत अनुमान लगाने पर अंधाधुंध कार्य करना अधिक नुकसान पहुंचा सकता है। वर्षों से, शोधकर्ताओं ने माना है कि यदि एक रोबोट विफलता देख सकता है, तो वह समझ सकता है कि वह क्यों हुई, या उसे अनिश्चित होने पर बस मदद मांग लेनी चाहिए। हालांकि, एक नया अध्ययन इन धारणाओं को चुनौती देता है, यह सुझाव देते हुए कि समस्या का निदान करने की रोबोट की क्षमता पूरी तरह से इस बात पर निर्भर करती है कि वह किन सेंसरों का उपयोग करता है, और वर्तमान आर्टिफिशियल इंटेलिजेंस मॉडल यह जानने में आश्चर्यजनक रूप से खराब हैं कि उन्हें कब रुककर मदद मांगनी चाहिए।
इसकी जांच करने के लिए, शोधकर्ताओं ने एक नियंत्रित वातावरण बनाया जहां वे ज्ञात कारणों के साथ विशिष्ट विफलताएं पैदा कर सकते थे। उन्होंने एक सिम्युलेटेड रोबोटिक आर्म को एक सरल कार्य करने के लिए प्रोग्राम किया: एक वस्तु उठाना और उसे कहीं रखना। फिर उन्होंने तीन अलग-अलग प्रकार की समस्याएं पेश कीं। पहला, रोबोट वस्तु को देखने में विफल हो सकता था क्योंकि वह छिपी हुई थी, गायब थी, या रोशनी बहुत कम थी। दूसरा, रोबोट वस्तु को उठाने की कोशिश कर सकता था लेकिन उसे गिरा सकता था क्योंकि उसकी पकड़ बहुत कमजोर थी, वस्तु बहुत भारी थी, या सतह बहुत फिसलन भरी थी। तीसरा, रोबोट वस्तु को रखने में विफल हो सकता था क्योंकि लक्ष्य पात्र (कंटेनर) भरा हुआ था या पहुंच से बाहर था। क्योंकि शोधकर्ताओं ने ये विफलताएं स्वयं बनाई थीं, इसलिए वे हर गलती के सटीक कारण जानते थे, जिससे उन्हें यह परीक्षण करने की अनुमति मिली कि क्या एक रोबोट वास्तव में इसे समझ सकता है।
शोधकर्ताओं ने पहले यह परीक्षण किया कि विभिन्न सेंसर क्या जानकारी प्रदान कर सकते हैं। उन्होंने पाया कि जो रोबोट सीख सकता है, उसमें एक स्पष्ट विभाजन था। जब विफलता वस्तु को न देख पाने के बारे में थी, तो कैमरा समस्या का निदान करने में उत्कृष्ट था, जिसने लगभग हर बार कारण को सही ढंग से पहचाना। हालांकि, जब विफलता वस्तु को गिराने के बारे में थी, तो कैमरा लगभग बेकार था। इमेज विश्लेषण कितना भी उन्नत क्यों न हो, कैमरा यह नहीं बता सका कि पकड़ कमजोर थी, वस्तु भारी थी, या सतह फिसलन भरी थी, क्योंकि ये भौतिक बल एक लेंस के लिए अदृश्य होते हैं। इसके विपरीत, जब शोधकर्ताओं ने रोबलेट को उसका अपना फोर्स डेटा दिया—ग्रिपर कितनी जोर से दबा रहा था और उसने कितना वजन महसूस किया इसके माप—तो रोबोट ने लगभग पूर्ण सटीकता के साथ गिरने का निदान किया। इसने एक मौलिक सत्य प्रकट किया: एक रोबोट समस्या का निदान नहीं कर सकता यदि उस समस्या के बारे में जानकारी उस डेटा में मौजूद नहीं है जिसे वह देख रहा है।
अध्ययन फिर छह अलग-अलग ओपन-सोर्स आर्टिफिशियल इंटेलिजेंस मॉडलों की ओर मुड़ा, जो वे सिस्टम हैं जिनका उपयोग अक्सर रोबोटों को भाषा और छवियों को समझने की क्षमता देने के लिए किया जाता है। शोधकर्ताओं ने इन मॉडलों को एक असफल प्रयास के कैमरा फुटेज को देखने और यह अनुमान लगाने के लिए कहा कि क्या गलत हुआ। परिणाम चौंकाने वाले थे। मॉडल उन सतर्क वैज्ञानिकों की तरह व्यवहार नहीं कर रहे थे जो जानते हैं कि उनके पास जानकारी की कमी है। इसके बजाय, उनका व्यवहार उस प्रश्न के लेआउट द्वारा निर्धारित किया गया था जो उनसे पूछा गया था। यदि "मुझे नहीं पता" कहने का विकल्प अंत में सूचीबद्ध था, तो मॉडल लगभग हमेशा उत्तर देने से इनकार कर देते थे, यह दावा करते हुए कि वे कारण का निर्धारण नहीं कर सकते। यदि शोधकर्ताओं ने वही विकल्प सूची के शीर्ष पर स्थानांतरित कर दिया, तो मॉडल अचानक उत्तर देने से रुक गए और अनुमान लगाने लगे, अक्सर उच्च आत्मविश्वास के साथ, भले ही वे गलत थे। उनके आत्मविश्वास का स्तर वास्तविकता को प्रतिबिंबित नहीं करता था; एक मॉडल गलत उत्तर के प्रति 100 प्रतिशत सुनिश्चित हो सकता था, या सही उत्तर के प्रति 50 प्रतिशत सुनिश्चित हो सकता था, जिसमें जोड़ने के लिए कोई पैटर्न नहीं था।
शोधकर्ताओं ने यह भी परीक्षण किया कि क्या मॉडलों को फोर्स डेटा, जिसे सरल टेक्स्ट के रूप में लिखा गया हो, देने से मदद मिलेगी। छह में से चार मॉडलों के लिए, इस अतिरिक्त जानकारी ने एक बड़ा अंतर पैदा किया। अचानक, वे गिरने की विफलताओं का सही निदान करने में सक्षम थे, जो यादृच्छिक अनुमान लगाने से बढ़कर आधे से अधिक बार सही उत्तर देने तक पहुँच गया। इसने सिद्ध किया कि मॉडल भौतिकी को समझने में स्वाभाविक रूप से अक्षम नहीं थे; वे केवल सही सेंसर डेटा की कमी से जूझ रहे थे। हालांकि, इस नई क्षमता के साथ भी, वे यह निर्णय लेने में विफल रहे कि मदद कब मांगनी चाहिए। वे अधिक बार नहीं पूछते थे जब प्रश्न सस्ता (कम लागत वाला) था और अकेले कार्य करने का जोखिम अधिक था, न ही वे तब रुकते थे जब प्रश्न महंगा था। मदद मांगने की उनकी रणनीति कठोर थी और इसने इंसान को बाधित करने की लागत को नजरअंदाज किया।
अध्ययन के अनुसार, एक रोबोट के लिए सबसे प्रभावी रणनीति मॉडल की अपनी भावना या आत्मविश्वास पर भरोसा करना नहीं है, जो अक्सर भ्रामक होता है। इसके बजाय, मदद मांगने का निर्णय दो मापने योग्य तथ्यों पर आधारित होना चाहिए: रोबोट का निदान वास्तव में कितना सटीक है, और इंसान से पूछने की लागत कितनी है। यदि रोबोट के सेंसर विश्वसनीय रूप से बता सकते हैं कि क्या गलत है, तो उसे कार्य करना चाहिए। यदि सेंसर उत्तर प्रदान करने में सक्षम नहीं हैं, या यदि रोबोट का अपना निदान गलत होने की संभावना है, तो उसे मदद मांगनी चाहिए। अध्ययन दिखाता है कि मानव से एक एकल प्रश्न रोबोट की सफलता दर को लगभग शून्य से 80 प्रतिशत से ऊपर ले जा सकता है, लेकिन केवल तभी जब रोबोट सही समय पर पूछे। आज, पूछने का निर्णय अक्सर एक अनुमान होता है, लेकिन आगे का रास्ता स्पष्ट है: रोबोट को अपने इंद्रियों की सीमाओं और एक प्रश्न की वास्तविक लागत को जानने के लिए वायर्ड (तैयार) किया जाना चाहिए, बजाय इसके कि वे उस मशीन के आत्मविश्वास पर भरोसा करें जो यह नहीं जानता कि वह क्या नहीं जानता।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।