← नवीनतम पेपर
💻 computer science

ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions

यह शोध पत्र ERR@HRI 3.0 चुनौती प्रस्तुत करता है, जिसने रोबोट की त्रुटियों पर बाइस्टैंडर (दर्शक) की प्रतिक्रियाओं का पता लगाने और संभावित विफलताओं का पूर्वानुमान लगाने के लिए एंड-टू-एंड मल्टीमॉडल मशीन लर्निंग को आगे बढ़ाने हेतु दो प्राकृतिक, क्राउडसोर्स्ड वीडियो डेटासेट पेश किए, जो यह प्रदर्शित करता है कि सबमिट किए गए मॉडल बेसलाइन सिस्टम से बेहतर प्रदर्शन करते हैं।

मूल लेखक: Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाने की कोशिश करते हुए देख रहे हैं। कभी-कभी रोबोट ब्रेड गिरा देता है। कभी-कभी वह टोस्टर को फ्रिज में रखने की कोशिश करता है। अतीत में, वैज्ञानिकों ने रोबोट को अपनी गलतियों को पहचानने के लिए सिखाने की कोशिश की, जिसमें उन्हें "फीचर्स" (जैसे "क्या ब्रेड फर्श पर है?") की एक चेकलिस्ट दी गई और उनसे पहले से साफ और व्यवस्थित किए गए डेटा को देखने के लिए कहा गया। लेकिन इस पेपर के लेखक कहते हैं, "रुको! यह वैसा ही है जैसे किसी बाइक का डायग्राम देखकर बाइक चलाना सीखने की कोशिश करना जो एक एकदम रोशनी वाले स्टूडियो में रखी हो। असली जीवन बहुत अव्यवस्थित होता है!"

यह पेपर ERR@HRI 3.0 पेश करता है, एक चुनौती जिसे शोधकर्ताओं को बेहतर बनाने में मदद करने के लिए डिज़ाइन किया गया है ताकि वे अपनी गलतियों को पकड़ सकें—और यहाँ तक कि होने से पहले ही उनका अनुमान लगा सकें—इंसानों की वास्तविक, अव्यवस्थित प्रतिक्रियाओं को देखकर।

दो बड़े मिशन

इस चुनौती ने शोधकर्ताओं को दो अलग-अलग "वीडियो गेम लेवल" हल करने के लिए दिए, जिसमें लोगों (जो रोबोट और इंसानों को विफल होते देख रहे थे) के कच्चे, बिना एडिट किए गए वेबकैम फुटेज का उपयोग किया गया।

लेवल 1: "ओप्स!" डिटेक्टर (BAD डेटासेट)
कल्पना कीजिए कि 45 लोग एक स्क्रीन के सामने बैठे हैं, वीडियो देख रहे हैं जहाँ एक रोबोट या इंसान गलती करता है। यहाँ लक्ष्य रिएक्टिव (प्रतिक्रियात्मक) है: क्या एक कंप्यूटर गलती होने के बाद व्यक्ति के चेहरे को देखकर यह कह सकता है, "ओह, उन्होंने अभी एक विफलता देखी!"?

  • चुनौती: वीडियो कच्चे (raw) हैं। लाइटिंग बदलती है, कैमरा एंगल टेढ़े-मेढ़े हैं, और लोग अलग-अलग जगहों पर बैठे हैं। यह वास्तविक दुनिया है, कोई लैब नहीं।
  • डेटा: इसमें 46 अलग-अलग विफलता के परिदृश्य और कुल 1,645 वीडियो क्लिप्स थे। क्लिप्स लगभग 15.5 सेकंड लंबे हैं।
  • परिणाम: इस चुनौती में 3 टीमों ने मॉडल सबमिट किए। उन सभी ने पेपर के अपने "बेसलाइन" मॉडल (जो मूल रूप से एक मानक न्यूरल नेटवर्क था जो अपनी पूरी कोशिश कर रहा था) से बेहतर प्रदर्शन किया। बेसलाइन मॉडल का स्कोर 0.502 मैक्रो F1 (एक विशिष्ट स्कोर जो यह बताता है कि उसने विफलता और गैर-विफलता दोनों को पहचानने में कितना संतुलन बनाया, न कि केवल एक साधारण सटीकता प्रतिशत) था, लेकिन नए मॉडलों ने इसे हरा दिया।

लेवल 2: "रुको, यह एक बुरा विचार है!" प्रेडिक्टर (Bad Idea डेटासेट)
यह अधिक दिलचस्प और चालाकी भरा हिस्सा है। कल्पना कीजिए कि 29 लोग एक वीडियो देख रहे हैं जहाँ एक रोबोट कुछ करना शुरू करता है, लेकिन वीडियो इससे पहले कट जाता है कि हम देख सकें कि वह सफल हुआ या विफल। लोगों को अनुमान लगाना है: "क्या यह अच्छा होगा या बुरा?"

  • लक्ष्य: क्या एक कंप्यूटर व्यक्ति के चेहरे को अनुमान लगाते समय देख सकता है और बता सकता है कि वह क्या होने वाला है? यह एंटीसिपेटरी (पूर्वानुमानित) है। यह दुर्घटना से पहले "उह-ओह" वाले भाव को पकड़ने के बारे में है।
  • डेटा: इसमें 30 परिदृश्य और 865 क्लिप्स थे। ये क्लिप्स बहुत छोटे हैं, केवल 1.95 सेकंड के।
  • परिणाम: फिर से, इस लेवल को खेलने वाली 3 टीमों ने बेसलाइन को हराया। बेसलाइन मॉडल का AUC-ROC स्कोर 0.564 था (एक माप जो यह बताता है कि मॉडल एक "अच्छे" और "बुरे" अनुमान के बीच अंतर करने में कितना सक्षम है, जहाँ 0.5 रैंडम गेसिंग है), जो यह दर्शाता है कि पल भर के चेहरे के भाव के आधार पर भविष्य की भविष्यवाणी करना वास्तव में बहुत, बहुत कठिन है।

यह पेपर किस बात को "ना" कहता है

लेखक बहुत स्पष्ट हैं कि इस समस्या के लिए क्या काम नहीं करता है, और उन्होंने पुराने तरीकों को स्पष्ट रूप से खारिज कर दिया:

  1. कोई "प्री-क्लीनड" डेटा नहीं: पेपर नोट करता है कि पिछले अधिकांश कार्यों में पहले से निकाले गए फीचर्स (pre-extracted features) पर निर्भरता थी, जिसने शोधकर्ताओं के लिए उपलब्ध तरीकों के प्रकार को सीमित कर दिया था। इसे ठीक करने के लिए, चुनौती ने रॉ वीडियो डेटा जारी किया। यह डिज़ाइन विकल्प फीचर इंजीनियरिंग को प्रतिबंधित करने के लिए नहीं था, बल्कि शोधकर्ताओं को पिक्सेल डेटा पर सीधे आधुनिक, एंड-टू-एंड लर्निंग विधियों को लागू करने और यह देखने के लिए था कि क्या वे पुराने दृष्टिकोणों की तुलना में वास्तविक जीवन की अव्यवस्था को बेहतर ढंग से संभाल सकते हैं।
  2. कोई "लैब-परफेक्ट" सेटिंग नहीं: उन्होंने इस विचार को खारिज कर दिया कि रोबोट को केवल नियंत्रित कमरों में सीखना चाहिए जहाँ रोशनी एकदम सही हो। वे क्राउडसोर्स्ड डेटा की अव्यवस्था चाहते थे (अलग-अलग कैमरे, अजीब कोण) क्योंकि रोबोटों को वास्तविक दुनिया में इसी का सामना करना पड़ेगा।
  3. केवल "रिएक्ट" करना नहीं: उन्होंने तर्क दिया कि गलती होने का इंतज़ार करना और फिर उसे ठीक करना बहुत देर हो जाना है। उन्होंने एंटीसिपेशन (पूर्वानमान) पर जोर दिया—यह पता लगाना कि कुछ गलत होने वाला है इससे पहले कि वह पूरी तरह से हो जाए।

वे कितने आश्वस्त हैं?

यह पेपर यह दावा नहीं करता कि उन्होंने रोबोट सुरक्षा की समस्या को हमेशा के लिए हल कर दिया है। इसके बजाय, वे सुझाव देते हैं कि उनके नए डेटासेट और तरीके एक बेहतर शुरुआती बिंदु हैं।

  • उन्होंने परिणामों को एक टेस्ट सेट पर विशिष्ट गणितीय स्कोर (जैसे मैक्रो F1 और AUC-ROC) का उपयोग करके मापा है जिसे टीमों ने पहले कभी नहीं देखा था।
  • उन्होंने पाया कि हालांकि नए मॉडल बेसलाइन से बेहतर थे, लेकिन "एंटीसिपेशन" कार्य (लेवल 2) अभी भी कठिन है। बेसलाइन ने सिग्नल को डिटेक्ट करना शुरू करने के लिए क्लिप के समय का 35.6% हिस्सा लिया, जबकि रिएक्टिव टास्क के लिए यह केवल 8.8% था। यह सुझाव देता है कि "बुरे विचार" वाले चेहरे को पढ़ना "ओप्स" वाले चेहरे को पढ़ने की तुलना में बहुत अधिक कठिन है।
  • लेखक कहते हैं कि तीन टीमों ने वैध मॉडल सबमिट किए, और उन सभी ने बेसलाइन से बेहतर प्रदर्शन किया। वे यह नहीं कहते कि मॉडल परफेक्ट हैं, बल्कि वे कहते हैं कि यह एक कदम आगे की ओर है।

मुख्य निष्कर्ष

इस पेपर को ऐसे सोचें जैसे कि एक साइंस फेयर के आयोजकों ने कहा हो, "केवल कांच के बॉक्स में काम करने वाले रोबोट बनाना बंद करें। देखते हैं कि क्या वे एक वास्तविक लिविंग रूम की अराजकता को संभाल सकते हैं।" उन्होंने दो नए अव्यवस्थित, वास्तविक वीडियो प्रदान किए और सबसे बुद्धिमान कोडर्स को चुनौती दी कि वे ऐसे मॉडल बनाएं जो रोबोट की गलती को पहचान सकें या आपदा होने से पहले उसका अनुमान लगा सकें। परिणाम दिखाते हैं कि हालांकि यह पुराने तरीकों से बेहतर करना संभव है, लेकिन त्रुटियों की भविष्यवाणी करने की "क्रिस्टल बॉल" वाली क्षमता अभी भी प्रगति पर है। लेखक आशा करते हैं कि ये उपकरण रोबोटों को अधिक जागरूक, अधिक भरोसेमंद और मानव जीवन की अव्यवस्थित वास्तविकता के लिए तैयार करने में मदद करेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →