← नवीनतम पेपर
💻 computer science

Failure Identification in Imitation Learning Via Statistical and Semantic Filtering

यह शोध पत्र FIDeL को प्रस्तुत करता है, जो एक पॉलिसी-स्वतंत्र मॉड्यूल है जो इमिटेशन लर्निंग में वास्तविक विफलताओं को सौम्य विचलन से सटीक रूप से अलग करने के लिए विजन-लैंग्वेज मॉडल्स के माध्यम से सांख्यिकीय विसंगति का पता लगाने और सिमेंटिक फ़िल्टरिंग को जोड़ता है, जिसे नए BotFails डेटासेट द्वारा मान्य किया गया है और अत्याधुनिक बेसलाइनों पर बेहतर प्रदर्शन द्वारा सिद्ध किया गया है।

मूल लेखक: Quentin Rolland, Fabrice Mayran de Chamisso, Jean-Baptiste Mouret

प्रकाशित 2026-04-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Quentin Rolland, Fabrice Mayran de Chamisso, Jean-Baptiste Mouret

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपनी सुबह की कॉफी बनाने के लिए एक प्रतिभाशाली रोबोट शेफ को काम पर रखा है। आपने उसे यह सिखाया है कि आप हर दिन कैसे बिल्कुल सही तरीके से कॉफी बनाते हैं। रोबोट जल्दी सीख जाता है और कुछ ही सेकंड में कॉफी बना सकता है।

लेकिन समस्या यह है: रोबोट नाजुक (brittle) होते हैं।

यदि काउंटर पर कोई मक्खी बैठ जाए, यदि कॉफी बीन्स सामान्य से थोड़ी अलग हों, या यदि आप गलती से कप को गिरा दें, तो रोबोट को समझ नहीं आता कि क्या करना है। वह शायद टूटे हुए कप के ऊपर कॉफी बनाने की कोशिश करता रहेगा, या इससे भी बुरा, वह भ्रमित होकर हर तरफ उबलता हुआ पानी बिखेर देगा।

यह पेपर FIDeL (Failure Identification in Demonstration Learning) नामक एक समाधान पेश करता है। FIDeL को एक अति-सतर्क सुरक्षा निरीक्षक (safety inspector) के रूप में समझें जो रोबोट के बगल में खड़ा है, उसके हर कदम पर नज़र रख रहा है, और केवल तभी "इमरजेंसी स्टॉप" बटन दबाने के लिए तैयार है जब वास्तव में इसकी आवश्यकता हो।

यहाँ FIDel कैसे काम करता है, इसे एक रचनात्मक उपमा (analogy) का उपयोग करके तीन सरल चरणों में समझाया गया है:

तीन-चरणीय सुरक्षा प्रणाली

1. "अंतर पहचानो" खेल (Anomaly Detection)

सबसे पहले, FIDeL को यह जानने की जरूरत है कि "सामान्य" क्या दिखता है। यह विशेषज्ञ द्वारा कॉफी बनाने के सैकड़ों वीडियो का अध्ययन करता है। यह हर सूक्ष्म विवरण का एक मानसिक मानचित्र (mental map) बनाता है: कप कहाँ है, भाप कैसे उठती है, हाथ कैसे हिलता है।

जब रोबोट काम करना शुरू करता है, तो FIDeL रोबोट के वर्तमान दृश्य की तुलना अपने मानसिक मानचित्र से करता है।

  • उपमा: दो तस्वीरों के बीच "अंतर पहचानो" (Spot the Difference) का खेल खेलने की कल्पना करें। FIDeL इसमें अविश्वसनीय रूप से तेज़ है। यदि रोबोट एक चम्मच गिरा देता है, या यदि कॉफी पॉट थोड़ा झुका हुआ है, तो FIDeL तुरंत उस "अंतर" को पहचान लेता है और लाल झंडी (red flag) दिखा देता है।
  • सावधानी: कभी-कभी, लाल झंडी का मतलब आपदा नहीं होता। शायद मेज पर एक मक्खी बैठी है, या फर्श पर कोई छाया हिल रही है। ये "विसंगतियां" (anomalies) हैं (ऐसी चीजें जो अलग हैं), लेकिन ये "विफलताएं" (failures) नहीं हैं (ऐसी चीजें जो कार्य को बाधित करती हैं)। यदि FIDeL हर बार मक्खी बैठने पर रोबोट को रोक देता, तो रोबोट कभी अपना काम पूरा नहीं कर पाता।

2. "स्मार्ट रूलर" (Conformal Prediction)

FIDeL को कैसे पता चलता है कि कोई "अंतर" चिंता करने लायक बड़ा है या नहीं? यह केवल अनुमान नहीं लगाता; यह एक स्मार्ट रूलर (Smart Ruler) का उपयोग करता है।

अतीत में, सुरक्षा प्रणालियाँ एक निश्चित रूलर का उपयोग करती थीं (जैसे, "यदि रोबोट पथ से 5 सेमी भटक जाता है, तो रुक जाओ!")। लेकिन रोबट अलग-अलग गति और अलग-अलग वातावरण में चलते हैं। एक 5 सेमी का विचलन एक चौड़े किचन में ठीक हो सकता है लेकिन एक तंग कोने में आपदा बन सकता है।

FIDeL कॉन्फ़ॉर्मल प्रेडिक्शन (Conformal Prediction) नामक एक विशेष गणितीय उपकरण का उपयोग करके एक गतिशील, लचीला रूलर बनाता है।

  • उपमा: एक रबर बैंड की कल्पना करें जो स्थिति के आधार पर खिंचता और सिकुड़ता है। यदि रोबोट कोई नाजुक कार्य कर रहा है, तो रबर बैंड कसकर बंधा है (बहुत संवेदनशील)। यदि वह कोई कठिन कार्य कर रहा है, तो बैंड ढीला है (अधिक सहिष्णु)। यह सुनिश्चित करता है कि FIDeL छोटी-मोटी हलचल पर घबराए नहीं, लेकिन वास्तविक और खतरनाक फिसलन को पकड़ ले।

3. "बुद्धिमान न्यायाधीश" (Semantic Filtering)

यही असली जादू है। जब "स्मार्ट रूलर" कहता है, "हे, यहाँ कुछ अजीब है!", तो FIDeL तुरंत रोबोट को नहीं रोकता। इसके बजाय, वह एक बुद्धिमान न्यायाधीश (Brainy Judge) (एक विज़न-लैंग्वेज मॉडल, या VLM) को बुलाता है।

न्यायाधीश उस अजीब चीज़ को देखता है और पूछता है: "क्या यह एक समस्या है?"

  • परिदृश्य A: रोबोट मेज पर एक मक्खी देखता है। "अंतर पहचानो" खेल चिल्ला उठा, और "स्मार्ट रूलर" ने कहा, "यह अजीब है!" न्यायाधीश मक्खी को देखता है, कार्य को पढ़ता है ("कॉफी बनाना"), और कहता है, "गलत अलार्म (False Alarm)। मक्खी कॉफी को नहीं रोकेगी। रोबोट को जारी रखने दें।"
  • परिदृश्य B: रोबोट देखता है कि कॉफी पॉट खाली है। "अंतर पहचानो" खेल चिल्ला उठता है। न्यायाधीश खाली पॉट को देखता है और कहता है, "वास्तविक विफलता! यदि रोबोट ऐसे ही प्रयास करता रहा तो वह जल जाएगा। रुक जाओ (STOP)!"

यह एक बड़ी बात क्यों है?

FIDeL से पहले, सुरक्षा प्रणालियाँ एक सुरक्षा गार्ड की तरह थीं जो हर उस हरकत पर "रुको!" चिल्लाते थे जो एकदम सटीक नहीं थी। इसका मतलब था कि रोबोट को बार-बार रोका जाता था, जिससे उत्पादन धीमा हो जाता था और उपयोगकर्ता निराश हो जाते थे।

FIDeL एक स्मार्ट सुरक्षा गार्ड की तरह है जो यह जानता है कि फर्श पर दौड़ती हुई एक हानिरहित गिलहरी और एक वास्तविक घुसपैठिये के बीच क्या अंतर है।

  • यह गलत अलार्म को कम करता है: यह रोबोट को मामूली गड़बड़ियों (जैसे मक्खी या छाया) के बावजूद काम जारी रखने देता है।
  • यह वास्तविक आपदाओं को पकड़ता है: यह रोबोट को कुछ भी तोड़ने या किसी को चोट पहुँचाने से पहले ही रोक देता है।
  • यह खुद को स्पष्ट करता है: यदि यह रोबोट को रोकता है, तो यह बता सकता है कि क्यों (जैसे, "कप खाली है"), जिससे मनुष्यों के लिए इस प्रणाली पर भरोसा करना आसान हो जाता है।

परिणाम

लेखकों ने इसका परीक्षण एक नए डेटासेट BotFails (वास्तविक दुनिया के रोबोट कार्यों का एक संग्रह जिसमें जानबूझकर गलतियाँ की गई हैं) पर किया। FIDeL पिछली विधियों की तुलना में वास्तविक विफलताओं को पहचानने में बहुत बेहतर था, जिसने महत्वपूर्ण अंतर से सटीकता में सुधार किया।

संक्षेप में: FIDeL रोबोट को यह "अंतर्ज्ञान" (gut feeling) देता है कि चीजें कब गलत हो रही हैं, लेकिन यह उन्हें यह तय करने के लिए एक "मस्तिष्क" भी देता है कि उन्हें वास्तव में रुकना चाहिए या बस आगे बढ़ते रहना चाहिए। यह एक ऐसे रोबोट के बीच का अंतर है जो डर से लगातार पंगु रहता है और एक ऐसे रोबोट के बीच का अंतर है जो आत्मविश्वासी, सुरक्षित और कुशल है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →