← नवीनतम पेपर
💻 computer science

Failing Forward: Adaptive Failure-Informed Learning for Vision-Language-Action Models

यह शोध पत्र एडेप्टिव फेलियर-इन्फॉर्म्ड लर्निंग (AFIL) को प्रस्तुत करता है, जो एक एंड-टू-एंड फ्रेमवर्क है जो ऑनलाइन-जनरेटेड फेलियर ट्राजेक्टरीज को एडेप्टिव नेगेटिव गाइडेंस के रूप में उपयोग करके विजन-लैंग्वेज-एक्शन मॉडल्स की मजबूती को बढ़ाता है ताकि नीतियों को त्रुटि-प्रवण क्षेत्रों से दूर ले जाया जा सके और कार्य सफलता दरों में सुधार किया जा सके।

मूल लेखक: Meng Zheng, Samhita Marri, Anwesa Choudhuri, Benjamin Planche, Zhongpai Gao, Van Nguyen Nguyen, Terrence Chen, Girish Chowdhary, Ziyan Wu

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Meng Zheng, Samhita Marri, Anwesa Choudhuri, Benjamin Planche, Zhongpai Gao, Van Nguyen Nguyen, Terrence Chen, Girish Chowdhary, Ziyan Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई कार्य करना सिखा रहे हैं, जैसे ब्लॉक को एक के ऊपर एक रखना या प्लेट पर केला रखना। पारंपरिक रूप से, हम रोबोट को मनुष्यों द्वारा उस कार्य को पूरी तरह से (परफेक्टली) करने के वीडियो दिखाकर सिखाते हैं। रोबोट इन "सफलता की कहानियों" को देखता है और उनकी नकल करने की कोशिश करता है।

समस्या क्या है? वास्तविक जीवन परफेक्ट नहीं होता। यदि रोबोट थोड़ा फिसल जाता है या किसी वस्तु को अजीब कोण पर पकड़ लेता है, तो उसे यह नहीं पता होता कि इसे कैसे ठीक किया जाए। क्योंकि उसने केवल सटीक उदाहरणों से सीखा है, उसे यह नहीं पता कि चीजें गलत होने पर क्या करना है। वह बस वही गलती करता रहता है जब तक कि पूरा कार्य विफल न हो जाए। यह एक नाविक को केवल शांत, स्थिर समुद्र में सिखाने जैसा है; जैसे ही तूफान आता है, उसे समझ नहीं आता कि पतवार कैसे संभालनी है।

यह शोध पत्र इस समस्या को ठीक करने के लिए AFIL (Adaptive Failure-Informed Learning) नामक एक नई विधि पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. केवल सफलता से नहीं, बल्कि गलतियों से सीखना

केवल रोबोट को कार्य को पूरी तरह से करने के वीडियो दिखाने के बजाय, AFIL उसे एक साथ दो चीजें सिखाता है:

  • "सफलता" वाला शिक्षक: रोबोट को दिखाता है कि कार्य को पूरी तरह से कैसे किया जाता है।
  • "विफलता" वाला शिक्षक: रोबोट को दिखाता है कि चीजें गलत होने पर क्या होता है (जैसे, वस्तु को गिरा देना, लक्ष्य से चूक जाना)।

रोबोट दोनों से सीखता है। वह "सही तरीके" से चलना सीखता है, लेकिन वह यह भी सीखता है कि "गलत तरीके" को कैसे पहचाना जाए ताकि वह उससे बच सके।

2. "दो सिरों वाला" मस्तिष्क

शोधकर्ताओं ने एक विशेष रोबोट मस्तिष्क बनाया है जिसके दो "सिर" (जिसे Dual Action Generator कहा जाता है) हैं जो एक ही आँखों और कानों (दृष्टि और भाषा की समझ) को साझा करते हैं:

  • सिर A भविष्यवाणी करता है कि एक आदर्श चाल कैसी दिखती है।
  • सिर B भविष्यवाणी करता है कि एक असफल चाल कैसी दिखती है।

उन्हें दो अलग-अलग, विशाल मस्तिष्कों की आवश्यकता नहीं है। वे सारा भारी काम (छवि और निर्देशों को समझना) साझा करते हैं, लेकिन निर्णय लेने के लिए उनके पास अलग-अलग "मांसपेशियां" होती हैं। यह सिस्टम को कुशल बनाता है और इसके लिए बहुत अधिक अतिरिक्त कंप्यूटर शक्ति की आवश्यकता नहीं होती है।

3. "स्टीयरिंग व्हील" जो खुद को समायोजित करता है

यह सबसे चतुर हिस्सा है। जब रोबोट वास्तव में कार्य कर रहा होता है, तो वह केवल "सफलता" वाले शिक्षक का अंधाधुंध पालन नहीं करता है। वह लगातार "विफलता" वाले शिक्षक की जांच करता रहता है।

इसे कार चलाने के समान समझें जिसमें एक बहुत ही स्मार्ट सह-पायलट है:

  • यदि रास्ता साफ है और "सफलता" और "विफलता" दोनों शिक्षक एक ही पथ पर सहमत हैं, तो रोबोट सामान्य रूप से गाड़ी चलाता है।
  • लेकिन, यदि रोबोट किसी खाई की ओर बढ़ने लगता है (एक विफलता), तो "विफलता" वाला शिक्षक चिल्लाकर कहता है, "वहाँ मत जाओ!"
  • इसके बाद सिस्टम स्वचालित रूप से स्टीयरिंग व्हील को समायोजित करता है ताकि रोबोट को खाई से दूर और सुरक्षित पथ की ओर धकेला जा सके।

शोध पत्र इसे "Adaptive Negative Guidance" कहता है। यह एक चुंबकीय प्रतिकर्षण (repulsion) की तरह है: रोबोट गलती के जितने करीब आता है, उसे सुरक्षा की ओर वापस धकेलने वाला बल उतना ही मजबूत होता जाता है। महत्वपूर्ण बात यह है कि यह बल स्थिर नहीं है; यह केवल तभी मजबूत होता है जब रोबro वास्तव में विफल होने के खतरे में होता है, और जब चीजें ठीक चल रही होती हैं तो यह कमजोर रहता है।

4. उन्हें "विफलता" का डेटा कैसे मिलता है

आप सोच सकते हैं, "आप रोबोट को सब कुछ तोड़े बिना विफल होते हुए दिखाने के लिए वीडियो कैसे प्राप्त करते हैं?"
शोधकर्ताओं ने रोबोट को तोड़ने के लिए मनुष्यों को काम पर नहीं रखा। इसके बजाय, उन्होंने रोबोट को अपने आप कार्य करने के लिए छोड़ दिया। जब वह अनिवार्य रूप से कोई गलती करता है, तो सिस्टम उस "ओह!" वाले क्षण को रिकॉर्ड कर लेता है। यह एक छात्र द्वारा गणित के सवाल हल करने के अभ्यास जैसा है; जब वे गलत उत्तर देते हैं, तो वे अपनी गलती को लिख लेते हैं ताकि अगली बार उससे सीख सकें। यह स्वचालित रूप से होता है, बिना मनुष्यों द्वारा विशिष्ट "विफलता परिदृश्यों" को मैन्युअल रूप से डिजाइन किए।

परिणाम

टीम ने रोबोट द्वारा विभिन्न कार्यों को करने पर इसका परीक्षण किया, साधारण स्टैकिंग से लेकर जटिल, बहु-चरणीय कार्यों तक।

  • बेहतर रिकवरी: जब चीजें थोड़ी सी गलत हुईं, तो AFIL रोबोट को पता था कि इसे कैसे ठीक किया जाए, जबकि पुराने रोबोट बस हार मान लेते थे।
  • नई स्थितियाँ: AFIL रोबोट उन नई वस्तुओं या अव्यवस्थित मेजों को संभालने में बहुत बेहतर था जिन्हें उसने पहले नहीं देखा था।
  • लंबे कार्य: यह विशेष रूप रूप से लंबे, जटिल कार्यों के लिए अच्छा था जहाँ छोटी गलतियाँ आमतौर पर कुल विफलता में बदल जाती हैं।

संक्षेप में: AFIL रोबोट को सिखाता है कि विफलता सीखना का एक हिस्सा है। उन्हें यह दिखाकर कि क्या नहीं करना है और उन्हें गलतियों से दूर जाने का एक स्मार्ट, समायोज्य तरीका देकर, रोबोट अधिक विश्वसनीय, मजबूत और वास्तविक दुनिया की अव्यवस्था के लिए तैयार हो जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →