← नवीनतम पेपर
🤖 machine learning

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

यह शोध पत्र "Don't Fool Me Twice" प्रस्तावित करता है, जो एक निरंतर सीखने वाला (continual learning) ढांचा है जो ऑनलाइन व्यवधान अवलोकन (online disturbance observation), विजन-लैंग्वेज मॉडल तर्क (vision-language model reasoning), और कर्नेल रिग्रेशन (kernel regression) को जोड़कर मोबाइल एम्बोडेड एजेंटों को अनदेखी, एम्बोडिमेंट-विशिष्ट प्रतिकूलताओं के अनुकूल होने में सक्षम बनाता है ताकि वे विसंगतियों से सीख सकें और भविष्य के नियोजन एवं सुधार (planning and recovery) में सुधार कर सकें।

मूल लेखक: Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक व्यस्त, अप्रत्याशित शहर में चलना सिखा रहे हैं। अतीत में, हमने रोबोटों को उन सभी चीजों की एक विशाल नियम पुस्तिका देकर सिखाने की कोशिश की थी जो गलत हो सकती थीं (जैसे "गीले फर्श पर न चलें" या "गर्म चूल्हे को न छुएं")। लेकिन वास्तविक दुनिया अव्यवस्थित है। एक गीला फर्श पहियों वाले रोबोट के लिए खतरनाक हो सकता है, लेकिन उड़ने वाले ड्रोन के लिए ठीक हो सकता है। एक चमकदार दर्पण कैमरे को भ्रमित कर सकता है, लेकिन लेजर स्कैनर को नहीं।

यह शोध पत्र एक नई प्रणाली पेश करता है जिसे "डोंट फूल मी ट्वाइस" (DFM2) कहा जाता है। पहले से ही एक विशाल नियम पुस्तिका याद करने के बजाय, यह प्रणाली रोबोट को वास्तविक समय में अपनी गलतियों से सीखने के लिए प्रशिक्षित करती है, ताकि वह एक ही गलती दोबारा कभी न करे।

यह कैसे काम करता है, यहाँ सरल चरणों और उपमाओं के साथ दिया गया है:

1. "ओप्स" का क्षण (मुसीबत का पता लगाना)

कल्पना कीजिए कि आप सड़क पर चल रहे हैं, और अचानक आपको हवा का एक तेज़ झोंका महसूस होता है जो आपको रास्ते से धकेल देता है। आप लड़खड़ा जाते हैं।

  • रोबोट का दृष्टिकोण: रोबोट एक आदर्श पथ का पालन कर रहा है। अचानक, उसके सेंसर कहते हैं, "रुको, मैं वहां नहीं हूँ जहाँ मुझे होना चाहिए!" या "मेरा कैमरा भ्रमित हो रहा है।"
  • प्रणाली: DFM2 तुरंत इसे एक "एडवर्सिटी" (एक कठिन स्थिति) के रूप में चिह्नित करता है। यह इसे केवल अनदेखा नहीं करता; यह रुकता है और कहता है, "यहाँ कुछ गलत है।"

2. जासूसी का काम (मस्तिष्क से पूछना)

एक बार जब रोबोट लड़खड़ा जाता है, तो उसे यह जानने की आवश्यकता होती है कि क्यों

  • उपमा: कल्पना कीजिए कि आप एक पत्थर से टकराकर गिर गए। आप चारों ओर देखते हैं और एक बुद्धिमान मित्र (एक विजन-लैंग्वेज मॉडल, या VLM) से पूछते हैं, "मुझे ठोकर क्यों लगी?"
  • प्रणाली: रोबोट VLM को उस क्षेत्र की तस्वीर दिखाता है जहाँ वह लड़खड़ाया था। VLM उस छवि को देखता है और कहता है, "ओह, वह हवा फेंकने वाला एक पंखा है," या "वह फर्श पर एक काली चादर है जो तुम्हारे कैमरे को भ्रमित कर रही है।"
  • ट्विस्ट: पुराने सिस्टम के विपरीत जो लगातार VLM से पूछते रहते हैं (जो धीमा है और रोबोट को अत्यधिक सतर्क बनाता है, जिससे वह उन चीजों से भी बचने लगता है जो वास्तव में खतरनाक नहीं हैं), DFM2 केवल तब पूछता है जब कोई गलती होती है। यह इसे तेज़ और स्मार्ट बनाता है।

3. "खतरे का नक्शा" बनाना (खतरे के आकार को समझना)

अब जब रोबोट जान गया है कि समस्या का कारण क्या था (जैसे कि पंखा), तो उसे यह जानने की आवश्यकता है कि समस्या कितनी गंभीर है और वह कहाँ समाप्त होती है

  • उपमा: यदि एक पंखा आपको रास्ते से धकेल रहा है, तो हवा केवल पंखे के पास ही नहीं होती; वह एक विशिष्ट आकार में फैलती है। हवा के कुछ हिस्से तेज़ होते हैं, कुछ कमजोर।
  • प्रणाली: रोबोट खतरे का एक 3D "हीट मैप" बनाता है। वह सीखता है कि पंखे के ठीक बगल में पंखा रोबोट को ज़ोर से धकेलता है, लेकिन जैसे-जैसे आप दूर जाते हैं, इसका प्रभाव कम होता जाता है। यह केवल यह नहीं कहता कि "पंखा = बुरा"; यह कहता है "पंखा = यहाँ तेज़ धक्का, वहाँ हल्का धक्का।"
  • गणित: यह बहुत कम डेटा बिंदुओं का उपयोग करके इस आकार को बनाने के लिए एक चतुर गणितीय ट्रिक (कर्नेल रिग्रेशन) का उपयोग करता है, ताकि यह बिना सौ बार दुर्घटनाग्रस्त हुए तेज़ी से सीख सके।

4. "दोबारा कभी नहीं" का वादा (भविष्य की योजना)

यही "डोंट फूल मी ट्वाइस" का मूल है।

  • उपमा: अगली बार जब आप उसी पंखे को देखते हैं, तो आपको यह जानने के लिए गिरने की ज़रूरत नहीं है कि यह खतरनाक है। आपको हवा के आकार की याद रहती है और आप सुरक्षित रूप से इसके चारों ओर चलते हैं।
  • प्रणाली: रोबोट पंखे की "कहानी" और उसका 3D खतरा मानचित्र एक लाइब्रेरी में सहेज लेता है। यदि वह फिर से किसी पंखे को देखता है (भले ही वह कोई दूसरा पंखा हो), तो वह तुरंत उसे पहचान लेता है, जानता है कि उसे कितनी जगह देनी है, और उसके चारों ओर एक सुरक्षित रास्ता बनाने की योजना बनाता है।

"धोखा देने" के दो अलग प्रकार

शोध पत्र ने यह साबित करने के लिए कि यह सभी के लिए काम करता है, दो बहुत अलग प्रकार के रोबोटों पर इसका परीक्षण किया:

  1. उड़ने वाला ड्रोन (बाहरी बल):

    • समस्या: एक पंखा ड्रोन को उसके रास्ते से भटका देता है।
    • पाठ: ड्रोन पंखे के चारों ओर उड़ना सीखता है, न कि केवल पंखे से बचना। वह "विंड फील्ड" (हवा के क्षेत्र) को सीखता है।
  2. पहियों वाला रोबोट (आंतरिक भ्रम):

    • समस्या: रोबोट एक चिकनी, काली चादर के ऊपर से गुजरता है। उसका कैमरा भ्रमित हो जाता है क्योंकि वहां ट्रैक करने के लिए कोई पैटर्न नहीं है, और उसे लगता है कि वह चल रहा है जबकि वास्तव में वह फंसा हुआ है (या इसके विपरीत)।
    • पाठ: रोबोट सीखता है कि "काली चादर = कैमरा भ्रम।" वह केवल चादर से बचता नहीं है; वह धीमा होना या अपना कोण बदलना सीखता है ताकि उसका कैमरा बेहतर देख सके, जिससे भ्रम होने से पहले ही रोका जा सके।

परिणाम

परीक्षणों में, "डोंट फूल मी ट्वाइस" का उपयोग करने वाले रोबोट पुराने तरीकों का उपयोग करने वाले रोबोटों की तुलना में बहुत बेहतर थे:

  • पुराने रोबोट: या तो दुर्घटनाग्रस्त हो जाते थे क्योंकि उन्हें खतरे का पता नहीं था, या वे बहुत डरे हुए थे क्योंकि वे हर चीज़ से बचने के लिए बहुत लंबे, धीमे चक्कर लेते थे।
  • DFM2 रोबोट: वे कम बार दुर्घटनाग्रस्त हुए (परीक्षणों में 81.8% उत्तरजीविता दर), उन्होंने छोटे रास्ते लिए, और उन्होंने पंखे और भ्रमित करने वाले फर्श जैसी कठिन जगहों से बहुत सुचारू रूप से निकलना सीखा।

संक्षेप में: DFM2 एक रोबोट को उस छात्र से बदल देता है जो हर सबक भूल जाता है, एक ऐसे छात्र में जो अपनी हर गलती से सीखता है, खतरे के विशिष्ट आकार को याद रखता है, और आत्मविश्वास के साथ दुनिया में आगे बढ़ता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →