← नवीनतम पेपर
🤖 machine learning

BadWAM: When World-Action Models Dream Right but Act Wrong

यह शोध पत्र BadWAM प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो यह प्रदर्शित करता है कि वर्ल्ड-एक्शन मॉडल्स (WAMs) उन प्रतिकूल हमलों के प्रति संवेदनशील हैं जहाँ छोटे दृश्य व्यवधान (visual perturbations) मॉडल की कल्पित भविष्य और उसके द्वारा निष्पादित कार्यों को अलग कर सकते हैं, जिससे महत्वपूर्ण कार्य विफलताओं का कारण बनता है, भले ही मॉडल के आंतरिक अनुमान तर्कसंगत बने रहें।

मूल लेखक: Qi Li, Xingyi Yang, Xinchao Wang

प्रकाशित 2026-07-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qi Li, Xingyi Yang, Xinchao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

स्वप्न देखते रोबोट और चालाक ग्लिच (The Dreaming Robot and the Sneaky Glitch)

एक ऐसे रोबोट की कल्पना करें जो न केवल वही देखता है जो अभी हो रहा है, बल्कि यह भी "सपना" देखता है कि आगे क्या होने वाला है। यह एम्बोडीड एआई (embodied AI) का अत्याधुनिक क्षेत्र है, जहाँ कंप्यूटर रोबोटिक भुजाओं या मोबाइल बेस जैसे भौतिक शरीरों को नियंत्रित करना सीखते हैं। पारंपरिक रूप से, रोबट रिफ्लेक्सिव मुक्केबाजों की तरह थे: उन्होंने एक मुक्का देखा और तुरंत जवाबी हमला कर दिया। लेकिन आधुनिक "वर्ल्ड-एक्शन मॉडल्स" (WAMs) शतरंज के ग्रैंडमास्टर्स की तरह हैं। कोई भी चाल चलने से पहले, वे अपने मन में भविष्य का अनुकरण (simulate) करते हैं। वे पूछते हैं, "अगर मैं इस कप को पकड़ता हूँ, तो क्या यह गिर जाएगा? अगर मैं यहाँ कदम रखता हूँ, तो क्या मैं लड़खड़ा जाऊँगा?" परिणाम की कल्पना करने की यह क्षमता उन्हें सुरक्षित और स्मार्ट बनाने के लिए बनाई गई है, जो एक अंतर्निहित सुरक्षा जांच के रूप में कार्य करती है। यदि भविष्य का रोबोट का सपना खतरनाक दिखता है, तो उसे रुक जाना चाहिए और फिर से सोचना चाहिए।

बड़ा सवाल जो शोधकर्ता पूछ रहे हैं, वह यह है: क्या यह स्वप्न देखते वाला रोबोट वास्तव में सुरक्षित है? यदि एक रोबोट अपने भविष्य की जाँच कर सकता है, तो क्या एक हैकर उसे धोखा दे सकता है? एक नए अध्ययन के अनुसार, इसका उत्तर चिंताजनक रूप से "हाँ" है। यह पेपर एक ऐसी स्थिति का पता लगाता है जहाँ रोबोट के कैमरा फीड में एक छोटा सा, लगभग अदृश्य बदलाव—जैसे धूल का एक कण या दीवार पर एक सूक्ष्म पैटर्न—रोबोट के मस्तिष्क को भ्रमित कर सकता है। डरावनी बात यह नहीं है कि रोबोट सपना देखना बंद कर देता है; बल्कि यह है कि रोबोट एक आदर्श, सुरक्षित भविष्य का सपना देखता रहता है जबकि उसका शरीर पूरी तरह से विनाशकारी कार्य कर रहा होता है। यह वैसा ही है जैसे रोबोट एक रस्सी पर सुरक्षित चलने का सपना देख रहा हो, लेकिन उसके पैर वास्तव में खाई में गिर रहे हों।

पेपर की खोज: बैडWAM (BadWAM)

इस पेपर के पीछे के शोधकर्ताओं ने, जिनका नेतृत्व क्यू ली और शिंचाओ वांग ने किया, इन रोबोटों का परीक्षण करने का एक नया तरीका पेश किया जिसे BadWAM कहा जाता है। BadWAM को रोबोट के सपनों के लिए एक "तनाव परीक्षण" (stress test) के रूप में समझें। वे देखना चाहते थे कि क्या वे एक रोबोट को बिना यह महसूस किए कि कुछ गलत हुआ है, कार्य विफल करने के लिए मजबूर कर सकते हैं। उन्होंने एक विशिष्ट भेद्यता (vulnerability) खोजी जिसे वे वर्ल्ड-एक्शन ड्रिफ्ट (World-Action Drift) कहते हैं।

आमतौर पर, जब हम किसी रोबोट को हैक करने के बारे में सोचते हैं, तो हम कल्पना करते हैं कि उसे ऐसी चीजें दिखाई जा रही हैं जो वहाँ नहीं हैं, जिससे वह घबरा जाए या जम जाए। लेकिन BadWAM ने कुछ अधिक चालाकी भरा पाया। शोधकर्ताओं ने दिखाया कि वे सूक्ष्म दृश्य ट्रिक्स का उपयोग करके रोबोट के "सपने" (भविष्य की उसकी भविष्यवाणी) को पूरी तरह से सामान्य दिखा सकते हैं, जबकि साथ ही उसके "कार्यों" (जो वह वास्तव में करता है) को हाईजैक कर सकते हैं।

पेपर दो मुख्य तरीकों से इस हमले के काम करने का प्रदर्शन करता है, जो परेशानी के दो अलग-अलग रूपों की तरह हैं:

  1. "ओवरट हाइजैक" (एक्शन-ओनली अटैक): यह शोर वाला, अव्यवस्थित संस्करण है। हमलावर रोबोट के दृश्य के साथ इतना छेड़छाड़ करता है कि वह तुरंत गलत काम करने लगे। LIBERO नामक डेटासेट पर उनके परीक्षणों में, यह हमला बहुत घातक था। इसने रोबोट की सफलता दर को एक अत्यधिक विश्वसनीय 96.5% से घटाकर एक अस्थिर 43.1% तक पहुँचा दिया। रोबोट वस्तुओं को उठाने की कोशिश करता है लेकिन उन्हें गिरा देता है या उन्हें पूरी तरह से मिस कर देता है।

  2. "स्टील्थ घोस्ट" (इमेजिनेशन-प्रिजर्विंग अटैक): यह वास्तव में डरावना हिस्सा है। यहाँ, हमलावर भेष बदलने में माहिर है। वे रोबोट के दृश्य में इस तरह बदलाव करते हैं कि भविष्य का रोबोट का "सपना" अभी भी एकदम सही और सुरक्षित दिखता है। यदि आप रोबोट से पूछेंगे, "तुम्हें क्या लगता है कि आगे क्या होगा?" तो वह कहेगा, "मुझे लगता है कि मैं ब्लॉक को उठाऊँगा और धीरे से रख दूँगा।" और उसके मन में, वास्तव में वही हो रहा है। लेकिन वास्तविकता में, रोबोट गलत जगह पहुँच रहा है या ब्लॉक को गिरा रहा है। "सपना" और "क्रिया" एक दूसरे से अलग (drift) हो गए हैं। रोबोट एक आपदा को अंजाम दे रहा है जबकि वह विश्वास कर रहा है कि वह एक सफलता को अंजाम दे रहा है।

शोधकर्ताओं ने पाया कि यह "ड्रिफ्ट" एक बड़ी सुरक्षा खामी है। उन्होंने विभिन्न प्रकार के रोबोट दिमागों (जिन्हें जॉइंट WAM और IDM WAM कहा जाता है) पर इसका परीक्षण किया और पाया कि भले ही रोबोट की भविष्य की भविष्यवाणियाँ सत्य के बहुत करीब रहीं (सपने को बरकरार रखते हुए), रोबोट फिर भी कार्य करने में विफल रहा। वास्तव में, उन्होंने पाया कि आप रोबोट को विफल कर सकते हैं जबकि "फ्यूचर डिस्टेंस" (सपना कितना बदला) को बहुत कम रखा जा सकता है। यह सुझाव देता है कि केवल रोबोट के "सपने" की जाँच करना उसे सुरक्षित रखने के लिए पर्याप्त नहीं है।

यह हमला कैसे काम करता है

पेपर बताता है कि BadWAM को रोबोट के गुप्त कोड या आंतरिक वेट्स (weights) को जानने की आवश्यकता नहीं है। यह एक ब्लैक-बॉक्स टेस्टर की तरह काम करता है। हमलावर रोबोट को एक विजुअल इनपुट भेजता है, जो एक्शन निकलता है उसे देखता है, और फिर इनपुट को थोड़ा सा बदलता है ताकि देख सके कि क्या वह एक्शन को और खराब कर सकता है। वे इसे बार-बार करते हैं, जैसे एक मूर्तिकार पत्थर के ब्लॉक को तराशता है, जब तक कि उन्हें एक ऐसा सूक्ष्म, अदृश्य पैटर्न न मिल जाए जो रोबोट को विफल होने के लिए मजबूर कर दे।

सबसे दिलचस्प निष्कर्षों में से एक यह है कि रोबोट कैसे विफल होता है। वह तुरंत पागल नहीं हो जाता। पेपर दिखाता है कि रोबोट अक्सर सामान्य व्यवहार के साथ शुरुआत करता है। वह शायद पहला ऑब्जेक्ट सफलतापूर्वक पकड़ ले, लेकिन जैसे-जैसे कार्य जारी रहता है, उसकी हरकतें धीरे-धीरे पटरी से उतरने लगती हैं। यह "हजारों कटों से मृत्यु" (death by a thousand cuts) वाला परिदृश्य है। रोबोट दूसरी वस्तु को गिरा देता है, तीसरी को मिस कर देता है, और अंततः पूरे मिशन में विफल हो जाता है, जबकि उसका आंतरिक सिमुलेशन इस बात पर अड़ा रहता है कि सब कुछ योजना के अनुसार चल रहा है।

अध्ययन ने यह भी देखा कि क्या यह ट्रिक अलग-अलग रोबोटों पर काम करती है। उन्होंने पाया कि यदि उन्होंने एक प्रकार के रोबोट मॉडल पर हमले को प्रशिक्षित किया, तो यह अक्सर अन्य, थोड़े अलग मॉडलों पर भी काम करता है। यह सुझाव देता है कि समस्या केवल एक विशिष्ट सॉफ़्टवेयर में बग नहीं है; यह एक मौलिक दोष है कि ये "सपना देखते" रोबोट अपने विचारों को अपने कार्यों से कैसे जोड़ते हैं।

सुरक्षा जाँच की सीमाएँ

पेपर ने कुछ सरल बचावों का भी परीक्षण किया, जैसे इमेज को धुंधला करना या कैमरा फीड में शोर (noise) जोड़ना, इस उम्मीद में कि हमलावर के ट्रिक को धोया जा सके। हालांकि इनमें से कुछ ट्रिक्स ने थोड़ा मदद किया, लेकिन वे रामबाण साबित नहीं हुए। या तो वे हमले को रोकने में विफल रहे या उन्होंने रोबोट को उस समय भी काम करने में बदतर बना दिया जब उस पर हमला नहीं किया जा रहा था। शोधकर्ताओं ने एक "डिटेक्टर" बनाने की भी कोशिश की जो यह फ्लैग करे कि रोबोट का सपना और क्रिया मेल नहीं खा रहे हैं, लेकिन यह डिटेक्टर अधिकांश हमलों को मिस कर गया जब इसे बहुत सावधानीपूर्वक सेट किया गया था (ताकि गलत अलार्म से बचा जा सके)।

इस शोध का निचोड़ रोबोटिक्स के क्षेत्र के लिए एक चेतावनी है। यह विचार कि "यदि एक रोबोट भविष्य की कल्पना कर सकता है, तो वह सुरक्षित होगा" बहुत नाजुक है। पेपर सुझाव देता है कि असली खतरा केवल यह नहीं है कि रोबोट गलत चीज़ देखता है, बल्कि यह है कि उसका कल्पना और उसके कार्य तालमेल से बाहर हो सकते हैं। एक रोबोट इस बात से पूरी तरह आश्वस्त हो सकता है कि वह सही काम कर रहा है, जबकि उसका शरीर गलत काम कर रहा होता है।

अपने प्रयोगों में, शोधकर्ताओं ने दिखाया कि केवल थोड़े से विजुअल नॉइज़ (परटर्बेशन साइज 0.06) के साथ, वे एक अत्यधिक सफल रोब ביותר को विफलता की ओर ले जाने वाले रोबोट में बदल सकते हैं। उन्होंने केवल रोबोट को तोड़ा नहीं; उन्होंने उस कनेक्शन को तोड़ दिया जो रोबोट के सोचने और उसके वास्तव में करने के बीच है। इसका अर्थ यह है कि अगली पीढ़ी के सुरक्षित रोबोटों के लिए, इंजीनियर केवल भविष्य की भविष्यवाणी करने की रोबोट की क्षमता पर भरोसा नहीं कर सकते। उन्हें ऐसे सिस्टम बनाने की आवश्यकता है जो लगातार यह जाँचते रहें कि क्या रोबोट का सपना उसकी वास्तविकता से मेल खाता है, यह सुनिश्चित करते हुए कि स्वप्नद्रष्टा और कर्ता दोनों एक ही पृष्ठ पर हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →