← नवीनतम पेपर
💻 computer science

Not What You Asked For: Typographic Attacks in Household Robot Manipulation

यह शोध पत्र प्रदर्शित करता है कि विज़न-लैंग्वेज मॉडल का उपयोग करने वाले घरेलू रोबोटों पर टाइपोग्राफिक हमले दृश्य निर्णय को दरकिनार कर भौतिक रूप से परिणामी हेरफेर विफलताओं का कारण बन सकते हैं, जो रोबोट के सिमेंटिक मैप को विषाक्त करके और वस्तुओं की गलत पकड़ने तथा परिवहन की ओर ले जाकर एक सिम्युलेटेड वातावरण में 67.8% सफलता दर प्राप्त करते हैं।

मूल लेखक: Ali Iranmanesh, Peng Liu

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ali Iranmanesh, Peng Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक घरेलू रोबोट की कल्पना एक मददगार लेकिन थोड़े नादान सहायक के रूप में करें। इसके दुनिया को समझने के दो मुख्य तरीके हैं:

  1. इसकी आँखें (दृष्टि): यह किसी वस्तु को देखता है और कहता है, "यह एक कॉफी मग जैसा दिखता है।"
  2. इसका मस्तिष्क (भाषा): यह आपके आदेश को सुनता है, "कृपया मेरे लिए कॉफी मग ले आओ," और शब्दों को जो वह देख रहा है उससे मिलाता है।

आधुनिक रोबोटों में, इन दोनों प्रणालियों को एक ही "मस्तिष्क" (जिसे विजन-लैंग्वेज मॉडल कहा जाता है) में जोड़ दिया जाता है। यह इसलिए बेहतरीन है क्योंकि रोबोट बिना दोबारा प्रशिक्षित हुए हजारों नई चीजों को समझ सकता है। हालांकि, यह शोध पत्र बताता है कि यह जुड़ाव एक खतरनाक खामी पैदा करता है।

"जादुई स्टिकर" का खेल

शोधकर्ताओं ने पाया कि यदि आप किसी पूरी तरह से अलग वस्तु पर, जैसे कि टोस्टर, जूता या लैंप पर, "COFFEE MUG" शब्द लिखे हुए कागज का एक टुकड़ा चिपका देते हैं, तो रोबोट का मस्तिष्क भ्रमित हो जाता है।

क्योंकि रोबोट का "भाषा" और "दृष्टि" वाला हिस्सा आपस में बहुत मजबूती से जुड़ा हुआ है, रोबोट वस्तु के आकार और रंग को देखना बंद कर देता है। इसके बजाय, वह पहले टेक्स्ट को पढ़ता है और बाद में देखता है। वह "COFFEE MUG" शब्द देखता है और तुरंत तय कर लेता है, "आह, यह कॉफी मग ही होगा," और इस तथ्य को पूरी तरह अनदेखा कर देता है कि वह वास्तव में एक टोस्टर है।

डोमिनो प्रभाव: एक नज़र से पकड़ने तक

जो चीज़ इसे खतरनाक बनाती है, वह केवल यह नहीं है कि रोबोट सोचता है कि टोस्टर एक मग है। बल्कि यह है कि इसके बाद क्या होता है।

  1. जहरीला मानचित्र: रोबोट केवल एक छोटी गलती नहीं करता; वह इस त्रुटि को अपने कमरे के स्थायी 3D मानसिक मानचित्र (mental map) में लिख देता है। यह ऐसा है जैसे रोबोट ने अपनी याददाश्त में टोस्टर पर एक स्टिकी नोट चिपका दिया हो और लिखा हो "यह एक मग है।"
  2. अंधा विश्वास: भले ही रोबोट दूर चला जाए और वापस आए, या यदि स्टिकर दिखाई न दे रहा हो, फिर भी वह अपने मानसिक मानचित्र पर भरोसा करता है। वह सोचता है, "मुझे पता है कि वहां एक मग रखा है," क्योंकि उसने पहले वह बात अपनी याददाश्त में दर्ज कर ली थी।
  3. काइनेटिक विफलता (Kinetic Failure): रोबोट फिर चलकर आता है, टोस्टर को उठाता है, और उसे आपको देने या कप होल्डर में रखने की कोशिश करता है।

शोध पत्र इसे "काइनेटिक फेलियर" कहता है। यह केवल एक सॉफ्टवेयर ग्लिच नहीं है जहाँ रोबोट गलत चीज़ बोल देता है; यह एक भौतिक क्रिया है जहाँ रोबोट गलत वस्तु के प्रति प्रतिबद्ध हो जाता है और उसे पूरे घर में इधर-उधर ले जाता है।

प्रयोग: उन्होंने इसका परीक्षण कैसे किया

शोधकर्ता वास्तविक रोबोटों पर वास्तविक घरों में इसका परीक्षण नहीं कर सके (यह बहुत महंगा और जोखिम भरा है), इसलिए उन्होंने हैबिटेट (Habitat) नामक एक अत्यधिक यथार्थवादी वीडियो गेम सिमुलेशन का उपयोग किया।

  • सेटअप: उन्होंने एक ऐसे रोबोट को लिया जो पहले से ही वस्तुओं को खोजने और उठाने में सक्षम था।
  • हमला: उन्होंने एक लक्षित वस्तु (जैसे "CUP") का नाम लिखे हुए प्रिंटेड स्टिकर को एक यादृच्छिक (random), पास की वस्तु (डिस्ट्रैक्टर) पर रखा।
  • परिणाम: 59 विशिष्ट परीक्षण परिदृश्यों में, जहाँ रोबोट पहले से ही काम करने में सक्षम था, स्टिकर ने रोबलेट को 67.8% बार धोखा दिया।

सबसे सफल मामलों में, रोबोट ने केवल गलत चीज़ नहीं पकड़ी; उसने सफलतापूर्वक गलत वस्तु तक रास्ता बनाया, उसे उठाया, कमरे के पार ले गया, और उसे सही जगह पर रखने की कोशिश की। रोबोट उस गलती के प्रति पूरी तरह "प्रतिबद्ध" था।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पिछली रिसर्च ने इस बात पर ध्यान दिया कि स्टिकर रोबोट को गलत जगह तक नेविगेट करने के लिए कैसे धोखा देते हैं (जैसे ड्रोन का गलत छत की ओर उड़ना)। लेकिन यह पहली बार है जब किसी ने दिखाया है कि स्टिकर रोबोट को भौतिक रूप से गलत वस्तु को पकड़ने और हिलाने के लिए कैसे धोखा दे सकते हैं।

खतरा यह है कि रोबोट की "याददाश्त" (3D मैप) उस जहर को जीवित रखती है। भले ही आप स्टिकर हटा दें, रोबोट अभी भी गलत वस्तु को उठाने की कोशिश कर सकता है क्योंकि उसका आंतरिक मानचित्र दूषित हो गया है।

प्रस्तावित समाधान

लेखकों का सुझाव है कि हम केवल रोबोट की "आंखों" को टेक्स्ट को अनदेखा करने के लिए ठीक नहीं कर सकते। हमें यह बदलना होगा कि रोबोट अपनी याददाश्त का उपयोग कैसे करता है। वे तीन सुरक्षा जांच प्रस्तावित करते हैं:

  1. दोबारा जांचें (Double-Check): केवल एक नज़र पर भरोसा न करें। रोबोट को अपनी स्थायी याददाश्त में लिखने से पहले वस्तु को अलग-अलग कोणों से देखने दें।
  2. टेक्स्ट को पहचानें (Spot the Text): एक माध्यमिक प्रणाली होनी चाहिए जो कहे, "रुको, इस वस्तु पर एक स्टिकर है। अभी इस लेबल पर भरोसा मत करो।"
  3. अंतिम जांच (Final Check): वस्तु को पकड़ने से ठीक पहले, रोबोट को एक आखिरी बार उसे देखने दें ताकि यह सुनिश्चित हो सके कि उसे धोखा नहीं दिया गया है।

संक्षेप में: शब्दों वाला कागज का एक टुकटा एक स्मार्ट रोबोट को यह सोचने के लिए धोखा दे सकता है कि टोस्टर एक कप है, और रोबोट खुशी-खुशी उस टोस्टर को आपकी रसोई के काउंटर तक ले जाएगा। यह पेपर साबित करता है कि यह भविष्य के घरेलू रोबोटों के लिए एक वास्तविक, भौतिक जोखिम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →