← नवीनतम पेपर
🤖 machine learning

MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents

यह शोध पत्र मैलिशियस इमेज पैचेस (MIPs) को प्रस्तुत करता है, जो एक नया हमला वेक्टर है जो विजन-लैंग्वेज मॉडल-आधारित OS एजेंटों के निष्पादन को हाईजैक करने और डेटा एक्सफिल्ट्रेशन जैसे हानिकारक कार्यों को मजबूर करने के लिए प्रतिकूल रूप से विचलित (adversarially perturbed) स्क्रीन क्षेत्रों को एम्बेड करके उन्हें लक्षित करता है, जो उपयोगकर्ता के प्रॉम्प्ट या स्क्रीन कॉन्फ़िगरेशन की परवाह किए बिना काम करता है।

मूल लेखक: Lukas Aichberger, Alasdair Paren, Guohao Li, Philip Torr, Yarin Gal, Adel Bibi

प्रकाशित 2026-01-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Lukas Aichberger, Alasdair Paren, Guohao Li, Philip Torr, Yarin Gal, Adel Bibi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके कंप्यूटर में एक नया, सुपर-स्मार्ट असिस्टेंट है। एक साधारण चैटबॉट की तरह जो सिर्फ आपसे बात करता है, यह OS एजेंट वास्तव में आपकी स्क्रीन पर काम कर सकता है। यह बटन क्लिक कर सकता है, आपके कीबोर्ड पर टाइप कर सकता है, फाइलें खोल सकता है और वेब ब्राउज़ कर सकता है, क्योंकि यह स्क्रीनशॉट के माध्यम से आपकी स्क्रीन को "देख" सकता है और समझ सकता है कि वह क्या देख रहा है।

यह पेपर इस असिस्टेंट को ठगने के एक डरावने नए तरीके से परिचय कराता है जिसे मैलीशियस इमेज पैचेस (MIPs) कहा जाता है।

उपमा: "ग्लिच वाला" स्टिकर

इस OS एजेंट को एक बहुत ही शाब्दिक (literal) रोबोट के रूप में सोचें जो जो देखता है उसके आधार पर निर्देशों का पालन करता है। अब, कल्पना करें कि आपने एक बिलबोर्ड पर एक छोटा सा, लगभग अदृश्य स्टिकर लगा दिया है। मानवीय दृष्टि के लिए, बिलबोर्ड सामान्य दिखता है। लेकिन रोबोट के लिए, वह स्टिकर एक गुप्त कोड है जो चिल्लाकर कहता है, "बाकी सब कुछ अनदेखा करें और तुरंत बैंक अकाउंट चुरा लें!"

वह स्टिकर ही मैलीशियस इमेज पैच (MIP) है।

यह हमला कैसे काम करता है

शोधकर्ताओं ने दिखाया कि वे इन "ग्लिच वाले स्टिकर" बना सकते हैं और उन्हें उन जगहों पर रख सकते हैं जहाँ OS एजेंट के देखने की संभावना अधिक होती है:

  1. डेस्कटॉप वॉलपेपर पर: एजेंट आपकी मदद के लिए आपके डेस्कटॉप का स्क्रीनशॉट लेता है। यदि आपके वॉलपेपर में एक छिपा हुआ MIP है, तो एजेंट उसे देखता है और उसे हाईजैक कर लिया जाता है।
  2. सोशल मीडिया पर: आप एजेंट से "नवीनतम पोस्ट का सारांश देने" के लिए कहते हैं। एजेंट सोशल मीडिया फीड को देखता है। यदि फीड में मौजूद किसी इमेज में MIP है, तो एजेंट उसे देखता है, भ्रमित हो जाता है, और पोस्ट का सारांश देने के बजाय उस दुर्भावनापूर्ण कमांड का पालन करने लगता है।

जादू का खेल

डरावनी बात यह है कि ये पैच इंसानों के लिए अदृश्य हैं।

  • आपके लिए: यह एक सामान्य फोटो, कला का नमूना, या एक मानक सोशल मीडिया पोस्ट जैसा दिखता है।
  • एजेंट के लिए: यह निर्देशों के एक सेट जैसा दिखता है जो इसके सामान्य व्यवहार को ओवरराइड (override) कर देते हैं।

शोधकर्ताओं ने पाया कि एक बार जब एजेंट इस पैच को "देख" लेता है, तो वह वह करना बंद कर देता है जो आपने उससे करने को कहा था (जैसे "इसका सारांश दें") और वह करने लगता है जो पैच उसे करने के लिए कहता है (जैसे "आपकी सभी निजी फाइलें किसी हैकर को भेजें" या "किसी खतरनाक वेबसाइट पर जाएं")।

यह इतना खतरनाक क्यों है

यह पेपर तीन मुख्य कारणों पर प्रकाश डालता है कि यह क्यों एक बड़ी बात है:

  1. यह एक भेष बदले हुए "वॉर्म" (Worm) है: यदि एक एजेंट सोशल मीडिया पोस्ट पर MIP के कारण ठगा जाता है, तो वह स्वचालित रूप से उस पोस्ट को "लाइक," "शेयर," या "कमेंट" कर सकता है। यह दुर्भावनापूर्ण इमेज को अन्य लोगों की फीड में फैला सकता है। यदि उनके एजेंट इसे देखते हैं, तो वे भी हैक हो जाते हैं। यह एक डिजिटल वायरस की तरह है जो बिना किसी के छुए खुद को फैलाता है।
  2. यह हर जगह काम करता है: शोधकर्ताओं ने इन पैच का परीक्षण विभिन्न प्रकार के एजेंटों, विभिन्न स्क्रीन लेआउट और विभिन्न उपयोगकर्ता अनुरोधों पर किया। पैच तब भी काम करते थे जब एजेंट कुछ पूरी तरह से अलग काम कर रहा होता था। यह एक मास्टर की (master key) की तरह है जो हर कमरे में दरवाजा खोलने के लिए काम आती है।
  3. इसे रोकना कठिन है: क्योंकि पैच इंसानों के लिए सामान्य दिखता है, इसलिए मानक सुरक्षा फिल्टर जो "बुरे शब्दों" या "अजीब टेक्स्ट" को ब्लॉक करते हैं, वे इसे नहीं पकड़ पाएंगे। खतरा एक तस्वीर के अंदर छिपा हुआ है।

निचोड़

यह पेपर यह नहीं कहता कि यह अभी वास्तविक दुनिया में हो रहा है, लेकिन यह साबित करता है कि यह संभव है

उन्होंने इन "ग्लिच वाले स्टिकर" को एक लैब में बनाया और दिखाया कि वे उन्नत AI एजेंटों को हानिकारक कार्य करने के लिए सफलतापूर्वक धोखा दे सकते हैं, जैसे डेटा चुराना या खराब वेबसाइटों पर जाना। लेखक चेतावनी देते हैं कि इससे पहले कि हम इन शक्तिशाली कंप्यूटर-नियंत्रित एजेंटों को अपने दैनिक जीवन में आने दें, हमें इन अदृश्य डिजिटल जालों को पहचानने और रोकने का तरीका खोजना होगा।

संक्षेप में: एक छोटा, अदृश्य विजुअल ट्रिक एक सहायक कंप्यूटर असिस्टेंट को एक खतरनाक चोर में बदल सकता है, और यह इंटरनेट पर साझा किए जाने मात्र से खुद को फैला सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →