← नवीनतम पेपर
🤖 AI

Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models

यह शोध पत्र यह प्रदर्शित करके क्लाउड-एज लार्ज विजन-लैंग्वेज मॉडल (LVLM) इन्फरेंस में एक गंभीर भेद्यता को उजागर करता है कि एक ब्लैक-बॉक्स एडवर्सरी केवल 10% प्रसारित विजन टोकन को मैनिपुलेट करके विभिन्न अत्याधुनिक मॉडलों में सटीकता को 88.31% तक कम कर सकती है।

मूल लेखक: Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

प्रकाशित 2026-07-07
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट असिस्टेंट (एक लार्ज विजन-लैंग्वेज मॉडल) है, जो "क्लाउड" में स्थित एक विशाल, शक्तिशाली डेटा सेंटर में रहता है। हालाँकि, आप एक छोटे, बैटरी से चलने वाले डिवाइस जैसे कि स्मार्टफोन या स्मार्ट कैमरा पर "एज" (Edge) पर हैं।

रोबोट को आपकी ली गई तस्वीर के बारे में सवालों के जवाब देने के लिए, आप पूरी भारी तस्वीर क्लाउड पर नहीं भेजते हैं। इसके बजाय, आपका फोन एक त्वरित, हल्का स्कैन करता है और तस्वीर को डिजिटल "नोट्स" के एक सेट में बदल देता है जिसे विजन टोकन्स (Vision Tokens) कहा जाता है। फिर यह इन नोट्स को इंटरनेट के माध्यम से क्लाउड पर भेज देता है, जहाँ बड़ा दिमाग काम पूरा करता है और जवाब वापस भेज देता है।

नया कमजोर बिंदु: संदेशवाहक (The Messenger)

यह शोध पत्र तर्क देता है कि आपके फोन और क्लाउड के बीच यह "हैंड-ऑफ" (काम का हस्तांतरण) एक नया, खतरनाक कमजोर बिंदु बनाता है। इंटरनेट कनेक्शन को आपके और रोबोट के बीच दौड़ने वाले एक संदेशवाहक के रूप में सोचें।

शोधकर्ताओं ने पाया कि इस रास्ते के बीच में खड़ा एक हैकर (एक एडवर्सरी) उन डिजिटल नोट्स को बीच में ही रोक सकता है। उन्हें रोबोट के दिमाग को तोड़ने या आपके फोन को हैक करने की आवश्यकता नहीं है; उन्हें बस उन नोट्स को ले जाते समय उनमें थोड़ा सा बदलाव (tweak) करने की आवश्यकता है।

हमला: "विजन टोकन मैनिपुलेशन" (Vision Token Manipulation)

शोधकर्ता इस हमले को VTM-अटैक (विजन टोकन मैनिपुलेशन अटैक) कहते हैं। उन्होंने यह परीक्षण करने के लिए चार अलग-अलग तरीके आजमाए कि एक हैकर इन नोट्स के साथ कैसे छेड़छाड़ कर सकता है, भले ही वे उनमें से बहुत कम हिस्से (सिर्फ 10%) को ही क्यों न बदल दे:

  1. द शफल (परम्यूटेशन - The Shuffle): कल्पना करें कि नोट्स एक ताश की गड्डी हैं जो एक तस्वीर का वर्णन करती है। हैकर कुछ कार्डों का क्रम बदल देता है। रोबोट अभी भी उन्हीं कार्डों को देखता है, लेकिन जो कहानी वे बताते हैं वह अब उलझी हुई और भ्रमित करने वाली हो जाती है।
  2. द इरेज़र (मास्किंग - The Eraser): हैकर कुछ नोट्स को लेता है और उन्हें खाली कागज (शून्य) में बदल देता है। यह एक ऐसी फोटो को देखने जैसा है जहाँ पहेली के कुछ महत्वपूर्ण टुकड़े अचानक गायब हो गए हों।
  3. द स्टैटिक (गौसियन परटर्बेशन - The Static): हैकर नोट्स में थोड़ा सा "स्टैटिक" या शोर (noise) जोड़ देता है, जिससे वे थोड़े धुंधले या विकृत हो जाते हैं, जैसे रेडियो सिग्नल में हस्तक्षेप होता है।
  4. द फ्लिप (साइन फ्लिप - The Flip): यह सबसे विनाशकारी था। कल्पना करें कि एक नोट कहता है "लाल"। हैकर इसे "लाल नहीं" या रोबोट के दिमाग में बिल्कुल विपरीत दिशा में बदल देता है। यह एक नक्शा लेकर उत्तर के तीर को दक्षिण की ओर घुमाने जैसा है। रोबोट पूरी तरह से दिशा भटक जाता है।

परिणाम: ताश का घर (A House of Cards)

टीम ने आज उपलब्ध छह सबसे स्मार्ट विजन रोबोट्स (छोटे से लेकर विशाल मॉडल्स तक) पर इसका परीक्षण किया। परिणाम चौंकाने वाले थे:

  • मामूली बदलाव, बड़ा संकट: नोट्स में केवल 10% बदलाव करके, वे रोबोट की बुद्धिमत्ता को क्रैश कर सकते थे।
  • "फ्लिप" घातक था: कुछ मामलों में, "साइन फ्लिप" हमले ने रोबोट की सटीकता को लगभग 88% से घटाकर लगभग 0% कर दिया। यह ऐसा है जैसे किसी बुद्धिमान व्यक्ति ने कान में एक सूक्ष्म फुसफुसाहट सुनने के बाद अचानक पढ़ना या देखना भूल गया हो।
  • सभी रोबोट समान नहीं हैं: कुछ रोबोट मॉडल (जैसे Qwen परिवार) इन हमलों के तहत तुरंत ढह गए। अन्य (जैसे InternVL परिवार) थोड़े सख्त थे, लेकिन फिर भी असुरक्षित थे।

"स्मार्ट" हैक

शोधकर्ताओं ने यह तरीका भी खोजा जिससे हमला और भी बुरा हो सके। नोट्स के साथ रैंडम तरीके से छेड़छाड़ करने के बजाय, उन्होंने एक गणितीय पद्धति का उपयोग करके सबसे महत्वपूर्ण नोट्स (जिन पर रोबोट सबसे अधिक निर्भर करता है) को खोजने और विशेष रूप से उन्हें निशाना बनाने का तरीका अपनाया। इसने रोबोट को और भी तेज़ी से विफल कर दिया।

निष्कर्ष

यह शोध पत्र निष्कर्ष निकालता है कि जबकि आपके फोन और क्लाउड के बीच काम को विभाजित करना कुशल है, यह डेटा के साथ छेड़छाड़ करके सिस्टम को नुकसान पहुँचाने के लिए एक दरवाजा खोलता है। एज से क्लाउड तक भेजे जाने वाले "नोट्स" के साथ की गई थोड़ी सी, लक्षित छेड़छाड़ भी सबसे उन्नत AI विजन सिस्टम को पूरी तरह से विफल करने के लिए पर्याप्त है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →