← नवीनतम पेपर
💻 computer science

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

यह शोधपत्र EntropyScan का प्रस्ताव करता है, जो एक हल्का और ट्रिगर-अज्ञेय (trigger-agnostic) तरीका है जो बेनाइन नमूनों पर विजुअल अटेंशन डिस्ट्रीब्यूशन में संरचनात्मक विसंगतियों को Tsallis एंट्रॉपी और Z-स्कोर नॉर्मलाइज़ेशन का उपयोग करके मात्रात्मक रूप से मापकर बैकडोर वाले लार्ज विजन-लैंग्वेज मॉडल्स का पता लगाता है, जो प्रशिक्षण डेटा या ट्रिगर्स के ज्ञान की आवश्यकता के बिना उच्च सटीकता प्राप्त करता है।

मूल लेखक: Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अभी-अभी एक तीसरे पक्ष के विक्रेता (third-party seller) से एक उच्च श्रेणी का, स्मार्ट कैमरा खरीदा है। आप इसका उपयोग तस्वीरों का वर्णन करने के लिए करना चाहते हैं, लेकिन आप चिंतित हैं: क्या विक्रेता ने इस कैमरे को गुप्त रूप से प्रोग्राम किया है कि यदि आप इसे कोई विशिष्ट, छिपी हुई आकृति दिखाएं तो यह कुछ खतरनाक कहे?

यह लार्ज विजन-लैंग्वेज मॉडल्स (LVLMs) की समस्या है। ये शक्तिशाली AI सिस्टम हैं जो छवियों को "देख" सकते हैं और उनके बारे में "बात" कर सकते हैं। चूंकि इन्हें अक्सर इंटरनेट से डाउनलोड किया जाता है, इसलिए इसमें बैकडोर (backdoor) के साथ "जहर" (poisoning) दिए जाने का जोखिम होता है।

एक बैकडोर एक गुप्त स्विच की तरह है। यदि आप AI को बिल्ली की एक सामान्य तस्वीर दिखाते हैं, तो वह कहता है, "यह एक बिल्ली है।" लेकिन यदि आप उसे एक बिल्ली की तस्वीर दिखाते जिस पर एक छोटा सा, अदृश्य स्टिकर (जिसे ट्रिगर कहते हैं) लगा हो, तो AI अचानक सुरक्षा नियमों को अनदेखा कर देता है और कुछ हानिकारक कहता है, जैसे "बम कैसे बनाएं।"

समस्या: "ब्लैक बॉक्स" निरीक्षण

आज के अधिकांश सुरक्षा उपकरण या तो AI के बनने से पहले जहर को खोजने की कोशिश करते हैं, या वे ट्रिगर को ढूंढकर AI को बात करते समय पकड़ने की कोशिश करते हैं। लेकिन क्या होगा यदि आपके पास पहले से ही एक तैयार AI मॉडल है, आप नहीं जानते कि गुप्त ट्रिगर कैसा दिखता है, और आपके पास मूल प्रशिक्षण डेटा (training data) भी नहीं है?

आपको मॉडल का निरीक्षण करने का एक तरीका चाहिए ताकि यह देखा जा सके कि क्या वह "बीमार" है, बिना यह जाने कि विशिष्ट बीमारी के लक्षण (ट्रिगर) क्या हैं।

समाधान: एंट्रॉपीस्कैन (EntropyScan - एक "अटेंशन एक्स-रे")

यह शोध पत्र एंट्रॉपीस्कैन (EntropyScan) नामक एक उपकरण पेश करता है। इसे AI के मस्तिष्क के लिए एक "एक्स-रे मशीन" की तरह समझें।

यह इस प्रकार काम करता है:

1. "फोकस" का उदाहरण

कल्पना कीजिए कि AI एक छात्र है जो एक फोटो को देख रहा है और उसका वर्णन लिख रहा है।

  • एक स्वस्थ छात्र (स्वस्थ मॉडल): एक समुद्र तट की फोटो देखते समय, उनकी आँखें स्वाभाविक रूप से रेत, लहरों और आकाश को एक संतुलित, तार्किक तरीके से स्कैन करती हैं। उनका "ध्यान" (attention) सुचारू रूप से फैला हुआ होता है।
  • एक "जहरीला" छात्र (बैकडोर वाला मॉडल): भले ही वे एक सामान्य फोटो देख रहे हों, बैकडोर इंजेक्शन ने उनके मस्तिष्क की वायरिंग को बिगाड़ दिया है। उनकी आँखें अजीब तरह से फड़क सकती हैं या किसी विशिष्ट हिस्से पर असामान्य रूप से टिकी रह सकती हैं, भले ही वहां कोई ट्रिगर मौजूद न हो। वे अजीब पैटर्न में "अत्यधिक ध्यान केंद्रित" (over-focusing) या "कम ध्यान केंद्रित" (under-focusing) कर रहे हैं।

2. "भ्रम" को मापना (एंट्रॉपी)

शोधकर्ताओं ने महसूस किया कि इस अजीब देखने के पैटर्न को त्सालिस एंट्रॉपी (Tsallis Entropy) नामक चीज़ का उपयोग करके गणितीय रूप से मापा जा सकता है।

  • एंट्रॉपी (Entropy) को "अव्यवस्था" या "आश्चर्य" के माप के रूप में सोचें।
  • एक स्वस्थ AI का ध्यान का पैटर्न अनुमानित और सुचारू होता है (कम आश्चर्य)।
  • एक जहरीला AI ध्यान का एक टेढ़ा-मेढ़ा, अराजक या अजीब तरह से केंद्रित पैटर्न दिखाता है (उच्च आश्चर्य/विसंगति)।

3. "संदर्भ जांच" (Reference Check)

यह जानने के लिए कि AI अजीब है या नहीं, आपको एक आधार रेखा (baseline) की आवश्यकता है।

  • संदर्भ (The Reference): शोधकर्ता उसी AI मॉडल के एक ज्ञात "स्वस्थ" संस्करण (डेवलपर द्वारा आधिकारिक रूप से जारी किया गया) को लेते हैं।
  • परीक्षण (The Test): वे "संदिग्ध" मॉडल और "स्वस्थ" संदर्भ मॉडल दोनों को एक ही 200 यादृच्छिक (random), सामान्य तस्वीरें देते हैं।
  • तुलना (The Comparison): वे देखते हैं कि संदिग्ध मॉडल का ध्यान पैटर्न, स्वस्थ वाले से कितना अलग है।

यदि संदिग्ध मॉडल का ध्यान पैटर्न स्वस्थ वाले की तुलना में काफी अधिक "शोर भरा" (noisy) या "अजीब" है, तो एंट्रॉपीस्कैन इसे बैकडोर वाला घोषित कर देता है।

यह विशेष क्यों है

  • ट्रिगर की आवश्यकता नहीं: आपको यह जानने की ज़रूरत नहीं है कि गुप्त स्टिकर कैसा दिखता है। आप बस यह देखते हैं कि AI सामान्य रूप से कैसे व्यवहार करता है।
  • हल्का (Lightweight): इसके लिए मॉडल को फिर से प्रशिक्षित करने या जटिल गणनाओं की आवश्यकता नहीं होती है। यह केवल कुछ सेकंड में मॉडल को स्कैन कर लेता है।
  • उच्च सटीकता: अपने परीक्षणों में, इस पद्धति ने जहरीले मॉडलों को 98.5% बार पकड़ा, यहाँ तक कि उन बहुत चालाक हमलों के खिलाफ भी जिन्हें अन्य विधियों ने छोड़ दिया था।

निष्कर्ष

एंट्रॉपीस्कैन एक ऐसे सुरक्षा गार्ड की तरह है जिसे चोर का चेहरा या चोरी की गई वस्तु जानने की आवश्यकता नहीं है। इसके बजाय, वे बस यह देखते हैं कि लोग दरवाजे से कैसे गुजरते हैं। यदि कोई अन्य लोगों की तुलना में अजीब, अप्राकृतिक तरीके से चलता है (ध्यान में संरचनात्मक विसंगति), तो गार्ड जानता है कि कुछ गलत है, भले ही वह हथियार को देख न सके।

शोध पत्र का दावा है कि यह विधि विभिन्न प्रकार के AI मॉडल और विभिन्न प्रकार के हमलों पर काम करती है, जो यह जांचने का एक तेज़, विश्वसनीय तरीका प्रदान करती है कि डाउनलोड किया गया AI सुरक्षित है या नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →