← नवीनतम पेपर
💻 computer science

VALD: Multi-Stage Vision Attack Detection for Efficient LVLM Defense

VALD एक प्रशिक्षण-मुक्त, बहु-चरणीय रक्षा प्रणाली है जो लार्ज विजन-लैंग्वेज मॉडल्स के लिए कम लागत वाले इमेज कंसिस्टेंसी चेक और टेक्स्ट-एम्बेडिंग विश्लेषण को एजेंटिक डेटा कंसोलिडेशन के साथ जोड़कर प्रतिकूल हमलों (एडवर्सरियल अटैक्स) का कुशलतापूर्वक पता लगाती है, जिससे स्वच्छ इनपुट्स के लिए कम्प्यूटेशनल ओवरहेड को कम करते हुए अत्याधुनिक सटीकता प्राप्त होती है।

मूल लेखक: Nadav Kadvil, Malak Fares, Ayellet Tal

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nadav Kadvil, Malak Fares, Ayellet Tal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन थोड़ा भोला रोबोट सहायक है जिसका नाम LVLM (लार्ज विजन-लैंग्वेज मॉडल) है। यह रोबोट किसी तस्वीर को देखकर उसका सटीक वर्णन कर सकता है, जैसे कि कोई टूर गाइड। "यह पार्क में फ्रिसबी के साथ खेल रहा एक गोल्डन रिट्रीवर है," यह कह सकता है।

हालाँकि, हैकर्स फोटो में बहुत छोटे, अदृश्य "ग्लिच" (खामियां) डाल सकते हैं। आपकी मानवीय आँखों के लिए, फोटो बिल्कुल वैसी ही दिखती है जैसी वह थी। लेकिन रोबोट के लिए, ये ग्लिच एक सम्मोहक फुसफुसाहट की तरह हैं जो उसे यह कहने पर मजबूर कर देते हैं कि "यह वास्तव में एक लाल फायर हाइड्रेंट है!" रोबोट को झूठ बोलने के लिए छल लिया जाता है, भले ही वह अपनी पूरी कोशिश कर रहा हो।

यह शोध पत्र एक नया सुरक्षा तंत्र पेश करता है जिसे VALD (विज़न अटैक डिटेक्शन) कहा जाता है ताकि इसे रोका जा सके। इसे VALD के रूप में न देखें जो एक भारी, महंगे बॉडीगार्ड की तरह है जो इमारत में प्रवेश करने वाले हर व्यक्ति की जांच करता है, बल्कि एक चतुर, बहु-चरणीय सुरक्षा टीम के रूप में देखें जो त्वरित जांच और स्मार्ट तर्क का मिश्रण उपयोग करती है।

VALD कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:

1. "एक त्वरित नज़र" (चरण 1: प्रारंभिक पहचान)

अधिकांश लोग जो इमारत में आ रहे हैं वे निर्दोष हैं। हर किसी का आईडी कार्ड विस्तार से जांचने में बहुत समय लगता है। इसलिए, VALD के पास एक त्वरित नज़र (Quick Glance) चरण है।

  • उपमा: कल्पना कीजिए कि आपके पास बिल्ली की एक फोटो है। यदि आप इसे सिकोड़ते हैं, धुंधला करते हैं, या एक कोने को काट देते हैं, तो भी यह स्पष्ट रूप से एक बिल्ली ही रहेगी। इसका "सार" नहीं बदला है।
  • हैक: यदि फोटो में कोई छिपा हुआ हैकर ग्लिच है, तो सिकोड़ने या धुंधला करने से अक्सर वह ग्लिच "टूट" जाता है। रोबोट अचानक कुत्ते को बिल्ली के बजाय देख सकता है, या भ्रमित हो सकता है।
  • कार्रवाई: VALD जल्दी से फोटो लेता है, उस पर कुछ हानिरहित फिल्टर लगाता है (जैसे धुंधला करना या क्रॉप करना), और रोबोट से पूछता है: "क्या यह अभी भी उसी चीज़ जैसा दिखता है?"
    • यदि उत्तर है "हाँ, यह सुसंगत है": बहुत बढ़िया! यह शायद एक साफ फोटो है। VALD रोबोट को तुरंत जवाब देने की अनुमति देता है। ऐसा 95% समय होता है, जिससे बहुत सारा समय और ऊर्जा बचती है।
    • यदि उत्तर है "रुको, यह अजीब लग रहा है": यह इसे संदिग्ध के रूप में चिह्नित करता है और अगले चरण पर चला जाता है।

2. "समूह चर्चा" (चरण 2: विलंबित पहचान)

संदिग्ध फोटो के लिए, हमें गहराई से जांच करने की आवश्यकता है, लेकिन हम अभी भी कुशल रहना चाहते हैं।

  • उपमा: कल्पना कीजिए कि आप 10 अलग-अलग लोगों से एक ही धुंधली फोटो का वर्णन करने के लिए कहते हैं। यदि वे सभी कहते हैं, "यह एक बिल्ली है," तो आप उन पर भरोसा करते हैं। यदि एक कहता है "यह एक बिल्ली है" और दूसरा कहता है "यह एक टोस्टर है," तो आप जानते हैं कि फोटो या उनमें से कोई एक भ्रमित है।
  • कार्रवाई: VALD मूल फोटो और सभी फिल्टर किए गए संस्करणों के लिए विवरण तैयार करता है। फिर यह टेक्स्ट (पाठ) को देखता है। यदि विवरण इधर-उधर बिखरे हुए हैं (कुछ "बिल्ली" कहते हैं, कुछ "टोस्टर", कुछ "फायर हाइड्रेंट"), तो यह पुष्टि करता है कि हमला हो रहा है। यदि वे ज्यादातर सहमत हैं, तो यह अभी भी सुरक्षित हो सकता है।

3. "स्मार्ट संपादक" (चरण 3: अंतिम सुधार)

केवल उन फोटो के लिए जो पहले दो जांचों में विफल रहे, VALD "बिग बॉस" (एक बहुत ही शक्तिशाली, महंगी AI) को बुलाता है।

  • उपमा: कल्पना कीजिए कि आपके पास एक अव्यवस्थित कमरा है जिसमें उसमें मौजूद चीजों के 10 अलग-अलग विवरण हैं। कुछ कहते हैं "नीली कुर्सी," कुछ कहते हैं "लाल कुर्सी," और एक कहता है "उड़ता हुआ यूनिकोर्न।" आपको इस सब को साफ करने के लिए एक स्मार्ट संपादक की आवश्यकता है।
  • कार्रवाई: बिग बॉस सभी अलग-अलग विवरणों को देखता है। वह एक सरल नियम का उपयोग करता है: "बहुमत पर भरोसा करें, बाहरी विचारों (outliers) को अनदेखा करें।"
    • यदि 10 में से 9 विवरण "कुत्ता" कहते हैं, और 1 "फायर हाइड्रेंट" कहता है, तो संपादक जानता है कि "फायर हाइड्रेंट" हैक का परिणाम है।
    • संपादक सुसंगत हिस्सों ("कुत्ता," "पार्क," "फ्रिसबी") को जोड़ता है और अजीब, असंगत हिस्सों को हटा देता है।
    • महत्वपूर्ण: बिग बॉस यह केवल कठिन मामलों के लिए करता है। यह हर फोटो के लिए कीमती AI का समय बर्बाद नहीं करता है।

यह एक गेम-चेंजर क्यों है?

  1. यह तेज़ है: क्योंकि यह 95% सामान्य फोटो को तुरंत फ़िल्टर कर देता है, यह सिस्टम को धीमा नहीं करता है। यह एक वीआईपी लाइन की तरह है जहाँ केवल संदिग्ध लोगों को ही प्रतीक्षा करनी पड़ती है।
  2. यह सस्ता है: आपको हर एक फोटो के लिए सबसे महंगी, शक्तिशाली AI की आवश्यकता नहीं है। आप महंगी "बिग बॉस" का उपयोग केवल तभी करते हैं जब अत्यंत आवश्यक हो।
  3. यह स्मार्ट है: फोटो को "ठीक" करने (जो कठिन है) के बजाय, यह उस कहानी को ठीक करता है जो रोबोट बताता है। यह समझ जाता है कि यदि फोटो को अलग तरह से देखने पर कहानी बदल जाती है, तो वह कहानी एक झूठ है।

निष्कर्ष

VALD एक जासूसी एजेंसी की तरह है जो जानती है कि उसके 95% क्लाइंट निर्दोष हैं। हर किसी से पूछताछ करने के बजाय, वह एक त्वरित बैकग्राउंड चेक करता है। यदि आप पास हो जाते हैं, तो आप स्वतंत्र हैं। यदि आप संदिग्ध दिखते हैं, तो वे विशेषज्ञों की एक टीम को नोट्स की तुलना करने और सच का पता लगाने के लिए बुलाते हैं। इस तरह, वे अच्छे लोगों का समय बर्बाद किए बिना बुरे लोगों को पकड़ लेते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →