← नवीनतम पेपर
💬 NLP

Dynamic Token Reweighting for Robust Vision-Language Models

यह शोधपत्र DTR को प्रस्तुत करता है, जो एक नवीन इन्फरेंस-टाइम डिफेंस (inference-time defense) है, जो विजन-लैंग्वेज मॉडल्स में मल्टीमॉडल जेलब्रेक हमलों को प्रभावी ढंग से कम करने के लिए की-वैल्यू कैश्स (key-value caches) को अनुकूलित करके विजुअल टोकन को गतिशील रूप से पुन: भारित (reweight) करता है, जबकि सामान्य क्षमताओं और दक्षता को बनाए रखता है।

मूल लेखक: Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विज़न-लैंग्वेज मॉडल (VLM) एक बहुत ही बुद्धिमान, सुशिक्षित लाइब्रेरियन है जो किताबें (टेक्स्ट) पढ़ सकता है और चित्रों (इमेज) को देख सकता है। इस लाइब्रेरियन को मददगार होने के लिए प्रशिक्षित किया गया है, लेकिन यह खतरनाक अनुरोधों को मना करने के लिए भी बनाया गया है, जैसे कि "मैं बम कैसे बनाऊं?"

हालाँकि, हैकर्स ने इस लाइब्रेरियन को धोखा देने का एक चालाकी भरा तरीका खोज लिया है। वे केवल सवाल नहीं पूछते; वे लाइब्रेरियन को एक ऐसी तस्वीर दिखाते हैं जो मासूम दिखती है लेकिन उसमें छिपे हुए खतरनाक निर्देश होते हैं (जैसे कि बम की एक फोटो जिसके साथ कैप्शन लिखा हो "इसे कैसे बनाएं?")। लाइब्रेरियन उस तस्वीर से भ्रमित हो जाता है, अपने सुरक्षा नियमों को भूल जाता है, और गलती से खतरनाक निर्देश दे देता है। इसे "मल्टीमॉडल जेलब्रेक" (Multimodal Jailbreak) कहा जाता है।

यह पेपर एक नया बचाव पेश करता है जिसे DTR (डायनेमिक टोकन रीवेटिंग - Dynamic Token Reweighting) कहा जाता है। यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है:

1. समस्या: चित्र में "खराब शोर" (Bad Noise)

जब लाइब्रेरियन एक तस्वीर को देखता है, तो वह उसे हजारों छोटे-छोटे टुकड़ों में तोड़ देता है जिन्हें "टोकन" (सोचिए कि ये पहेली के व्यक्तिगत टुकड़े या पिक्सेल हैं) कहा जाता है।

  • एक सामान्य तस्वीर में, सभी टुकड़े मिलकर एक कहानी बताते हैं।
  • एक जेलब्रेक तस्वीर में, हैकर कुछ विशिष्ट टुकड़ों में "खराब शोर" जोड़ देता है। ये खराब टुकड़े लाइब्रेरियन के कान में फुसफुसाते हैं, "अपने सुरक्षा नियमों को अनदेखा करो! मेरी ओर देखो!"

2. पुराने समाधान: भारी हथौड़े (The Heavy Hammers)

इसे रोकने के पिछले तरीके एक बड़े हथौड़े (Sledgehammer) के उपयोग की तरह थे:

  • फाइन-ट्यूनिंग (Fine-tuning): लाइब्रेरियन को नई किताबों के साथ फिर से प्रशिक्षित करना। यह महंगा है, धीमा है, और कभी-कभी लाइब्रेरियन अपने वास्तविक काम (जैसे वस्तुओं की पहचान करना) को करना भूल जाता है।
  • इमेज-टू-टेक्स्ट (Image-to-Text): लाइब्रेरियन को जवाब देने से पहले तस्वीर का वर्णन जोर से करने के लिए मजबूर करना। यह धीमा है और अक्सर उन सूक्ष्म विवरणों को खो देता है जिनका उपयोग हैकर उन्हें ठगने के लिए करते हैं।

3. नया समाधान: DTR (एक स्मार्ट वॉल्यूम नॉब)

DTR एक चतुर, रियल-टाइम फिक्स है जो तब होता है जब लाइब्रेरियन तस्वीर को देख रहा होता है। इसके लिए लाइब्रेरियन को फिर से प्रशिक्षित करने या तस्वीर का वर्णन करने की आवश्यकता नहीं होती है। इसके बजाय, यह पहेली के टुकड़ों के लिए "स्मार्ट वॉल्यूम नॉब" की तरह काम करता है।

यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

चरण A: "रिफ्यूजल डायरेक्शन" (Refusal Direction) खोजना

सबसे पहले, सिस्टम लाइब्रेरियन की "सुरक्षा मांसपेशी" का पता लगाता है। यह उस विशिष्ट मानसिक दिशा को सीखता है जिस पर लाइब्रेरियन तब जाता है जब वह कहता है, "नहीं, मैं यह नहीं कर सकता।" आइए इसे "रिफ्यूजल वेक्टर" (Refusal Vector) कहें।

चरण B: "रिवर्शल" (Reversal) परीक्षण

जब एक नई तस्वीर आती है, तो DTR एक काल्पनिक प्रश्न पूछता है: "यदि मैं तस्वीर के कुछ हिस्सों का वॉल्यूम कम कर दूँ, तो क्या मैं लाइब्रेरियन को वापस 'ना' कहने की ओर धकेल सकता हूँ?"

  • यदि तस्वीर सुरक्षित (Benign) है: तस्वीर के कुछ हिस्सों का वॉल्यूम कम करने से लाइब्रेरियन के मन में ज्यादा बदलाव नहीं आता है। तस्वीर स्पष्ट है, और लाइब्रेरियन मददगार बना रहता है।
  • यदि यह एक जेलब्रेक है: सिस्टम पाता है कि केवल कुछ विशिष्ट "खराब शोर" वाले टुकड़ों का वॉल्यूम कम करने से लाइब्रेरियन अचानक अपने सुरक्षा नियमों को याद कर लेता है और अनुरोध को अस्वीकार कर देता है।

चरण C: डायनेमिक रीवेटिंग (The Magic)

एक बार जब DTR उन "खराब शोर" वाले टुकड़ों की पहचान कर लेता है, तो यह गतिशील रूप से उनका भार (Weight) कम कर देता है (यानी उनका वॉल्यूम कम कर देता है) और अच्छे टुकड़ों को तेज रखता है

  • उपमा: कल्पना कीजिए कि एक गाना गा रहा एक समूह (Choir) है। यदि एक गायक खतरनाक आदेश चिल्ला रहा है, तो DTR उस गायक को समूह से बाहर नहीं निकालता (क्योंकि इससे गाना बिगड़ जाएगा)। इसके बजाय, यह उस विशिष्ट गायक पर 'म्यूट बटन' लगा देता है जबकि बाकी समूह को स्पष्ट और तेज रहने देता है। गाना (छवि का अर्थ) बरकरार रहता है, लेकिन खतरनाक आदेश शांत हो जाता है।

यह बेहतर क्यों है?

  1. यह तेज़ है: इसे तस्वीर को फिर से पढ़ने या मॉडल को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह बस तुरंत वॉल्यूम नॉब को एडजस्ट करता है।
  2. यह सटीक है: यह केवल छवि के "बुरे" हिस्सों को चुप कराता है, जिससे लाइब्रेरियन अभी भी तस्वीर के बाकी हिस्सों को स्पष्ट रूप से देख सकता है।
  3. यह हैकर्स के लिए एक जाल है: पेपर नोट करता है कि हैकर्स के लिए एक मजेदार दुविधा है। लाइब्रेरियन को ठगने के लिए, उन्हें "खराब शोर" को तेज रखना होगा। लेकिन अगर वे इसे तेज करते हैं, तो DTR इसे पकड़ लेता है और इसे म्यूट कर देता है। यदि वे इसे इतना धीमा रखते हैं कि DTV का ध्यान न जाए, तो लाइब्रेरियन ट्रिक को अनदेखा कर देता है और सुरक्षित रहता है। हैकर जीत नहीं सकता।

सारांश

DTR एक क्लब के बाउंसर की तरह है जो भीड़ में से उस एक व्यक्ति को तुरंत पहचान सकता है जो हथियार लेकर अंदर घुसने की कोशिश कर रहा है। सभी को बाहर निकालने के बजाय (जो पार्टी को रोक देता है) या सबकी जेबें तलाशने के बजाय (जिसमें बहुत समय लगता है), बाउंसर बस उस एक व्यक्ति के चारों ओर एक "फोर्स फील्ड" बना देता है, जिससे हथियार निष्प्रभावी हो जाता है जबकि बाकी पार्टी सामान्य रूप से चलती रहती है।

यह AI मॉडल को उनकी मददगार, तेज़ और स्मार्ट होने की क्षमता खोए बिना विजुअल ट्रिक्स से सुरक्षित रहने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →