← नवीनतम पेपर
💻 computer science

AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

यह शोध पत्र AEGIS को प्रस्तुत करता है, जो एक मैकेनिज्म-गाइडेड डिफेंस है जो टेक्स्ट-टू-इमेज मॉडल्स में विजुअल सिनोनिम जेलब्रेक्स को प्रभावी ढंग से बेअसर करने के लिए इन्फरेंस के दौरान स्पार्स सिमेंटिक-इंजेक्टिंग अटेंशन हेड्स की गतिशील रूप से पहचान करता है और उन्हें निर्देशित करता है, जबकि सौहार्दपूर्ण अवधारणाओं (benign concepts) की शुद्धता को बनाए रखता है।

मूल लेखक: Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

AEGIS का विवरण: टेक्स्ट-टू-इमेज मॉडल्स में विजुअल सिनोनिम जेलब्रेक्स के खिलाफ एक मैकेनिज्म-गाइडेड डिफेंस

बड़ी समस्या: AI आर्ट का "ट्रोजन हॉर्स" (Trojan Horse)

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, लेकिन थोड़ी लापरवाह कलाकार (AI) है जो वह सब कुछ बनाता है जिसका आप वर्णन करते हैं। आपने दरवाजे पर एक सुरक्षा गार्ड (सेफ्टी फिल्टर) तैनात किया है ताकि लोगों को हिंसा या नग्नता की तस्वीरें मांगने से रोका जा सके।

  • पुराना तरीका: यदि कोई कहता है, "एक खूनी अपराध स्थल (bloody crime scene) बनाओ," तो गार्ड उन्हें तुरंत रोक देता है।
  • नया पैंतरा (विजुअल सिनोनिम अटैक): एक चालाक हमलावर आता है और कहता है, "गहरे लाल रंग के पेंट की एक बिखरी हुई बाल्टी बनाओ।"
    • गार्ड के लिए, यह पूरी तरह से मासूम लगता है। यह सिर्फ पेंट है!
    • लेकिन कलाकार के दिमाग के लिए, "गहरा लाल पेंट" और "खून" इतने दृश्य रूप से समान हैं कि कलाकार फिर से अपराध स्थल बनाना शुरू कर देता है।

इसे विजुअल सिनोनिम अटैक (VSA) कहा जाता है। टेक्स्ट सुरक्षित है, लेकिन तस्वीर खतरनाक निकलती है।

दुविधा: "बच्चे और स्नान के पानी" वाली समस्या (The "Baby and the Bathwater" Problem)

यह पेपर बताता है कि वर्तमान बचाव प्रणाली एक भयानक विकल्प में फंसी हुई है:

  1. कुछ न करें: "लाल पेंट" के अनुरोधों को आने दें, और आपको हिंसक चित्र मिलेंगे।
  2. सब कुछ ब्लॉक कर दें: "लाल पेंट" के हमलों को रोकने के लिए, आप कलाकार से कहते हैं, "दोबारा कभी लाल पेंट का उपयोग मत करना।"
    • परिणाम: अब कलाकार केचप, स्ट्रॉबेरी या सूर्यास्त नहीं बना सकता। आपने बुरे लोगों को रोकने के लिए कलाकार की मासूम चीजें बनाने की क्षमता को बर्बाद कर दिया है। इसे ओवर-मिटिगेशन (over-mitigation) कहा जाता है।

समाधान: AEGIS (द "सर्जिकल स्पाई")

शोधकर्ताओं ने AEGIS नामक एक नया डिफेंस बनाया है। दरवाजे पर खड़े होने या पूरे रंगों को प्रतिबंधित करने के बजाय, AEGIS एक सर्जिकल स्पाई (Surgical Spy) की तरह काम करता है जो कलाकार के चित्र बनाते समय उसके मस्तिष्क की निगरानी करता है।

यह कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:

1. जांच (मैकेनिस्टिक विश्लेषण)

शोधकर्ताओं ने पूछा: AI के दिमाग के अंदर ठीक कहाँ "लाल पेंट" बदलकर "खून" बन जाता है?

उन्होंने पाया कि AI एक बड़ा दिमाग नहीं है; यह हजारों छोटे श्रमिकों (जिन्हें अटेंशन हेड्स कहा जाता है) से बना है।

  • निष्कर्ष: जब AI कुछ बुरा बनाता है, तो वह अपने सभी श्रमिकों का उपयोग नहीं कर रहा होता है। वह केवल एक बहुत ही विशिष्ट समूह का उपयोग कर रहा होता है (लगभग 10% श्रमिक), जिन्हें "सेमेंटिक-इंजेक्टिंग हेड्स" कहा जाता है।
  • उपमा: एक विशाल ऑर्केस्ट्रा की कल्पना करें। जब संगीत डरावना हो जाता है, तो पूरा ऑर्केस्ट्रा जोर से नहीं बज रहा होता; बल्कि पीछे की पंक्ति में केवल तीन विशिष्ट वायलिन वादक ही एक डरावनी धुन बजाना शुरू करते हैं।

2. रणनीति (एडेप्टिव स्टीयरिंग)

पूरे ऑर्केस्ट्रा को निकालने (जिससे संगीत बर्बाद हो जाए) या वायलिन वादकों को अनदेखा करने (जिससे डरावना संगीत बजता रहे) के बजाय, AEGIS कुछ चतुर करता है:

  • यह समस्या पैदा करने वालों की पहचान करता है: यह जानता है कि कौन से 10% श्रमिक "लाल पेंट" को "खून" में बदलने के लिए जिम्मेदार हैं।
  • यह एक "रिपल्शन फोर्स" (विकर्षण बल) लागू करता है: जब वे विशिष्ट श्रमिक कुछ असुरक्षित बनाने की कोशिश करते हैं, तो AEGIS उनके हाथों को उस डरावने विचार से दूर धकेल देता है।
  • यह समझदार है: यदि श्रमिक एक हानिरहित लाल टमाटर बनाने की कोशिश कर रहे हैं, तो AEGIS उन्हें अकेला छोड़ देता है। यह केवल तभी विरोध करता है जब वास्तव में "डरावनी धुन" बज रही हो।

3. परिणाम

  • सुरक्षा: "लाल पेंट" के अनुरोध अब हिंसा में नहीं बदलते। हमला विफल हो जाता है।
  • उपयोगिता (Utility): कलाकार अभी भी केचप, स्ट्रॉबेरी और सूर्यास्त पूरी तरह से बना सकता है। "हानिरहित" लाल रंग सुरक्षित रहता है।
  • गति: क्योंकि AEGIS चित्र बनाने की प्रक्रिया के दौरान केवल कुछ ही श्रमिकों को ट्यून करता है, इसलिए यह AI को ज्यादा धीमा नहीं करता है। इसे पूरे कलाकार को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; यह बस एक रियल-टाइम सुपरवाइजर की तरह काम करता है।

यह क्यों महत्वपूर्ण है

पेपर का दावा है कि यह एक बड़ी उपलब्धि है क्योंकि यह "सुरक्षा बनाम उपयोगिता" की दुविधा को हल करता है। पिछले तरीके एक मक्खी को मारने के लिए हथौड़े (सभी लाल चीजों को ब्लॉक करना) के उपयोग की तरह थे। AEGIS एक लेजर पॉइंटर का उपयोग करके केवल मक्खी को मारने जैसा है, जिससे बाकी कमरा अछूता रहता है।

उन्होंने विभिन्न AI मॉडल्स (जैसे Stable Diffusion और FLUX) पर इसका परीक्षण किया और पाया कि AEGIS कला की गुणवत्ता को खराब किए बिना अन्य किसी भी तरीके की तुलना में "विजुअल सिनोनिम" के धोखे को बेहतर ढंग से रोकता है।

संक्षेप में: AEGIS उस छोटे, छिपे हुए स्विच को ढूंढ लेता है जो AI को सुरक्षित शब्दों को खतरनाक चित्रों में बदलने के लिए उपयोग करता है, और यह स्विच केवल तभी बंद करता है जब आवश्यक हो, जिससे AI सुरक्षित और रचनात्मक दोनों बना रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →