← नवीनतम पेपर
💻 computer science

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

यह शोध पत्र प्रकट करता है कि उभरते हुए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs), पारंपरिक डिफ्यूजन मॉडल्स की तुलना में अधिक सुरक्षा जोखिम पैदा करते हैं क्योंकि वे अपनी बेहतर सेमेंटिक समझ के माध्यम से अधिक असुरक्षित सामग्री उत्पन्न करते हैं और पहचान से अधिक प्रभावी ढंग से बच निकलते हैं, जिससे इन अल्प-मान्य चुनौतियों को संबोधित करने की तत्काल आवश्यकता रेखांकित होती है।

मूल लेखक: Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

प्रकाशित 2026-03-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि AI आर्ट जनरेशन की दुनिया एक हलचल भरी रसोई है। लंबे समय तक, इस रसोई के शेफ डिफ्यूजन मॉडल्स (जैसे स्टेबल डिफ्यूजन) थे। वे सख्त रेसिपी का पालन करने में माहिर थे, लेकिन यदि आप उन्हें कोई अस्पष्ट या अमूर्त आदेश देते, तो वे अक्सर भ्रमित हो जाते, खाना जला देते, या बस आपको बिखरे हुए पिक्सल की एक प्लेट परोस देते।

हाल ही में, रसोई में एक नए प्रकार के शेफ ने प्रवेश किया है: मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM)। इन्हें "सुपर-शेफ" के रूप में सोचें जो बेहतरीन भाषाविद् भी हैं। वे केवल रेसिपी का पालन नहीं करते; वे आपके शब्दों के पीछे के इरादे, सांस्कृतिक संदर्भ और यहाँ तक कि स्लैंग (बोलचाल की भाषा) को भी समझते हैं।

यह पेपर एक सुरक्षा निरीक्षण रिपोर्ट है जो एक डरावना सवाल पूछ रही है: क्या एक ऐसा शेफ होना जो आपको बहुत अच्छी तरह समझता है, रसोई को अधिक खतरनाक बना देता है?

यहाँ उनके निष्कर्षों का विवरण दिया गया, सरल उपमाओं का उपयोग करते हुए:

1. "टूटा हुआ बनाम खतरनाक" विरोधाभास (The "Broken vs. Dangerous" Paradox)

निष्कर्ष: नए सुपर-शेफ (MLLMs) पुराने डिफ्यूजन शेफ की तुलना में "असुरक्षित" या हानिकारक चित्र (जैसे हिंसा या नग्नता) बनाने की बहुत अधिक संभावना रखते हैं।

उपमा:
कल्पना कीजिए कि आप एक शेफ से "एक डरावने राक्षस की तस्वीर बनाने" के लिए कहते हैं।

  • पुराना शेफ (डिफ्यूजन): इस अमूर्त अवधारणा से भ्रमित हो जाता है। वह शायद "डरावना" शब्द को चित्रित करने की कोशिश करेगा या बस एक धुंधला सा कचरा बना देगा। क्योंकि छवि टूटी हुई या निरर्थक है, सुरक्षा फिल्टर अक्सर इसे अनदेखा कर देते हैं। यह एक ऐसी कार की तरह है जो खाई में गिरने से पहले ही खराब हो गई।
  • नया शेफ (MLLM): समझता है कि "डरावना राक्षस" का वास्तव में क्या अर्थ है। वे एक भयानक, वास्तविक दिखने वाला राक्षस बनाते हैं। क्योंकि यह छवि इतनी सटीक है और आपके इरादे का पूरी तरह पालन करती है, इसलिए यह वास्तव में खतरनाक सामग्री है
  • जोखिम: नए शेफ जटिल, अमूर्त या यहाँ तक कि स्लैंग-आधारित अनुरोधों को समझने में इतने अच्छे हैं कि वे ऐसी हानिकारक सामग्री बना सकते हैं जिसे पुराने शेफ बनाना ही नहीं समझ पाते।

2. "भाषा की बाधा" का जाल (The "Language Barrier" Trap)

निष्कर्ष: नए शेफ किसी भी भाषा में खतरनाक होते हैं, जबकि पुराने शेफ ज्यादातर तब विफल होते हैं जब आप ऐसी भाषा बोलते हैं जो वे नहीं जानते।

उपमा:
यदि आप चीनी भाषा में एक खतरनाक व्यंजन का ऑर्डर देने की कोशिश करते हैं:

  • पुराना शेफ: चीनी नहीं बोलता। वह खाली नजरों से देखता रहता है या रैंडम आकृतियाँ बना देता है। भाषा की बाधा के कारण खतरा रुक जाता है।
  • नया शेफ: चीनी (और कई अन्य भाषाओं) में कुशल है। वह अनुरोध को पूरी तरह समझता है और तुरंत वह खतरनाक व्यंजन बना देता है। इसका मतलब है कि बुरे तत्व केवल भाषा बदलकर सुरक्षा फिल्टरों को बायपास कर सकते हैं।

3. "जेंडर बायस" (लिंग पूर्वाग्रह) की गड़बड़ी (The "Gender Bias" Glitch)

निष्कर्ष: जब बिना लिंग निर्दिष्ट किए किसी "व्यक्ति" को यौन या हिंसक संदर्भ में चित्रित करने के लिए कहा जाता है, तो नए शेफ भारी रूप से महिलाओं को चित्रित करना चुनते हैं।

उपमा:
यदि आप किसी इंसान को "एक डरावनी स्थिति में एक व्यक्ति को चित्रित करने" के लिए कहते हैं, तो वे पुरुष या महिला बना सकते हैं। लेकिन इन AI शेफों में एक अजीब, अंतर्निहित पूर्वाग्रह है। यदि आप कहते हैं "एक व्यक्ति को चित्रित करो," तो वे लगभग स्वचालित रूप से हानिकारक परिदृश्य में एक महिला को चित्रित करते हैं। यह एक ऐसे कैमरे की तरह है जो, आप चाहे किसी पर भी पॉइंट करें, जब दृश्य गहरा (डार्क) होता है तो हमेशा महिलाओं पर ही फोकस करता है। यह हानिकारक रूढ़ियों को पुख्ता करता है।

4. "अदृश्य स्याही" की समस्या (The "Invisible Ink" Problem - Fake Image Detection)

निष्कर्ष: यह पता लगाना बहुत कठिन है कि एक छवि सुपर-शेफ (MLLM) द्वारा बनाई गई है या पुराने शेफ (डिफ्यूजन) द्वारा।

उपमा:
कल्पना कीजिए कि सुरक्षा गार्ड (फेक इमेज डिटेक्टर्स) जालसाजी पकड़ने की कोशिश कर रहे हैं।

  • पुराने शेफ की जालसाजी: ये थोड़ी "अजीब" दिखती हैं। लाइटिंग अजीब होती है, या हाथों में बहुत अधिक उंगलियां होती हैं। गार्ड इन्हें आसानी से पकड़ सकते हैं।
  • नए शेफ की जालसाजी: ये इतनी वास्तविक हैं कि ये असली कैमरे से ली गई फोटो जैसी लगती हैं।
  • ट्विस्ट: पेपर ने पाया कि यदि आप नए शेफ को एक लंगा, विस्तृत विवरण देते हैं (जैसे "एक कुत्ता" के बजाय, "घास पर पत्तों के साथ धूप वाले पार्क में दौड़ता हुआ एक गोल्डन रिट्रीवर" कहें), तो छवि और भी अधिक वास्तविक हो जाती है और गार्डों के लिए इसे पकड़ना और भी कठिन हो जाता है। पुराना शेफ लंबे विवरण से बस भ्रमित होकर कचरा बना देता है, लेकिन नया शेफ उन विवरणों का उपयोग एक परफेक्ट फेक बनाने के लिए करता है।

5. क्या हम गार्ड्स को ठीक कर सकते हैं? (Can We Fix the Guards?)

निष्कर्ष: हम गार्ड्स को नई जालसाजी पहचानने के लिए प्रशिक्षित कर सकते हैं, लेकिन यह कठिन है।

उपमा:

  • गार्ड्स को प्रशिक्षित करना: यदि हम सुरक्षा गार्डों को पुराने मैसी (कचरा) और नए परफेक्ट जालसाजी दोनों के उदाहरण दिखाते हैं, तो वे अपने काम में बेहतर हो जाते हैं।
  • समस्या: वास्तविक दुनिया में, हमारे पास हमेशा नए शेफ के "सीक्रेट सॉस" (ट्रेनिंग डेटा) तक पहुंच नहीं होती है। व्यावसायिक सुरक्षा उपकरण (जैसे कि सोशल मीडिया कंपनियों द्वारा उपयोग किए जाने वाले) अक्सर "ब्लैक बॉक्स" होते हैं। उन्हें पुराने शेफ पर प्रशिक्षित किया गया था और वे नए शेफ को पकड़ने के लिए संघर्ष कर रहे हैं। यह एक छोटे बच्चे के लिए बने जाल से एक मास्टर चोर को पकड़ने की कोशिश करने जैसा है।

निचोड़ (The Bottom Line)

पेपर यह निष्कर्ष निकालता है कि हालांकि ये नए AI मॉडल अद्भुत उपकरण हैं जो हमें बेहतर समझते हैं, उनकी समझने की क्षमता ही उनकी सबसे बड़ी सुरक्षा खामी भी है।

वे एक सुपर-इंटेलिजेंट जिनी (Genie) की तरह हैं जो आपकी इच्छाओं को बिल्कुल वैसे ही पूरा करते हैं जैसा आपका इरादा है, भले ही आपका इरादा कुछ बुरा हो। पुराने मॉडल एक अनाड़ी जिनी की तरह थे जो अक्सर आपको गलत समझ लेते थे, जिससे अनजाने में हम अपने स्वयं के बुरे आवेगों से बच जाते थे। जैसे-जैसे हम इन स्मार्ट मॉडल्स की ओर बढ़ रहे हैं, हमें ऐसे नए सुरक्षा जाल की आवश्यकता है जो न केवल "बुरे शब्दों" को, बल्कि चतुर और जटिल तरीकों से व्यक्त किए गए "बुरे विचारों" को भी संभाल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →