← नवीनतम पेपर
🤖 machine learning

No Safe Dose: How Training Data Drives Unsafe Image Generation

यह शोध पत्र यह प्रदर्शित करता है कि टेक्स्ट-टू-इमेज मॉडलों में असुरक्षित आउटपुट को सीधे और निरंतर रूप से प्रशिक्षण डेटा में असुरक्षित छवियों की पूर्ण संख्या के बजाय उनकी आनुपातिकता संचालित करती है, साथ ही यह भी दिखाता है कि सुरक्षा फ़िल्टरिंग छवि की गुणवत्ता को कम किए बिना मॉडल की सुरक्षा में सुधार करती है और टेक्स्ट एनकोडर भी अवशिष्ट जोखिम में महत्वपूर्ण योगदान देता है।

मूल लेखक: Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली कलाकार को लिखित विवरणों के आधार पर चित्र बनाना सिखा रहे हैं। यह कलाकार लाखों तस्वीरों और उनके साथ दिए गए विवरणों (कैप्शन) को देखकर सीखता है।

यह शोध पत्र, "No Safe Dose," एक सरल लेकिन महत्वपूर्ण प्रश्न पूछता है: यदि सीखने के दौरान आप गलती से इस कलाकार को कुछ खराब या खतरनाक तस्वीरें खिला दें, तो क्या वे बाद में खतरनाक चित्र बनाने लगेंगे?

यहाँ शोधकर्ताओं ने क्या पाया है, इसे सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. "खराब सेब" का प्रभाव (The "Bad Apples" Effect)

शोधकर्ताओं ने एक नियंत्रित प्रयोग किया। उन्होंने अलग-अलग "टोकरियों" का उपयोग करके एक ही AI कलाकार को प्रशिक्षित किया।

  • टोकरी A: 0% खराब तस्वीरें (पूरी तरह से स्वच्छ)।
  • टोकरी B: 1.2% खराब तस्वीरें (इंटरनेट पर पाई जाने वाली प्राकृतिक मात्रा)।
  • टोकरी C: 5% खराब तस्वीरें।
  • टोकरी D: 10% खराब तस्वीरें।

परिणाम: जैसे-जैसे उन्होंने प्रशिक्षण की टोकरी में खराब तस्वीरें जोड़ीं, AI ने अधिक खराब चित्र बनाना शुरू कर दिया। यह कोई अचानक हुआ बदलाव नहीं था; यह एक स्थिर, अनुमानित बढ़त थी। प्रशिक्षण डेटा में जितने अधिक "खराब सेब" होंगे, AI उतना ही अधिक "खराब सेब" पैदा करेगा।

2. यह अनुपात के बारे में है, संख्या के बारे में नहीं

आप सोच सकते हैं, "अगर मेरे पास 1,00,000 खराब तस्वीरों वाली एक बड़ी टोकरी है, तो यह 1,000 खराब तस्वीरों वाली छोटी टोकरी से बदतर है।" शोध पत्र कहता है—नहीं

महत्वपूर्ण यह है कि खराब तस्वीरों का प्रतिशत (अनुपात) क्या है, न कि कुल संख्या।

  • उपमा: कल्पना कीजिए कि आप सूप में मसाला डाल रहे हैं। यदि आप चाय के एक छोटे कप में एक चुटकी नमक डालते हैं, तो वह बहुत नमकीन हो जाता है। यदि आप एक विशाल बर्तन में एक चुटकी नमक डालते हैं, तो वह मुश्किल से पता चलता है। लेकिन यदि आप विशाल बर्तन में एक चम्मच नमक डालते हैं, तो वह बहुत नमकीन हो जाता है।
  • निष्कर्ष: AI अपने प्रशिक्षण डेटा में बुरे विचारों के घनत्व (concentration) पर ध्यान देता है। चाहे आपका डेटासेट 1 मिलियन छवियों का हो या 8 मिलियन छवियों का, यदि खराब छवियों का प्रतिशत समान है, तो AI एक जैसा व्यवहार करेगा। इसका अर्थ है कि सुरक्षा फिल्टर (safety filters) इस बात पर निर्भर नहीं करते कि आपका डेटासेट कितना बड़ा है।

3. "मशीन में भूत" (The "Ghost in the Machine" - Irreducible Floor)

यहाँ चौंकाने वाला हिस्सा है: यहाँ तक कि जब शोधकर्ताओं ने प्रशिक्षण डेटा से 100% खराब तस्वीरें हटा दीं, तब भी AI ने लगभग 16.6% खराब चित्र बनाए।

क्यों?
AI के दो भाग हैं:

  1. चित्रकार (The Painter): वह हिस्सा जो तस्वीरों से सीखता है (जिसे शोधकर्ताओं ने साफ किया था)।
  2. अनुवादक (The Translator): एक पूर्व-प्रशिक्षित "टेक्स्ट एनकोडर" जो उपयोगकर्ता के प्रॉम्प्ट को पढ़ता है और चित्रकार को बताता है कि क्या करना है। यह अनुवादक शोधकर्ताओं के काम शुरू करने से पहले ही अपने स्वयं के विशाल, अस्त-व्यस्त इंटरनेट डेटा पर प्रशिक्षित किया गया था।

उपमा: कल्पना कीजिए कि आप एक चित्रकार को संदर्भ के लिए साफ तस्वीरों का एक सेट देते हैं, लेकिन निर्देश देने वाला व्यक्ति (अनुवादक) चित्रकार के कान में खतरनाक विचार फुसफुसाता रहता है क्योंकि उसने वे विचार किसी अन्य, अव्यवस्थित स्रोत से सीखे हैं। साफ फोटो एल्बम होने के बावजूद, चित्रकार गलतियाँ करता है क्योंकि निर्देश दूषित हैं।

शोधकर्ताओं ने पाया कि इस "अनुवादक" को एक सुरक्षित संस्करण (जिसे SafeCLIP कहा जाता है) से बदलने से खराब चित्र दर 16.6% से घटकर 9.6% हो गई। यह साबित करता है कि सर्वोत्तम परिणाम प्राप्त करने के लिए आपको तस्वीरों और निर्देशों, दोनों को साफ करना होगा।

4. "विरोधी" का रहस्य (The "Adversarial" Secret)

शोधकर्ताओं ने पाया कि यह खतरा ज्यादातर छिपा हुआ है।

  • सामान्य उपयोगकर्ता: यदि आप AI को "बिल्ली बनाना" या "सूर्यास्त चित्रित करना" (सुरक्षित प्रॉम्प्ट) कहते हैं, तो यह लगभग 99% बार सुरक्षित चित्र बनाता है, चाहे उसने कितना भी बुरा डेटा देखा हो। खराब प्रशिक्षण डेटा सामान्य, मैत्रीपूर्ण उपयोग के लिए अदृश्य रहता है।
  • बुरे इरादे वाले लोग (Bad Actors): खतरा केवल तभी सामने आता है जब कोई AI को धोखा देने की कोशिश करता है (Adversarial prompts - यानी उसे गलत सामग्री बनाने के लिए मजबूर करना)। खराब प्रशिक्षण डेटा AI को आसानी से चकमा देने योग्य बना देता है।

उपमा: AI को एक किले की तरह समझें। यदि आप विनम्रता से मुख्य द्वार से प्रवेश करते हैं, तो गार्ड (सुरक्षा फिल्टर) आपको अंदर आने देते हैं, और आप एक सुंदर बगीचा देखते हैं। लेकिन, यदि आपका "प्रशिक्षण आहार खराब" है, तो किले की दीवारों में छिपी हुई दरारें होती हैं जिन्हें केवल एक कुशल चोर (एक 'एडवर्सरियल प्रॉम्प्ट') ही ढूंढ और फायदा उठा सकता है।

5. कोई "गुणवत्ता कर" नहीं (No "Quality Tax")

एक आम चिंता यह है: "यदि हम सारी खराब चीजों को हटा देते हैं, तो क्या AI चित्र बनाने में कमजोर हो जाएगा?"
उत्तर: नहीं। शोधकर्ताओं ने चित्रों की गुणवत्ता (तीक्ष्णता और चित्र टेक्स्ट से कितनी अच्छी तरह मेल खाता है जैसे मेट्रिक्स का उपयोग करके) की जांच की और पाया कि इसमें कोई अंतर नहीं था। डेटा को साफ करने से AI कम बुद्धिमान या चित्र बदसूरत नहीं हुए। यह एक "मुफ्त" सुरक्षा अपग्रेड था।

सारांश

  • खराब प्रशिक्षण डेटा खराब AI आउटपुट का कारण बनता है। जितना अधिक बुरा डेटा होगा, आउटपुट उतना ही खराब होगा।
  • प्रतिशत मायने रखता है। एक छोटे डेटासेट के 10% को साफ करना उतना ही प्रभावी है जितना कि एक विशाल डेटासेट के 10% को साफ करना।
  • आप केवल फोटो साफ करके इसे ठीक नहीं कर सकते। AI का "अनुवादक" हिस्सा भी सुरक्षित होना चाहिए, अन्यथा जोखिम का एक आधारभूत स्तर हमेशा बना रहेगा।
  • यह सामान्य लोगों के लिए अदृश्य है। जोखिम ज्यादातर तब दिखाई देता है जब कोई सिस्टम को धोखा देने की कोशिश करता है।
  • सुरक्षा गुणवत्ता को नुकसान नहीं पहुँचाती। आप चित्रों को खराब किए बिना AI को सुरक्षित बना सकते हैं।

शोध पत्र निष्कर्ष निकालता है कि AI को सुरक्षित बनाने के लिए, आपको एक बहुस्तरीय रक्षा (layered defense) की आवश्यकता है: प्रशिक्षण तस्वीरों को साफ करें, एक सुरक्षित "अनुवादक" का उपयोग करें, और उन लोगों के खिलाफ मजबूत बचाव रखें जो सिस्टम को धोखा देने की कोशिश कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →