← नवीनतम पेपर
💻 computer science

SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

SafeDiffusion-R1 एक ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को पेश करता है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (Group Relative Policy Optimization) और एक नवीन CLIP-आधारित स्टीयरिंग रिवॉर्ड तंत्र का उपयोग करता है ताकि महंगी पर्यवेक्षित डेटा की आवश्यकता के बिना या विनाशकारी विस्मृति (catastrophic forgetting) से ग्रस्त हुए, डिफ्यूजन मॉडल को सुरक्षा बाधाओं के साथ प्रभावी ढंग से संरेखित किया जा सके और जनरेशन की गुणवत्ता में सुधार किया जा सके।

मूल लेखक: Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास डिफ्यूजन (Diffusion) नाम का एक बहुत ही प्रतिभाशाली कलाकार है। इस कलाकार ने पूरी इंटरनेट की करोड़ों तस्वीरों को देखकर पेंटिंग करना सीखा है। क्योंकि इंटरनेट पर सब कुछ मौजूद है, इसलिए इस कलाकार ने सुंदर परिदृश्य (landscapes) बनाना तो सीख लिया, लेकिन साथ ही उसने अनुचित या खतरनाक चीजें बनाना भी सीख लिया।

अब, आप इस कलाकार को एक पारिवारिक पत्रिका (family-friendly magazine) के लिए चित्र बनाने के लिए काम पर रखना चाहते हैं। आपको इस कलाकार को यह सिखाने की आवश्यकता है कि वह फिर कभी उन बुरी चीजों को बनाए, लेकिन आप उसकी सुंदर और जटिल दृश्य (जैसे कि एक लाल कुर्सी पर बैठा हुआ बिल्ली और उसके बगल में एक नीला कुत्ता) बनाने की क्षमता को खराब नहीं करना चाहते।

यह शोध पत्र इस कलाकार को प्रशिक्षित करने का एक नया तरीका पेश करता है, जिसे SafeDiffusion-R1 कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है:

1. पुराने तरीकों के साथ समस्या

पहले, बुरी आदतों को "अनलर्न" (unlearn) करने की कोशिश करना एक छात्र को "अच्छे उदाहरणों" और "बुरे उदाहरणों" की एक पाठ्यपुस्तक दिखाकर पढ़ाने जैसा था।

  • समस्या: आपको इन उदाहरणों के एक विशाल पुस्तकालय की आवश्यकता थी (जो महंगा और कठिन है)।
  • दुष्प्रभाव: जब आपने कलाकार को बुरी चीजों को भूलने के लिए मजबूर किया, तो वे अक्सर बाकी सब कुछ भी भूल जाते थे। वे भ्रमित हो जाते थे, और उनकी सुंदर पेंटिंग्स धुंधली या अजीब दिखने लगती थीं। इसे "कैटास्ट्रोफिक फॉरगेटिंग" (catastrophic forgetting) कहा जाता है।

2. नया समाधान: "ऑनलाइन कोच"

एक स्थिर पाठ्यपुस्तक के बजाय, SafeDiffusion-R1 कलाकार के पेंटिंग करते समय उसके बगल में खड़े एक लाइव कोच की तरह काम करता है।

  • ऑनलाइन लर्निंग: कलाकार एक प्रॉम्प्ट (निर्देश) के आधार पर एक चित्र बनाने की कोशिश करता है (भले ही वह जोखिम भरा हो)। कोच तुरंत परिणाम को देखता है और फीडबैक देता है।
  • "ग्रुप" का तरीका: कोच केवल "अच्छा" या "बुरा" नहीं कहता। इसके बजाय, वे कलाकार को उसी प्रॉम्प्ट के चार अलग-अलग संस्करण बनाने के लिए कहते हैं। फिर, कोच उनकी तुलना करता है: "वर्जन A ठीक है, लेकिन वर्जन B बहुत बुरा है।" यह कलाकार को अत्यधिक पुरस्कारों से भ्रमित हुए बिना, सापेक्ष अंतर (relative difference) सीखने में मदद करता है। इसे ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) कहा जाता है।

3. गुप्त हथियार: "कम्पास" (स्टीयरिंग रिवॉर्ड)

यह इस शोध पत्र का सबसे बड़ा नवाचार है। आमतौर पर, कलाकार को यह बताने के लिए कि "नग्नता न दिखाएं," आपको एक विशेष विशेषज्ञ (रिवॉर्ड मॉडल) की आवश्यकता होती है जो पेंटिंग को देखे और कहे "नहीं।" उस विशेषज्ञ को प्रशिक्षित करना कठिन है।

SafeDiffusion-R1 इसके बजाय एक जादुिक कम्पास का उपयोग करता है।

  • यह कैसे काम करता है: कल्पना कीजिए कि कलाकार का मस्तिष्क विचारों का एक विशाल मानचित्र है। इस मानचित्र पर, "सुरक्षित" विचार उत्तर में हैं, और "असुरक्षित" विचार दक्षिण में हैं।
  • ट्रिक: सिस्टम को हर पेंटिंग की जांच करने के लिए किसी इंसान की आवश्यकता नहीं है। यह बस उपयोगकर्ता द्वारा टाइप किए गए शब्दों (प्रॉम्ट) को लेता है और गणित का उपयोग करके कलाकार के शुरू करने से पहले ही उन शब्दों को धीरे से उत्तर (सुरक्षित) की ओर धकेलता है।
  • परिणाम: यदि कोई जोखिम भरी तस्वीर के लिए कहता है, तो सिस्टम कलाकार के दिमाग में निर्देश को पेंटिंग शुरू होने से पहले ही एक सुरक्षित संस्करण में सूक्ष्म रूप से बदल देता है। कलाकार एक सुरक्षित चित्र बनाता है क्योंकि उसे एक "सुरक्षित" निर्देश दिया गया था, न कि इसलिए कि उसे एक "बुरे" के लिए दंडित किया गया था।

4. परिणाम: सुरक्षित, स्मार्ट और सटीक

इस पद्धति ने परीक्षण में तीन बड़ी जीत हासिल कीं:

  • सुरक्षा: इसने अनुचित चित्रों की संख्या को काफी कम कर दिया। यदि पुराना कलाकार एक टेस्ट सेट में 646 अनुचित चित्र बनाता था, तो इस नए तरीके ने केवल 15 बनाए।
  • सामान्यीकरण (Generalization): भले ही उन्होंने मुख्य रूप से कलाकार को "नग्नता" वाले प्रॉम्प्ट्स पर प्रशिक्षित किया था, कलाकार ने अन्य बुरी चीजों (जैसे हिंसा या घृणास्पद भाषण) से बचना भी सीख लिया, भले ही उन्होंने प्रशिक्षण के दौरान उन विशिष्ट उदाहरणों को कभी नहीं देखा था। यह वैसा ही है जैसे किसी को जहरीले सेब न खाने के लिए सिखाना, और वे अचानक जहरीले बेर भी खाना बंद कर देते हैं।
  • गुणवत्ता: पुरानी पद्धतियों के विपरीत, जिन्होंने कलाकार की पेंटिंग्स को धुंधला या टूटा हुआ बना दिया था, इस पद्धति ने वास्तव में जटिल निर्देशों (जैसे वस्तुओं को गिनना या उन्हें विशिष्ट स्थानों पर रखना) का पालन करने की कलाकार की क्षमता में सुधार किया।

सारांश

SafeDiffusion-R1 एक नई प्रशिक्षण तकनीक है जो AI इमेज जनरेटर्स को "अच्छे बनाम बुरे" के विशाल पुस्तकालय के बिना सुरक्षित होना सिखाती है। यह कई प्रयासों की तुलना करने के लिए एक लाइव कोच का उपयोग करता है और पेंटिंग शुरू करने से पहले ही AI के विचारों को सुरक्षा की ओर धीरे से मोड़ने के लिए एक गणितीय कम्पास का उपयोग करता है। परिणाम एक ऐसा AI है जो सुरक्षित, स्मार्ट है और अपनी कलात्मक प्रतिभा को खोए बिना काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →