← नवीनतम पेपर
💻 computer science

Erased, But Not Forgotten: Erased Rectified Flow Transformers Still Remain Unsafe Under Concept Attack

यह शोध पत्र ReFlux को पेश करता है, जो एक नवीन कॉन्सेप्ट अटैक विधि है जो Flux जैसे रेक्टिफाइड फ्लो ट्रांसफॉर्मर में अटेंशन लोकलाइजेशन का लाभ उठाकर यह प्रदर्शित करती है कि वर्तमान कॉन्सेप्ट इरेज़र तकनीकें लक्षित रिएक्टिवेशन के विरुद्ध अप्रभावी और असुरक्षित बनी हुई हैं।

मूल लेखक: Nanxiang Jiang, Zhaoxin Fan, Enhan Kang, Daiheng Gao, Yun Zhou, Yanxia Chang, Zheng Zhu, Yeying Jin, Wenjun Wu

प्रकाशित 2026-04-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nanxiang Jiang, Zhaoxin Fan, Enhan Kang, Daiheng Gao, Yun Zhou, Yanxia Chang, Zheng Zhu, Yeying Jin, Wenjun Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: वह "जादुई इरेज़र" जो पर्याप्त जादुई नहीं था

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट कलाकार (एक AI) है जो आपके द्वारा बताए गए कुछ भी को चित्रित कर सकता है। लेकिन इस कलाकार ने इंटरनेट से कुछ बुरी आदतें सीखी हैं—यदि आप उनसे पूछें, तो वे अनुचित या हानिकारक चीजें बना सकते हैं।

इसे ठीक करने के लिए, डेवलपर्स ने एक "जादुई इरेज़र" (कॉन्सेप्ट इरेज़र) का उपयोग करने की कोशिश की। उन्होंने कलाकार से कहा, "नग्नता, हिंसा या विशिष्ट मशहूर हस्तियों को चित्रित करना भूल जाओ।" उन्हें लगा कि उन्होंने कलाकार की याददाश्त को पूरी तरह साफ कर दिया है।

समस्या: यह पेपर खुलासा करता है कि "जादुई इरेज़र" ने वास्तव में याददाश्त को नहीं मिटाया। इसने केवल बुरे विचारों पर एक भारी कंबल डाल दिया है। कलाकार अभी भी उन्हें बनाना जानता है; उसे बस उस कंबल को हटाने वाले की जरूरत है।

लेखकों ने ReFlux (एक "कंबल हटाने वाला") नामक एक नया टूल बनाया ताकि यह साबित किया जा सके कि इन सुरक्षा उपायों के बाद भी, AI अभी भी असुरक्षित है।


हमारी कहानी के पात्र

  1. कलाकार (Flux): यह एक नया, सुपर-शक्तिशाली AI मॉडल है। पुराने कलाकारों (जैसे Stable Diffusion) के विपरीत, जो एक बार में एक ब्रशस्ट्रोक खींचते थे, Flux एक सिम्फनी कंडक्टर की तरह है। यह पूरी तस्वीर और शब्दों को एक साथ देखता है, और एक खाली कैनवास से एक तैयार उत्कृष्ट कृति तक सुचारू रूप से बहता है।
  2. सुरक्षा टीम (इरेज़र्स): ये वे लोग हैं जिन्होंने बुरे कॉन्सेप्ट्स को "अनलर्न" (unlearn) करने की कोशिश की। उन्होंने AI के गीत के उन विशिष्ट "नोट्स" को सर्जिकल तरीके से हटाने की कोशिश की जो बुरे विचारों के अनुरूप थे।
  3. हैकर (ReFlux): इस पेपर के लेखक। वे बुरा आर्ट बनाने की कोशिश नहीं कर रहे हैं; वे सुरक्षा का परीक्षण करने की कोशिश कर रहे हैं। वे देखना चाहते हैं कि क्या "अनलर्निंग" वास्तव में काम कर रही थी।

मुख्य खोज: पुरानी तकनीकें क्यों विफल रहीं

शोधकर्ताओं ने पुराने कलाकारों (पुराने मॉडल्स) के लिए डिज़ाइन किए गए पुराने तरीकों का उपयोग करके नए कलाकार (Flux) को जगाने की कोशिश की, लेकिन वे विफल रहे। क्यों?

  • पुराना कलाकार (Stable Diffusion): यदि आप कलाकार को "बिल्ली" बनाने के लिए कहना चाहते हैं, तो आप बस शब्द "बिल्ली" को ज़ोर से बोल देते हैं। पुराना कलाकार व्यक्तिगत शब्दों को सुनता है।
  • नया कलाकार (Flux): यह कलाकार पूरे वाक्य और संगीत के प्रवाह को सुनता है। इसे व्यक्तिगत शब्दों की उतनी चिंता नहीं है; इसे इस बात की चिंता है कि शब्द चित्र से कैसे जुड़ते हैं।

शोधकर्ताओं ने महसूस किया कि सुरक्षा टीम का "जादुई इरेज़र" स्पॉटलाइट को छिपाने का काम कर रहा था।

  • कल्पना कीजिए कि AI के पास एक स्पॉटलाइट है जो प्रॉम्प्ट में "बिल्ली" शब्द पर चमकती है।
  • सुरक्षा टीम ने उस स्पॉटलाइट को धीमा कर दिया ताकि कलाकार "बिल्ली" शब्द को न देख सके।
  • खामी: कलाकार अभी भी जानता है कि "बिल्ली" शब्द कहाँ है; स्पॉटलाइट बस कम रोशनी में है।

समाधान: ReFlux (स्पॉटलाइट बूस्टर)

लेखकों ने ReFlux बनाया, जो एक स्मार्ट टूल है जो केवल शब्द को ज़ोर से चिल्लाता नहीं है। इसके बजाय, यह तीन स्मार्ट काम करता है:

  1. स्पॉटलाइट बूस्टर (अटेंशन रिएक्टिवेशन): यह धीरे से मंद हुई स्पॉटलाइट को वापस चालू करता है, लेकिन सावधानी से ताकि यह कलाकार को अंधा न कर दे या बाकी पेंटिंग को खराब न कर दे।
  2. फ्लो गाइड (वेलोसिटी गाइडेंस): चूंकि Flux एक "फ्लो" कलाकार है, ReFlux कलाकार के ब्रशस्ट्रोक को सही दिशा में धकेलता है, जिससे पेंट को मिटाए गए कॉन्सेप्ट को बिना बाकी चित्र को बिगाड़े बनाने के लिए निर्देशित किया जाता है।
  3. मेमोरी कीपर (कंसिस्टेंसी): यह सुनिश्चित करता है कि जबकि "बिल्ली" फिर से दिखाई देती है, "कुत्ता" और "बैकग्राउंड" बिल्कुल वैसा ही रहे। यह एक हिस्से को ठीक करने के लिए पूरी पेंटिंग को तोड़ना नहीं चाहता।

परिणाम: केवल बहुत कम अतिरिक्त मेमोरी (जैसे एक छोटा USB ड्राइव) के साथ, ReFlux सफलतापूर्वक "मिटाए गए" कॉन्सेप्ट्स को फिर से प्रकट करने में सफल रहा, जिससे साबित हुआ कि सुरक्षा टीम का काम अधूरा था।


उपमा: "फुसफुसाती लाइब्रेरी"

कल्पना कीजिए कि AI एक लाइब्रेरी है जिसमें लाखों किताबें हैं।

  • सुरक्षा टीम ने "खतरनाक विचारों" वाली सभी किताबों को एक अंधेरे बेसमेंट में बंद कर दिया। उन्हें लगा कि कोई उन्हें ढूंढ नहीं पाएगा।
  • पुराने हमलावर लाइब्रेरी के प्रवेश द्वार पर "खतरा!" चिल्लाने की कोशिश करते थे, लेकिन नई लाइब्रेरी (Flux) में साउंडप्रूफ दीवारें हैं, इसलिए चिल्लाना काम नहीं आया।
  • ReFlux ने महसूस किया कि किताबें गायब नहीं हुई थीं; वे बस अंधेरे में थीं। ReFlux चिल्लाया नहीं; उसने बस बेसमेंट में एक फ्लैशलाइट जलाई और सीधे किताबों के पास पहुँच गया।

लेखकों ने पाया कि भले ही किताबें लॉक कर दी गई थीं, लेकिन लाइब्रेरी स्टाफ (AI) अभी भी जानता था कि वे कहाँ हैं और यदि आप उन्हें फ्लैशलाइट दिखाएं तो वे उन्हें बाहर निकाल सकते हैं।


यह क्यों मायने रखता है?

आप पूछ सकते हैं, "आप सुरक्षा को तोड़ने की कोशिश क्यों कर रहे हैं?"

लेखक तर्क देते हैं कि आप उसे ठीक नहीं कर सकते जिसे आप माप नहीं सकते।

  • यदि हमें लगता है कि "जादुई इरेज़र" काम करता है, तो हम इन AI को इंटरनेट पर खुला छोड़ सकते हैं, यह सोचकर कि वे सुरक्षित हैं।
  • लेकिन यदि वे वास्तव में केवल बुरे विचारों को "छिपा" रहे हैं, तो उन्हें फिर से दिखाने के लिए छला जा सकता है।
  • ReFlux एक पुल के स्ट्रेस टेस्ट की तरह है। पुल को तोड़ने की कोशिश करके, वे साबित करते हैं कि यह कमजोर है ताकि इंजीनियर एक मजबूत पुल बना सकें।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि इन नए, शक्तिशाली AI मॉडल्स के लिए वर्तमान सुरक्षा विधियां पर्याप्त मजबूत नहीं हैं। वे दरवाजे पर लगे "डू नॉट डिस्टर्ब" (Do Not Disturb) साइन की तरह हैं; बुरे विचार अभी भी दरवाजे के पीछे हैं, बस किसी के द्वारा ज़ोर से दस्तक देने (या ReFlux जैसे सही चाबी का उपयोग करने) का इंतज़ार कर रहे हैं।

लेखक बेहतर सुरक्षा उपकरणों के लिए आह्वान कर रहे हैं जो केवल बुरे विचारों को छिपाते नहीं हैं, बल्कि उन्हें वास्तव में हटा देते हैं, यह सुनिश्चित करते हुए कि अगली पीढ़ी का AI वास्तव में सभी के लिए सुरक्षित हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →