← नवीनतम पेपर
💻 computer science

Closing the Safety Gap: Surgical Concept Erasure in Visual Autoregressive Models

यह शोध पत्र VARE और S-VARE को प्रस्तुत करता है, जो नवीन फ्रेमवर्क हैं जो सहायक विजुअल टोकन और विशिष्ट लॉस फंक्शन्स का लाभ उठाकर विजुअल ऑटोरेग्रेसिव मॉडल्स में सर्जिकल कॉन्सेप्ट इरेज़र (surgical concept erasure) को सक्षम करते हैं ताकि जनरेशन की गुणवत्ता और सिमेंटिक फिडेलिटी को बनाए रखते हुए असुरक्षित कॉन्सेप्ट्स को हटाया जा सके।

मूल लेखक: Xinhao Zhong, Yimin Zhou, Zhiqi Zhang, Junhao Li, Yi Sun, Bin Chen, Shu-Tao Xia, Xuan Wang, Ke Xu

प्रकाशित 2026-02-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinhao Zhong, Yimin Zhou, Zhiqi Zhang, Junhao Li, Yi Sun, Bin Chen, Shu-Tao Xia, Xuan Wang, Ke Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, अति-यथार्थवादी (hyper-realistic) रोबोट कलाकार है। यह कलाकार कैनवास पर रंग मिला कर पेंटिंग नहीं करता; इसके बजाय, यह पिक्सेल दर पिक्सेल चित्र बनाता है, जैसे लेगो (LEGO) ब्लॉक्स को एक के ऊपर एक रखा जा रहा हो। लेकिन इसमें एक पेच है: यह चित्रों को परतों (layers) में बनाता है, एक धुंधले, कम-रिज़ॉल्यूशन वाले स्केच से शुरू करके धीरे-धीरे और अधिक विवरण जोड़ता जाता है जब तक कि चित्र स्पष्ट न हो जाए। एक विजुअल ऑटोरेग्रेसिव (Visual Autoregressive - VAR) मॉडल इसी तरह काम करते हैं। वे टेक्स्ट से चित्र बनाने में अद्भुत हैं, लेकिन उनमें एक खतरनाक दोष है: यदि आप उनसे कुछ अनुपयुक्त बनाने के लिए कहते हैं (जैसे कि कोई हिंसक दृश्य या नग्न आकृति), तो वे खुशी-खुशी ऐसा करेंगे।

समस्या यह है कि अन्य प्रकार के AI कलाकारों (जिन्हें डिफ्यूजन मॉडल कहा जाता है) के लिए हमारे पास जो "सुरक्षा उपकरण" हैं, वे इस लेगो-स्टैकिंग वाले रोबोट पर काम नहीं करते हैं। इन पुराने उपकरणों को जबरदस्ती इस नए रोबोट पर थोपना वैसा ही है जैसे किसी मैकेनिकल घड़ी के लिए बने हथौड़े से डिजिटल घड़ी को ठीक करने की कोशिश करना—इससे पूरी चीज़ ही टूट जाती है।

यह पेपर इस रोबोट को बिना उसकी चित्र बनाने की क्षमता को बिगाड़े, इसे ठीक करने का एक नया, "सर्जिकल" तरीका पेश करता है। उन्होंने इसे कैसे किया, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है:

1. समस्या: गलतियों का "डोमिनो प्रभाव" (The "Domino Effect" of Mistakes)

पुराने तरीकों में, जब किसी चीज़ को बुरा (जैसे कि एक "चर्च") बनाने से रोकने की कोशिश की जाती थी, तो इंजीनियर रोबोट को कहते थे: "चर्च मत बनाओ; इसके बजाय एक सामान्य इमारत बनाओ।"

हालाँकि, क्योंकि रोबोट परतों में चित्र बनाता है (धुंधले से लेकर स्पष्ट तक), पहली परत में होने वाली एक छोटी सी गलती दूसरी परत में बढ़ जाती है, और फिर तीसरी परत में विस्फोट कर देती है। जब तक चित्र पूरा होता है, रोबोट सही ढंग से कुछ भी बनाना भूल चुका होता है। चित्र एक पिघले हुए ढेर जैसा दिखने लगता है। इसे त्रुटि संचय (error accumulation) कहा जाता है।

2. समाधान: "स्थिरीकरण मार्गदर्शक" (The "Stabilizing Guide" - VARE)

रोबोट को बिखरने से रोकने के लिए, लेखकों ने उसे एक स्थिरीकरण मार्गदर्शक दिया।

कल्पना कीजिए कि आप एक छात्र को पेड़ बनाना सिखा रहे हैं। केवल यह कहने के बजाय कि, "पेड़ मत बनाओ," आप उसके सामने एक सामान्य पेड़ का चित्र रखते हैं और कहते हैं, "इस चित्र को देखो। अब, कुछ ऐसा बनाने की कोशिश करो जो लगभग इसके जैसा हो, लेकिन बिना उन विशिष्ट शाखाओं के जो इसे एक पेड़ बनाती हैं।"

लेखकों ने रोबोट के प्रशिक्षण में "सहायक दृश्य टोकन" (ये मार्गदर्शक चित्र हैं) जोड़े। यह रोबोट की परतों को संरेखित (aligned) रखता है। यह त्रुटियों के "डोमिनो प्रभाव" को रोकता है, जिससे यह सुनिश्चित होता है कि रोबोट एक सुसंगत चित्र बनाने की क्षमता बनाए रखे, भले ही वह एक बुरे विचार को हटाने की कोशिश कर रहा हो।

3. स्कैल्पल (Scalpel): "फिल्टर्ड क्रॉस-एंट्रॉपी" (Filtered Cross-Entropy - S-VARE)

एक बार जब रोबोट स्थिर हो गया, तो उन्हें बाकी चित्र को खराब किए बिना किसी बुरे विचार को सटीक रूप से हटाने की आवश्यकता थी।

  • पुराना तरीका: इसे एक फाँस (splinter) निकालने के लिए हथौड़े का उपयोग करने जैसा समझें। आप विचार को मिटाने के लिए रोबבות के गणित को एक "सुरक्षित" संस्करण के साथ पूरी तरह से मिलाने के लिए मजबूर करते हैं। लेकिन चूंकि रोबोट डिजिटल "बिट्स" (ऑन/ऑफ स्विच) के साथ काम करता है न कि स्मूथ ग्रेडिएंट्स के साथ, यह हथौड़े वाला दृष्टिकोण अक्सर पूरे चित्र को ही नष्ट कर देता है।
  • नया तरीका (S-VARE): लेखकों ने एक स्कैल्पल (शल्य चिकित्सा चाकू) का आविष्कार किया। उन्होंने महसूस किया कि रोबोट कभी-कभी छोटी गलतियाँ करता है, लेकिन वह मुख्य विचार के बारे में आमतौर पर सही होता है। इसलिए, उन्होंने एक "फ़िल्टर" बनाया।
    • यदि रोबोट पहले से ही चित्र को काफी हद तक सही पहचान रहा है (उदाहरण के लिए, उसने आकाश और ज़मीन को सही ढंग से पहचान लिया है), तो स्कैल्पल उन हिस्सों को अनदेखा कर देता है।
    • यह केवल उन विशिष्ट हिस्सों को काटता (समायोजित करता) है जहाँ रोबोट "बुरे" विचार (जैसे नग्नता या विशिष्ट वस्तु) को बनाने की कोशिश कर रहा है।
    • यह एक ऐसे सर्जन की तरह है जो केवल ट्यूमर पर ऑपरेशन करता है और स्वस्थ ऊतकों को वैसे ही छोड़ देता है।

4. सुरक्षा जाल: "प्रिजर्वेशन लॉस" (Preservation Loss)

कभी-कभी, जब आप किसी विशिष्ट समस्या को ठीक करने की कोशिश करते हैं, तो आप अनजाने में अन्य चीजों को भी बिगाड़ देते हैं। उदाहरण के लिए, यदि आप रोबोट को कहते हैं "चर्च मत बनाओ," तो हो सकता है कि वह कोई भी इमारत बनाना भूल जाए, या वह "आकाश" शब्द को समझना बंद कर दे। इसे "लैंग्वेज ड्रिफ्ट" (language drift) कहा जाता है।

इसे रोकने के लिए, लेखकों ने एक सुरक्षा जाल जोड़ा। वे लगातार रोबोट को याद दिलाते रहते हैं: "जब आप चर्च को हटा रहे हों, तो सुनिश्चित करें कि आप आकाश, घास और रोशनी को बिल्कुल उसी तरह से बनाएं जैसे आपने पहले बनाया था।" यह सुनिश्चित करता है कि रोबोट अपनी सामान्य कलात्मक क्षमताओं को बरकरार रखते हुए केवल विशिष्ट प्रतिबंधित वस्तु को बनाने की क्षमता खोए।

परिणाम

पेपर का परीक्षण "इन्फिनिटी" (Infinity) नामक मॉडल पर किया गया। परिणाम प्रभावशाली थे:

  • 97% सफलता: वे संवेदनशील सामग्री (जैसे नग्नता या चर्च जैसी विशिष्ट वस्तुएं) को बनाने से रोबोट को सफलतापूर्वक रोक पाए।
  • न्यूनतम क्षति: अन्य चीजों को बनाने की रोबोट की क्षमता में 2% से भी कम की गिरावट आई। यह अभी भी सुंदर, उच्च-गुणवत्ता वाले चित्र बनाता है।
  • मजबूती (Robustness): यहाँ तक कि जब लोगों ने भ्रमित करने वाले या "एडवर्सरियल" प्रॉम्प्ट्स (बुरे विचार को चुपके से शामिल करने की कोशिश) के साथ रोबोट को धोखा देने की कोशिश की, तब भी रोबोट ने उसे बनाने से इनकार कर दिया।

संक्षेप में: लेखकों ने एक ऐसा ढांचा तैयार किया है जो एक स्थिर मार्गदर्शक, एक सर्जिकल स्कैल्पल और एक सुरक्षा जाल तीनों का काम करता है। यह उन्हें इस नई पीढ़ी के इमेज-जेनरेटिंग AI से खतरनाक विचारों को सर्जिकल तरीके से हटाने की अनुमति देता है, बिना AI की कला बनाने की क्षमता को नष्ट किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →