← नवीनतम पेपर
💻 computer science

Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering

यह शोध पत्र REINS को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो वीडियो डिफ्यूजन मॉडल्स को उनके आंतरिक निरूपणों (internal representations) को इन्फरेंस के समय सुरक्षित जनरेशन की ओर निर्देशित करके संरेखित करती है, जो विविध मॉडल्स और स्केल्स में सामान्य क्षमताओं को कम किए बिना हानिकारक सामग्री को प्रभावी ढंग से रोकने के लिए सुपरवाइज्ड PCA के माध्यम से खोजी गई एक एकल रैखिक दिशा का लाभ उठाती है।

मूल लेखक: Rohit Kundu, Arindam Dutta, Sarosij Bose, Athula Balachandran, Amit K. Roy-Chowdhury

प्रकाशित 2026-06-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rohit Kundu, Arindam Dutta, Sarosij Bose, Athula Balachandran, Amit K. Roy-Chowdhury

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Pulling The REINS" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

समस्या: जंगली घोड़ा (The Wild Horse)

एक शक्तिशाली वीडियो बनाने वाले AI (एक "वीडियो डिफ्यूजन मॉडल") की कल्पना एक जंगली घोड़े के रूप में करें। यह घोड़ा अविश्वसनीय रूप से प्रतिभाशाली है; यह आपके द्वारा मांगी गई किसी भी चीज़ के यथार्थवादी दृश्यों में दौड़ सकता है। हालाँकि, क्योंकि यह जंगली है, यदि आप इसे कुछ खतरनाक करने के लिए कहते हैं (जैसे "लड़ाई दिखाओ" या "फेक न्यूज़ बनाओ"), तो यह खुशी-खुशी वही करेगा।

वर्तमान में, लोग इस घोड़े को रोकने के लिए दो तरीकों से प्रयास करते हैं, लेकिन दोनों में बड़ी कमियां हैं:

  1. द्वारपाल (प्रॉम्प्ट फ़िल्टरिंग - Prompt Filtering): आप घोड़े के दौड़ना शुरू करने से पहले ही उसे रोकने की कोशिश करते हैं, यानी आपकी रिक्वेस्ट की जाँच करते हैं। यदि आप "लड़ाई" कहते हैं, तो आपको ब्लॉक कर दिया जाता है। लेकिन एक चतुर धोखेबाज बस कह सकता है कि "संघर्ष का एक नाटकीय दृश्य" (a dramatic scene of conflict), और घोड़ा गेट के पार निकल जाएगा।
  2. कूड़ेदान (आउटपुट फ़िल्टरिंग - Output Filtering): आप घोड़े को दौड़ने देते हैं, वीडियो बनाते हैं, और फिर परिणाम की जाँच करते हैं। यदि वह खतरनाक है, तो आप उसे कूड़ेदान में फेंक देते हैं। इससे उस सारी ऊर्जा और समय की बर्बादी होती है जो वीडियो बनाने में लगा था, और घोड़े ने उस खतरनाक रास्ते पर दौड़ना भी सीख लिया।

समाधान: REINS (स्टीयरिंग व्हील)

लेखक REINS (REpresentation-space INference-time Safety steering) पेश करते हैं। घोड़े को रोकने या वीडियो को फेंकने के बजाय, REINS सीधे घोड़े के मस्तिष्क से जुड़ा एक स्टीयरिंग व्हील है, जो उसके दौड़ते समय काम करता है।

यह घोड़े को फिर से प्रशिक्षित नहीं करता (कोई महंगा शिक्षण सत्र नहीं)। यह घोड़े की मांसपेशियों को नहीं बदलता (कोई वेट अपडेट नहीं)। यह केवल वीडियो जेनरेट करते समय घोड़े के आंतरिक विचारों को एक सुरक्षित दिशा में मोड़ देता है।

यह कैसे काम करता है: "सुरक्षा दिशा-सूचक" (The Safety Compass)

1. "सुरक्षा रेखा" खोजना (Finding the "Safety Line")
शोधकर्ताओं ने पाया कि AI के मस्तिष्क के अंदर (विशेष रूप से इसके "हिडन स्टेट्स" या आंतरिक विचारों में), एक स्पष्ट, सीधी रेखा है जो "सुरक्षित" विचारों को "असुरक्षित" विचारों से अलग करती है।

  • उपमा: कल्पना करें कि AI का मस्तिष्क एक विशाल मानचित्र है। सभी "असुरक्षित" वीडियो बाईं ओर क्लस्टर (समूहित) हैं, और सभी "सुरक्षित" वीडियो दाईं ओर हैं।
  • खोज: Supervised PCA नामक गणितीय ट्रिक का उपयोग करके, उन्होंने एक एकल तीर (एक दिशा) खोजा जो सीधे "असुरक्षित" पक्ष से "सुरक्षित" पक्ष की ओर इशारा करता है।

2. धकेलने का सही क्षण (The Perfect Moment to Nudge)
आप यात्रा की शुरुआत में (जब मैप अभी बना ही नहीं है) या अंत में (जब गाड़ी टकरा चुकी है) कार को स्टीयर नहीं कर सकते।

  • पेपर में पाया गया कि 'नज' (हल्का सा धक्का/मोड़) लगाने का सबसे अच्छा समय प्रक्रिया के बीच में (वीडियो जनरेशन के लगभग 50% के दौरान) है।
  • उपमा: यह समुद्र के बीच में एक जहाज को स्टीयर करने जैसा है। यदि आप बहुत जल्दी स्टीयर करते हैं, तो जहाज ने अभी तक पर्याप्त गति प्राप्त नहीं की होती; यदि आप बहुत देर से स्टीयर करते हैं, तो जहाज पहले ही चट्टानों से टकरा चुका होता है। "मिडल लेयर" (मध्य परत) वह सटीक स्थान है जहाँ AI के पास अनुरोध को समझने के लिए पर्याप्त जानकारी होती है लेकिन वह अपना विचार बदलने के लिए पर्याप्त लचीला भी होता है।

3. कोमल धक्का (The Gentle Push)
जब AI वीडियो बना रहा होता है, तो REINS उसके आंतरिक विचारों में एक छोटा, गणना किया गया धक्का जोड़ता है, जो उसे मानचित्र के "सुरक्षित" पक्ष की ओर निर्देशित करता है।

  • परिणाम: यदि आप "हिंसक लड़ाई" मांगते हैं, तो AI केवल मना नहीं करता। इसके बजाय, वह स्टीयरिंग व्हील का अनुसरण करता है और एक "नाटकीय मुकाबला" (dramatic standoff) या "खेल प्रतियोगिता" (sports competition) उत्पन्न करता है। यह आपके अनुरोध की भावना (एक्शन, मूवमेंट) को बनाए रखता है लेकिन खतरनाक सामग्री को सुरक्षित चीज़ से बदल देता है।

यह विशेष क्यों है?

  • यह अदृश्य है: AI को पता नहीं चलता कि उसे स्टीयर किया जा रहा है। उसे बस लगता है कि वह स्वाभाविक रूप से एक वीडियो बना रहा है।
  • यह मजबूत है: भले ही कोई हैकर चालाकी भरे प्रॉम्प्ट (जेलब्रेकिंग) के साथ AI को धोखा देने की कोशिश करे, "स्टीयरिंग व्हील" फिर भी काम करता है क्योंकि यह शब्दों को नहीं, बल्कि विचारों को ठीक करता है।
  • यह तेज़ है: इसके लिए AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस एक बार दिशा की गणना करते हैं, और फिर आप इसे AI द्वारा बनाए गए किसी भी वीडियो पर उपयोग कर सकते हैं।
  • यह हर जगह काम करता है: लेखकों ने 9 अलग-अलग वीडियो मॉडल्स पर इसका परीक्षण किया (छोटे से लेकर बड़े तक) और यह उन सभी पर काम कर गया, चाहे आप वीडियो शुरू करने के लिए टेक्स्ट टाइप कर रहे हों या इमेज अपलोड कर रहे हों।

ट्रेड-ऑफ (द "गोल्डिलॉक्स" ज़ोन)

पेपर एक दिलचस्प खोज नोट करता है: जैसे-जैसे AI गहराई से सोचता है, सुरक्षा संबंधी जानकारी बढ़ती जाती है, लेकिन AI का मन बदलने की क्षमता गहराई में जाने के साथ कमजोर होती जाती है।

  • बहुत उथला (Too Shallow): AI ने अभी तक पर्याप्त रूप से सोचा नहीं है; स्टीयरिंग का कोई प्रभाव नहीं पड़ता।
  • बहुत गहरा (Too Deep): AI ने पहले ही निर्णय ले लिया है; अब उसे धकेलने से ग्लिच आ सकते हैं या वीडियो खराब हो सकता है।
  • बिल्कुल सही (Just Right): मध्य परतें (middle layers) AI को अनुरोध समझने की अनुमति देती हैं लेकिन सुरक्षा की ओर मुड़ने के लिए पर्याप्त लचीलापन भी प्रदान करती हैं।

सारांश

REINS एक जंगली वीडियो बनाने वाले घोड़े में GPS-गाइडेड ऑटोपायलट स्थापित करने जैसा है। यह घोड़े को दौड़ने से नहीं रोकता, और न ही इसे नए करतब सिखाने की आवश्यकता है। यह बस धीरे से घोड़े के आंतरिक विचारों को खतरनाक ढलानों से दूर और सुरक्षित, सुंदर रास्तों की ओर निर्देशित करता है, जिससे यह सुनिश्चित होता है कि अंतिम वीडियो सुंदर लेकिन हानिरहित हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →