PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
यह शोध पत्र पॉलिसी-एडेप्टिव इमेज गार्डरेल्स के मूल्यांकन के लिए पॉलिसीशिफ्टबेंच (PolicyShiftBench) का परिचय देता है, और पॉलिसीशिफ्टगार्ड (PolicyShiftGuard) का प्रस्ताव करता है, जो दो-चरणीय रेसिपी के साथ प्रशिक्षित एक नवीन मॉडल है जो विभिन्न सुरक्षा नीतियों के अनुकूल गतिशील रूप से ढलने में मौजूदा विधियों की तुलना में काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, बहु-मंजिला इमारत के प्रवेश द्वार पर एक सुरक्षा गार्ड हैं। इस इमारत में कई अलग-अलग कमरे हैं, और प्रत्येक कमरे के अपने अनूठे नियम हैं कि आप अंदर क्या ला सकते हैं।
- कमरा A (आर्ट गैलरी): आप एक नग्न व्यक्ति की पेंटिंग ला सकते हैं क्योंकि यह कला है।
- कमरा B (फैमिली प्लेरूम): आप वही पेंटिंग बिल्कुल नहीं ला सकते; यह बच्चों के लिए बहुत अधिक उजागर करने वाली है।
- कमरा C (मेडिकल लैब): आप घाव की तस्वीर ला सकते हैं क्योंकि यह डॉक्टरों को सिखाने के लिए है।
- कमरा D (न्यूज़रूम): आप लड़ाई की तस्वीर ला सकते हैं क्योंकि यह एक समाचार कहानी है।
समस्या:
अधिकांश वर्तमान "सुरक्षा गार्ड" (AI इमेज फिल्टर्स) ऐसे गार्डों की तरह हैं जो केवल एक नियम जानते हैं: "यदि मैं नग्न व्यक्ति या लड़ाई देखता हूँ, तो तुरंत रोक दो।" वे दरवाजे पर लगे साइन को नहीं देखते कि आप किस कमरे में प्रवेश करने की कोशिश कर रहे हैं। यदि आप फैमिली प्लेरूम में मेडिकल डायग्राम लेकर जाने की कोशिश करते हैं, तो एक स्मार्ट गार्ड उसे जाने देगा। लेकिन एक "मूर्ख" गार्ड उसे रोक देगा क्योंकि वह "नग्नता" वाले हिस्से को देख लेता है, और संदर्भ (context) को अनदेखा कर देता है।
पेपर कहता है कि यह पॉलिसी शिफ्ट (policy shifts) के प्रति विफल होने का मामला है। एक ही छवि एक संदर्भ में सुरक्षित हो सकती है लेकिन दूसरे में खतरनाक, फिर भी वर्तमान AI मॉडल छवि पर ही अटक जाते हैं और बदलते नियमों को अनदेखा कर देते हैं।
समाधान: PolicyShiftGuard
लेखकों ने इस समस्या को ठीक करने के लिए PolicyShiftGuard नामक एक नया सिस्टम और PolicyShiftBench नामक एक नया टेस्ट बनाया है।
1. नया टेस्ट: "द कैमलियन चैलेंज" (The Chameleon Challenge)
उन्होंने एक बेंचमार्क (एक टेस्ट) बनाया जिसमें 2,000 परिदृश्य (scenarios) हैं। कल्पना कीजिए कि वे एक फोटो लेते हैं और उसे AI को 7 या 8 बार दिखाते हैं, लेकिन हर बार वे AI को एक अलग "नियम पुस्तिका" (policy) थमाते हैं।
- प्रयास 1: "यहाँ चाकू की एक फोटो है। नियम पुस्तिका कहती है: 'कोई हथियार नहीं लाया जा सकता।'" -> AI को कहना चाहिए: ब्लॉक (BLOCK)।
- प्रयास 2: "यहाँ चाकू की वही फोटो है। नियम पुस्तिका कहती है: 'यह एक कुकिंग शो है; चाकू की अनुमति है।'" -> AI को कहना चाहिए: पास (PASS)।
यह टेस्ट मापता है कि क्या AI केवल नियम पुस्तिका के आधार पर अपना निर्णय बदल सकता है, न कि केवल तस्वीर के आधार पर। वे इसे पॉलिसी शिफ्ट स्कोर (PSS) कहते हैं।
2. प्रशिक्षण विधि: "द टू-स्टेप डांस" (The Two-Step Dance)
AI को लचीला बनाने के लिए, उन्होंने एक विशेष दो-चरणीय प्रशिक्षण रेसिपी का उपयोग किया:
चरण 1: रैंडमाइज्ड पॉलिसी SFT (द जनरलिस्ट लेसन):
उन्होंने AI को अलग-अलग नियम पुस्तिकाएं पढ़ना और छोटे, स्पष्ट उत्तर (जैसे "True" या "False") देना सिखाया। उन्होंने नियमों के क्रम को मिला दिया ताकि AI "नियम #1 हमेशा नग्नता के बारे में है" जैसा कुछ याद करके धोखाधड़ी न कर सके। उसे वास्तव में टेक्स्ट को पढ़ना ही था।चरण 2: बाउंड्री-पेयर अडैप्टेशन (द टाइटरोप लेसन):
यह उनका गुप्त नुस्खा (secret sauce) है। उन्होंने AI को एक ही इमेज लगातार दो बार दिखाई:- एक बार उस नियम के साथ जो कहता है "BLOCK"।
- दूसरी बार उस नियम के साथ जो कहता है "PASS"।
उन्होंने AI को यह महसूस करने के लिए मजबूर किया: "रुको, तस्वीर नहीं बदली। केवल नियम बदला है। मुझे नियम के अनुसार अपना उत्तर बदलना होगा।" यह AI को दृश्य साक्ष्य (visual evidence) और पॉलिसी निर्णय को अलग करने के लिए प्रशिक्षित करता है।
3. परिणाम: तेज़ और लचीला
पेपर में इस नए गार्ड का परीक्षण कई अन्य AI मॉडल्स (बड़ी कंपनियों के विशाल मॉडल्स सहित) के खिलाफ किया गया।
- पुराने गार्ड: कई मौजूदा मॉडल "भंगुर" (brittle) थे। वे खतरनाक इमेज को पहचान तो सकते थे, लेकिन अगर नियम बदल जाते, तो वे भ्रमित हो जाते थे। वे अक्सर सुरक्षित इमेज को ब्लॉक कर देते थे या खतरनाक इमेज को निकल जाने देते थे क्योंकि वे बहुत कठोर थे।
- PolicyShiftGuard: उनका नया मॉडल चैंपियन था। इसने अन्य सभी की तुलना में "फ्लिप" (बदलाव वाले) परिदृश्यों को बहुत बेहतर तरीके से संभाला।
- इसने उनके नए टेस्ट पर 76.9 का शीर्ष स्कोर प्राप्त किया।
- यह बहुत तेज़ भी था। जहाँ अन्य मॉडल्स को सोचने और लंबे स्पष्टीकरण लिखने में काफी समय लगता था, वहीं PolicyShiftGuard एक सेकंड से भी कम समय में एक त्वरित, संक्षिप्त उत्तर (जैसे "True | 01") दे देता था।
मुख्य निष्कर्ष (The Big Takeaway)
पेपर का तर्क है कि सुरक्षा केवल इस बारे में नहीं है कि एक इमेज कैसी दिखती है; यह इमेज और वर्तमान नियमों के बीच के संबंध के बारे में है।
इसे एक क्लब के बाउंसर की तरह समझें। एक अच्छा बाउंसर केवल आपका चेहरा नहीं देखता; वह आज की विशिष्ट इवेंट लिस्ट के साथ आपकी आईडी चेक करता है। यदि यह "किड्स डे" है, तो बाउंसर शोर मचाने वाली भीड़ को रोकता है। यदि यह "एडल्ट्स ओनली" है, तो बाउंसर उन्हें अंदर जाने देता है। PolicyShiftGuard पहला बाउंसर है जो निर्णय लेने से पहले वास्तव में दरवाजे पर लगे साइन को पढ़ता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।