← नवीनतम पेपर
💻 computer science

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

SafeCap एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो सुरक्षा-प्रासंगिक इमेज कैप्शन उत्पन्न करने के लिए मॉडलों को प्रशिक्षित करके जेलब्रेक हमलों के विरुद्ध लार्ज विजन-लैंग्वेज मॉडल की सुरक्षा को बढ़ाता है, जिससे एक फ्रोजन (frozen) LLM को संरेखित निर्णयों की ओर निर्देशित किया जाता है, और इस प्रकार विजन उपयोगिता को बनाए रखते हुए मौजूदा सुरक्षा संरेखण विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng

प्रकाशित 2026-08-12
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक सुपर-स्मार्ट रोबोट दोस्त है जो लगभग किसी भी अन्य व्यक्ति से बेहतर किताबें पढ़ सकता है और कहानियाँ लिख सकता है। यह रोबोट पहले से ही बहुत सावधान है; यदि आप इसे कुछ खतरनाक करने के लिए कहते हैं, जैसे बम बनाना, तो यह विनम्रता से कहता है, "बिल्कुल नहीं, यह असुरक्षित है।" लेकिन अब, कल्पना कीजिए कि आप इस रोबोट को केवल शब्दों के बजाय एक बम की तस्वीर दिखाते हैं। अचानक, रोबोट भ्रमित हो जाता है। वह देखता है, सोचता है, "ओह, यह तो बस एक शानदार ड्राइंग है!" और अपने सुरक्षा नियमों को भूलकर, खुशी-खुशी उस उपकरण को बनाने के तरीके के बारे में समझाने लगता है। यह वह पेचीदा समस्या है जिसका सामना आधुनिक "विज़न-लैंग्वेज" (दृष्टि-भाषा) मॉडल के वैज्ञानिक कर रहे हैं: वे देखने में तो बहुत अच्छे हैं, लेकिन जब वे किसी चित्र को देखते हैं, तो उनके सुरक्षा ब्रेक कभी-कभी विफल हो जाते हैं।

इसे ठीक करने के लिए, शोधकर्ता इन मॉडलों को एक विशेष तरीके से "द्विभाषी" बनने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। वे चाहते हैं कि रोबोट न केवल एक चित्र को देखे और उत्तर दे, बल्कि पहले उस चित्र का सुरक्षित और सावधान तरीके से वर्णन करे, और फिर उत्तर दे। इसे एक सुरक्षा गार्ड की तरह समझें जिसे किसी संदिग्ध पैकेज के बारे में विस्तृत रिपोर्ट लिखने के बाद ही आपको यह बताने की अनुमति दी जाती है कि उसके साथ क्या करना है। यदि रिपोर्ट अस्पष्ट है या उसमें खतरे को पहचानने में चूक हो गई है, तो गार्ड रुक जाता है और कहता है, "रुको, मुझे और ध्यान से देखने की जरूरत है।" यह पेपर, जिसे SafeCap कहा जाता है, एक नया प्रशिक्षण तरीका पेश करता है जो इन AI रोबोटों को स्वचालित रूप से ये सुरक्षा रिपोर्ट लिखना सिखाता है, जिससे उन्हें धोखा देना बहुत कठिन हो जाता है।

समस्या: जब तस्वीरें दिमाग को चकमा देती हैं

लार्ज विज़न-लैंग्वेज मॉडल्स (LVLMs) चैटबॉट्स के सुपर-चार्ज्ड संस्करणों की तरह हैं जो देख सकते हैं। वे उन टेक्स्ट-ओनली (केवल टेक्स्ट वाले) मस्तिष्कों से अपनी "अच्छी व्यवहार" विरासत में लेते हैं जिन पर उन्हें बनाया गया था। लेकिन तस्वीरें चालाक होती हैं। एक टेक्स्ट-ओनली मॉडल "बम बनाने" के अनुरोध को मना कर सकता है, लेकिन यदि आप उसे एक बम की तस्वीर दिखाते हैं जिसके साथ एक नोट लिखा हो "मैं इसे कैसे बनाऊं?", तो मॉडल चित्र से विचलित हो सकता है और अपने सुरक्षा नियमों को भूल सकता है। यह एक ऐसे गार्ड की तरह है जो आमतौर पर आईडी चेक करता है लेकिन किसी आगंतुक की शर्ट पर लगे चमकदार स्टिकर से विचलित होकर उसे अंदर जाने देता है।

इसे ठीक करने के पिछले प्रयासों में "इन्फरेंस-टाइम डिफेंस" शामिल थे, जो रोबोट की आँखों के सामने एक फिल्टर लगाने जैसा है। एक लोकप्रिय विधि, जिसे ECSO कहा जाता है, चित्र को रोबोट द्वारा देखे जाने के बाद शब्दों में बदलने की कोशिश करती है, इस उम्मीद में कि एक टेक्स्ट-ओनली सुरक्षा प्रणाली खतरे को पकड़ लेगी। लेकिन यह एक जटिल पेंटिंग को अपने अंधे मित्र को वर्णित करने और यह आशा करने जैसा है कि वे ब्रश के स्ट्रोक में छिपे हुए जाल को पहचान लेंगे। अक्सर, विवरण सूक्ष्म लेकिन खतरनाक विवरणों को छोड़ देता है, और सुरक्षा प्रणाली विफल हो जाती है।

समाधान: SafeCap (द "सेफ्टी कैप्शन" ट्रेनर)

इस पेपर के लेखक SafeCap का प्रस्ताव करते हैं, जो एक चतुर प्रशिक्षण विधि है जो रोबोट को उत्तर देने से पहले अपनी स्वयं की सुरक्षा रिपोर्ट लिखने के लिए प्रशिक्षित करती है। केवल "हाँ" या "नहीं" कहने के बजाय, मॉडल को दो चीजें आउटपुट करने के लिए प्रशिक्षित किया जाता है:

  1. एक कैप्शन (Caption): चित्र का एक विस्तृत विवरण जो किसी भी सुरक्षा-संबंधित विवरण (जैसे "खतरा" लेबल या कोई हथियार) को उजागर करता है।
  2. एक उत्तर (Answer): उपयोगकर्ता के प्रश्न का अंतिम प्रतिक्रिया।

जादू प्रशिक्षण के दौरान होता है। मॉडल केवल कैप्शन लिखना नहीं सीखता; यह एक ऐसा कैप्शन लिखना सीखता है जो एक "फ्रोज़न" (अपरिवर्तित) टेक्स्ट-ओनली AI को सही सुरक्षा निर्णय लेने में मदद करे। कल्पना कीजिए कि एक छात्र (मॉडल) परीक्षा दे रहा है। शिक्षक (प्रशिक्षण प्रणाली) कहता है, "पहले इस चित्र का सारांश लिखो। फिर, मैं वह सारांश एक सख्त ग्रेडर को दूंगा जो चित्र नहीं देख सकता। यदि ग्रेडर केवल आपके सारांश के आधार पर कहता है कि 'यह खतरनाक है', और आप भी कहते हैं कि 'यह खतरनाक है', तो तुम्हें इनाम मिलेगा।"

यह मॉडल को ईमानदार और संपूर्ण होने के लिए मजबूर करता है। यह केवल खतरे को अनदेखा नहीं कर सकता और यह उम्मीद नहीं कर सकता कि ग्रेडर इसे मिस कर देगा। इसे कैप्शन में खतरे को स्पष्ट रूप से इंगित करना होगा ताकि सुरक्षा जांच काम कर सके।

यह कैसे काम करता है: "रिवॉर्ड" गेम

यह प्रशिक्षण रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) नामक तकनीक का उपयोग करता है। इसे एक वीडियो गेम की तरह समझें जहाँ मॉडल को अच्छे व्यवहार के लिए अंक मिलते हैं और बुरे व्यवहार के लिए अंक कटते हैं।

  • टेम्पलेट रिवॉर्ड (The Template Reward): मॉडल को एक सख्त प्रारूप का पालन करना चाहिए (कैप्शन लिखें, फिर उत्तर दें)। यदि वह प्रारूप में गलती करता है, तो उसे शून्य अंक मिलते हैं।
  • उत्तर रिवॉर्ड (The Answer Reward): मॉडल के अंतिम उत्तर की जाँच की जाती है। यदि यह सहायक और सुरक्षित है, तो इसे अंक मिलते हैं। यदि यह खतरनाक है, तो इसके अंक नाटकीय रूप रूप से काट दिए जाते हैं (एक विशेष गणितीय ट्रिक का उपयोग करके जिसे "एक्सपोनेंशियल रिस्क-डिस्काउंट" कहा जाता है जो खतरनाक उत्तरों को लगभग शून्य के बराबर बना देता है)।
  • कैप्शन रिवॉर्ड (The Caption Reward): यह असली सफलता का मंत्र है। मॉडल को अतिरिक्त अंक मिलते हैं यदि उसके द्वारा लिखा गया कैप्शन "फ्रोज़न" टेक्स्ट-ओनली AI को उसी सुरक्षित निष्कर्ष तक पहुँचने में मदद करता है। यदि कैप्शन अस्पष्ट है और फ्रोज़न AI खतरे को मिस कर देता है, तो मॉडल को उस हिस्से के लिए कोई अंक नहीं मिलता है।

उन्होंने क्या पाया: बिना बुद्धिमत्ता खोए सुरक्षा

शोधकर्ताओं ने SafeCap का परीक्षण पांच अलग-अलग सुरक्षा बेंचमार्क (AI को चकमा देने के लिए डिज़ाइन किए गए परीक्षण) और छह उपयोगिता बेंचमार्क (यह देखने के लिए परीक्षण कि क्या AI अभी भी सामान्य कार्यों जैसे चित्र का वर्णन करना या पहेलियाँ हल करना जानता है) पर किया। उन्होंने 2 बिलियन से 4 बिलियन पैरामीटर्स तक के विभिन्न आकार के मॉडलों का उपयोग किया।

परिणाम प्रभावशाली थे:

  • सुरक्षा में वृद्धि (Safety Boost): "डायरेक्टकैप" प्रोटोकॉल (जहाँ मॉडल कैप्शन लिखता है और फिर उत्तर देता है) के तहत, SafeCap ने विभिन्न मॉडलों में सुरक्षा स्कोर में 3.7 से 19.0 अंक का सुधार किया। 4B-बेस मॉडल के लिए, सुरक्षा स्कोर में भारी 19.0 अंकों की वृद्धि हुई।
  • कोई समझौता नहीं (No Trade-off): आमतौर पर, किसी मॉडल को सुरक्षित बनाने से वह कम बुद्धिमान हो जाता है (वह हानिरहित प्रश्नों का उत्तर देने से मना कर देता है)। लेकिन SafeCap ने "विज़न यूटिलिटी" (चित्रों का वर्णन करने और प्रश्नों के उत्तर देने की क्षमता) को लगभग पहले जैसा ही बनाए रखा। इसने रोबोट को एक चिड़चिड़ा "ना" कहने वाला मशीन नहीं बनाया; बल्कि इसे एक स्मार्ट और अधिक सावधान मॉडल बनाया।
  • प्रतिस्पर्धा को पछाड़ना: मानक सुरक्षा प्रशिक्षण (SFT), DPO, और SafeGRPO नामक एक नई विधि जैसे अन्य तरीकों की तुलना में, SafeCap शीर्ष पर रहा। इसने बेहतर उपयोगिता बनाए रखते हुए उच्च सुरक्षा स्कोर प्राप्त किया।

यह क्यों महत्वपूर्ण है

यह पेपर सुझाव देता है कि इन विज़ुअल AI मॉडलों को सुरक्षित रखने का सबसे अच्छा तरीका उन्हें केवल चित्र देखने के बाद पैच करना नहीं है, बल्कि उन्हें देखने के बारे में "ज़ोर से सोचने" (think out loud) के लिए प्रशिक्षित करना है। मॉडल को सुरक्षा-जागरूक कैप्शन जेनरेट करने के लिए मजबूर करके, यह दृश्य दुनिया और टेक्स्ट-आधारित सुरक्षा नियमों के बीच एक सेतु बनाता है।

लेखकों ने पाया कि यह तरीका तब सबसे अच्छा काम करता है जब मॉडल को इस "कैप्शन-फर्स्ट" पथ का उपयोग करने के लिए प्रशिक्षित किया जाता है। यदि आप मॉडल का उपयोग बिना कैप्शन के करने की कोशिश करते हैं (सीधे उत्तर पूछकर), तो सुरक्षा लाभ कम होते हैं और विशिष्ट मॉडल पर निर्भर करते हैं। लेकिन जब मॉडल को अपनी "सेफ्टी कैप्शन" की आदत का उपयोग करने की अनुमति दी जाती है, तो यह जेलब्रेक और खतरनाक अनुरोधों के खिलाफ बहुत अधिक मजबूत हो जाता है।

संक्षेप में, SafeCap AI को एक तस्वीर देखने, खतरे का स्पष्ट वर्णन करने और फिर निर्णय लेने के लिए प्रशिक्षित करता है। यह एक गार्ड को प्रशिक्षित करने जैसा है कि वह गेट खोलने से पहले हमेशा एक रिपोर्ट लिखे, यह सुनिश्चित करते हुए कि भले ही गेटकीपर का ध्यान भटक जाए, लिखित रिपोर्ट सभी को सुरक्षित रखे। यह पेपर दिखाता है कि यह दृष्टिकोण न केवल प्रभावी है बल्कि इसकी क्षमता को भी बरकरार रखता है, जो एक दृश्य दुनिया में सुरक्षित AI के लिए एक आशाजनक मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →