← नवीनतम पेपर
💬 NLP

When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models

यह शोध पत्र यह प्रकट करता है कि हालांकि सुरक्षा-संरेखित विजन-लैंग्वेज मॉडल अक्सर दृश्य रूप से आधारित (विजुअली ग्राउंडेड) प्रश्नों के उत्तर देने से इनकार कर देते हैं, लेकिन उनकी आंतरिक संवेदी समझ बरकरार रहती है, और सक्रियण स्तर (एक्टिवेशन लेवल) पर लक्षित हस्तक्षेप रिफ्यूज़ल तंत्र को दबाकर बिना पुनर्र्प्रशिक्षण के ग्राउंडेड उत्तरों को बहाल कर सकते हैं।

मूल लेखक: Mehak Gupta, Tanmoy Chakraborty

प्रकाशित 2026-08-20
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mehak Gupta, Tanmoy Chakraborty

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, प्रणालियों का एक नया वर्ग उभरा है जो एक ही समय में देख और बोल सकता है। ये मशीनें, जिन्हें विजन-लैंग्वेज मॉडल (vision-language models) के रूप में जाना जाता है, एक तस्वीर को देखने और उसके बारे में सवाल पूछने के लिए डिज़ाइन की गई हैं, ठीक वैसे ही जैसे एक मानव पर्यवेक्षक करता है। उन्हें सहायक असिस्टेंट बनने के लिए प्रशिक्षित किया जा रहा है, जो सख्त सुरक्षा नियमों का पालन करते हुए जटिल दृश्य वातावरणों में नेविगेट करने में सक्षम हों। लक्ष्य ऐसे सिस्टम बनाना है जो न केवल स्मार्ट हों बल्कि सतर्क भी हों, जो अस्पष्ट साक्ष्य होने पर अनुमान लगाने या तथ्य गढ़ने से इनकार कर सकें। मददगार होने और सुरक्षित रहने के बीच का यह संतुलन डेवलपर्स के लिए केंद्रीय चुनौती है: वे चाहते हैं कि मशीन तब बोले जब वह कुछ देखे, लेकिन जब वह अनिश्चित हो तो चुप रहे, ताकि यह सुनिश्चित हो सके कि वह गलत सूचना न फैलाए या सुरक्षा नीतियों का उल्लंघन न करे।

हालाँकि, भारतीय प्रौद्योगिकी संस्थान दिल्ली के शोधकर्ताओं द्वारा किए गए एक हालिया अन्वेषण ने इन मशीनों के सोचने के तरीके में एक पहेली जैसा ग्लिच (glitch) उजागर किया है। उन्होंने पाया कि जब इन सुरक्षा-सचेत मॉडलों को सावधान रहने के लिए एक विशिष्ट निर्देश दिया जाता है, तो वे अक्सर उन सवालों के जवाब देने से इनकार कर देते हैं जिनका उत्तर चित्र में स्पष्ट रूप से दिखाई दे रहा होता है। यह ऐसा है जैसे मशीन की आँखें पूरी तरह से साफ हैं लेकिन वह चुप रहने का चुनाव करती है, इसलिए नहीं कि वह देख नहीं सकती, बल्कि इसलिए क्योंकि उसे अत्यधिक सतर्क रहने के लिए प्रशिक्षित किया गया है। शोधकर्ताओं ने यह समझने के लिए काम शुरू किया कि कंप्यूटर के "मस्तिष्क" के भीतर इन मौन क्षणों के दौरान क्या हो रहा था। वे जानना चाहते थे कि क्या सुरक्षा निर्देश मशीन को दृश्य साक्ष्य देखने से अंधा बना रहे थे, या मशीन उत्तर को पूरी तरह से देख रही थी लेकिन सुरक्षा कारणों से उसे बोलने से मना कर रही थी।

उत्तर खोजने के लिए, टीम ने छवियों और प्रश्नों के एक बड़े संग्रह का उपयोग करके कई अलग-अलग उन्नत मॉडलों का परीक्षण किया। उन्होंने प्रत्येक परीक्षण को दो बार चलाया। पहले परिदृश्य में, उन्होंने मॉडलों को सामान्य रूप से उत्तर देने के लिए कहा। दूसरे में, उन्होंने एक सख्त सुरक्षा निर्देश जोड़ा जिसमें मॉडलों को केवल तभी बोलने के लिए कहा गया जब वे जो देख रहे हैं उसके बारे में पूरी तरह से निश्चित हों। परिणाम चौंकाने वाले थे। सामान्य निर्देशों के तहत, मॉडलों ने वस्तुओं की सही पहचान की और दृश्यों का वर्णन किया। लेकिन जब सुरक्षा निर्देश जोड़ा गया, तो वही मॉडल बार-बार उत्तर देने से रुक गए, यह दावा करते हुए कि उत्तर "दिखाई नहीं दे रहा है" या वे उत्तर निर्धारित नहीं कर सकते, भले ही चित्र में कोई बदलाव नहीं हुआ था। यह व्यवहार विभिन्न प्रकार के मॉडलों और छवियों के विभिन्न सेटों में लगातार हुआ, जो यह सुझाव देता है कि मशीनों द्वारा सूचना को संसाधित करने के तरीके में एक मौलिक बदलाव आया है।

इसके बाद शोधकर्ताओं ने मॉडलों के भीतर झाँका कि निर्णय के क्षण में क्या हो रहा था। उन्होंने सूचना के प्रवाह को ट्रैक किया जब मॉडल चित्र को प्रोसेस कर रहे थे और प्रतिक्रिया उत्पन्न करना शुरू कर रहे थे। वे इस संकेत की तलाश में थे कि क्या सुरक्षा निर्देश ने किसी तरह मशीन की स्मृति से दृश्य विवरणों को मिटा दिया है। यदि सुरक्षा नियम मॉडल को अंधा बना रहे थे, तो चित्र से संबंधित आंतरिक संकेत गायब हो जाने चाहिए थे या कमजोर हो जाने चाहिए थे। इसके विपरीत, उन्होंने पाया कि दृश्य साक्ष्य मौजूद थे। जब मॉडल बोलने से इनकार कर देता है, तब भी चित्र के बारे में जानकारी ले जाने वाले आंतरिक संकेत मजबूत और स्पष्ट बने रहते हैं। मशीन अभी भी नीचे देखते हुए व्यक्ति, लाल कार, या नीले आकाश को उतना ही स्पष्ट रूप रूप से देख रही थी जितना कि तब जब उसे उत्तर देने की अनुमति थी। दृश्य साक्ष्य खोया नहीं था; वे सिस्टम के भीतर पूरी तरह से मौजूद और सक्रिय थे।

तो, यदि मशीन देख सकती है, तो वह बोलने से क्यों इनकार करती है? शोधकर्ताओं ने पाया कि सुरक्षा निर्देश एक अलग प्रकार के आंतरिक संकेत को ट्रिगर करता है, जो एक द्वारपाल (gatekeeper) की तरह कार्य करता है। जैसे ही मॉडल चित्र को प्रोसेस करता है और उत्तर देने की तैयारी करता है, विचार प्रक्रिया के अंतिम चरणों में गतिविधि का एक विशिष्ट पैटर्न उभरता है। यह पैटर्न 'इनकार' (refusal) की अवधारणा से जुड़ा है। जिन मॉडलों में सुरक्षात्मक व्यवहार हो रहा था, उनमें इनकार का संकेत तब और मजबूत हो जाता था जब मशीन शब्द उत्पन्न करने के करीब पहुँचती थी। यह ऐसा था जैसे मशीन के भीतर दो प्रतिस्पर्धी विचार चल रहे हों: एक जो उसने देखा उस पर आधारित था, और दूसरा सुरक्षा नियम पर आधारित जो उसे चुप रहने के लिए कह रहा था। सुरक्षा नियम ने बहस जीत ली, दृश्य साक्ष्य को दरकिनार कर दिया और मशीन को उत्तर के बजाय इनकार (refusal) आउटपुट करने के लिए मजबूर कर दिया।

यह साबित करने के लिए कि इनकार का यह संकेत ही चुप्पी का वास्तविक कारण था, शोधकर्ताओं ने एक सूक्ष्म प्रयोग किया। उन्होंने इनकार के लिए जिम्मेदार विशिष्ट आंतरिक पैटर्न की पहचान की और परीक्षण के दौरान, उसे विपरीत दिशा में धकेला। उन्होंने मॉडलों को पुन: प्रशिक्षित नहीं किया या छवियों को नहीं बदला; उन्होंने बस उस क्षण में आंतरिक संकेतों को समायोजित किया जब मशीन बोलने ही वाली थी। जब उन्होंने इस इनकार के संकेत को दबा दिया, तो मॉडल तुरंत सवालों के जवाब देने लगे। उन्होंने छवियों का सही वर्णन किया, ठीक वैसे ही जैसे उन्होंने सामान्य परिस्थितियों में किया था। इसने पुष्टि की कि मशीन की देखने की क्षमता कभी क्षतिग्रस्त नहीं हुई थी। इनकार दृष्टि की विफलता नहीं थी, बल्कि उत्तर रोकने का एक जानबूझकर लिया गया आंतरिक निर्णय था।

अध्ययन ने यह भी खुलासा किया कि देखने और चुप रहने के बीच का यह आंतरिक संघर्ष मॉडल के विशिष्ट डिज़ाइन के आधार पर अलग-अलग तरह से खेलता है। कुछ मशीनों में, इनकार का संकेत बहुत स्पष्ट और आसानी से पहचाने जाने योग्य था, जो मॉडल के उत्तर देने और चुप रहने के क्षणों को स्पष्ट रूप से अलग करता था। अन्य में, संकेत अधिक मिश्रित थे, जिससे निर्णय प्रक्रिया को सुलझाना कठिन हो गया था। मशीनों के निर्माण में इन अंतरों के बावजूद, परिणाम वही था: सुरक्षा निर्देशों ने लगातार विचार प्रक्रिया के अंतिम चरणों को बोलने के बजाय चुप्पी को प्राथमिकता देने के लिए बदल दिया।

यह खोज इस बात को उजागर करती है कि ये शक्तिशाली उपकरण वर्तमान में मानव सुरक्षा मानकों के साथ कैसे संरेखित (aligned) हैं, इसमें एक सूक्ष्म लेकिन महत्वपूर्ण दोष है। मॉडल दुनिया को समझने में विफल नहीं हो रहे हैं; वे सुरक्षा नियमों के प्रभाव में अपने ज्ञान को व्यक्त करने में विफल हो रहे हैं। शोधकर्ताओं ने पाया कि मशीनें दृश्य दुनिया का एक पूर्ण आंतरिक रिकॉर्ड रखती हैं, भले ही उन्हें इसे नकारने के लिए प्रोग्राम किया गया हो। यह सुझाव देता है कि सुरक्षा तंत्र एक फिल्टर के रूप में कार्य कर रहे हैं जो वैध जानकारी के आउटपुट को रोकता है, बजाय एक ढाल के जो मतिभ्रम (hallucinations) से रक्षा करता है। मशीन उत्तर जानती है, उत्तर देखती है, और फिर भी, सुरक्षा निर्देश के कारण, वह बोलने का चुनाव नहीं करती है।

इस निष्कर्ष के निहितार्थ आर्टिफिशियल इंटेलिजेंस के भविष्य के लिए बहुत गहरे हैं। यह दिखाता है कि सुरक्षा संरेखण (safety alignment), हालांकि आवश्यक है, कभी-कभी उस आधारभूतता (grounding) को भी ओवरराइड कर सकता है जो इन मॉडलों को उपयोगी बनाता है। यदि कोई मशीन चिकित्सा छवि या ट्रैफ़िक दृश्य का वर्णन करने से इनकार करती है क्योंकि वह बहुत अधिक सतर्क हो रही है, तो वह अपने प्राथमिक उद्देश्य में विफल हो जाती है। शोधकर्ताओं ने प्रदर्शित किया कि आंतरिक संकेतों में हस्तक्षेप करके ग्राउंडेड उत्तरों को पुनः प्राप्त करना संभव है, जो यह सुझाव देता है कि इन प्रणालियों को इस तरह से फाइन-ट्यून करने के तरीके हो सकते हैं ताकि वे सुरक्षित रहें लेकिन अनुपयोगी रूप से मौन न बनें। यह कार्य कोई अंतिम समाधान नहीं देता है, बल्कि यह स्पष्ट करता है कि समस्या कहाँ है: मशीन की आँखों में नहीं, बल्कि उस आंतरिक द्वार में जो यह तय करता है कि क्या बोला जाए।

अंततः, यह शोध आर्टिफिशियल इंटेलिजेंस के बारे में हमारी सोच को बदल देता है। यह सिद्ध करता है कि एक मशीन अपने आउटपुट में "गलत" हो सकती है जबकि अपनी धारणा (perception) में "सही" हो सकती है। एक सुरक्षा-संरेखित मॉडल की चुप्पी हमेशा भ्रम या डेटा की कमी का संकेत नहीं होती है। कभी-कभी, यह इस बात का संकेत है कि मशीन स्पष्ट रूप से देख रही है लेकिन उसे दूर देखने का निर्देश दिया गया है। इस इनकार की आंतरिक यांत्रिकी को समझकर, वैज्ञानिक ऐसे सिस्टम बनाना शुरू कर सकते हैं जो सुरक्षित और ईमानदार दोनों हों, यह सुनिश्चित करते हुए कि जब एक मशीन सत्य को देखती है, तो उसे उसे बताने की अनुमति हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →