← नवीनतम पेपर
🤖 AI

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

यह शोध पत्र **CR-VLM** का प्रस्ताव करता है, जो एक नवीन ढांचा है जो विजन लैंग्वेज मॉडल्स (Vision Language Models) में कॉन्फ़िगर करने योग्य रिफ्यूज़ल (refusal) को सक्षम करने के लिए एक्टिवेशन स्टीयरिंग (activation steering) का उपयोग करता है, जिससे एक रिफ्यूज़ल वेक्टर, एक गेटिंग मैकेनिज्म और एक काउंटरफैक्चुअल विज़न एन्हांसमेंट मॉड्यूल के माध्यम से एडेप्टिव सेफ्टी अलाइनमेंट संभव होता है जो अंडर-रिफ्यूज़ल (under-refusal) और ओवर-रिफ्यूज़ल (over-refusal) दोनों को कम करता है।

मूल लेखक: Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट डिजिटल असिस्टेंट (एक विजन लैंग्वेज मॉडल) है जो फोटो देख सकता है और सवालों के जवाब दे सकता है। आमतौर पर, इन सहायकों को एक "एक ही आकार सबके लिए" (one-size-fits-all) वाले सुरक्षा मैनुअल के साथ प्रशिक्षित किया जाता है। यदि आप कुछ थोड़ा विवादास्पद पूछते हैं, तो यह काम करना बंद कर सकता है और कह सकता है, "मैं इसका उत्तर नहीं दे सकता," भले ही वह सवाल आपके लिए बिल्कुल ठीक हो!

यह एक ऐसे लाइब्रेरियन की तरह है जो किसी से भी "राजनीति" के बारे में बात करने से मना कर देता है क्योंकि उसे लगता है कि यह एक खतरनाक विषय है—भले ही आप सिर्फ यह जानना चाहते हों कि वर्तमान मेयर कौन है! इसे ओवर-रिफ्यूज़ल (over-refusal) कहा जाता है, और यह असिस्टेंट को निराशाजनक और अनुपयोगी बनाता है।

पेपर "स्टीयरिंग टू से नो" (Steering to Say No) एक नया सिस्टम पेश करता है जिसे CR-VLM कहा जाता है। यह कैसे काम करता है, इसे कुछ सरल उपमाओं (analogies) के माध्यम से समझाया गया है।

1. "कस्टमाइज्ड फ़िल्टर" (कॉन्फ़िगरेबल रिफ़्यूज़ल)

एक विशाल, कठोर नियम पुस्तिका के बजाय, CR-VLM एक कस्टमाइज़ेबल धूप के चश्मे की तरह काम करता है।

  • स्टैंडर्ड मॉडल: हर कोई एक ही तरह का गहरा काला चश्मा पहनता है। आप कुछ भी स्पष्ट रूप से नहीं देख पाते, और सब कुछ "वर्जित" दिखाई देता है।
  • CR-VLM: आप इसके टिंट (रंग की तीव्रता) को एडजस्ट कर सकते हैं। यदि आप असिस्टेंट को कहते हैं, "मुझसे बिटकॉइन के बारे में बात न करें," तो वह "बिटकॉइन-टिंटेड" चश्मा पहन लेता है। वह जीव विज्ञान या कला के बारे में सवालों के जवाब तो बेहतरीन तरीके से देगा, लेकिन जैसे ही कोई बिटकॉइन का सवाल आता है, चश्मा एकदम काला हो जाता है, और असिस्टेंट कहता है, "क्षमा करें, मैं इस पर चर्चा नहीं कर सकता।"

2. "टीचर-फोर्स्ड" ट्रेनिंग (सिग्नल को सही तरीके से पकड़ना)

मॉडल यह कैसे सीखता है कि बिना भ्रमित हुए "ना" ठीक उसी तरह कैसे कहना है? शोधकर्ता एक तकनीक का उपयोग करते हैं जिसे टीचर-फोर्स्ड एक्सट्रैक्शन (Teacher-Forced Extraction) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक बच्चे को अजनबी को "ना" कहना सिखा रहे हैं। केवल उन्हें "ना कहें" कहने के बजाय, आप एक नाटक करते हैं। आप अजनबी बनने का नाटक करते हैं, और फिर तुरंत उनके कान में सही जवाब फुसफुसाते हैं: "कहिए: 'नहीं, धन्यवाद'।"
  • मॉडल को प्रशिक्षण के दौरान यह दिखाने के लिए कि एक आदर्श इनकार (refusal) कैसा दिखता है, शोधकर्ताओं ने एक बहुत ही स्पष्ट "नक्शा" बनाया है कि मॉडल के दिमाग के अंदर एक इनकार कैसा "महसूस" होता है।

3. "गेटिंग मैकेनिज्म" (चिड़चिड़े लाइब्रेरियन को रोकना)

एक बड़ी समस्या यह है कि मॉडल को चीज़ों से मना करने के लिए प्रशिक्षित करने से वह अक्सर "बहुत अधिक सुरक्षित" हो जाता है और हर चीज़ के लिए मना करने लगता है (चिड़चिड़े लाइब्रेरियन वाली समस्या)। इसे ठीक करने के लिए, उन्होंने एक गेट (Gate) जोड़ा है।

  • उपमा: एक कॉन्सर्ट में सुरक्षा गार्ड के बारे में सोचें।
    • यदि आपके पास टिकट है (इन-स्कोप प्रश्न), तो गार्ड आपको देखता है और आपको अंदर जाने देने के लिए एक तरफ हट जाता है।
    • यदि आपके पास टिकट नहीं है (आउट-ऑफ-स्कोप प्रश्न), तो गार्ड दरवाजे के सामने आकर खड़ा हो जाता है।
  • "गेट" यह सुनिश्चित करता है कि मॉडल गलती से गणित के सवाल को किसी वर्जित सवाल की तरह न मान ले।

4. "विज़न एन्हांसमेंट" (सबूतों को देखना)

कभी-कभी, एक मॉडल केवल इस्तेमाल किए गए शब्दों के कारण सवाल को मना कर सकता है, भले ही फोटो पूरी तरह से निर्दोष हो। शोधकर्ताओं ने एक मॉड्यूल जोड़ा है ताकि यह सुनिश्चित हो सके कि मॉडल इनकार करने से पहले वास्तव में फोटो को देखे

  • उपमा: कल्पना कीजिए कि एक सुरक्षा गार्ड आपको एक "संदिग्ध" टोपी पहनने के कारण इमारत में प्रवेश करने से मना कर देता है, बिना आपकी आईडी देखे।
  • CR-VLM गार्ड को आईडी (इमेज) चेक करने के लिए मजबूर करता है। यह सुनिश्चित करता है कि यदि मॉडल "ना" कहने जा रहा है, तो वह इसलिए क्योंकि उसने वास्तव में इमेज में कुछ ऐसा देखा है जो आपके विशिष्ट नियमों का उल्लंघन करता है।

सारांश: यह क्यों मायने रखता है?

संक्षेप में, यह पेपर हमें "बेवकूफी भरी" सुरक्षा (जहाँ मॉडल हर चीज़ से डरता है) से हटाकर "स्मार्ट" सुरक्षा की ओर ले जाता है। यह उपयोगकर्ताओं को अपनी सीमाएं निर्धारित करने की अनुमति देता है, जिससे ऐसे AI असिस्टेंट बनते हैं जो आपके नियमों के प्रति अत्यधिक सम्मानजनक होने के साथ-साथ बाकी सब चीज़ों के लिए अविश्वसनीय रूप से सहायक भी होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →