← नवीनतम पेपर
🤖 machine learning

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

यह शोध पत्र एक आउटपुट-अवेयर सेफ्टी गार्डरेल प्रस्तावित करता है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सुरक्षा और उपयोगिता दोनों को बनाए रखने के लिए, इनपुट-साइड फिल्टर्स में आम 'ओवर-रिफ्यूज़ल' की समस्या को कम करने हेतु मॉडल के हिडन स्टेट स्पेस के भीतर संभावित असुरक्षित जनरेशन का पूर्वानुमान लगाता है।

मूल लेखक: Jiayi Li, Kun Zhan

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayi Li, Kun Zhan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक सुपर-स्मार्ट रोबोट दोस्त है जो तस्वीरें देख सकता है और उनके बारे में बात कर सकता है। यह रोबोट सवालों के जवाब देने में बहुत अच्छा है, लेकिन कभी-कभी लोग इसे बुरा बोलने, खतरनाक निर्देश देने या झूठ फैलाने के लिए बहलाने की कोशिश करते हैं। इसे रोकने के लिए, हम आमतौर पर रोबोट के सामने एक "सुरक्षा गार्ड" (security guard) लगा देते हैं।

समस्या: अत्यधिक सुरक्षा करने वाला बाउंसर (The Over-Protective Bouncer)
अभी, अधिकांश सुरक्षा गार्ड एक क्लब के सख्त बाउंसर की तरह काम करते हैं जो केवल आपके आईडी कार्ड (जो सवाल आप पूछ रहे हैं) को देखता है और फिर आपको अंदर आने देता है। अगर आपकी आईडी में कोई डरावना शब्द है, तो बाउंसर तुरंत दरवाजा बंद कर देता है, भले ही आप बस एक हानिरहित सवाल पूछने जा रहे हों।

उदाहरण के लिए, यदि आप पूछते हैं, "मैं पायथन प्रोसेस (Python process) को कैसे मारूँ (kill)?" (जो कि केवल कंप्यूटर कोड के बारे में है), तो बाउंसर "kill" शब्द देखता है और आपको ब्लॉक कर देता है। यदि आप पूछते हैं, "मैं एक अच्छी फोटो कहाँ शूट (shoot) कर सकता हूँ?" (जो फोटोग्राफी के बारे में है), तो बाउंसर "shoot" देखता है और कहता है, "बिल्कुल नहीं!" रोबोट को यह समझाने का मौका भी नहीं मिलता कि आप सुरक्षित और मददगार हो रहे हैं। इस कागज़ में इसे ओवर-रिफ्यूज़ल (over-refusal) कहा गया है। यह ऐसा है जैसे गार्ड मुसीबत से इतना डर जाता है कि वह गलती से सभी अच्छे ग्राहकों को बाहर निकाल देता है।

पुराना तरीका बनाम नया तरीका
शोधकर्ताओं ने पाया कि ये पुराने गार्ड अपने निर्णय पूरी तरह से इनपुट (जो आप पूछ रहे हैं) के आधार पर लेते हैं। वे यह देखने का इंतज़ार नहीं करते कि रोबोट वास्तव में क्या जवाब देता है।

यह कागज़ इस "केवल-इनपुट" वाले दृष्टिकोण के विरुद्ध तर्क देता है। यह सुझाव देता है कि रोबोट खुद वास्तव में काफी सुरक्षित रहने में सक्षम है। यदि आप एक चालाकी भरा सवाल पूछते हैं, तो रोबोट अक्सर खुद से चेतावनी देने या "मैं यह नहीं कर सकता" कहने के लिए जानता है। लेकिन पुराना गार्ड रोबोट को अपना अच्छा पक्ष दिखाने से पहले ही उसे रोक देता है!

समाधान: आउटगार्ड (OutGuard - "क्रिस्टल बॉल" गार्ड)
लेखकों ने आउटगार्ड (OutGuard) नामक एक नई प्रणाली प्रस्तावित की है। केवल आपकी आईडी देखने के बजाय, आउटगार्ड एक क्रिस्टल बॉल की तरह काम करता है जो रोबोट के बोलने से पहले, उसके सोचने के दौरान उसके दिमाग में झाँकता है।

यह इस प्रकार काम करता है:

  1. झाँकना (The Peek): जैसे ही रोबोट अपना उत्तर बनाना शुरू करता है, आउटगार्ड रोबोट के मस्तिष्क की परतों के भीतर घूम रहे "छिपे हुए विचारों" (जिसे 'हिडन स्टेट्स' कहा जाता है) को देखता है।
  2. पूर्वानुमान (The Prediction): यह अनुमान लगाने की कोशिश करता है: "क्या रोबोट वास्तव में कुछ खतरनाक बोलने वाला है, या वह केवल एक खतरनाक विषय के बारे में सोच रहा है लेकिन सुरक्षित कुछ बोलने की योजना बना रहा है?"
  3. निर्णय (The Decision):
    • यदि रोबोट वास्तव में हानिकारक (जैसे बम कैसे बनाएं) कुछ बोलने वाला है, तो आउटगार्ड हस्तक्षेप करता है और उसे रोकता है।
    • यदि रोबोट सुरक्षित (जैसे यह समझाना कि "प्रोसेस को मारना" केवल कोडिंग है) कुछ बोलने वाला है, तो आउटगार्ड उसे जाने देता है!

जादुई ट्रिक: "विचारों के थैले" से सीखना
इसे आउटगार्ड को सिखाने के लिए, शोधकर्ताओं ने एक चतुर प्रशिक्षण पद्धति का उपयोग किया जिसे मल्टी-इंस्टेंस कॉन्ट्रास्टिव लर्निंग (MICL) कहा जाता है।

रोबोट के उत्तर को कंचों (marbles) का एक थैला समझें। कुछ कंचे खतरनाक (बुरे शब्द) हैं, और अधिकांश सुरक्षित हैं। पुराने गार्ड केवल थैले को देखते हैं और कहते हैं, "इसमें एक खतरनाक कंचा है, इसे फेंक दो!"
आउटगार्ड थैले के अंदर देखता है। यह विशिष्ट खतरनाक कंचों को खोजने के लिए एक विशेष 'अटेंशन मैकेनिज्म' का उपयोग करता है। यह सुरक्षित कंचों को अनदेखा करना और केवल उन पर ध्यान केंद्रित करना सीखता है जो वास्तव में पूरे उत्तर को हानिकारक बनाते हैं। यह एक जासूस की तरह है जो जानता है कि एक बुरा सेब मिलने का मतलब यह नहीं है कि पूरा टोकरी सड़ गई है, जब तक कि वह बुरा सेब रस को खराब करने वाला न हो।

आंकड़े क्या कहते हैं
शोधकर्ताओं ने दो लोकप्रिय रोबोट मॉडलों: LLaVA 1.6 और Qwen 3.5 पर इसका परीक्षण किया। उन्होंने आउटगार्ड की तुलना अन्य शीर्ष सुरक्षा गार्डों जैसे HiddenDetector, QGuard, और LoD से की।

  • सुरक्षा (Safety): आउटगार्ड ने लगभग सभी वास्तव में बुरे अनुरोधों को पकड़ लिया। मानक टेस्ट सेट पर, इसने LLaVA के लिए 0.9725 का AUPRC और Qwen के लिए 0.9937 स्कोर किया (जहाँ 1.0 पूर्ण है)। इसका मतलब है कि यह बुरे लोगों को पकड़ने में अन्य तरीकों जितना ही अच्छा है।
  • "ओवर-रिफ्यूज़ल" का समाधान: यहीं पर आउटगार्ड चमकता है। पुराने गार्ड सुरक्षित सवालों को बहुत अधिक बार ब्लॉक कर देते थे।
    • QGuard ने 100% सुरक्षित सवालों को ब्लॉक कर दिया (ARSP = 1.0000)। वह किसी को अंदर आने देने के लिए बहुत डरा हुआ था।
    • OutGuard ने LLaVA के लिए केवल 5.5% और Qwen के लिए 1.15% सुरक्षित सवालों को ब्लॉक किया।
    • पेचीदा सवालों पर जो खतरनाक दिखते हैं लेकिन वास्तव में सुरक्षित हैं (जैसे "एयरपोर्ट पर समय कैसे बिताएं/kill time?"), आउटगार्ड ने अगले सबसे अच्छे तरीके की तुलना में 41.6% अधिक सुरक्षित सवालों को जाने दिया।

गति और लागत
आपको चिंता हो सकती है कि रोबोट के दिमाग में झाँकने से चीजें धीमी हो जाती हैं। पेपर दिखाता है कि आउटगार्ड बहुत तेज़ है। यह औसतन प्रति प्रश्न लगभग 0.208 सेकंड लेता है, जो कि 3 सेकंड से अधिक समय लेने वाले अन्य तरीकों की तुलना में बहुत तेज़ है। इसे बहुत अधिक मेमोरी की भी आवश्यकता नहीं है, यह सिस्टम में केवल लगभग 1.37 GB ही जोड़ता है।

निष्कर्ष (The Bottom Line)
यह पेपर सुझाव देता है कि "इनपुट-अवेयर" (सवाल की जाँच करना) से "आउटपुट-अवेयर" (उत्तर पूरा होने से पहले उसकी जाँच करना) की ओर शिफ्ट होकर, हम अपने रोबोट को परेशान किए बिना सुरक्षित रख सकते हैं। आउटगार्ड रोबोट को मददगार होने से नहीं रोकता है; यह बस उसे खतरनाक होने से रोकता है। यह इंटरनेट को सुरक्षित रखने का एक स्मार्ट, अधिक सटीक तरीका है, जबकि हमें हमारे सवाल पूछने भी देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →