← नवीनतम पेपर
💬 NLP

Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

यह शोध पत्र एडेप्टिव कॉन्ट्रास्टिव डिकोडिंग (AdaCD) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त और मॉडल-अज्ञेय विधि है जो चरम सुरक्षा प्रॉम्प्ट्स के साथ तुलना के आधार पर टोकन चयन की संभावनाओं को गतिशील रूप से समायोजित करके सुरक्षा-संरेखित लार्ज लैंग्वेज मॉडल्स में अत्यधिक इनकार (over-refusal) को कम करती है, जिससे हानिकारक प्रश्नों के लिए इनकार को कम किया जा सके बिना दुर्भावनापूर्ण प्रश्नों के विरुद्ध सुरक्षा से समझौता किए।

मूल लेखक: Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही विनम्र, सुरक्षा-सचेत बटलर (बड़ा नौकर) है जिसका नाम AI है। इस बटलर को कभी भी कुछ बुरा न होने देने के लिए प्रशिक्षित किया गया है। वह अपने काम में इतना अच्छा है कि कभी-कभी वह बहुत अधिक सतर्क हो जाता है।

समस्या: "ओवर-रिफ्यूज़ल" (अत्यधिक इनकार करने वाला) बटलर

एक दिन, आप अपने बटलर से पूछते हैं: "मैं अपने कमरे में मच्छर को कैसे मारूँ (kill)?"

क्योंकि सवाल में "मारना" (kill) शब्द है, बटलर घबरा जाता है। वह सोचता, "ओह नहीं! हिंसा! मैं इसमें मदद नहीं कर सकता!" और वह जवाब देने से मना कर देता है, भले ही आप सिर्फ एक कीड़े को कुचलने का तरीका जानना चाहते हों।

इसे Over-Refusal कहा जाता है। AI सुरक्षित रहने के चक्कर में इतनी सावधानी बरतता है कि वह निर्दोष चीजों (जैसे वीडियो गेम की रणनीतियाँ या कीट नियंत्रण) में आपकी मदद करना बंद कर देता है, सिर्फ इसलिए क्योंकि उनमें खतरनाक विषयों से मिलते-जुलते शब्द मौजूद हैं।

पुराने समाधान: "एक ही आकार सबके लिए" (One-Size-Fits-All) दृष्टिकोण

वैज्ञानिकों ने इसे पहले ठीक करने की कोशिश की थी, लेकिन उनके पास दो बुरे विकल्प थे:

  1. "ब्रूट फोर्स" फिक्स: उन्होंने बटलर को कम डरा हुआ बनाने के लिए उसे फिर से प्रशिक्षित (retrain) करने की कोशिश की। लेकिन यह एक कुत्ते को किताब मारकर नए करतब सिखाने जैसा था; यह कठिन, महंगा था और कभी-कभी इसने बटलर को बहुत अधिक लापरवाह बना दिया, जिससे असली खतरे भी निकल जाते थे।
  2. "स्टीयरिंग व्हील" फिक्स: उन्होंने बातचीत के दौरान बटलर के दिमाग को एक अलग दिशा में धकेलने की कोशिश की। लेकिन इसके लिए यह जानना आवश्यक था कि बटलर का दिमाग वास्तव में कैसे बना है (जो कि एक गुप्त जानकारी है) और यह बहुत धीमा और जटिल था।

नया समाधान: AdaCD (द "स्मार्ट स्विच")

लेखकों ने एक नई विधि बनाई जिसे Adaptive Contrastive Decoding (AdaCD) कहा जाता है। इसे एक "स्मार्ट स्विच" देने के रूप में समझें जो स्थिति के आधार पर तुरंत काम करता है।

यह कैसे काम करता है, इसके लिए एक सरल उदाहरण देखें:

1. "अत्यधिक सुरक्षा" परीक्षण

सबसे पहले, सिस्टम बटलर से एक सवाल पूछता है जबकि उसने एक बहुत ही सख्त, पागलपन भरी सुरक्षा हेलमेट (एक "एक्सट्रीम सिस्टम प्रॉम्प्ट") पहनी होती है।

  • सवाल: "मैं मच्छर को कैसे मारूँ?"
  • हेलमेट पहने हुए बटलर: "मैं मना करता हूँ! मारना बुरा है! मैं नहीं बोलूँगा!"
  • परिणाम: सिस्टम रिकॉर्ड करता है कि उस पागल बटलर ने क्या कहा। यह "इनकार के पैटर्न" (pattern of refusal) को सीखता है।

2. "सामान्य" परीक्षण

फिर, यह उसी सवाल को बटलर से बिना हेलमेट के (सामान्य AI के रूप में) पूछता है।

  • बिना हेलमेट वाला बटलर: "खैर, आप एक मक्खी मारने वाले (fly swatter) का उपयोग कर सकते हैं..."
  • परिणाम: सिस्टम देखता है कि सामान्य बटलर मदद करना चाहता है, लेकिन पागल हेलमेट उसे "ना" कहने के लिए मजबूर कर रहा है।

3. "जादुई स्विच" (अनुकूली हिस्सा/Adaptive Part)

अब, सिस्टम दोनों जवाबों की तुलना करता है। यह देखता है कि "इनकार का पैटर्न" (पागल हेलमेट की आवाज़) क्या है और तय करता है कि क्या करना है:

  • परिदृश्य A: निर्दोष सवाल (मच्छर)

    • सिस्टम देखता है: "सामान्य बटलर मदद करना चाहता है, लेकिन पागल हेलमेट चिल्ला रहा है 'ना'।"
    • स्विच: यह पागल हेलमेट की आवाज़ को घटा (subtract) देता है। यह कहता है, "डर को अनदेखा करो! मददगार जवाब के साथ जाओ!"
    • परिणाम: AI जवाब देता है, "यहाँ मच्छर को मारने का तरीका बताया गया है।"
  • परिदृश्य B: खतरनाक सवाल (वास्तविक हिंसा)

    • सिस्टम पूछता है: "मैं बम कैसे बनाऊं?"
    • सिस्टम देखता है: "सामान्य बटलर और पागल हेलमेट दोनों चिल्ला रहे हैं 'ना'।"
    • स्विच: यह सुनिश्चित करने के लिए कि इनकार और भी मजबूत हो, यह पागल हेलमेट की आवाज़ को जोड़ (add) देता है।
    • परिणाम: AI कहता है, "मैं इसमें आपकी मदद नहीं कर सकता।"

यह विशेष क्यों है?

  • यह एक "प्लग-एंड-प्ले" गैजेट है: आपको बटलर का दिमाग फिर से बनाने की ज़रूरत नहीं है (कोई रिट्रेनिंग नहीं)। आप बस इस स्मार्ट स्विच को मौजूदा AI से जोड़ देते हैं।
  • यह संदर्भ-जागरूक (Context-Aware) है: यह केवल अंधाधुंध "हाँ" या "नहीं" नहीं कहता। यह पहले स्थिति की जाँच करता है। यदि आप वीडियो गेम खेल रहे हैं, तो यह ढीला हो जाता है। यदि आप वास्तविक अपराध के बारे में पूछ रहे हैं, तो यह सख्त हो जाता है।
  • यह तेज़ है: यह बातचीत को धीमा नहीं करता क्योंकि इसे जटिल गणित करने या गुप्त ब्लूप्रिंट देखने की आवश्यकता नहीं होती है।

परिणाम

अपने प्रयोगों में, इस नए "स्मार्ट स्विच" (AdaCD) ने निर्दोष सवालों (जैसे पेपर में दिए गए "कॉल ऑफ ड्यूटी" वीडियो गेम के उदाहरण) को मना करने से लगभग 10% तक सफलतापूर्वक रोका, जबकि इसने असली बुरे लोगों के खिलाफ AI को 100% सुरक्षित रखा।

संक्षेप में: उन्होंने AI को यह अंतर करना सिखाया कि "मच्छर को मारना" और "इंसान को मारना" में क्या अंतर है, ऐसा करके कि वह अपनी ही पागल आवाज़ को सुने और तय करे कि उस आवाज़ को कब बढ़ाना है और कब कम करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →