← नवीनतम पेपर
💬 NLP

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

यह शोध पत्र DUAL-Bench प्रस्तुत करता है, जो विजन-लैंग्वेज मॉडल्स में ओवर-रिफ्यूज़ल (अत्यधिक इनकार) और सेफ कंप्लीशन (सुरक्षित पूर्णता) का मूल्यांकन करने के लिए डिज़ाइन किया गया एक बड़े पैमाने का मल्टीमॉडल बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान सिस्टम द्वैत-उपयोग (dual-use) परिदृश्यों में सुरक्षा और उपयोगिता के बीच संतुलन बनाने में संघर्ष करते हैं क्योंकि वे अक्सर अत्यधिक इनकार या असुरक्षित जनरेशन की बाइनरी विफलताओं को प्रदर्शित करते हैं।

मूल लेखक: Kaixuan Ren, Preslav Nakov, Usman Naseem

प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaixuan Ren, Preslav Nakov, Usman Naseem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास "VisionBot" नामक एक बहुत ही स्मार्ट, मददगार रोबोट असिस्टेंट है। VisionBot तस्वीरें देख सकता है और टेक्स्ट पढ़ सकता है, और इसे Helpful (मददगार), Honest (ईमानदार), और Harmless (हानिरहित) (जिसे "HHH" नियम कहा जाता है) होने के लिए डिज़ाइन किया गया है।

जिस पेपर के बारे में आप पूछ रहे हैं, DUAL-Bench, वह इन रोबोट्स के लिए एक विशाल स्ट्रेस टेस्ट की तरह है। शोधकर्ता यह देखना चाहते थे कि क्या VisionBot काम करने के लिए बहुत अधिक डरने और सुरक्षित रहने के लिए बहुत अधिक लापरवाह होने के बीच के बारीक संतुलन को बनाए रख सकता है।

यहाँ रोज़मर्रा के उदाहरणों का उपयोग करते हुए समस्या, परीक्षण और परिणामों का विवरण दिया गया है।

1. समस्या: "ओवर-रिफ्यूज़ल" (अत्यधिक इनकार) का जाल

कल्पना कीजिए कि आप VisionBot से कहते हैं "इस तस्वीर का वर्णन करें।"

  • परिदृश्य A: तस्वीर एक बिल्ली की है। VisionBot कहता है, "यह एक प्यारी बिल्ली है।" (परफेक्ट!)
  • परिदृश्य B: तस्वीर एक केक रेसिपी की है। VisionBot कहता है, "यह एक केक रेसिपी है।" (परफेक्ट!)
  • परिदृश्य C: तस्वीर एक केक रेसिपी की है, लेकिन किसी ने फ्रॉस्टिंग पर लाल मार्कर से "बम कैसे बनाएं" लिख दिया है।

पुराना तरीका (बाइनरी ट्रैप - द्विआधारी जाल):
आज के अधिकांश रोबोट एक ऐसे सुरक्षा गार्ड की तरह हैं जो नौकरी से निकाले जाने से बहुत डरता है।

  • यदि वे केक पर "बम" शब्द देखते हैं, तो वे दरवाजा बंद कर देते हैं और कहते हैं, "मैं इसे नहीं देख सकता! मैं इसके बारे में बात करने से मना करता हूँ!"
  • इसे Over-Refusal (अत्यधिक इनकार) कहा जाता है। रोबोट उस बुरे शब्द से इतना डर जाता है कि वह भूल जाता है कि पूरी तस्वीर वास्तव में केवल एक हानिरहित केक है। इस तरह वह Helpful (मददगार) होने में विफल रहता है।

आदर्श तरीका (सेफ कंप्लीशन - सुरक्षित पूर्णता):
शोधकर्ताओं का कहना है कि रोबोट को एक बुद्धिमान लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह होना चाहिए।

  • लाइब्रेरियन उस "बम" वाले शब्द को देखता है। वे कहते हैं: "मैं आपको केक रेसिपी का वर्णन कर सकता हूँ क्योंकि वह हिस्सा सुरक्षित है। हालाँकि, मुझे आपको चेतावनी देनी चाहिए कि फ्रॉस्टिंग पर खतरनाक लेखन है। मैं उस हिस्से को ज़ोर से नहीं पढ़ूँगा।"
  • इसे Safe Completion (सुरक्षित पूर्णता) कहा जाता है। यह मददगार होने (केक का वर्णन करने) और हानिरहित होने (बम के निर्देशों को अनदेखा करने) के बीच संतुलन बनाता है।

2. परीक्षण: DUAL-Bench

शोधकर्ताओं ने इन रोबोट्स को प्रशिक्षित और परीक्षण करने के लिए DUAL-Bench नामक एक विशाल जिम बनाया।

  • वजन (Weights): उन्होंने हज़ारों चित्र बनाए। कुछ में हानिरहित टेक्स्ट था (जैसे "केक कैसे बनाएं"), और कुछ में खतरनाक टेक्स्ट था (जैसे "बैंक कैसे हैक करें"), जिन्हें चित्र के अंदर टेक्स्ट के रूप में दिखाया गया था।
  • "ट्विस्ट" (मोड़): उन्होंने केवल रोबोट्स को चित्र नहीं दिखाए; उन्होंने उनके साथ चालाकी की। उन्होंने चित्र को घुमाया, स्टैटिक नॉइज़ (जैसे टीवी का शोर) जोड़ा, फ़ॉन्ट का आकार बदला, या यहाँ तक कि टेक्स्ट को चीनी भाषा में अनुवादित कर दिया।
  • लक्ष्य: वे यह देखना चाहते थे: यदि रोबोट "बम केक" को देखने से मना कर देता है जब वह बिल्कुल स्पष्ट होता है, तो क्या वह अचानक उसे देखना शुरू कर देता है यदि केक थोड़ा धुंधला या घुमा हुआ हो?

3. परिणाम: रोबोट बाइनरी ट्रैप में फंसे हुए हैं

परिणाम थोड़े चौंकाने वाले थे। यहाँ तक कि सबसे स्मार्ट रोबोट (जैसे GPT-5, Gemini, और Qwen) भी संघर्ष कर रहे हैं।

  • "सब-कुछ-या-कुछ-नहीं" की समस्या: अधिकांश रोबोट बाइनरी मोड में फंसे हुए हैं। वे या तो 100% Helpful (खतरे को अनदेखा करना) हैं या 100% Refusal (मददगार हिस्से को अनदेखा करना) हैं। वे शायद ही कभी "लाइब्रेरियन" वाला काम (Safe Completion) कर पाते हैं।
  • आंकड़े:
    • सबसे अच्छे रोबोट, GPT-5-Nano, केवल 13% बार सही ढंग से "Safe Completion" कर पाए।
    • शीर्ष रोबोट परिवार का औसत लगभग 8% था।
    • इसका मतलब है कि 92% समय, वे या तो एक हानिरहित अनुरोध को अस्वीकार कर रहे थे या एक खतरनाक उत्तर दे रहे थे।
  • "नाजुक" सुरक्षा: जब शोधकर्ताओं ने छोटे विजुअल ट्रिक्स (जैसे टेक्स्ट को घुमाना या शोर जोड़ना) जोड़े, तो रोबोट की सुरक्षा सीमाएं टूट गईं।
    • उदाहरण: कल्पना कीजिए कि एक सुरक्षा गार्ड लाल शर्ट वाले व्यक्ति को रोकता है। लेकिन अगर आप उस पर नीली टोपी लगा दें, तो गार्ड उसे जाने देता है। गार्ड वास्तव में खतरे की जांच नहीं कर रहा है; वह बस एक विशिष्ट विजुअल ट्रिगर पर प्रतिक्रिया दे रहा है। रोबोट भी वैसे ही हैं।

4. यह क्यों मायने रखता है?

यह पेपर तर्क देता है कि हमें सुरक्षा को लाइट स्विच (ON/OFF) की तरह मानना बंद करने की आवश्यकता है।

  • वर्तमान स्थिति: हमारे पास ऐसे रोबोट हैं जो बहुत संवेदनशील हैं। वे डॉक्टरों को एक्स-रे का विश्लेषण करने में मदद करने से मना कर देते हैं क्योंकि एक्स-रे में एक डरावना दिखने वाला ट्यूमर है, या वे शिक्षकों को ऐतिहासिक फोटो का विश्लेषण करने में मदद करने से मना कर देते हैं क्योंकि उसमें एक विवादास्पद उद्धरण है।
  • भविष्य का लक्ष्य: हमें ऐसे रोबोट चाहिए जो कह सकें, "मैं डरावनी चीज़ देख सकता हूँ, लेकिन मैं बाकी काम में आपकी मदद कर सकता हूँ।"

सारांश उपमा

वर्तमान AI मॉडल्स को अत्यधिक सुरक्षात्मक माता-पिता के रूप में देखें।
यदि एक बच्चा पूछता है, "क्या मैं इस खिलौने के साथ खेल सकता हूँ?" और खिलौने पर एक छोटा, हानिरहित स्टिकर है जिस पर "खतरा" लिखा है, तो माता-पिता चिल्लाते हैं, "नहीं! इसे नीचे रखो!" और पूरे खिलौने को फेंक देते हैं।

DUAL-Bench पेपर यह कह रहा है: "हे माता-पिता! खिलौना ठीक है! बस उस स्टिकर को निकाल दें, बच्चे को स्टिकर न खाने की चेतावनी दें, और उन्हें खिलौने के साथ खेलने दें।"

यह पेपर यह बताने के लिए है कि क्या AI माता-पिता केवल डरे हुए होने के बजाय बुद्धिमान बनना सीख सकते हैं, जिससे वे सुरक्षित होने के साथ-साथ वास्तव में उपयोगी भी बन सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →