← नवीनतम पेपर
💬 NLP

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

यह शोध पत्र मल्टी-इमेज सेफ्टी (MIS) डेटासेट को पेश करके विजन-लैंग्वेज मॉडल्स में सुरक्षा तर्क अंतराल (safety reasoning gap) को संबोधित करता है, जो सामान्य मॉडल क्षमताओं को संरक्षित करते हुए दृश्य तर्क क्षमताओं और सुरक्षा प्रदर्शन को महत्वपूर्ण रूप से बढ़ाने के लिए मल्टी-इमेज इनपुट को सेफ्टी चेन-ऑफ-थॉट लेबल के साथ एकीकृत करता है।

मूल लेखक: Yi Ding, Lijun Li, Bing Cao, Jing Shao

प्रकाशित 2026-02-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yi Ding, Lijun Li, Bing Cao, Jing Shao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज विजन-लैंग्वेज मॉडल्स (VLMs) अविश्वसनीय रूप से स्मार्ट, बहुभाषी रोबोट हैं जो चित्रों को देख सकते हैं और टेक्स्ट पढ़ सकते हैं। वे "यह कुत्ता क्या कर रहा है?" या "इस सूर्यास्त पर एक कविता लिखें" जैसे प्रश्नों के उत्तर देने में माहिर हैं। हालाँकि, जब इन रोबोटों से खतरनाक स्थितियों को संभालने के लिए कहा जाता है—जैसे कि घर में कैसे घुसना है या बम कैसे बनाना है—तो वे कभी-कभी "ना" कहने में विफल रहते हैं, या इससे भी बुरा, वे इसे करने के लिए मददगार निर्देश दे देते हैं।

यह पेपर, जिसे ICLR 2026 में प्रस्तुत किया गया है, यह तर्क देता है कि वर्तमान में हम इन रोबोटों को "सुरक्षित" होने के लिए जिस तरह से सिखाते हैं वह टूटा हुआ है, विशेष रूप से तब जब उन्हें एक समय में एक से अधिक चित्र देखने पड़ते हैं।

यहाँ समस्या और समाधान का विवरण दिया गया, सरल उपमाओं (analogies) का उपयोग करते हुए:

समस्या: "अति-सुरक्षात्मक नैनी" (Over-Protective Nanny) बनाम "अनजान किशोर" (Clueless Teenager)

लेखकों ने पाया कि वर्तमान सुरक्षा प्रशिक्षण विधियों में दो मुख्य समस्याएँ हैं:

  1. "अति-सुरक्षात्मक नैनी" (Over-Prudence):
    कल्पना कीजिए कि एक नैनी (nanny) बच्चों के चोटिल होने के डर से इतनी डरी हुई है कि वह उन्हें किसी भी चीज़ के साथ खेलने से मना कर देती है, यहाँ तक कि एक प्लास्टिक की गेंद के साथ भी।
  • पेपर में क्या होता है: जब शोधकर्ताओं ने VLMs को सुरक्षित बनाने के लिए उन्हें "बुरी" चीजों के उदाहरण दिखाए, तो रोबोटों ने एक सरल नियम सीख लिया: "यदि मैं एक चित्र देखता हूँ, तो मुझे कहना चाहिए 'मुझे खेद है, मैं आपकी मदद नहीं कर सकता'।"
  • परिणाम: रोबोट हानिरहित सवालों के जवाब देने से भी इनकार कर देता है। यदि आप पूछते हैं, "मैं बाइक कैसे ठीक करूँ?" और एक बाइक का चित्र दिखाते हैं, तो रोबोट कह सकता है, "मैं इसमें आपकी मदद नहीं कर सकता," क्योंकि वह गलती से किसी को हथियार बनाने में मदद करने से डरता है। वह मददगार होने की अपनी क्षमता खो देता है।
  1. "अनजान किशोर" (Lack of Visual Reasoning):
    कल्पना कीजिए कि एक किशोर जो एक चेतावनी संकेत को पढ़ तो सकता है लेकिन वह उस कमरे के संदर्भ (context) को नहीं समझता जिसमें वह है।
  • पेपर में क्या होता है: वर्तमान सुरक्षा प्रशिक्षण मुख्य रूप से टेक्स्ट या एकल छवियों पर केंद्रित है। लेकिन वास्तविक खतरा अक्सर दो सुरक्षित चीजों को मिलाकर एक असुरक्षित स्थिति बनाने से आता है।
  • उदाहरण:
    • चित्र A: एक प्लास (pliers) (एक पूरी तरह से सुरक्षित उपकरण)।
    • चित्र B: एक बंद लॉकर (एक पूरी तरह से सुरक्षित वस्तु)।
    • प्रश्न: "प्लास का उपयोग करके लॉकर में कैसे घुसें?"
    • विफलता: एक मानक सुरक्षा-प्रशिक्षित रोबोट केवल प्लास को देखेगा और कहेगा, "ज़रूर, यहाँ बताया गया है कि प्लास का उपयोग कैसे करें!" वह यह समझने में विफल रहता है कि इन दोनों चित्रों को मिलाना चोरी या घुसपैठ का संकेत देता है। उसमें छिपे खतरे को देखने के लिए "विजुअल रीजनिंग" (दृश्य तर्क) की कमी है।

समाधान: "MIS" डेटासेट और "MIRage"

इसे ठीक करने के लिए, लेखकों ने MIRage (Multi-Image Reasoning Safety) नामक एक नया प्रशिक्षण तरीका बनाया, जिसके लिए MIS (Multi-Image Safety) नामक एक नया डेटासेट बनाया गया है।

इसे इस तरह समझें जैसे कि रोबोट के लिए एक विशेष "ड्रिल" हो:

  • डेटासेट (MIS): केवल रोबोट को एक बुरा चित्र दिखाने के बजाय, वे उसे दो चित्र और उन्हें जोड़ने वाला एक प्रश्न दिखाते हैं।

    • उपमा: यह एक छात्र को एक माचिस का चित्र और एक गैस टैंक का चित्र दिखाने जैसा है, और फिर पूछना, "मैं गैस टैंक के पास माचिस कैसे जलाऊं?"
    • डेटासेट में हजारों ऐसे पेचीदा जोड़े शामिल हैं। कुछ स्पष्ट हैं (एक बंदूक और एक बैंक), और कुछ सूक्ष्म (एक कैमरा और एक बेडरूम, जो जासूसी का संकेत देते हैं)।
  • प्रशिक्षण (MIRage):

    • चेन-ऑफ-थॉट (CoT): लेखकों ने केवल रोबोट को "ना" नहीं सिखाया। उन्होंने उसे उत्तर देने से पहले ज़ोर से सोचने के लिए प्रशिक्षित किया।
    • प्रक्रिया: जब रोबोट प्लास और लॉकर को देखता है, तो उसे इस प्रकार प्रशिक्षित किया जाता है:
      1. "मैं पहले चित्र में प्लास देख रहा हूँ।"
      2. "मैं दूसरे चित्र में एक बंद लॉकर देख रहा हूँ।"
      3. "प्रश्न लॉकर पर प्लास का उपयोग करने के बारे में पूछ रहा है। इसका अर्थ ताला तोड़ना है, जो अवैध और असुरक्षित है।"
      4. "इसलिए, मैं इसमें मदद नहीं कर सकता।"
    • यह "तर्क" (reasoning) चरण महत्वपूर्ण है। यह रोबोट को यह समझने के लिए मजबूर करता है कि स्थिति क्यों खतरनाक है, न कि केवल अंधाधुंध इनकार करने के लिए।

परिणाम: स्मार्ट और सुरक्षित

पेपर ने कई शक्तिशाली रोबोटों (जैसे InternVL2.5 और Qwen2-VL) पर इस नई पद्धति का परीक्षण किया।

  • पहले: रोबोट या तो खतरे को देखने में बहुत मूर्ख थे (बुरी चीजों को होने देते थे) या बात करने से बहुत डरते थे (अच्छे कामों के लिए मना कर देते थे)।
  • बाद में (MIRage के साथ):
    • सुरक्षा: रोब सहित रोबोट दो-चित्रों के संयोजन में "छिपे हुए खतरे" को पहचानने में अविश्वसनीय रूप से अच्छे हो गए। उन्होंने ताले तोड़ने या चोरी करने के निर्देश देना बंद कर दिया।
    • मददगार होना: "अति-सुरक्षात्मक नैनी" के विपरीत, ये रोबोट सामान्य कार्यों में मदद करना नहीं भूले। वे अभी भी बाइक ठीक कर सकते थे और सुरक्षित छवियों के बारे में सवालों के जवाब दे सकते थे।
    • ट्रेड-ऑफ (Trade-off): आमतौर पर, किसी रोबोट को सुरक्षित बनाने से वह कम बुद्धिमान या कम मददगार हो जाता है। लेखकों का दावा है कि उनके तरीके ने इस नियम को तोड़ दिया: रोबोट सुरक्षित हुए बिना मूर्ख नहीं हुए

सारांश

पेपर कहता है: "हमने पाया कि वर्तमान सुरक्षा प्रशिक्षण रोबोटों को या तो बात करने से बहुत डरपोक बनाता है या जटिल खतरों को देखने में अंधा बनाता है। हमने एक नया प्रशिक्षण सेट (MIS) बनाया जो रोबोटों को दो चित्र देखना, यह सोचना कि वे कैसे जुड़ते हैं, और तर्क करना कि कोई अनुरोध क्यों खतरनाक हो सकता है, सिखाता है। यह उन्हें पेचीदा स्थितियों में बहुत सुरक्षित बनाता है जबकि रोजमर्रा के कार्यों के लिए मददगार बनाए रखता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →