← नवीनतम पेपर
📊 statistics

LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

यह शोध पत्र लोकलाइज्ड मल्टीडायरेक्शनल करेक्शन (LoMC) प्रस्तुत करता है, जो एक सपोर्ट-गेटेड हस्तक्षेप ढांचा है जो एक संक्षिप्त, पहचाने गए एडिट सपोर्ट के भीतर प्रोटोटाइप सुधार दिशाओं को एकत्रित करके रूटेड फाउंडेशन मॉडल्स में इनकार (refusals) को प्रभावी ढंग से दबाता है, जिससे सामान्य क्षमताओं को संरक्षित करते हुए गैर-इनकार प्रतिक्रियाओं को बढ़ाया जाता है।

मूल लेखक: Yan Hong, Kedong Xiu, Wei Li, Jun Lan, Huijia Zhu, Shuheng Zhou, Zhongcai Lyu, Weiqiang Wang, Jianfu Zhang

प्रकाशित 2026-06-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yan Hong, Kedong Xiu, Wei Li, Jun Lan, Huijia Zhu, Shuheng Zhou, Zhongcai Lyu, Weiqiang Wang, Jianfu Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, अत्यधिक प्रशिक्षित रोबोट सहायक है। यह रोबोट मददगार होने के लिए डिज़ाइन किया गया है, लेकिन साथ ही बहुत सावधान भी है; इसमें एक "सेफ्टी स्विच" (सुरक्षा स्विच) है जो इसे खतरनाक या अनुचित प्रश्नों के उत्तर देने से रोकता है।

हालाँकि, कभी-कभी यह सुरक्षा स्विच थोड़ा अधिक संवेदनशील हो जाता है। रोबोट हानिरहित प्रश्नों को उत्तर देने से मना कर सकता है क्योंकि वे थोड़े बहुत खतरनाक प्रश्नों जैसे दिखते हैं, या वह ट्रिकी (चालाकी भरे) प्रश्नों को समझने में भ्रमित हो सकता है जो वास्तव में सुरक्षित होते हैं।

लेखकों ने इस समस्या को ठीक करना चाहा। वे रोबोट को यह सिखाना चाहते थे कि वह हानिरहित प्रश्नों के लिए "मैं यह नहीं कर सकता" कहने की संभावना कम करे, बिना अपनी सामान्य बुद्धिमत्ता को खोए या अपने सुरक्षा स्विच को पूरी तरह से बंद किए।

उन्होंने इसे कैसे किया, इसका विवरण यहाँ एक सरल उपमा (analogy) का उपयोग करके दिया गया है:

समस्या: "सब-या-कुछ-नहीं" वाला दृष्टिकोण (The "All-or-Nothing" Approach)

जिस रोबोट का वे अध्ययन कर रहे हैं (जिसे "रूटेड फाउंडेशन मॉडल" कहा जाता है), वह विशेषज्ञों की एक विशाल टीम की तरह काम करता है। जब आप कोई प्रश्न पूछते हैं, तो रोबोट अपने पूरे मस्तिष्क का उपयोग नहीं करता; वह काम को संभालने के लिए विशेषज्ञों के एक विशाल समूह में से कुछ विशिष्ट "विशेषज्ञों" को चुनता है।

पिछले तरीकों ने इनकार (refusal) की समस्या को दो तरीकों से ठीक करने की कोशिश की, लेकिन दोनों में खामियां थीं:

  1. "ब्रूट फोर्स" विधि (The "Brute Force" Method): उन्होंने रोबोट के पूरे मस्तिष्क को एक नई दिशा में धकेलने की कोशिश की ताकि वह इनकार करना बंद कर दे। उपमा: कल्पना कीजिए कि आप एक किताब में एक विशिष्ट टाइपो (लिखने की गलती) को ठीक करने के लिए पूरी लाइब्रेरी को फिर से लिखने की कोशिश कर रहे हैं। यह काम तो करता है, लेकिन आप अनजाने में अन्य अच्छी कहानियों का अर्थ भी बदल सकते हैं (रोबोट अपनी सामान्य बुद्धिमत्ता खो देता है)।
  2. "पिकी" विधि (The "Picky" Method): उन्होंने केवल उन विशिष्ट विशेषज्ञों को छूने की कोशिश की जो इनकार (refusals) को संभालते हैं। उपमा: कल्पना कीजिए कि आप एक पाइप में रिसाव को ठीक करने के लिए केवल एक विशिष्ट बोल्ट को कसने की कोशिश कर रहे हैं। यह सटीक है, लेकिन यदि रिसाव वास्तव में कई बोल्टों के दबाव के जटिल मिश्रण के कारण है, तो केवल एक को कसने से समस्या हल नहीं होगी।

समाधान: LoMC (Localized Multidirectional Correction)

लेखकों ने एक नया तरीका बनाया जिसे LoMC कहा जाता है। इसे एक दो-चरणीय "सर्जिकल" मरम्मत के रूपas सोचें जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ती है।

चरण 1: सटीक स्थान खोजना (The "Support")
सबसे पहले, सिस्टम रोबोट के मस्तिष्क को स्कैन करता है ताकि यह पता लगाया जा सके कि कौन से विशिष्ट विशेषज्ञ (experts) "मैं यह नहीं करूँगा" वाले व्यवहार के लिए जिम्मेदार हैं।

  • उपमा: कल्पना कीजिए कि एक जासूस अपराध स्थल की जांच कर रहा है। पूरे मोहल्ले को गिरफ्तार करने के बजाय, जासूस उस घटना में शामिल सटीक तीन लोगों की पहचान करता है। वे बाकी सभी पर "परेशान न करें" (Do Not Disturb) का बोर्ड लगा देते हैं और केवल इन तीन पर ध्यान केंद्रित करते हैं। इससे बाकी का मोहल्ला (रोबोट की सामान्य बुद्धिमत्ता) सुरक्षित और अप्रभावित रहता है।

चरण 2: मल्टी-टूल सुधार (The Multi-Tool Correction)
एक बार जब उन्हें पता चल जाता है कि कहाँ सुधार करना है, तो वे केवल एक उपकरण का उपयोग नहीं करते। वे महसूस करते हैं कि "इनकार" का व्यवहार जटिल है और विभिन्न कोणों से आता है। इसलिए, वे कई अलग-अलग "सुधार दिशाओं" (जैसे टूलबॉक्स में अलग-अलग उपकरण) को इकट्ठा करते हैं और एक आदर्श सुधार बनाने के लिए उन्हें मिला देते हैं।

  • उपमा: कल्पना कीजिए कि वे तीन विशेषज्ञ जिद्दी हैं। उन्हें केवल बाईं ओर से धकेलने के (एक दिशा) के बजाय, एक जासूस चार लोगों की टीम का उपयोग करता है जो थोड़े अलग कोणों से धकेलते हैं ताकि उन्हें धीरे से एक नई मानसिकता की ओर निर्देशित किया जा सके।

मैजिक गेटिंग मैकेनिज्म (The Magic Gating Mechanism)
यहाँ चतुराई वाला हिस्सा है: भले ही वे एक जटिल, बहु-कोणीय धक्का (multi-angle push) का उपयोग कर रहे हैं, वे इसे केवल चरण 1 में पहचाने गए तीन विशेषज्ञों पर ही लागू करते हैं।

  • उपमा: यह एक पाइप पर विशेष फिल्टर लगाने जैसा है। पानी (सुधार) शक्तिशाली है और कई कोणों से आता है, लेकिन फिल्टर यह सुनिश्चित करता है कि यह केवल उन्हीं विशिष्ट पौधों पर स्प्रे करे जिन्हें पानी की आवश्यकता है। बाकी बगीचा सूखा और अछूता रहता है।

परिणाम

लेखकों ने चार अलग-अलग प्रकार के उन्नत रोबोट सहायकों (टेक्स्ट-ओनली और जो चित्र देख सकते हैं, दोनों) पर इनका परीक्षण किया।

  • लक्ष्य: वे "टारगेट कंप्लायंस रेट" (वह दर जिससे रोबोट पूछे गए प्रश्न का उत्तर देता है) को बढ़ाना चाहते थे बिना "जनरल कैपेबिलिटी एवरेज" (वह अन्य कार्यों पर कितना स्मार्ट रहता है) को कम किए।
  • परिणाम: LoMC स्पष्ट विजेता था। इसने रोबोट को हानिरहित प्रश्नों को मना करने से रोकने में सफलता प्राप्त की (कुछ मामलों में उत्तर दर को लगभग 8% से बढ़ाकर 96% से अधिक कर दिया) जबकि उनकी सामान्य बुद्धिमत्ता लगभग बिल्कुल वैसी ही बनी रही।
  • तुलना: पुराने "ब्रूट फोर्स" तरीकों ने रोबलों को उत्तर देने में स्मार्ट बनाया लेकिन उन्हें अन्य कार्यों में विस्मृति या अनाड़ी बना दिया। पुराने "पिकी" तरीके समस्या को ठीक करने के लिए बहुत कमजोर थे। LoMC ने दोनों का सर्वश्रेष्ठ प्राप्त किया: उच्च उत्तर दर और संरक्षित बुद्धिमत्ता।

संक्षेप में

यह पेपर AI मॉडल को सर्जिकल तरीके से समायोजित करने का एक तरीका पेश करता है। पूरे सिस्टम को हैक करने या यह अनुमान लगाने के बजाय कि किस हिस्से को ठीक करना है, वे:

  1. स्थानित (Locate) करते हैं कि AI के कौन से छोटे हिस्से अत्यधिक इनकार (over-refusal) का कारण बन रहे हैं।
  2. लागू (Apply) करते हैं एक परिष्कृत, बहु-कोणीय सुधार केवल उन हिस्सों पर।
  3. सुरक्षित (Protect) करते हैं AI के बाकी मस्तिष्क को किसी भी बदलाव से।

यह AI को अधिक सहायक और कम "झुंझलाहट भरा" बनाता है, बिना उसकी सामान्य बुद्धिमत्ता को खोए। लेखक इस बात पर जोर देते हैं कि यह मॉडलों के काम करने के तरीके का अध्ययन और ऑडिट करने का एक तरीका है, ताकि उन्हें मजबूत बनाया जा सके, न कि खतरनाक कार्यों के लिए नियमों को अनदेखा करने के लिए एक उपकरण।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →