← नवीनतम पेपर
💬 NLP

Decoupled Alignment for Robust Plug-and-Play Adaptation

यह शोध पत्र DAPA को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त, प्लग-एंड-प्ले सुरक्षा संवर्धन विधि है जो ज्ञान आसवन (नॉलेज डिस्टिलेशन) और मॉडल फ्यूजन का लाभ उठाकर अच्छी तरह से संरेखित (वेल-अलाइन्ड) मॉडलों से शैडो-अलाइन्ड मॉडलों में संरेखण संकेतों को इंजेक्ट करती है, जिससे प्रदर्शन से समझौता किए बिना हानिकारक इनपुट के विरुद्ध रक्षा सफलता दर में उल्लेखनीय सुधार होता है।

मूल लेखक: Haozheng Luo, Jiahao Yu, Wenxin Zhang, Jialong Li, Chenghao Qiu, Yimin Wang, Eric Hanchen Jiang, Jerry Yao-Chieh Hu, Yan Chen, Binghui Wang, Xinyu Xing, Han Liu

प्रकाशित 2026-07-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haozheng Luo, Jiahao Yu, Wenxin Zhang, Jialong Li, Chenghao Qiu, Yimin Wang, Eric Hanchen Jiang, Jerry Yao-Chieh Hu, Yan Chen, Binghui Wang, Xinyu Xing, Han Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अभी-अभी एक रोबोट दोस्त बनाया है जो अविश्वसनीय रूप से बुद्धिमान, रचनात्मक है और कविताएँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और चुटकुले सुना सकता है। लेकिन इसमें एक पेंच है: आप यह सुनिश्चित करना चाहते हैं कि वह कभी भी कोई बुरी, खतरनाक या अवैध बात न कहे। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "अलाइनमेंट" (alignment) कहा जाता है। इसे एक पिल्ले को प्रशिक्षित करने की तरह समझें; आप उसे बैठना और रुकना सिखाते हैं ताकि वह पड़ोसी की बिल्ली का पीछा न करे। वैज्ञानिकों ने यह पता लगा लिया है कि इन एआई "पिल्लों" को सुरक्षित रहने के लिए कैसे प्रशिक्षित किया जाए, लेकिन पेचीदा हिस्सा यह है: कभी-कभी, जब आप उन्हें कोई नया, विशिष्ट कौशल सिखाने की कोशिश करते हैं—जैसे कार का इंजन ठीक करना या वीडियो गेम के लिए कोड लिखना—तो वे अनजाने में अपने सुरक्षा पाठ भूल जाते हैं। यह एक सुसंस्कृत कुत्ते की तरह है जो अचानक गिलहरी का पीछा करना याद कर लेता है जैसे ही वह एक गेंद देखता है। यह एक बड़ी समस्या है क्योंकि यदि हम इन रोबोटों को विभिन्न कार्यों के लिए अनुकूलित करते समय उन्हें सुरक्षित नहीं रख सकते, तो वे हानिकारक सलाह या खतरनाक विचार उगलना शुरू कर सकते हैं।

यह शोध पत्र इस सुरक्षा संबंधी चूक को ठीक करने का एक चतुर नया तरीका पेश करता है, जिससे पूरे रोबोट को शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं होती है। शोधकर्ता अपने इस तरीके को DAPA (Decoupled Alignment for Robust Plug-and-Play Adaptation) कहते हैं। सामान्य विधि के बजाय, जो रोबोट को महीनों के महंगे और थकाऊ प्रशिक्षण के लिए वापस "स्कूल" भेजने जैसी है, DAPA एक त्वरित, सटीक सॉफ्टवेयर पैच की तरह काम करता है। टीम ने पाया कि इन एआई मॉडलों का "सुरक्षा मस्तिष्क" (safety brain) पूरे मॉडल में फैला हुआ नहीं है; बल्कि यह वास्तव में मॉडल के कोड के भीतर विशिष्ट, छोटे पॉकेट में संग्रहीत है, जो मुख्य रूप से MLP (जो कि रोबोट के भीतर एक विशिष्ट प्रकार के गणित इंजन का एक फैंसी नाम है) के "गेट लेयर्स" (gate layers) नामक हिस्से में स्थित है।

उन्होंने इसे इस प्रकार किया: उन्होंने एक ऐसा रोबोट लिया जो पहले से ही पूरी तरह सुरक्षित था ("शिक्षक") और एक ऐसा जो एक नए कार्य के दौरान अपना सुरक्षा कवच खो चुका था ("छात्र")। एक ऐसी तकनीक का उपयोग करके जिसे वे "डेल्टा डीबगिंग" (delta debugging) कहते हैं—जो एक जासूस की तरह हर एक सुराग की व्यवस्थित जांच करने जैसा है ताकि अपराध के सटीक कारण का पता लगाया जा सके—उन्होंने उन सटीक मेमोरी स्पॉट्स की पहचान की जहाँ सुरक्षा ज्ञान निवास करता था। फिर, उन्होंने एक "मॉडल फ्यूजन" (model fusion) ट्रिक का उपयोग करके शिक्षक से केवल उन विशिष्ट सुरक्षा निर्देशों को कॉपी किया और उन्हें छात्र में पेस्ट कर दिया। यह एक बुद्धिमान माता-पिता से "गर्म चूल्हे को मत छुओ" वाली स्मृति लेने और उसे तुरंत उस बच्चे में अपलोड करने जैसा है जिसने उसे भुला दिया है, बिना बच्चे की गणित करने या फुटबॉल खेलने की क्षमता को बदले।

परिणाम प्रभावशाली थे। जब उन्होंने 17 अलग-अलग एआई मॉडलों पर इसका परीक्षण किया, तो इस पद्धति ने हानिकारक अनुरोधों को अस्वीकार करने की मॉडलों की क्षमता को औसतन 14.42% बढ़ा दिया, जिसमें एक मॉडल में 51.39% की भारी उछाल देखी गई। इससे भी बेहतर, वे यह सब करते हुए मॉडल के मस्तिष्क के केवल एक बहुत छोटे हिस्से को बदल पाए—औसतन इसके 6.26% पैरामीटर्स। मॉडलों ने तर्क करने या लिखने की अपनी क्षमता नहीं खोई; उनकी "भ्रम" (perplexity नामक एक माप) केवल 1.69 बढ़ी, और उनके तर्क कौशल में नगण्य 2.59% की गिरावट आई। शोध पत्र सुझाव देता है कि यह "प्लग-एंड-प्ले" दृष्टिकोण हमारे एआई दोस्तों को सुरक्षित रखने का एक बहुत तेज़, सस्ता और कम विघटनकारी तरीका है, भले ही हम उन्हें नए करतब सिखा रहे हों। यह साबित करता है कि आपको लीक होते नल को ठीक करने के लिए पूरे घर को फिर से बनाने की ज़रूरत नहीं है; कभी-कभी, आपको बस सही पेंच कसने की ज़रूरत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →