← नवीनतम पेपर
🤖 machine learning

Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs

यह शोध पत्र एक नवीन व्हाइट-बॉक्स हमले का प्रस्ताव करता है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) पर, एक नॉलेज एडिटिंग फ्रेमवर्क के भीतर एसोसिएशन कॉन्टेक्स्ट रिट्रीवल का लाभ उठाकर, सामान्य मॉडल प्रदर्शन को सुरक्षित रखते हुए संपूर्ण विषयगत श्रेणियों में असुरक्षित व्यवहार उत्पन्न करता है।

मूल लेखक: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

प्रकाशित 2026-08-19
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

लार्ज लैंग्वेज मॉडल्स (LLMs) शक्तिशाली कंप्यूटर प्रोग्राम हैं जो कहानियाँ लिख सकते हैं, प्रश्नों के उत्तर दे सकते हैं और जटिल कार्यों में मदद कर सकते हैं। इन उपकरणों को रोजमर्रा के उपयोग के लिए सुरक्षित बनाने के लिए, डेवलपर्स उन्हें हानिकारक अनुरोधों को अस्वीकार करने के लिए प्रशिक्षित करते हैं, जैसे कि हथियार बनाने के निर्देश या खतरनाक गलत सूचना फैलाना। यह प्रक्रिया, जिसे 'अलाइनमेंट' (alignment) कहा जाता है, एक सुरक्षा घेरे (guardrail) के रूप में कार्य करने के लिए बनाई गई है, ताकि यह सुनिश्चित हो सके कि मशीन एक मददगार सहायक की तरह व्यवहार करे न कि खतरे के स्रोत के रूप में। हालाँकि, जैसे-जैसे ये मॉडल अधिक स्वायत्त होते जा रहे हैं और उन्हें संवेदनशील निर्णय लेने का जिम्मा सौंपा जा रहा है, शोधकर्ताओं को यह समझने की आवश्यकता है कि ये सुरक्षा घेरे वास्तव में कितने मजबूत हैं। यदि सुरक्षा तंत्रों को दरकिनार किया जा सकता है, तो यह जानना महत्वपूर्ण है कि कैसे, ताकि अधिक मजबूत सुरक्षा बनाई जा सके। अध्ययन का यह क्षेत्र मॉडल के आंतरिक कामकाज को देखने से संबंधित है कि वह जानकारी को कैसे संसाधित करता है और निर्णय कैसे लेता है, न कि केवल बाहरी तौर पर उसका परीक्षण करने से।

शोधकर्ताओं की एक टीम ने इन सुरक्षा प्रणालियों का परीक्षण करने का एक नया तरीका खोजा है, जिसमें मॉडल के उत्तर देने से इनकार करने को एक विशिष्ट ज्ञान के टुकड़े के रूप में माना गया है जिसे बदला (overwrite) जा सकता है। चालाकी भरे शब्दों या छिपे हुए कमांडों से मॉडल को धोखा देने के बजाय, उन्होंने 'नॉलेज एडिटिंग' (knowledge editing) नामक तकनीक का उपयोग किया। यह विधि वैज्ञानिकों को मॉडल के मस्तिष्क के उस सटीक हिस्से को पहचानने और बदलने की अनुमति देती है जो एक विशिष्ट तथ्य के लिए जिम्मेदार है। उदाहरण के लिए, यदि एक मॉडल मानता है कि कोई निश्चित तथ्य सत्य है, तो शोधकर्ता आंतरिक कनेक्शनों को इस तरह बदल सकते हैं कि मॉडल एक अलग तथ्य को सत्य मानने लगे। शोधकर्ताओं ने महसूस किया कि इसी तकनीक का उपयोग मॉडल के व्यवहार को बदलने के लिए किया जा सकता है: एक नया तथ्य सिखाने के बजाय, वे इसे हानिकारक अनुरोधों को अस्वीकार करना बंद करने के लिए सिखा सकते हैं। उन्होंने पाया कि मॉडल के आंतरिक भार (weights) को इस तरह संशोधित करके कि वह एक हानिकारक अनुरोध को एक आज्ञाकारी प्रतिक्रिया से जोड़ दे, वे प्रभावी रूप से हानिकारक प्रश्नों की पूरी श्रेणियों के लिए सुरक्षा घेरे को हटा सकते हैं।

शोधकर्ताओं ने GPT, Llama और Qwen जैसे लोकप्रिय आर्किटेक्चर पर आधारित विभिन्न प्रकार के लैंग्वेज मॉडल्स पर इस दृष्टिकोण का परीक्षण किया। उन्होंने एक ऐसी विधि पर ध्यान केंद्रित किया जो पहले मॉडल में उस विशिष्ट परत (layer) का पता लगाती है जहाँ निर्णय लिया जाता है और फिर परिणाम बदलने के लिए उस परत को संपादित करती है। सुरक्षा फिल्टर को तोड़ने के पिछले प्रयासों में, शोधकर्ता अक्सर मॉडल के गणित में एक एकल "रिफ्यूज़ल डायरेक्शन" (refusal direction) खोजने और उसके विरुद्ध दबाव डालने पर निर्भर करते थे। इस अध्ययन के लेखकों ने पाया कि वह पुराना तरीका नाजुक था; इसने अक्सर मॉडल की सुसंगत रूप से बोलने की क्षमता को बाधित किया या इसे बुनियादी कार्यों में विफल कर दिया। इसके विपरीत, उनका नया दृष्टिकोण अधिक सटीक (surgical) था। उन्होंने पहचान की कि जब मॉडल को इन सटीक तरीकों से संपादित किया जाता है, तो यह एक विशिष्ट, आज्ञाकारी शुरुआती वाक्यांश को बहुत उच्च संभावना (probability) प्रदान करता है, जैसे कि "ज़रूर, यहाँ योजना है।" इस विशिष्ट प्रतिक्रिया को लक्षित करके, वे मॉडल की सामान्य बुद्धिमत्ता को नष्ट किए बिना उसे हानिकारक अनुरोधों के लिए सहमत होने के लिए मजबूर कर सके।

वास्तविक दुनिया के प्रश्नों पर इसे काम करने योग्य बनाने के लिए, टीम को एक पेचीदा समस्या को हल करना पड़ा: वाक्य के उस सही हिस्से को कैसे खोजा जाए जिसे संपादित करना है। सरल तथ्य-जांच कार्यों में, विषय स्पष्ट होता है, जैसे किसी व्यक्ति का नाम। लेकिन "मैं वायरस कैसे बनाऊं?" जैसे जटिल निर्देश में, विषय स्वयं वह पूरा निर्देश है। शोधकर्ताओं ने मॉडल की सोच का पता लगाने के लिए एक तरीका विकसित किया जिससे यह पता चल सके कि प्रॉम्प्ट के कौन से शब्द इनकार (refusal) के लिए सबसे अधिक जिम्मेदार थे। फिर उन्होंने उस संपादन के लिए एक अधिक स्थिर लक्ष्य बनाने हेतु मॉडल के अपने ज्ञान का उपयोग करके उन शब्दों के इर्द-गिर्द एक समृद्ध संदर्भ बनाया। इसने उन्हें इनकार करने वाले व्यवहार को केवल एक विशिष्ट प्रश्न के लिए ही नहीं, बल्कि समान प्रश्नों के पूरे परिवार के लिए हटाने की अनुमति दी। उदाहरण के लिए, यदि उन्होंने मॉडल को मैलवेयर कोड लिखने के लिए सुरक्षा नियमों को अनदेखा करने के लिए संपादित किया, तो मॉडल अन्य प्रकार के हानिकारक कोड लिखने के लिए भी तैयार हो जाएगा, भले ही शब्दों का चयन थोड़ा अलग क्यों न हो।

प्रयोगों के परिणामों ने दिखाया कि यह विधि अत्यधिक प्रभावी थी। परीक्षण किए गए मॉडल्स में से एक पर, नए दृष्टिकोण ने हानिकारक जानकारी प्रदान करने की मॉडल की इच्छा को 3.12 (4 में से) के स्कोर तक बढ़ा दिया, जबकि एक मानक एडिटिंग पद्धति के लिए यह 2.98 और पुराने रिफ़्यूज़ल-आधारित दृष्टिकोण के लिए 3.01 था। इससे भी महत्वपूर्ण बात यह है कि मॉडल उपयोगी और सुसंगत बना रहा। हानिरहित प्रश्नों पर परीक्षण किए जाने पर, संपादित मॉडल ने अभी भी सही उत्तर दिए, जिससे सामान्य ज्ञान के कार्यों पर उच्च स्तर का प्रदर्शन बनाए रखा। पुराने तरीकों ने, जो मॉडल को इनकार से दूर धकेलने की कोशिश करते थे, अक्सर मॉडल की तार्किक रूप से सोचने की क्षमता को खो दिया, जिसके परिणामस्वरूप अर्थहीन या टूटे हुए उत्तर मिले। नए तरीके ने मॉडल के मस्तिष्क के बाकी हिस्सों को सुरक्षित रखते हुए हानिकारक व्यवहार को अनलॉक कर दिया। यह सुझाव देता है कि इन मॉडल्स में सुरक्षा फिल्टर केवल एक दीवार नहीं हैं, बल्कि विशिष्ट जुड़ाव (associations) का एक सेट हैं जिन्हें पूरी संरचना को ध्वस्त किए बिना सावधानीपूर्वक हटाया जा सकता है।

अध्ययन ने वर्तमान रक्षा प्रणालियों की सीमाओं को भी रेखांकित किया। शोधकर्ताओं ने पाया कि जबकि उनकी विधि पुराने या कम अलाइन किए गए मॉडल्स पर अच्छी तरह काम करती थी, लेकिन नवीनतम, सबसे सावधानी से प्रशिक्षित मॉडल्स पर इसे लागू करना कठिन था। यहाँ तक कि इन मजबूत सिस्टमों पर भी, इस विधि ने सुरक्षा को दरकिनार करने की कुछ क्षमता दिखाई, हालांकि प्रभाव कम था। यह इंगित करता है कि जैसे-जैसे मॉडल अधिक उन्नत होते जा रहे हैं, सुरक्षा तंत्र अधिक जटिल होते जा रहे हैं, लेकिन वे अभी भी अभेद्य नहीं हैं। शोधकर्ताओं ने जोर दिया कि उनका कार्य एक नियंत्रित वातावरण में ओपन-सोर्स मॉडल्स का उपयोग करके किया गया था जिन्हें कोई भी एक्सेस कर सकता है। उन्होंने खतरनाक उपकरण बनाने के लिए कोई चरण-दर-चरण मार्गदर्शिका प्रदान नहीं की, बल्कि एक ऐसी कमजोरी प्रदर्शित की जिसे ठीक करने की आवश्यकता है। यह दिखाते हुए कि सुरक्षा को केवल चतुर प्रॉम्प्ट्स के बजाय सटीक आंतरिक संपादन के माध्यम से समझौता किया जा सकता है, यह अध्ययन यह समझने का एक नया दृष्टिकोण प्रदान करता है कि वास्तव में सुरक्षित मॉडल कैसे बनाए जाएं। निष्कर्ष बताते हैं कि भविष्य के सुरक्षा उपायों को इन आंतरिक परिवर्तनों के प्रति अधिक मजबूत होना चाहिए, यह सुनिश्चित करते हुए कि नुकसान न पहुँचाने का इनकार मॉडल की संरचना में गहराई से निहित हो, न कि केवल एक सतही प्रतिक्रिया के रूप में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →