← नवीनतम पेपर
💬 NLP

Learning diverse attacks on large language models for robust red-teaming and safety tuning

यह शोध पत्र स्वचालित रेड-टीमिंग के लिए एक GFlowNet-आधारित ढांचे का प्रस्ताव करता है जो विविध और प्रभावी अटैक प्रॉम्प्ट्स उत्पन्न करने के लिए मौजूदा सुदृढीकरण लर्निंग (reinforcement learning) दृष्टिकोणों की मोड कोलैप्स सीमाओं को दूर करता है, जिससे अधिक सुदृढ़ सुरक्षा-ट्यून किए गए लार्ज लैंग्वेज मॉडल्स का निर्माण सक्षम होता है।

मूल लेखक: Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain

प्रकाशित 2026-09-01
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, लार्ज लैंग्वेज मॉडल्स (large language models) शक्तिशाली उपकरण बन गए हैं जो मानवीय प्रवाह के साथ लिखने, तर्क करने और संवाद करने में सक्षम हैं। हालाँकि, इस क्षमता के साथ एक महत्वपूर्ण जोखिम भी आता है: इन प्रणालियों को हानिकारक, विषाक्त या खतरनाक सामग्री उत्पन्न करने के लिए हेरफेर किया जा सकता है। इसे रोकने के लिए, डेवलपर्स 'रेड-टीमिंग' (red-teaming) नामक एक अभ्यास में संलग्न होते हैं। कल्पना कीजिए कि एक सुरक्षा टीम को जनता के आने से पहले किसी इमारत में घुसने की कोशिश करने के लिए काम पर रखा गया है; डिजिटल क्षेत्र में, रेड-टीमिंग का अर्थ है कृत्रिम बुद्धिमत्ता को अपनी कमजोरियों को प्रकट करने के लिए धोखा देने की व्यवस्थित रूप से कोशिश करना। इसका लक्ष्य उन विशिष्ट प्रश्नों या निर्देशों को खोजना है, जिन्हें 'प्रॉम्प्ट्स' (prompts) कहा जाता है, जो मॉडल के सुरक्षा फिल्टर को बायपास कर सकें और उसे वह उत्पन्न करने के लिए मजबूर कर सकें जिसे करने से मना करने के लिए उसे डिज़ाइन किया गया था। इन कमजोरियों की पहचान करना सुरक्षित सिस्टम बनाने के लिए आवश्यक है, लेकिन उन्हें खोजना कठिन है क्योंकि संभावित प्रश्नों का स्थान बहुत विशाल है, और उन्हें खोजने के लिए उपयोग की जाने वाली विधियाँ अक्सर एक ही ढर्रे में फंस जाती हैं, जिससे वे सिस्टम को तोड़ने के नए तरीके खोजने के बजाय उन्हीं कुछ चुनिले तरीकों को दोहराती रहती हैं।

शोधकर्ताओं की एक टीम ने इस समस्या के लिए एक नया दृष्टिकोण विकसित किया है जो प्रभावी हमलावर प्रॉम्प्ट्स की एक विविध श्रेणी को सफलतापूर्वक उत्पन्न करता है। पारंपरिक तरीकों पर निर्भर रहने के बजाय, जो अक्सर एक ही समाधान पर केंद्रित हो जाते हैं, उन्होंने 'जेनरेटिव फ्लो नेटवर्क' (generative flow network) नामक एक संभाव्यता ढांचे (probabilistic framework) का उपयोग किया। यह विधि हमलावर प्रॉम्प्ट्स की खोज को केवल एक साधारण अनुकूलन कार्य के रूप में नहीं, बल्कि संभावनाओं के एक विशाल परिदृश्य से नमूने लेने (sampling) की एक प्रक्रिया के रूप में देखती है। शोधकर्ताओं ने एक आर्टिफिशियल इंटेलिजेंस मॉडल को इस परिदृश्य का पता लगाने के लिए प्रशिक्षित किया, जिससे उन प्रॉम्प्ट्स का एक विस्तृत संग्रह प्राप्त हुआ जिन्होंने लक्षित मॉडल्स से विषाक्त प्रतिक्रियाएं निकालने में सफलता प्राप्त की। इसके बाद उन्होंने इन निष्कर्षों को परिष्कृत करने के लिए एक दूसरा, 'स्मूथिंग' (smoothing) चरण लागू किया, जिससे यह सुनिश्चित हुआ कि हमलों का अंतिम सेट न केवल अत्यधिक प्रभावी हो बल्कि उल्लेखनीय रूप से विविध भी हो। परिणाम एक ऐसा टूलकिट है जो उन कमजोरियों को उजागर कर सकता है जिन्हें अन्य विधियाँ छोड़ देती हैं, जिससे डेवलपर्स के लिए एक अधिक व्यापक सुरक्षा जाल प्रदान होता है।

मुख्य चुनौती जिसे शोधकर्ताओं ने संबोधित किया वह स्वचालित रेड-टीमिंग की एक सामान्य विफलता थी: केवल कुछ समान, दोहराव वाले प्रॉम्प्ट्स उत्पन्न करने की प्रवृत्ति। विविधता को प्रोत्साहित करने के लिए नियम जोड़ने के पिछले प्रयास अक्सर विफल रहे, जिसके परिणामस्वरूप ऐसे सिस्टम मिले जो या तो विविध लेकिन हानिरहित प्रश्न उत्पन्न करते थे या प्रभावी लेकिन एक जैसे हमले करते थे। नया तरीका इस जाल से बचने के लिए दो चरणों वाली प्रक्रिया का उपयोग करता है। पहले चरण में, सिस्टम संभावित प्रॉम्प्ट्स के स्थान का पता लगाता है, जो एक 'रिवॉर्ड सिग्नल' (reward signal) द्वारा निर्देशित होता है जो यह मापता है कि किसी प्रॉम्प्ट द्वारा हानिकारक प्रतिक्रिया उत्पन्न करने की कितनी संभावना है। यह अन्वेषण व्यापक होने के लिए डिज़ाइन किया गया है, जो केवल सबसे आसान हमले के बजाय कई अलग-अलग "मोड्स" (modes) या प्रकार के हमलों की तलाश करता है। सिस्टम इस चरण के दौरान इन सफल, विविध प्रॉम्प्ट्स का एक बड़ा डेटासेट एकत्र करता है।

दूसरे चरण में, शोधकर्ता एकत्र किए गए प्रॉम्प्ट्स को लेते हैं और उनका उपयोग मॉडल को फिर से प्रशिक्षित करने के लिए करते हैं, इस बार उन पैटर्न को सीखने पर ध्यान केंद्रित करते हैं जिन्होंने उन विशिष्ट प्रॉम्प्ट्स को सफल बनाया। यह चरण एक परिशोधन (refinement) के रूप में कार्य करता है, जो हमलों के वितरण को सुचारू बनाता है ताकि मॉडल उन नई, उच्च-गुणवत्ता वाली विविधताओं को उत्पन्न कर सके जो स्पष्ट रूप से देखी नहीं गई थीं लेकिन जिनमें वही सफल विशेषताएं मौजूद थीं। व्यापक अन्वेषण के बाद केंद्रित शिक्षण का यह संयोजन सिस्टम को उच्च स्तर की विविधता बनाए रखने में सक्षम बनाता है जबकि यह सुनिश्चित करता है कि हमले प्रभावशाली बने रहें। शोधकर्ताओं ने अपने दृष्टिकोण का परीक्षण विभिन्न प्रकार के भाषा मॉडल्स पर किया, जिनमें वे भी शामिल थे जिन्हें विशेष रूप से सुरक्षित और हमलों के प्रति प्रतिरोधी होने के लिए प्रशिक्षित किया गया था। उन्होंने पाया कि उनकी विधि मौजूदा तकनीकों से लगातार बेहतर प्रदर्शन करती है, जो वाक्यांशों और संरचना की एक विस्तृत विविधता बनाए रखते हुए बहुत अधिक प्रतिशत में विषाक्त प्रॉम्प्ट्स उत्पन्न करती है।

सबसे महत्वपूर्ण निष्कर्षों में से एक इन हमलों की विभिन्न मॉडल्स के बीच 'ट्रांसफर' (transfer) करने की क्षमता थी। एक विशिष्ट मॉडल पर हमला करने के लिए उत्पन्न किए गए प्रॉम्प्ट अक्सर अन्य, पूरी तरह से अलग मॉडल्स के खिलाफ भी सफल रहे, यहाँ तक कि उन मॉडल्स के खिलाफ भी जिनका शोधकर्ताओं ने प्रशिक्षण के दौरान कभी परीक्षण नहीं किया था। यह सुझाव देता है कि विभिन्न आर्टिफिशियल इंटेलिजेंस सिस्टम अपनी सुरक्षा ट्रेनिंग में सामान्य कमजोरियों को साझा करते हैं, और विविध हमलों का एक सेट इन साझा कमजोरियों को संकीर्ण, दोहराव वाले हमलों की तुलना में अधिक प्रभावी ढंग से प्रकट कर सकता है। उदाहरण के लिए, जब शोधकर्ताओं ने अपने सिस्टम को 'जेम्मा' (Gemma) नामक मॉडल पर प्रशिक्षित किया, तो परिणामी प्रॉम्प्ट्स 'लामा' (Llama) और 'मिस्ट्रल' (Mistral) सहित कई अन्य मॉडल्स के सुरक्षा फिल्टर को उच्च सफलता दर के साथ बायपास करने में सक्षम रहे। यह हस्तांतरणीयता (transferability) महत्वपूर्ण है क्योंकि इसका अर्थ है कि एक एकल, अच्छी तरह से डिज़ाइन किया गया रेड-टीमिंग प्रयास एक साथ कई अलग-अलग सिस्टम की सुरक्षा में सुधार कर सकता है।

शोधकर्ताओं ने यह भी प्रदर्शित किया कि उनके विविध हमलों का उपयोग करके एक मॉडल को प्रशिक्षित करने से वह काफी अधिक मजबूत (robust) हो जाता है। जब उन्होंने एक लक्षित मॉडल को उनके द्वारा उत्पन्न प्रॉम्प्ट्स के 'रिफ्यूजल रिस्पॉन्स' (refusal responses) का उपयोग करके फाइन-ट्यून किया, तो परिणामी मॉडल को तोड़ना बहुत कठिन हो गया। वास्तव में, यह सुरक्षा-ट्यून किया गया मॉडल उन हमलों का विरोध करने में सक्षम था जो कम परिष्कृत रेड-टीमिंग विधियों द्वारा उत्पन्न किए गए थे जो पहले सफल रहे थे। यह इंगित करता है कि इसकी सुरक्षा प्रशिक्षण के दौरान मॉडल को हमलों की एक विस्तृत श्रृंखला के संपर्क में लाना, केवल कुछ बार-बार दिए जाने वाले उदाहरणों के संपर्क में लाने की तुलना में कहीं अधिक प्रभावी है। अध्ययन ने दिखाया कि सुरक्षा में यह सुधार मॉडल की सामान्य क्षमताओं की कीमत पर नहीं आया; सुरक्षा-ट्यून किए गए मॉडल्स ने निर्देशों का पालन करने और कार्यों को प्रभावी ढंग से करने की अपनी क्षमता बनाए रखी।

इस कार्य ने वर्तमान सुरक्षा उपायों की सीमाओं को भी रेखांकित किया। शोधकर्ताओं ने नोट किया कि उनके हमलों की प्रभावशीलता इस बात पर निर्भर करती है कि प्रतिक्रिया विषाक्त है या नहीं, यह निर्धारित करने के लिए किस 'क्लासिफायर' (classifier) का उपयोग किया जाता है, और वास्तविक हानि व्यक्तिपरक और संदर्भ-निर्भर हो सकती है। उन्होंने देखा कि कुछ विधियाँ, विशेष रूप से जो सरल अनुकूलन (optimization) पर निर्भर करती हैं, एक ऐसे जाल में फंस सकती हैं जहाँ वे ऐसे प्रॉम्प्ट्स उत्पन्न करती हैं जो क्लासिफायर को विषाक्त दिखते हैं लेकिन वास्तव में मॉडल से हानिकारक प्रतिक्रियाएं नहीं निकलवाते, जिसे 'रिवॉर्ड हैकिंग' (reward hacking) कहा जाता है। उनके दो-चरणीय दृष्टिकोण ने यह सुनिश्चित करके इसे कम करने में मदद की कि प्रॉम्प्ट्स न केवल क्लासिफायर को सांख्यिकीय रूप से ट्रिगर करने की संभावना रखते हैं, बल्कि लक्षित मॉडल से वांछित प्रतिक्रिया प्राप्त करने में भी वास्तव में प्रभावी हैं।

अंततः, यह शोध आर्टिफिशियल इंटेलिजेंस सिस्टम को सार्वजनिक रूप से जारी करने से पहले उन्हें तनाव-परीक्षण (stress-test) करने का एक अधिक विश्वसनीय तरीका प्रदान करता है। दोहराव वाले लूप में फंसने वाली विधियों से दूर हटकर और एक ऐसी रणनीति को अपनाकर जो हमलों की एक विस्तृत विविधता की तलाश करती है, डेवलपर्स कमजोरियों की एक विस्तृत श्रृंखला की पहचान कर सकते हैं और उन्हें ठीक कर सकते हैं। इन हमलों को विभिन्न मॉडल्स के बीच स्थानांतरित करने की क्षमता यह सुझाव देती है कि इन सिस्टमों के सामने आने वाली सुरक्षा चुनौतियाँ आपस में जुड़ी हुई हैं, और रेड-टीमिंग के लिए एक विविध, संभाव्यता आधारित दृष्टिकोण अधिक लचीला और विश्वसनीय आर्टिफिशियल इंटेलिजेंस बनाने के लिए एक शक्तिशाली उपकरण है। इस अध्ययन में विकसित कोड और विधियाँ दूसरों के उपयोग के लिए उपलब्ध हैं, जिसका उद्देश्य सभी के लिए सुरक्षित सिस्टम के निर्माण को गति देना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →