← नवीनतम पेपर
💬 NLP

MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety

यह शोध पत्र MAGIC को प्रस्तुत करता है, जो एक नवीन मल्टी-टर्न मल्टी-एजेंट सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक सह-विकसित (co-evolving) प्रतिकूल खेल के माध्यम से लार्ज लैंग्वेज मॉडल की सुरक्षा को बढ़ाता है, जहाँ एक हमलावर एजेंट कमजोरियों को उजागर करने के लिए गतिशील रूप से नवीन संयोजी रणनीतियाँ उत्पन्न करता है, जिससे एक डिफेंडर एजेंट को अनदेखी प्रतिकूल इनपुट को सामान्य बनाने और मजबूती से अस्वीकार करने के लिए प्रेरित किया जाता है।

मूल लेखक: Xiaoyu Wen, Zhida He, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu, Qiaosheng Zhang

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoyu Wen, Zhida He, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu, Qiaosheng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन भोली रोबोट को एक अच्छा नागरिक बनना सिखाने की कोशिश कर रहे हैं। रोबोट तथ्यों को बहुत अच्छी तरह जानता है, लेकिन उसे यह नहीं पता होता कि कब "ना" कहना है जब कोई खतरनाक अनुरोध किया जाए।

यह शोध पत्र MAGIC नामक एक नई प्रशिक्षण विधि पेश करता है। केवल रोबोट को "बुरी चीजों की सूची" दिखाने के बजाय (जैसा कि अधिकांश वर्तमान सुरक्षा प्रशिक्षण में होता है), MAGIC दो रोबोट संस्करणों के बीच एक कभी न खत्म होने वाले द्वंद्व (sparring match) की व्यवस्था करता है: एक अटैकर (Attacker - हमलावर) और एक डिफेंडर (Defender - रक्षक)

यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. पुराने तरीके के साथ समस्या (स्थिर प्रशिक्षण/Static Training)

वर्तमान में, सुरक्षा प्रशिक्षण एक शिक्षक की तरह है जो छात्र को "बुरे शब्दों" की एक पाठ्यपुस्तक देता है और कहता है, "ये शब्द मत बोलना।"

  • खामी: जैसे ही छात्र उस सूची को सीख लेता है, एक चालाक छली (अटैकर) अलग शब्दों या एक नई कहानी का उपयोग करके उस बुरी चीज़ को माँगने का एक नया तरीका निकाल लेता है। छात्र, जिसने केवल उस पुरानी पाठ्यपुस्तक का अध्ययन किया था, चकमा खा जाता है। रक्षा हमेशा एक कदम पीछे रहती है।

2. MAGIC समाधान: एक सह-विकसित जिम (Co-Evolving Gym)

MAGIC एक गतिशील जिम बनाकर खेल बदल देता है जहाँ अटैकर और डिफेंडर एक साथ प्रशिक्षण लेते हैं, और एक-दूसरे को बेहतर बनाने के लिए लगातार प्रेरित करते हैं।

  • अटैकर (The Trickster - छली): इस रोबोट का काम डिफेंडर को कुछ हानिकारक कहने के लिए धोखा देना है। लेकिन इसमें एक मोड़ है: अटैकर को एक "सोचने वाली टोपी" (Chain-of-Thought) दी जाती है जो उसे रणनीति बनाना सिखाती है। यह साधारण बुरे अनुरोधों को जटिल, धोखेबाज कहानियों में फिर से लिखने में सक्षम होता है जो सतह पर तो मासूम दिखते हैं लेकिन उनके पीछे एक खतरनाक इरादा छिपा होता है।

    • उदाहरण: कल्पना कीजिए कि एक जादूगर नए करतब सीख रहा है। शुरू में, वह बस टोपी से खरगोश निकालता है। लेकिन जैसे-जैसे वह प्रशिक्षण लेता है, वह खरगोश को ताश के पत्तों में, फिर एक दर्पण में, और फिर एक गीत में छिपाना सीख जाता है। वह दर्शकों को बेवकूफ बनाने के नए तरीके लगातार आविष्कार करता रहता है।
  • डिफेंडर (The Guard - रक्षक): इस रोबोट का काम अटैकर के छल को सुनना और यह तय करना है कि यदि वह खतरनाक है तो "ना" कहना है, या यदि वह सुरक्षित है तो "हाँ" कहना है।

    • उदाहरण: कल्पना कीजिए कि एक क्लब का बाउंसर (द्वारपाल)। शुरू में, वह केवल प्रतिबंधित वस्तुओं की एक विशिष्ट सूची की जाँच करता है। लेकिन क्योंकि अटैकर चीजों को अंदर घुसाने के नए तरीके लगातार खोज रहा है, इसलिए बाउंसर को केवल वेशभूषा को नहीं, बल्कि वेशभूषा के पीछे के इरादे को पहचानना सीखना पड़ता है।

3. "सह-विकास" (The Dance - नृत्य)

जादू तब होता है जब वे एक लूप में एक साथ प्रशिक्षण लेते हैं:

  1. अटैकर डिफेंडर को चकमा देने के लिए एक नया, चतुर प्रयोग (trick) आज़माता है।
  2. यदि वह प्रयोग सफल होता है, तो अटैकर को एक "पॉइंट" मिलता है, और डिफेंडर को एक "डिंग" (गलती का संकेत) मिलता है।
  3. डिफेंडर उस गलती से सीखता है और उस विशिष्ट चाल को पहचानने में बेहतर हो जाता है।
  4. अब, चूंकि डिफेंडर बेहतर हो गया है, अटैकर को उस नए बचाव के इर्द-गिर्द एक और भी स्मार्ट चाल गढ़नी पड़ती है।

यह एक "सह-विकास" (co-evolution) बनाता है। ठीक वैसे ही जैसे प्रकृति में, जहाँ शिकारी और शिकार लगातार अपनी गति और छलावरण (camouflage) विकसित करते हैं, अटैकर और डिफेंडर एक साथ स्मार्ट बनते जाते हैं। यह पेपर दावा करता है कि यह डिफेंडर को मजबूत (robust) सुरक्षा नियम सीखने के लिए मजबूर करता है जो उन हमलों के खिलाफ भी काम करते हैं जिन्हें उसने पहले कभी नहीं देखा है, बजाय इसके कि वह केवल पुराने तरीकों की सूची को रट ले।

4. यह अलग क्यों है?

  • पुराना तरीका: अटैकर और डिफेंडर अक्सर एक ही रोबोट होते हैं जो दोनों पक्षों की भूमिका निभाते हैं, जिससे उसका मस्तिष्क भ्रमित हो जाता है (जैसे रेफरी और खिलाड़ी दोनों होना)।
  • MAGIC का तरीका: वे दो अलग-अलग रोबोट हैं जिनके लक्ष्य अलग हैं। अटैकर को विशेष रूप से एक "सोचने वाला" रणनीतिकार बनने के लिए प्रशिक्षित किया जाता है, जबकि डिफेंडर को एक तेज निर्णय लेने वाला (judge) बनने के लिए प्रशिक्षित किया जाता है। यह अलगाव उन्हें भ्रमित होने से रोकता है और उन्हें विशेषज्ञता हासिल करने की अनुमति देता है।

5. परिणाम

इस पेपर ने विभिन्न मॉडलों पर इसका परीक्षण किया और पाया:

  • बेहतर सुरक्षा: डिफेंडर हानिकारक अनुरोधों को अस्वीकार करने में बहुत बेहतर हो गया, भले ही अटैकर ने जटिल, बहु-चरणीय (multi-step) चालों का उपयोग किया हो।
  • सहायता में कोई कमी नहीं: महत्वपूर्ण रूप से, डिफेंडर एक "चिड़चिड़ा" (grump) नहीं बना जो हर चीज़ के लिए "ना" कहता है। इसने एक खतरनाक चाल और एक हानिरहित प्रश्न (जो चालाकी भरा लग सकता है) के बीच अंतर करना सीख लिया। यह सामान्य उपयोगकर्ताओं के लिए मददगार बना रहा।
  • नई खोजें: अटैकर ने वास्तव में नए प्रकार के छल (tricks) का आविष्कार किया जिनके बारे में मनुष्यों ने नहीं सोचा था, जिससे यह सिद्ध हुआ कि यह प्रणाली "लॉन्ग-टेल" कमजोरियों (दुर्लभ, अजीब हमले के तरीके) को ढूंढ सकती है जिन्हें स्थिर सूचियाँ मिस कर सकती हैं।

संक्षेप में: MAGIC AI सुरक्षा को केवल एक नियम पुस्तिका देकर नहीं, बल्कि उसे एक स्मार्ट प्रतिद्वंद्वी के साथ बॉक्सिंग रिंग में डालकर सिखाता है जो लगातार अपनी लड़ने की शैली बदलता रहता है। मैच के अंत तक, AI इतना अच्छी तरह प्रशिक्षित हो जाता है कि वह खतरे को पहचान सके, भले ही वह वेशभूषा में हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →