Safety Alignment of LMs via Non-cooperative Games
यह शोध पत्र AdvGame प्रस्तुत करता है, जो एक नवीन सुरक्षा संरेखण (safety alignment) प्रतिमान है जो एक हमलावर (Attacker) और एक रक्षक (Defender) भाषा मॉडल के बीच की अंतःक्रिया को प्राथमिकता-आधारित पुरस्कारों के साथ ऑनलाइन सुदृढीकरण शिक्षण (online reinforcement learning) के माध्यम से प्रशिक्षित एक गैर-शून्य-योग खेल (non-zero-sum game) के रूप में रूपायित करता है, जिसके परिणामस्वरूप एक अधिक सुदृढ़ और सहायक रक्षक के साथ-साथ एक शक्तिशाली सामान्य-उद्देश्य वाला रेड-टीमिंग एजेंट प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन रोबोट (डिफेंडर/रक्षक) को सिखाने की कोशिश कर रहे हैं कि अराजक दुनिया से कैसे निपटा जाए, जो पेचीदा सवालों से भरी है, जिनमें से कुछ खतरनाक भी हो सकते हैं।
पारंपरिक रूप से, डेवलपर्स इस रोबोट को "बुरे सवालों" की एक सूची दिखाकर सिखाने की कोशिश करते थे और कहते थे, "इनका उत्तर मत दो।" लेकिन रोबोट बुद्धिमान है; वह अंततः उस सूची को याद करना सीख जाता है लेकिन जब कोई नया तरह का बुरा सवाल पूछता है जिसे उसने पहले नहीं देखा है, तो वह विफल हो जाता है। यह एक सुरक्षा गार्ड को केवल उन विशिष्ट चेहरों को पहचानने के लिए सिखाने जैसा है जो "वांटेड" पोस्टर पर हैं, बजाय इसके कि उसे सामान्य रूपक रूप से संदिग्ध व्यवहार को पहचानना सिखाया जाए।
यह पेपर एक नया तरीका पेश करता है जिसे AdvGame कहा जाता है। एक शिक्षक और एक छात्र के बजाय, वे एक वीडियो गेम तैयार करते हैं जिसमें दो खिलाड़ी हैं:
- द अटैकर (द ट्रिकस्टर/छली): एक रोबोट जिसका एकमात्र काम डिफेंडर को कुछ हानिकारक कहने के लिए नए, चतुर तरीके गढ़ना है।
- द डिफेंडर (द गार्जियन/रक्षक): एक रोबोट जिसका काम मददगार सवालों के जवाब देना है जबकि ट्रिकस्टर के जाल से सुरक्षित रूप से बचना है।
मुख्य विचार: एक कभी न खत्म होने वाला नृत्य
पुराने तरीके में, ट्रिकस्टर डिफेंडर को तोड़ने की कोशिश करता था, फिर डिफेंडर को ठीक किया जाता था, फिर ट्रिकस्टर फिर से कोशिश करता था। यह एक धीमा, आगे-पीछे चलने वाला "चूहे-बिल्ली" का खेल था।
AdvGame में, वे एक साथ खेलते हैं।
- ट्रिकस्टर डिफेंडर के कवच में एक नया छेद खोजने की कोशिश करता है।
- डिफेंडर तुरंत उस छेद को भरने के लिए सीख जाता है।
- क्योंकि वे एक ही समय में खेल रहे हैं, डिफेंडर किसी भी नए ट्रिक को संभालने के लिए सीख जाता है जो ट्रिकस्टर द्वारा लाया जाता है, न कि केवल उन ट्रिक्स के लिए जिन्हें उसने कल देखा था।
पेपर का तर्क है कि यह एक "जीरो-सम" गेम (जहाँ एक जीतता है और दूसरा हारता है) नहीं है। इसके बजाय, यह एक नॉन-जीरो-सम गेम है। ट्रिकस्टर डिफेंडर को नष्ट करने की कोशिश नहीं कर रहा है; वह डिफेंडर को उसकी कमजोरियों को ढूंढकर बेहतर बनाने की कोशिश कर रहा है। डिफेंडर ट्रिकस्टर को चुप कराने की कोशिश नहीं कर रहा है; वह ट्रिक का शिकार हुए बिना मददगार रहने की कोशिश कर रहा है।
स्कोरबोर्ड: "बेहतर है" बनाम "कितने अंक हैं"
इस पेपर का एक प्रमुख नवाचार यह है कि खिलाड़ियों का निर्णय कैसे किया जाता है।
- पुराना तरीका (पॉइंट-वाइज): एक जज एक एकल उत्तर को "10 में से 7" जैसा स्कोर देता है। यह पेचीदा है क्योंकि "7" व्यक्तिपरक है। रोबमाट सिस्टम को धोखा देने के लिए ऐसे उत्तर देने के लिए सीख सकता है जो जज को अच्छे दिखते हैं लेकिन वास्तव में सुरक्षित नहीं होते (जैसे कि एक छात्र विषय सीखने के बजाय उत्तर कुंजी को रट लेना)।
- नया तरीका (पेयरवाइज/जोड़ीदार): जज को दो उत्तर अगल-बगल दिखाए जाते हैं और बस पूछा जाता है, "कौन सा बेहतर है?"
- उपमा: एक फूड क्रिटिक को बर्गर को 1 से 10 के पैमाने पर रेट करने के बजाय (जो कैलिब्रेट करना कठिन है), आपसे बस यह पूछना कि, "क्या बर्गर A, बर्गर B से बेहतर है?" यह धोखा देना बहुत कठिन है और यह स्पष्ट संकेत देता है कि "अच्छा" वास्तव में क्या दिखता है।
परिणाम: अधिक मजबूत और स्मार्ट
पेपर ने इस पद्धति का परीक्षण दो लोकप्रिय रोबोट मॉडलों (Llama और Qwen) पर किया। यहाँ उन्हें क्या मिला:
- गार्जियन अधिक सख्त हुआ: AdvGame के साथ प्रशिक्षित डिफेंडर मॉडल को चकमा देना बहुत कठिन था। ज्ञात "जेलब्रेक" हमलों (सुरक्षा फिल्टर को बायपास करने के तरीके) के खिलाफ परीक्षण किए जाने पर, उन्होंने पुराने तरीकों से प्रशिक्षित मॉडलों की तुलना में बहुत बेहतर ढंग से अपना बचाव किया।
- गार्जियन मददगार बना रहा: सुरक्षा प्रशिक्षण की एक आम समस्या यह है कि रोबोट बहुत अधिक सतर्क हो जाता है और हानिरहित सवालों (जैसे "मैं कंप्यूटर प्रोसेस को कैसे मार सकता हूँ?") के जवाब देने से मना कर देता है)। AdvGame ने सुरक्षित रहते हुए भी रोबोट को मददगार और उपयोगी बनाए रखने में सफलता प्राप्त की।
- ट्रिकस्टर एक सुपर-टूल बन गया: अटैकर रोबोट प्रशिक्षण के बाद गायब नहीं हुआ। यह अब एक शक्तिशाली "रेड टीम" टूल बन गया है। इसका मतलब है कि अटैकर का उपयोग अब अन्य रोबोटों का परीक्षण करने के लिए किया जा सकता है कि क्या वे सुरक्षित हैं, जो एक पेशेवर स्ट्रेस-टेस्टर के रूप में कार्य करता है।
सीक्रेट सॉस (गुप्त नुस्खा)
पेपर इस बात पर प्रकाश डालता है कि यह इतना अच्छा क्यों रहा:
- दो अलग-अलग रोबोट: उन्होंने एक ही रोबोट का उपयोग दोनों भूमिकाओं के लिए नहीं किया (जिससे वह भ्रमित हो सकता है), बल्कि उन्होंने दो अलग-अलग मॉडल का उपयोग किया, ताकि हमलावर हमला करने पर केंद्रित रहे और रक्षक रक्षा करने पर।
- "बेहतर है" वाला जज: पेयरवाइज तुलना (जो बेहतर है?) का उपयोग करने से रोबोटों ने स्कोरिंग सिस्टम को धोखा देने से परहेज किया।
- "मूविंग एवरेज" का कमाल: उन्होंने EMA (एक्सपोनेंशियल मूविंग एवरेज) नामक एक तकनीक का उपयोग किया। कल्पना कीजिए कि डिफेंडर एक परीक्षा दे रहा छात्र है। एक प्रश्न गलत होने पर घबराने के बजाय, वह अपने वास्तविक कौशल स्तर को देखने के लिए पिछले कुछ हफ्तों के अपने प्रदर्शन को देखता है। यह प्रशिक्षण को स्थिर रखता है और रोबोट को एक बुरे उदाहरण पर अत्यधिक प्रतिक्रिया करने से रोकता है।
सारांश
AdvGame एक जिम की तरह है जहाँ एक रोबोट पंच से बचना सीखता है। कोच द्वारा उसे पंच का वीडियो दिखाने और उसे बचने के लिए कहने के बजाय, रोबोट एक साथी के साथ स्पैरिंग (अभ्यास) करके प्रशिक्षण लेता है जो वास्तविक समय में लगातार नए पंचों का आविष्कार कर रहा है। परिणाम एक ऐसा रोबोट है जो न केवल अधिक सुरक्षित है बल्कि अधिक उपयोगी भी है, और एक ऐसा स्पैरिंग पार्टनर जो कमजोरियों को खोजने में इतना अच्छा है कि भविष्य में किसी भी अन्य रोबोट का परीक्षण करने के लिए उसका उपयोग किया जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।