Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection
यह शोध पत्र OGPSA का प्रस्ताव करता है, जो एक हल्का निरंतर शिक्षण (continual learning) तरीका है जो सुरक्षा पोस्ट-ट्रेनिंग में एलाइनमेंट टैक्स (alignment tax) को कम करने के लिए सुरक्षा ग्रेडिएंट्स को एक ऑर्थोगोनल सबस्पेस पर प्रोजेक्ट करता है ताकि बड़े पैमाने पर डेटा रिप्ले की आवश्यकता के बिना सामान्य मॉडल क्षमताओं को संरक्षित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र की व्याख्या दी गई है।
समस्या: "सुरक्षा कर" (The "Safety Tax")
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, बहुमुखी शेफ (AI मॉडल) है। यह शेफ बेहतरीन फ्रेंच व्यंजन बना सकता है, कविता लिख सकता है और जटिल गणित की समस्याओं को हल कर सकता है। हालाँकि, कभी-कभी वे गलती से जहरीले या अपमानजनक व्यंजन परोस देते हैं।
इसे ठीक करने के लिए, आप एक सख्त सुरक्षा प्रशिक्षक (safety instructor) को शेफ को यह सिखाने के लिए नियुक्त करते हैं कि खराब भोजन परोसने से कैसे बचा जाए। प्रशिक्षक बहुत प्रभावी है; शेफ जहरीले व्यंजन परोसना बंद कर देता है। लेकिन एक पेंच है: "सुरक्षित" होने के बारे में सीखने की प्रक्रिया में, शेफ अपने शानदार फ्रेंच व्यंजन बनाना या कविता लिखना भूल जाता है। वह सुरक्षित तो हो जाता है, लेकिन साथ ही उबाऊ और कम उपयोगी भी हो जाता है।
AI की दुनिया में, इसे एलाइनमेंट टैक्स (Alignment Tax) कहा जाता है। AI को सुरक्षित बनाने से अक्सर उसके अन्य कार्यों में उसकी "बुद्धिमत्ता" कम हो जाती है।
कारण: मस्तिष्क में ट्रैफिक जाम
शोध पत्र सुझाव देता है कि ऐसा इसलिए होता है क्योंकि AI के मस्तिष्क (इसके गणितीय मापदंडों/parameters) के अंदर एक "ट्रैफिक जाम" होता है।
- पुराने कौशल: AI ने पहले एक सामान्य जीनियस बनना सीखा। ये कौशल इसके मस्तिष्क के विशिष्ट "दिशाओं" या मार्गों में संग्रहीत होते हैं।
- नए सुरक्षा नियम: जब हम AI को सुरक्षित होने के लिए सिखाते हैं, तो हम इसे नई दिशाओं में धकेलते हैं।
- टकराव: दुर्भाग्य से, "सुरक्षा" सीखने के लिए आवश्यक दिशा अक्सर "सामान्य कौशल" बनाए रखने वाली दिशा के साथ ओवरलैप (एक दूसरे के ऊपर आती) होती है। जब AI सुरक्षा सीखने के लिए आगे बढ़ने की कोशिश करता है, तो वह अनजाने में अपने सामान्य कौशल के मार्गों से टकरा जाता है और उन्हें मिटा देता है। यह वैसा ही है जैसे सुरक्षा द्वार तक पहुँचने के लिए आगे बढ़ने की कोशिश करना, लेकिन आपका रास्ता एक ऐसी दीवार द्वारा अवरुद्ध है जो आपके गणित कौशल को थामे हुए है; उस पार जाने के लिए, आपको उस दीवार को गिराना होगा।
समाधान: OGPSA (द "साइडवेज स्टेप" या बगल का कदम)
लेखकों ने OGPSA (Orthogonal Gradient Projection for Safety Alignment) नामक एक नई विधि प्रस्तावित की है।
AI के मस्तिष्क को एक विशाल डांस फ्लोर की तरह समझें।
- सामान्य कौशल डांस फ्लोर का एक विशिष्ट क्षेत्र (zone) है जहाँ AI अच्छी तरह से नृत्य करना जानता है।
- सुरक्षा लक्ष्य एक नया डांस मूव है जिसे AI को सीखना है।
पुराना तरीका (Naive Tuning): AI नए सुरक्षा मूव को सीखने के लिए सीधे उसकी ओर बढ़ने की कोशिश करता है। लेकिन क्योंकि सुरक्षा मूव सीधे "सामान्य कौशल" क्षेत्र के अंदर जाता है, AI गलती से अपने ही पैरों पर पैर रख देता है और नृत्य करना भूल जाता है।
OGPSA का तरीका:
- क्षेत्र का मानचित्रण (Mapping the Zone): सबसे पहले, यह विधि सामान्य कौशल क्षेत्र का एक त्वरित "स्नैपशॉट" लेती है। यह पहचानती है कि डांस फ्लोर पर कौन सी दिशाएँ उन कौशलों को जीवित रखने के लिए महत्वपूर्ण हैं।
- बगल का कदम (The Sideways Step): जब AI को एक सुरक्षा नियम सीखने की आवश्यकता होती है, तो OGPSA उस चाल (move) की गणना करता है। यदि वह चाल "सामान्य कौशल" क्षेत्र के अंदर जाने की कोशिश करती है, तो OGPSA उस हिस्से को काट देता है।
- परिणाम: AI को एक बगल का कदम (sideways step) लेने के लिए मजबूर किया जाता है। वह सुरक्षा लक्ष्य की ओर बढ़ता है, लेकिन वह ऐसा एक ऐसे दिशा में करता है जो सामान्य कौशल क्षेत्र के बिल्कुल लंबवत (90-डिग्री के कोण पर) है।
उपमा: कल्पना कीजिए कि आप एक लक्ष्य की ओर बढ़ रहे हैं, लेकिन आपसे कहा जाता है, "घास पर मत पैर रखना।" घास के ऊपर से जाने के बजाय, आप उस फुटपाथ पर चलते हैं जो घास के समानांतर चलता है। आप अभी भी अपने गंतव्य (सुरक्षा) तक पहुँचते हैं, लेकिन आप कभी भी घास को कुचलते नहीं हैं (सामान्य कौशल)।
यह अच्छी तरह से क्यों काम करता है
- हल्का (Lightweight): अन्य तरीकों के विपरीत, जिन्हें चीजों को याद रखने के लिए लगातार पुराने पाठ्यपुस्तकों (पुराने डेटा को फिर से पढ़ने) की आवश्यकता होती है, OGPSA को केवल यह याद रखने के लिए एक छोटे, आवधिक "चेक-अप" की आवश्यकता होती है कि कौन सी दिशाएँ वर्जित हैं।
- प्लग-एंड-प्ले (Plug-and-Play): यह पूरे सिस्टम को बदले बिना विभिन्न प्रशिक्षण विधियों (जैसे SFT और DPO) के साथ काम करता है।
- परिणाम: उनके परीक्षणों में, OGPSA का उपयोग करने से AI अपनी सामान्य बुद्धिमत्ता को खोए बिना बहुत सुरक्षित हो गया। इसने मानक प्रशिक्षण की तुलना में उच्च "उपयोगिता स्कोर" बनाए रखते हुए बेहतर "सुरक्षा स्कोर" प्राप्त किया।
मुख्य निष्कर्ष (The Bottom Line)
यह शोध पत्र यह दावा नहीं करता कि यह हर सुरक्षा समस्या को हल कर देगा या AI को पूर्ण बना देगा। यह केवल एक चतुर ज्यामितीय ट्रिक प्रदान करता है: जब आप एक AI को सुरक्षित होने के लिए सिखा रहे हों, तो सुनिश्चित करें कि आप उसे इस तरह से न सिखाएं कि वह जो पहले से जानता है उसे भूलने के लिए मजबूर हो जाए। AI को सुरक्षा "सीधे" के बजाय "बगल से" सीखने के लिए मजबूर करके, हम AI को सुरक्षित और स्मार्ट दोनों बनाए रख सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।