← नवीनतम पेपर
💬 NLP

Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection

यह शोध पत्र OGPSA का प्रस्ताव करता है, जो एक हल्का निरंतर शिक्षण (continual learning) तरीका है जो सुरक्षा पोस्ट-ट्रेनिंग में एलाइनमेंट टैक्स (alignment tax) को कम करने के लिए सुरक्षा ग्रेडिएंट्स को एक ऑर्थोगोनल सबस्पेस पर प्रोजेक्ट करता है ताकि बड़े पैमाने पर डेटा रिप्ले की आवश्यकता के बिना सामान्य मॉडल क्षमताओं को संरक्षित किया जा सके।

मूल लेखक: Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र की व्याख्या दी गई है।

समस्या: "सुरक्षा कर" (The "Safety Tax")

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, बहुमुखी शेफ (AI मॉडल) है। यह शेफ बेहतरीन फ्रेंच व्यंजन बना सकता है, कविता लिख सकता है और जटिल गणित की समस्याओं को हल कर सकता है। हालाँकि, कभी-कभी वे गलती से जहरीले या अपमानजनक व्यंजन परोस देते हैं।

इसे ठीक करने के लिए, आप एक सख्त सुरक्षा प्रशिक्षक (safety instructor) को शेफ को यह सिखाने के लिए नियुक्त करते हैं कि खराब भोजन परोसने से कैसे बचा जाए। प्रशिक्षक बहुत प्रभावी है; शेफ जहरीले व्यंजन परोसना बंद कर देता है। लेकिन एक पेंच है: "सुरक्षित" होने के बारे में सीखने की प्रक्रिया में, शेफ अपने शानदार फ्रेंच व्यंजन बनाना या कविता लिखना भूल जाता है। वह सुरक्षित तो हो जाता है, लेकिन साथ ही उबाऊ और कम उपयोगी भी हो जाता है।

AI की दुनिया में, इसे एलाइनमेंट टैक्स (Alignment Tax) कहा जाता है। AI को सुरक्षित बनाने से अक्सर उसके अन्य कार्यों में उसकी "बुद्धिमत्ता" कम हो जाती है।

कारण: मस्तिष्क में ट्रैफिक जाम

शोध पत्र सुझाव देता है कि ऐसा इसलिए होता है क्योंकि AI के मस्तिष्क (इसके गणितीय मापदंडों/parameters) के अंदर एक "ट्रैफिक जाम" होता है।

  • पुराने कौशल: AI ने पहले एक सामान्य जीनियस बनना सीखा। ये कौशल इसके मस्तिष्क के विशिष्ट "दिशाओं" या मार्गों में संग्रहीत होते हैं।
  • नए सुरक्षा नियम: जब हम AI को सुरक्षित होने के लिए सिखाते हैं, तो हम इसे नई दिशाओं में धकेलते हैं।
  • टकराव: दुर्भाग्य से, "सुरक्षा" सीखने के लिए आवश्यक दिशा अक्सर "सामान्य कौशल" बनाए रखने वाली दिशा के साथ ओवरलैप (एक दूसरे के ऊपर आती) होती है। जब AI सुरक्षा सीखने के लिए आगे बढ़ने की कोशिश करता है, तो वह अनजाने में अपने सामान्य कौशल के मार्गों से टकरा जाता है और उन्हें मिटा देता है। यह वैसा ही है जैसे सुरक्षा द्वार तक पहुँचने के लिए आगे बढ़ने की कोशिश करना, लेकिन आपका रास्ता एक ऐसी दीवार द्वारा अवरुद्ध है जो आपके गणित कौशल को थामे हुए है; उस पार जाने के लिए, आपको उस दीवार को गिराना होगा।

समाधान: OGPSA (द "साइडवेज स्टेप" या बगल का कदम)

लेखकों ने OGPSA (Orthogonal Gradient Projection for Safety Alignment) नामक एक नई विधि प्रस्तावित की है।

AI के मस्तिष्क को एक विशाल डांस फ्लोर की तरह समझें।

  • सामान्य कौशल डांस फ्लोर का एक विशिष्ट क्षेत्र (zone) है जहाँ AI अच्छी तरह से नृत्य करना जानता है।
  • सुरक्षा लक्ष्य एक नया डांस मूव है जिसे AI को सीखना है।

पुराना तरीका (Naive Tuning): AI नए सुरक्षा मूव को सीखने के लिए सीधे उसकी ओर बढ़ने की कोशिश करता है। लेकिन क्योंकि सुरक्षा मूव सीधे "सामान्य कौशल" क्षेत्र के अंदर जाता है, AI गलती से अपने ही पैरों पर पैर रख देता है और नृत्य करना भूल जाता है।

OGPSA का तरीका:

  1. क्षेत्र का मानचित्रण (Mapping the Zone): सबसे पहले, यह विधि सामान्य कौशल क्षेत्र का एक त्वरित "स्नैपशॉट" लेती है। यह पहचानती है कि डांस फ्लोर पर कौन सी दिशाएँ उन कौशलों को जीवित रखने के लिए महत्वपूर्ण हैं।
  2. बगल का कदम (The Sideways Step): जब AI को एक सुरक्षा नियम सीखने की आवश्यकता होती है, तो OGPSA उस चाल (move) की गणना करता है। यदि वह चाल "सामान्य कौशल" क्षेत्र के अंदर जाने की कोशिश करती है, तो OGPSA उस हिस्से को काट देता है।
  3. परिणाम: AI को एक बगल का कदम (sideways step) लेने के लिए मजबूर किया जाता है। वह सुरक्षा लक्ष्य की ओर बढ़ता है, लेकिन वह ऐसा एक ऐसे दिशा में करता है जो सामान्य कौशल क्षेत्र के बिल्कुल लंबवत (90-डिग्री के कोण पर) है।

उपमा: कल्पना कीजिए कि आप एक लक्ष्य की ओर बढ़ रहे हैं, लेकिन आपसे कहा जाता है, "घास पर मत पैर रखना।" घास के ऊपर से जाने के बजाय, आप उस फुटपाथ पर चलते हैं जो घास के समानांतर चलता है। आप अभी भी अपने गंतव्य (सुरक्षा) तक पहुँचते हैं, लेकिन आप कभी भी घास को कुचलते नहीं हैं (सामान्य कौशल)।

यह अच्छी तरह से क्यों काम करता है

  • हल्का (Lightweight): अन्य तरीकों के विपरीत, जिन्हें चीजों को याद रखने के लिए लगातार पुराने पाठ्यपुस्तकों (पुराने डेटा को फिर से पढ़ने) की आवश्यकता होती है, OGPSA को केवल यह याद रखने के लिए एक छोटे, आवधिक "चेक-अप" की आवश्यकता होती है कि कौन सी दिशाएँ वर्जित हैं।
  • प्लग-एंड-प्ले (Plug-and-Play): यह पूरे सिस्टम को बदले बिना विभिन्न प्रशिक्षण विधियों (जैसे SFT और DPO) के साथ काम करता है।
  • परिणाम: उनके परीक्षणों में, OGPSA का उपयोग करने से AI अपनी सामान्य बुद्धिमत्ता को खोए बिना बहुत सुरक्षित हो गया। इसने मानक प्रशिक्षण की तुलना में उच्च "उपयोगिता स्कोर" बनाए रखते हुए बेहतर "सुरक्षा स्कोर" प्राप्त किया।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र यह दावा नहीं करता कि यह हर सुरक्षा समस्या को हल कर देगा या AI को पूर्ण बना देगा। यह केवल एक चतुर ज्यामितीय ट्रिक प्रदान करता है: जब आप एक AI को सुरक्षित होने के लिए सिखा रहे हों, तो सुनिश्चित करें कि आप उसे इस तरह से न सिखाएं कि वह जो पहले से जानता है उसे भूलने के लिए मजबूर हो जाए। AI को सुरक्षा "सीधे" के बजाय "बगल से" सीखने के लिए मजबूर करके, हम AI को सुरक्षित और स्मार्ट दोनों बनाए रख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →