Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings
यह शोध पत्र प्रदर्शित करता है कि क्रमिक डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (Direct Preference Optimization) पहले से सीखे गए प्रेफरेंस को समान रूप से खराब नहीं करता है, बल्कि उद्देश्यों, सिग्नल की शक्ति और प्रशिक्षण क्रम के बीच संबंध के आधार पर स्थिरता से लेकर सकारात्मक हस्तांतरण तक के विविध परिणाम उत्पन्न करता है, जबकि यह भी प्रकट करता है कि ग्रेडिएंट विरोध इन प्रभावों का प्राथमिक चालक नहीं है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन सहायक (एक AI भाषा मॉडल) को सिखा रहे हैं कि उसे कैसा व्यवहार करना चाहिए। आप उसे केवल एक चीज़ नहीं सिखाते; आपके पास लक्ष्यों की एक सूची है: मददगार बनना, हानिरहित होना, ईमानदार होना और निर्देशों का पालन करना।
आमतौर पर, आप उन्हें एक के बाद एक सिखाएंगे। पहले, आप उन्हें मददगार बनना सिखाते हैं। फिर, आप उन्हें हानिरहित होना सिखाते हैं। मुख्य सवाल जो यह शोध पत्र पूछता है, वह यह है: जब आप दूसरा पाठ सिखाते हैं, तो क्या सहायक पहला वाला भूल जाता है?
सामान्य डर "विनाशकारी विस्मृति" (catastrophic forgetting) का है—जैसे एक छात्र जो इतिहास की परीक्षा के लिए पढ़ता है और फिर गणित की परीक्षा के लिए पढ़ता है, और फिर वह इतिहास के बारे में सब कुछ पूरी तरह से भूल जाता है।
यह शोध पत्र जांच करता है कि क्या AI के साथ ऐसा होता है, और यदि ऐसा है, तो क्यों होता है। यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है।
प्रयोग: "चार कमरे"
शोधकर्ताओं ने केवल एक परिदृश्य का परीक्षण नहीं किया। उन्होंने चार अलग-अलग "कमरे" (परिदृश्य) बनाए ताकि यह देखा जा सके कि कार्यों को बदलते समय AI कैसे प्रतिक्रिया देता है:
- टकराव वाला कमरा (वितरण संघर्ष - Distributional Conflict): "मददगार" बनाम "हानिरहित" सिखाना। ये दो अलग-अलग भाषाओं की तरह हैं; प्रॉम्प्ट और लक्ष्य बहुत अलग हैं।
- समझौता वाला कमरा (बहु-विशेषता - Multi-Attribute): "वाचालता" (बातूनी होना) बनाम "सुसंगतता" (तार्किक होना) सिखाना। ये सूक्ष्म-ट्यून किए गए गुण हैं जो आपस में लड़ सकते हैं।
- शोर वाला कमरा (मजबूत सुरक्षा संकेत - Strong Safety Signal): "हानिरहित" सिखाना जहाँ सुरक्षा संकेत अत्यंत स्पष्ट और तेज़ है, बनाम "मददगार" होना।
- सामंजस्य वाला कमरा (संगत उद्देश्य - Compatible Objectives): "निर्देशों का पालन करना" बनाम "ईमानदारी"। ये लक्ष्य स्वाभाविक रूप से एक-दूसरे के पूरक हैं और एक-दूसरे की मदद करते हैं।
बड़ी खोज: यह कोई 'ब्लैंकेट इरेज़र' नहीं है
सबसे महत्वपूर्ण खोज यह है कि AI सब कुछ समान रूप से नहीं भूलता है।
यदि आप AI के ज्ञान को एक बगीचे के रूप में देखते हैं, तो पिछले सिद्धांतों ने सुझाव दिया था कि एक नया फूल (एक नया उद्देश्य) लगाने से पुराने फूल मिट जाएंगे। इस शोध पत्र ने पाया कि यह सच नहीं है। इसके बजाय, बगीचा जटिल तरीकों से बदलता है:
- आंशिक निराकरण (Partial Weeding): कभी-कभी पुराने कौशल थोड़े कमजोर हो जाते हैं, लेकिन पूरी तरह खत्म नहीं होते।
- स्थिरता (Stability): कभी-कभी पुराने कौशल बिल्कुल वैसे ही रहते हैं।
- सकारात्मक हस्तांतरण (Positive Transfer): कभी-कभी, नया कौशल सीखने से पुराना कौशल वास्तव में बेहतर हो जाता है।
- पुनर्वितरण (Redistribution): यह पेचीदा हिस्सा है। AI केवल कुल मिलाकर "खराब" नहीं होता है। यह आसान कार्यों में खराब हो सकता है लेकिन कठिन कार्यों में बेहतर हो सकता है, या इसके विपरीत।
"आत्मविश्वासी" बनाम "अनिश्चित" छात्र की उपमा:
शोधकर्ताओं ने AI द्वारा दिए गए व्यक्तिगत प्रश्नों को देखा। उन्होंने पाया कि जब AI ने एक नया कौशल सीखा, तो उसने अपने पुराने ज्ञान के साथ एक जैसा व्यवहार नहीं किया।
- कुछ मामलों में, AI उन उत्तरों के बारे में कम आत्मविश्वासी हो गया जिन्हें वह पहले निश्चित रूप से जानता था ( "आसान" प्रश्न)।
- अन्य मामलों में, AI उन्हीं आसान प्रश्नों के बारे में अधिक आत्मविश्वासी हो गया।
- यह पूरी तरह से इस बात पर निर्भर करता है कि सिखाए जा रहे दो कौशलों के बीच क्या संबंध है।
रहस्य: ऐसा क्यों होता है?
शोधकर्ताओं को एक मजबूत संदेह था कि AI चीजें क्यों भूलता है। उन्हें लगा कि यह एक रस्सी को विपरीत दिशाओं में खींचने वाले दो लोगों की तरह है।
- सिद्धांत: दूसरा कौशल सिखाते समय, जो "गणित" (gradients) AI को नए दिशा में खींच रहा था, वह सीधे उस गणित के खिलाफ लड़ रहा था जो उसे पुरानी दिशा में खींच रहा था। यह एक रस्साकशी की तरह है जहाँ रस्सी टूट जाती है।
वास्तविकता की जाँच:
उन्होंने इस "रस्साकशी" को मापा और पाया कि वहाँ लगभग कोई लड़ाई नहीं थी।
- AI को नई दिशा में खींचने वाले बल वास्तव में पुराने दिशा के बल के लंबवत (perpendicular) (90-डिग्री के कोण पर) थे।
- रूपक (Metaphor): कल्पना कीजिए कि आप उत्तर की ओर चल रहे हैं। फिर आपको पूर्व की ओर चलने के लिए कहा जाता है। आप अपने उत्तर की ओर बढ़ने वाले कदमों के खिलाफ लड़ नहीं रहे हैं; आप बस एक मोड़ ले रहे हैं। AI को नए पाठ द्वारा "धकेला" नहीं जा रहा है; यह बस बगल की ओर खिसक रहा है।
निष्कर्ष
यह शोध पत्र निष्कर्ष निकालता है कि हम यह मान नहीं सकते कि एक नया कौशल सिखाने से पुराना कौशल बर्बाद हो जाएगा।
- यह मिश्रण पर निर्भर करता है: यदि दो कौशल संगत हैं (जैसे ईमानदारी और निर्देश), तो वे एक-दूसरे को बढ़ावा देते हैं। यदि वे बहुत अलग हैं (जैसे सुरक्षा बनाम मददगार होना), तो पुराना कौशल थोड़ा कमजोर हो सकता है, लेकिन आमतौर पर खत्म नहीं होता।
- यह संकेत पर निर्भर करता है: यदि नया पाठ बहुत स्पष्ट और तेज़ है (जैसे एक मजबूत सुरक्षा संकेत), तो यह पुराने कौशलों को कमजोर करने के बजाय उन्हें वास्तव में मजबूत कर सकता है।
- यह क्रम पर निर्भर करता है: A के बाद B सिखाना, B के बाद A सिखाने से अलग है।
निर्माताओं के लिए सीख:
यदि आप एक AI बना रहे हैं, तो केवल यह मानकर न बैठें कि एक नया फीचर जोड़ने से पुराने फीचर्स टूट जाएंगे। आपको यह देखना होगा कि लक्ष्य एक-दूसरे से कैसे संबंधित हैं। कभी-कभी, आप उन्हें सुरक्षित रूप से एक के ऊपर एक रख सकते हैं; अन्य समय में, आपको उन्हें सिखाने के क्रम के बारे में सावधान रहने की आवश्यकता होती है, क्योंकि AI की "याददाश्त" केवल अतीत को मिटाने के बजाय सूक्ष्म और असमान तरीकों से बदलती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।