Crafting Reversible SFT Behaviors in Large Language Models
यह शोध पत्र लॉस-कंस्ट्रेंड ड्यूल डिसेंट (LCDD) और SFT-इरेज़र को पेश करता है जो सुपरवाइज्ड फाइन-ट्यूनिंग व्यवहारों को विरल, कारण संबंधी रूप से आवश्यक उप-नेटवर्कों ("कैरियर्स") में संकुचित करने के लिए है जिन्हें मॉडल वेट्स को संशोधित किए बिना एक सॉफ्ट प्रॉम्प्ट के माध्यम से इन्फरेंस के समय चुनिंदा रूप से दबाया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) है जिसे एक नया करतब सिखाया गया है, जैसे हमेशा सवालों के जवाब में "मुझे नहीं पता" कहना, या खतरनाक सवालों के जवाब देने से मना करना, या शेक्सपियर की तरह बोलना। इस प्रक्रिया को सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) कहा जाता है।
समस्या जो लेखकों ने पाई है वह यह है कि जब आप रोबोट को यह नया करतब सिखाते हैं, तो उस करतब का "ज्ञान" रोबोट के दिमाग में हर जगह बिखर जाता है। यह वैसा ही है जैसे किसी को साइकिल चलाना सिखाना लेकिन उसके द्वारा शरीर की हर मांसपेशी का उपयोग करना, बजाय केवल उसकी टांगों और संतुलन का। क्योंकि यह कौशल हर जगह फैला हुआ है, इसलिए बाद में इसे बंद करना मुश्किल है बिना रोबोट की सामान्य रूप से बोलने की क्षमता को खराब किए।
यह पेपर परिचय देता है कि कैसे एक नए करतब को रोबोट के दिमाग के अंदर एक बहुत ही विशिष्ट, संक्षिप्त तरीके से सिखाया जाए ताकि वह करतब दिमाग के एक छोटे से, अलग "कमरे" में रहे। फिर वे दिखाते हैं कि वे एक गुप्त कोड के साथ उस विशिष्ट कमरे को कैसे बंद कर सकते हैं, जिससे रोबोट तुरंत अपना नया करतब भूल जाए, जबकि उसका बाकी दिमाग पूरी तरह से सुरक्षित रहे।
उन्होंने इसे कैसे किया, यहाँ सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "मैसी एटिक" (बिखरा हुआ अटारी)
आमतौर पर, जब आप एक मॉडल को फाइन-ट्यून करते हैं, तो नया व्यवहार एक बिखरी हुई अटारी की तरह फैल जाता है। यदि आप बाद में उस व्यवहार को हटाना चाहते हैं, तो आपको पूरी अटारी को खंगालना होगा, और आप अनजाने में रोबोट की गणित करने या ईमेल लिखने की क्षमता को भी हटा सकते हैं। आप उस नए व्यवहार के लिए सटीक "स्विच" को आसानी से नहीं ढूंढ सकते क्योंकि यह बाकी सब चीजों के साथ उलझा हुआ है।
2. समाधान भाग 1: LCDD (द "पैकिंग एक्सपर्ट")
लेखकों ने एक विधि बनाई जिसे लॉस-कंस्ट्रेंड डुअल डिसेंट (LCDD) कहा जाता है। इसे एक सुपर-व्यवस्थित पैकिंग विशेषज्ञ के रूप में सोचें।
- लक्ष्य: वे चाहते हैं कि आप उस "नए व्यवहार" को लें और उसे रोबोट के दिमाग के भीतर एक छोटे, विरल (sparse) "बैकपैक" (जिसे वे कैरियर कहते हैं) में फिट करने के लिए मजबूर करें।
- प्रतिबंध (Constraint): वे पैकिंग विशेषज्ञ को बताते हैं: "आपको पूरे नए व्यवहार को इस छोटे बैकपैक में फिट करना होगा, लेकिन आप यह नहीं कर सकते कि रोबोट अपने अन्य कार्यों (जैसे सवालों के सही जवाब देना) को करना भूल जाए।"
- परिणाम: विशेषज्ञ सफलतापूर्वक नए व्यवहार को एक छोटे, अलग सब-नेटवर्क में संकुचित (compress) कर देता है। रोबोट का बाकी दिमाग बिल्कुल वैसा ही रहता है जैसा प्रशिक्षण से पहले था। नया व्यवहार अब इस छोटे बैकपैक पर 100% निर्भर है। यदि बैकपैक मौजूद है, तो व्यवहार होता है। यदि बैकपैक को ब्लॉक कर दिया जाता है, तो व्यवहार गायब हो जाता है।
3. समाधान भाग 2: SFT-Eraser (द "सीक्रेट कोड")
एक बार जब व्यवहार उस छोटे बैकपैक के भीतर लॉक हो जाता है, तो लेखकों ने एक दूसरा टूल बनाया जिसे SFT-Eraser कहा जाता है।
- यह कैसे काम करता है: वे रोबोट के दिमाग के वजन (weights) को नहीं बदलते (जो कि रोबोट की मैनुअल को फिर से लिखने जैसा नहीं है)। इसके बजाय, वे एक विशेष सॉफ्ट प्रॉम्प्ट (इनपुट में जोड़े गए अदृश्य, गणितीय "शब्दों" का एक क्रम) बनाते हैं।
- जादू: जब इस गुप्त कोड को किसी सवाल में जोड़ा जाता है, तो यह उस "बैकपैक" को विशेष रूप से जाम करने वाली एक चाबी की तरह काम करता है जहाँ नया व्यवहार रहता है।
- परिणाम: रोबोट तुरंत अपने मूल व्यक्तित्व में वापस आ जाता है। यदि इसे शेक्सपियर की तरह बोलने के लिए प्रशिक्षित किया गया था, तो यह अचानक आधुनिक अंग्रेजी बोलने लगता है। यदि इसे खतरनाक सवालों को मना करने के लिए प्रशिक्षित किया गया था, तो यह फिर से उनके जवाब देने लगता है। रोबोट को "अनट्रेन" नहीं किया गया है; उसके दिमाग के उस विशिष्ट हिस्से को अस्थायी रूप से निष्प्रभावी कर दिया गया था जो उस व्यवहार को थामे हुए था।
4. प्रमाण: क्यों संरचना मायने रखती है
लेखकों ने यह साबित करने के लिए एक महत्वपूर्ण परीक्षण चलाया कि संरचना (छोटा बैकपैक) ही असली नायक था, न कि केवल गुप्त कोड।
- प्रयोग: उन्होंने उसी "गुप्त कोड" का उपयोग एक ऐसे रोबोट पर करने की कोशिश की जिसमें वह छोटा बैकपैक नहीं था (एक मानक रोबोट जहाँ व्यवहार हर जगह बिखरा हुआ है)।
- परिणाम: कोड विफल रहा। यह व्यवहार को बंद नहीं कर सका क्योंकि जाम करने के लिए कोई एकल, अलग लक्ष्य मौजूद नहीं था।
- सबक: यह साबित करता है कि आप एक बिखरे हुए दिमाग से व्यवहार को बस "हैक" करके नहीं निकाल सकते। आपको पहले उस व्यवहार के रहने के लिए एक साफ, अलग संरचना बनानी होगी। एक बार जब वह अलग हो जाता है, तो आप उसे पूरी तरह से नियंत्रित कर सकते हैं।
सारांश कि उन्होंने क्या पाया
- क्या हम व्यवहार को प्रतिवर्ती (reversible) बना सकते हैं? हाँ।
- कैसे? प्रशिक्षण के दौरान व्यवहार को एक छोटे, विरल "कैरियर" में मजबूर करके (LCDD का उपयोग करके) और फिर एक विशेष इनपुट कोड (SFT-Eraser) का उपयोग करके उस कैरियर को ब्लॉक करके।
- क्या यह काम करता है? उन्होंने तीन बहुत अलग व्यवहारों पर इसका परीक्षण किया:
- फिक्स्ड रिस्पॉन्स: रोबोट को हमेशा "मुझे नहीं पता" कहने के लिए बनाना।
- सेफ्टी (सुरक्षा): रोबोट को हानिकारक सवालों के जवाब देने से मना करने के लिए बनाना।
- स्टाइल (शैली): रोबोट को शेक्सपियर की तरह बोलने के लिए बनाना।
- निर्णय: सभी मामलों में, वे सफलतापूर्वक व्यवहार को मस्तिष्क के एक छोटे हिस्से में संकुचित करने में सफल रहे और बिना रोबोट के अंतर्निहित कोड को बदले, इसे अपनी इच्छानुसार चालू और बंद कर सके।
महत्वपूर्ण नोट: "गुप्त कोड" जिसे वे उपयोग करते हैं वह एक निरंतर गणितीय अनुक्रम (एक "सॉफ्ट प्रॉम्प्ट") है, न कि एक साधारण शब्द जिसे आप चैट बॉक्स में टाइप कर सकते हैं। पेपर इस बात को सिद्ध करने के लिए इसका उपयोग करता है कि व्यवहारों को कारणवश (causally) अलग और नियंत्रित किया जा सकता है, न कि इसे रोजमर्रा के चैटबॉट्स के लिए एक तैयार उत्पाद के रूप में।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।