← नवीनतम पेपर
🤖 machine learning

Crafting Reversible SFT Behaviors in Large Language Models

यह शोध पत्र लॉस-कंस्ट्रेंड ड्यूल डिसेंट (LCDD) और SFT-इरेज़र को पेश करता है जो सुपरवाइज्ड फाइन-ट्यूनिंग व्यवहारों को विरल, कारण संबंधी रूप से आवश्यक उप-नेटवर्कों ("कैरियर्स") में संकुचित करने के लिए है जिन्हें मॉडल वेट्स को संशोधित किए बिना एक सॉफ्ट प्रॉम्प्ट के माध्यम से इन्फरेंस के समय चुनिंदा रूप से दबाया जा सकता है।

मूल लेखक: Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) है जिसे एक नया करतब सिखाया गया है, जैसे हमेशा सवालों के जवाब में "मुझे नहीं पता" कहना, या खतरनाक सवालों के जवाब देने से मना करना, या शेक्सपियर की तरह बोलना। इस प्रक्रिया को सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) कहा जाता है।

समस्या जो लेखकों ने पाई है वह यह है कि जब आप रोबोट को यह नया करतब सिखाते हैं, तो उस करतब का "ज्ञान" रोबोट के दिमाग में हर जगह बिखर जाता है। यह वैसा ही है जैसे किसी को साइकिल चलाना सिखाना लेकिन उसके द्वारा शरीर की हर मांसपेशी का उपयोग करना, बजाय केवल उसकी टांगों और संतुलन का। क्योंकि यह कौशल हर जगह फैला हुआ है, इसलिए बाद में इसे बंद करना मुश्किल है बिना रोबोट की सामान्य रूप से बोलने की क्षमता को खराब किए।

यह पेपर परिचय देता है कि कैसे एक नए करतब को रोबोट के दिमाग के अंदर एक बहुत ही विशिष्ट, संक्षिप्त तरीके से सिखाया जाए ताकि वह करतब दिमाग के एक छोटे से, अलग "कमरे" में रहे। फिर वे दिखाते हैं कि वे एक गुप्त कोड के साथ उस विशिष्ट कमरे को कैसे बंद कर सकते हैं, जिससे रोबोट तुरंत अपना नया करतब भूल जाए, जबकि उसका बाकी दिमाग पूरी तरह से सुरक्षित रहे।

उन्होंने इसे कैसे किया, यहाँ सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "मैसी एटिक" (बिखरा हुआ अटारी)

आमतौर पर, जब आप एक मॉडल को फाइन-ट्यून करते हैं, तो नया व्यवहार एक बिखरी हुई अटारी की तरह फैल जाता है। यदि आप बाद में उस व्यवहार को हटाना चाहते हैं, तो आपको पूरी अटारी को खंगालना होगा, और आप अनजाने में रोबोट की गणित करने या ईमेल लिखने की क्षमता को भी हटा सकते हैं। आप उस नए व्यवहार के लिए सटीक "स्विच" को आसानी से नहीं ढूंढ सकते क्योंकि यह बाकी सब चीजों के साथ उलझा हुआ है।

2. समाधान भाग 1: LCDD (द "पैकिंग एक्सपर्ट")

लेखकों ने एक विधि बनाई जिसे लॉस-कंस्ट्रेंड डुअल डिसेंट (LCDD) कहा जाता है। इसे एक सुपर-व्यवस्थित पैकिंग विशेषज्ञ के रूप में सोचें।

  • लक्ष्य: वे चाहते हैं कि आप उस "नए व्यवहार" को लें और उसे रोबोट के दिमाग के भीतर एक छोटे, विरल (sparse) "बैकपैक" (जिसे वे कैरियर कहते हैं) में फिट करने के लिए मजबूर करें।
  • प्रतिबंध (Constraint): वे पैकिंग विशेषज्ञ को बताते हैं: "आपको पूरे नए व्यवहार को इस छोटे बैकपैक में फिट करना होगा, लेकिन आप यह नहीं कर सकते कि रोबोट अपने अन्य कार्यों (जैसे सवालों के सही जवाब देना) को करना भूल जाए।"
  • परिणाम: विशेषज्ञ सफलतापूर्वक नए व्यवहार को एक छोटे, अलग सब-नेटवर्क में संकुचित (compress) कर देता है। रोबोट का बाकी दिमाग बिल्कुल वैसा ही रहता है जैसा प्रशिक्षण से पहले था। नया व्यवहार अब इस छोटे बैकपैक पर 100% निर्भर है। यदि बैकपैक मौजूद है, तो व्यवहार होता है। यदि बैकपैक को ब्लॉक कर दिया जाता है, तो व्यवहार गायब हो जाता है।

3. समाधान भाग 2: SFT-Eraser (द "सीक्रेट कोड")

एक बार जब व्यवहार उस छोटे बैकपैक के भीतर लॉक हो जाता है, तो लेखकों ने एक दूसरा टूल बनाया जिसे SFT-Eraser कहा जाता है।

  • यह कैसे काम करता है: वे रोबोट के दिमाग के वजन (weights) को नहीं बदलते (जो कि रोबोट की मैनुअल को फिर से लिखने जैसा नहीं है)। इसके बजाय, वे एक विशेष सॉफ्ट प्रॉम्प्ट (इनपुट में जोड़े गए अदृश्य, गणितीय "शब्दों" का एक क्रम) बनाते हैं।
  • जादू: जब इस गुप्त कोड को किसी सवाल में जोड़ा जाता है, तो यह उस "बैकपैक" को विशेष रूप से जाम करने वाली एक चाबी की तरह काम करता है जहाँ नया व्यवहार रहता है।
  • परिणाम: रोबोट तुरंत अपने मूल व्यक्तित्व में वापस आ जाता है। यदि इसे शेक्सपियर की तरह बोलने के लिए प्रशिक्षित किया गया था, तो यह अचानक आधुनिक अंग्रेजी बोलने लगता है। यदि इसे खतरनाक सवालों को मना करने के लिए प्रशिक्षित किया गया था, तो यह फिर से उनके जवाब देने लगता है। रोबोट को "अनट्रेन" नहीं किया गया है; उसके दिमाग के उस विशिष्ट हिस्से को अस्थायी रूप से निष्प्रभावी कर दिया गया था जो उस व्यवहार को थामे हुए था।

4. प्रमाण: क्यों संरचना मायने रखती है

लेखकों ने यह साबित करने के लिए एक महत्वपूर्ण परीक्षण चलाया कि संरचना (छोटा बैकपैक) ही असली नायक था, न कि केवल गुप्त कोड।

  • प्रयोग: उन्होंने उसी "गुप्त कोड" का उपयोग एक ऐसे रोबोट पर करने की कोशिश की जिसमें वह छोटा बैकपैक नहीं था (एक मानक रोबोट जहाँ व्यवहार हर जगह बिखरा हुआ है)।
  • परिणाम: कोड विफल रहा। यह व्यवहार को बंद नहीं कर सका क्योंकि जाम करने के लिए कोई एकल, अलग लक्ष्य मौजूद नहीं था।
  • सबक: यह साबित करता है कि आप एक बिखरे हुए दिमाग से व्यवहार को बस "हैक" करके नहीं निकाल सकते। आपको पहले उस व्यवहार के रहने के लिए एक साफ, अलग संरचना बनानी होगी। एक बार जब वह अलग हो जाता है, तो आप उसे पूरी तरह से नियंत्रित कर सकते हैं।

सारांश कि उन्होंने क्या पाया

  • क्या हम व्यवहार को प्रतिवर्ती (reversible) बना सकते हैं? हाँ।
  • कैसे? प्रशिक्षण के दौरान व्यवहार को एक छोटे, विरल "कैरियर" में मजबूर करके (LCDD का उपयोग करके) और फिर एक विशेष इनपुट कोड (SFT-Eraser) का उपयोग करके उस कैरियर को ब्लॉक करके।
  • क्या यह काम करता है? उन्होंने तीन बहुत अलग व्यवहारों पर इसका परीक्षण किया:
    1. फिक्स्ड रिस्पॉन्स: रोबोट को हमेशा "मुझे नहीं पता" कहने के लिए बनाना।
    2. सेफ्टी (सुरक्षा): रोबोट को हानिकारक सवालों के जवाब देने से मना करने के लिए बनाना।
    3. स्टाइल (शैली): रोबोट को शेक्सपियर की तरह बोलने के लिए बनाना।
  • निर्णय: सभी मामलों में, वे सफलतापूर्वक व्यवहार को मस्तिष्क के एक छोटे हिस्से में संकुचित करने में सफल रहे और बिना रोबोट के अंतर्निहित कोड को बदले, इसे अपनी इच्छानुसार चालू और बंद कर सके।

महत्वपूर्ण नोट: "गुप्त कोड" जिसे वे उपयोग करते हैं वह एक निरंतर गणितीय अनुक्रम (एक "सॉफ्ट प्रॉम्प्ट") है, न कि एक साधारण शब्द जिसे आप चैट बॉक्स में टाइप कर सकते हैं। पेपर इस बात को सिद्ध करने के लिए इसका उपयोग करता है कि व्यवहारों को कारणवश (causally) अलग और नियंत्रित किया जा सकता है, न कि इसे रोजमर्रा के चैटबॉट्स के लिए एक तैयार उत्पाद के रूप में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →