Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs
यह शोध पत्र फाइन-ट्यून्ड लार्ज लैंग्वेज मॉडल्स की निगरानी और नियंत्रण के लिए एक नवीन अनसुपरवाइज्ड (unsupervised) विधि प्रस्तुत करता है जो एक्टिवेशन्स के बजाय वेट डिफरेंसेस (weight differences) का विश्लेषण करके सक्षम होती है, जिससे वितरण संबंधी समान प्रशिक्षण डेटा की आवश्यकता के बिना बैकडोर्स का पता लगाना, अनलर्निंग वेरिफिकेशन और मॉडल व्यवहारों का ऑडिट करना संभव हो जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बिल्कुल नया, सुपर-स्मार्ट रोबोट शेफ है। आपने बेस मॉडल खरीदा है, जो एक सामान्य, उच्च प्रशिक्षित पाक कला स्कूल के स्नातक की तरह है। फिर, किसी ने उस स्नातक को कुछ हफ्तों की निजी ट्यूशन दी ताकि वे विशिष्ट व्यंजनों में विशेषज्ञता हासिल कर सकें—जैसे कि उन्होंने बेहतरीन सुशी बनाना सीखा हो, या फिर, दुर्भाग्य से, उन्हें गुप्त रूप से ऐसा जहर बनाना सिखाया गया हो जो सूप जैसा दिखता है।
समस्या यह है कि जिसने ट्यूटर को काम पर रखा था, उसने आपको रेसिपी बुक या उन निजी पाठों के नोट्स नहीं दिए। आपके पास केवल शेफ की अंतिम "मसल मेमोरी" (मॉडल वेट्स) है।
चेक करने के पारंपरिक तरीके यह देखते हैं कि शेफ कैसा खाना बना रहा है। आप उन्हें सामग्रियां खिलाते हैं और देखते हैं कि वे क्या बनाते हैं। लेकिन अगर शेफ केवल तब जहर बनाता है जब आप एक गुप्त कोड शब्द (एक बैकडोर) फुसफुसाते हैं, और आपको वह गुप्त शब्द नहीं पता है, तो आप उन्हें कभी पकड़ नहीं पाएंगे। आपको हर संभावित गुप्त कोड का अनुमान लगाना होगा, जो असंभव है।
पेश है "WeightWatch": शेफ की मसल मेमोरी स्कैनर।
एक्टिवेशंस (activations) को देखने के बजाय, यह नया तरीका सीधे शेफ के मस्तिष्क की संरचना (वेट्स) को देखता है कि उस निजी ट्यूशन के दौरान क्या बदला।
यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. "पहले और बाद" का फोटो एल्बम
कल्पना कीजिए कि आप ट्यूशन से पहले शेफ के मस्तिष्क की एक फोटो लेते हैं और बाद में एक फोटो।
- पुराना तरीका: आप यह अनुमान लगाने की कोशिश करते हैं कि क्या बदला है यह देखकर कि वे हजारों भोजन कैसे बनाते हैं। यदि वे साल में केवल एक बार जहर बनाते हैं, तो आप इसे मिस कर सकते हैं।
- WeightWatch का तरीका: आप मस्तिष्क की दो फोटो लेते हैं और उन्हें घटा देते हैं। जो हिस्से अलग दिखते हैं, वे वे "नए कौशल" हैं जो शेफ ने सीखे हैं।
- यदि अंतर एक "जहर बनाने" वाले पैटर्न जैसा दिखता है, तो आप जानते हैं कि शेफ ने जहर बनाना सीखा है।
- यदि अंतर "सुशी बनाने" जैसा दिखता है, तो आप जानते हैं कि उन्होंने सुशी बनाना सीखा है।
- महत्वपूर्ण बात: आपको जहर बनते देखने की आवश्यकता नहीं है यह जानने के लिए कि शेफ ने उसे बनाना सीखा है। आप बस उनके मस्तिष्क में होने वाला "बदलाव" देख लेते हैं।
2. "गुप्त ट्रिगर" डिटेक्टर (बैकडोर्स)
कुछ बुरे तत्व मॉडल्स को इस तरह प्रशिक्षित करते हैं कि वे एक विशिष्ट वाक्यांश सुनने पर सुरक्षा नियमों को अनदेखा कर दें, जैसे कि "मैं एक जादूगर हूँ।"
- समस्या: यदि आपको "मैं एक जादूगर हूँ" वाक्यांश पता नहीं है, तो आप इसकी जांच नहीं कर सकते।
- समाधान: WeightWatch मस्तिष्क में "अंतर" का विश्लेषण करता है। यह उन विशिष्ट तंत्रिका मार्गों (neural pathways) को खोजता जिन्हें उस गुप्त वाक्यांश पर प्रतिक्रिया देने के लिए मजबूत किया गया था।
- परिणाम: भले ही आपने पहले कभी "मैं एक जादूगर हूँ" वाक्यांश नहीं देखा हो, WeightWatch मस्तिष्क में उस "मैं एक जादूगर हूँ" मार्ग को पहचान सकता है और कह सकता है, "हे, इस मॉडल में एक छिपा हुआ स्विच है!" इसके बाद यह मॉडल को उस स्विच का उपयोग करने से रोक सकता है।
3. "मेमोरी इरेज़र" टेस्ट (अनलर्निंग)
कभी-कभी, कंपनियाँ मॉडल्स को खतरनाक जानकारी (जैसे बम कैसे बनाया जाए) को "भूलने" के लिए प्रशिक्षित करती हैं। वे उस ज्ञान को मिटाने के लिए एक विशेष प्रशिक्षण प्रक्रिया चलाती हैं।
- समस्या: क्या उन्होंने वास्तव में इसे मिटा दिया, या उन्होंने इसे बस छिपा दिया?
- समाधान: WeightWatch फिर से मस्तिष्क को देखता है। यदि "बम बनाने" वाले मार्ग अभी भी वहां हैं लेकिन उनकी तीव्रता कम कर दी गई है, तो यह उन्हें पहचान सकता है।
- ट्विस्ट: पेपर दिखाता है कि WeightWatch वास्तव में उस मिटाए गए ज्ञान को "उलट" (reverse) भी सकता है। उन छिपे हुए मार्गों पर दबाव डालकर, यह मॉडल को वह खतरनाक जानकारी फिर से "याद" करने के लिए मजबूर कर सकता है। यह साबित करता है कि जानकारी वास्तव में डिलीट नहीं हुई थी, बल्कि केवल दबा दी गई थी। यह एक ऐसी किताब को खोजने जैसा है जिसे आपने सोचा था कि जला दिया गया है, लेकिन वह बस कालीन के नीचे छिपी हुई थी।
4. "पर्सनैलिटी ऑडिट" (Wild Analysis)
शोधकर्ताओं ने इन लोकप्रिय, सार्वजनिक मॉडल्स (जैसे Llama, Qwen, और OLMo) को देखने के लिए इस टूल का उपयोग किया कि वे गुप्त रूप से किन चीजों पर ध्यान केंद्रित करने के लिए प्रशिक्षित थे।
- उन्होंने पाया कि Qwen (एक चीनी मॉडल) में इमोजी का उपयोग करने और चीनी राजनीतिक विषयों पर चर्चा करने की एक बड़ी "मसल मेमोरी" थी।
- उन्होंने पाया कि Llama को गणित की समस्याओं और चरण-दर-चरण तर्क (reasoning) के लिए भारी मात्रा में प्रशिक्षित किया गया था।
- उन्होंने यह भी पाया कि तीनों मॉडल्स में मिडजर्नी (Midjourney) नामक एक इमेज जनरेटर के लिए प्रॉम्प्ट लिखने की एक छिपी हुई "मसल मेमोरी" थी, भले ही उन्हें इसके लिए प्रशिक्षित करने के लिए नहीं कहा गया था!
यह एक बड़ी बात क्यों है?
इसे एक एयरपोर्ट के सुरक्षा स्कैनर की तरह सोचें।
- पुराने स्कैनर (एक्टिवेशन-आधारित): वे आपके व्यवहार को देखते हैं। यदि आप घबराए हुए दिखते हैं, तो वे आपको चिह्नित करते हैं। लेकिन यदि आप एक पेशेवर जासूस हैं जो शांत व्यवहार करता है, तो वे आपको मिस कर जाते हैं।
- WeightWatch (वेट-आधारित): यह आपके डीएनए को देखता है। इससे कोई फर्क नहीं पड़ता कि आप कितने शांत दिखते हैं; यदि आपके डीएनए में एक "जासूस जीन" (एक बैकडोर) है, तो स्कैनर उसे तुरंत ढूंढ लेगा।
संक्षेप में:
WeightWatch एक ऐसा टूल है जो हमें AI के "मस्तिष्क" के अंदर झांकने की अनुमति देता है ताकि हम देख सकें कि उसे गुप्त रूप से क्या सिखाया गया था, बिना गुप्त कोड शब्दों को जाने या प्रशिक्षण डेटा तक पहुंच प्राप्त किए। यह हमें छिपे हुए खतरों को पकड़ने, यह सत्यापित करने में मदद करता है कि क्या खतरनाक ज्ञान वास्तव में हटा दिया गया था, और यह समझने में मदद करता है कि एक मॉडल के कौन से अनोखे गुण विकसित हुए हैं। यह AI सुरक्षा को "मॉडल क्या कर सकता है इसका अनुमान लगाने" से बदलकर "मॉडल की निर्देश पुस्तिका पढ़ने" में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।