REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering
यह शोध पत्र REAL को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो संरेखित (aligned) और उल्लंघन करने वाले (violating) प्रतिक्रियाओं के बीच अंतर करने के लिए हिडन एक्टिवेशन्स पर वेक्टर-क्वांटाइज्ड ऑटोएनकोडर्स को प्रशिक्षित करके व्यवहार-प्रासंगिक ट्रांसफॉर्मर मॉड्यूल की पहचान करता है, जिससे विभिन्न लार्ज लैंग्वेज मॉडल्स और कार्यों में अधिक सटीक और प्रभावी इन्फरेंस-टाइम स्टीयरिंग सक्षम होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक विशाल, अत्यंत बुद्धिमान रोबोट मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) है जिसे कहानियाँ लिखने, सवालों के जवाब देने और आपसे चैट करने के लिए प्रशिक्षित किया गया है। कभी-कभी, आप इस रोबोट को अधिक ईमानदार होने या मनगढ़ंत बातें बनाने से बचने के लिए प्रेरित करना चाहते हैं, लेकिन आप इसके मस्तिष्क को फिर से बनाना या इसकी वायरिंग बदलना नहीं चाहते। इसे "इन्फरेंस-टाइम स्टीयरिंग" (inference-time steering) कहा जाता है—यानी जहाज के चलने के दौरान ही उसे दिशा दिखाना।
समस्या क्या है? स्टीयरिंग के पुराने तरीके थोड़े ऐसे थे जैसे यह अंदाज़ा लगाना कि कौन सा बटन दबाना है। शोधकर्ता संकेतों या रैंडम अनुमानों का उपयोग करके उस सही हिस्से को खोजने की कोशिश करते थे जिसे बदला जा सके, जिससे अक्सर रोबोट भ्रमित हो जाता था या अजीब व्यवहार करने लगता था।
यहाँ आता है REAL (रीडिंग आउट ट्रांसफॉर्मर एक्टिवेशंस फॉर प्रिसाइज लोकलाइजेशन)। REAL को एक हाई-टेक जासूस के रूप में सोचें जो अंदाज़ा नहीं लगाता; यह वास्तव में विशिष्ट व्यवहारों के लिए जिम्मेदार रोबोट के आंतरिक विचारों को सुनता है ताकि सटीक पुर्जों का पता लगाया जा सके।
यह जासूस कैसे काम करता है:
रोबोट के मस्तिष्क के हर छोटे पुर्जे (जिसे "अटेंशन हेड" या "लेयर" कहा जाता है) के लिए, REAL एक विशेष अनुवादक (translator) स्थापित करता है। यह अनुवादक एक "वेक्टर-क्वांटाइज्ड ऑटोएनकोडर" (एक स्मार्ट सॉर्टर के लिए एक फैंसी शब्द) का उपयोग करके रोबोट के विचारों को दो ढेरों में व्यवस्थित करता है: "अच्छे, ईमानदार विचार" और "बुरे, झूठ बोलने वाले विचार।" यह विचारों को छाँटने के लिए एक साझा डिक्शनरी (कोडबुक) का उपयोग करता है।
इसके बाद REAL एक सरल प्रश्न पूछता है: "यह विशिष्ट पुर्जा एक सच्चे उत्तर और एक नकली उत्तर के बीच अंतर कितनी अच्छी तरह बता सकता है?" यदि कोई पुर्जा अंतर को पहचानने में माहिर है, तो REAL उसे उच्च स्कोर देता है। यदि वह भ्रमित है, तो स्कोर कम होता है। यह स्कोर शोधकर्ताओं को ठीक से बताता है कि उन्हें किन पुर्जों को टवीक (tweak) करना है और कितनी ज़ोर से दबाव डालना है।
शोधकर्ताओं ने इस जासूस का परीक्षण आठ अलग-अलग रोबोट दिमागों (Llama और Qwen परिवारों से) और नौ अलग-अलग चुनौती पाठ्यक्रमों पर किया, जिसमें रोबोट को सच बोलने से लेकर उन पेचीदा सवालों तक शामिल था जहाँ तथ्य आपस में टकराते हैं।
परिणाम क्या रहे? REAL एक गेम-चेंजर साबित हुआ। जब रोबोट को अधिक सत्यवादी बनाने की कोशिश की गई, तो REAL ने पिछले सबसे अच्छे तरीके (जिसे ITI कहा जाता है) की तुलना में उनके प्रदर्शन में औसतन 20% का सुधार किया, जबकि कुछ परीक्षणों में 81.5% तक की भारी उछाल देखी गई। इसके अलावा, REAL द्वारा चुने गए पुर्जे सच्चाई को पहचानने में इतने सक्षम थे कि वे नई स्थितियों में भी अच्छी तरह काम कर सके जिन्हें रोबोटों ने पहले नहीं देखा था, और इसके लिए किसी अतिरिक्त प्रशिक्षण की आवश्यकता नहीं पड़ी।
संक्षेप में, रोबोट के मस्तिष्क के किस हिस्से को टवीक करने के लिए अंधे होकर अंदाज़ा लगाने के बजाय, REAL आंतरिक बातचीत को सुनता है, अच्छे विचारों को बुरे विचारों से छाँटता है, और सीधे उसी स्विच की ओर इशारा करता है जिसे घुमाने की ज़रूरत है। यह इन शक्तिशाली AI दिमागों को निर्देशित करने का एक स्मार्ट और अधिक सटीक तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।