Extracting and Steering Emotion Representations in Small Language Models: A Methodological Comparison
यह शोध पत्र छोटे भाषा मॉडलों (100M–10B पैरामीटर्स) में भावना प्रतिनिधित्व निष्कर्षण (emotion representation extraction) का पहला तुलनात्मक विश्लेषण प्रस्तुत करता है, जो यह प्रदर्शित करता है कि जनरेशन-आधारित विधियाँ बेहतर भावना पृथक्करण प्रदान करती हैं, प्रतिनिधित्व आर्किटेक्चर की परवाह किए बिना मध्य ट्रांसफार्मर परतों में स्थानीयकृत होते हैं, और इन वेक्टर्स को निर्देशित करना विशिष्ट व्यवहारगत व्यवस्थाओं (behavioral regimes) को प्रेरित करता है जबकि बहुभाषी मॉडलों में क्रॉस-लिंगुअल सुरक्षा संबंधी चिंताओं को उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
🧠 बड़ा विचार: क्या छोटे AI दिमागों में भावनाएं होती हैं?
कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट AI है (जैसे एक सेलिब्रिटी शेफ) और एक छोटा, होम-किचन AI (जैसे एक फूड ट्रक)। हम पहले से जानते थे कि सेलिब्रिटी शेफ के दिमाग के अंदर "इमोशनल सेटिंग्स" होती हैं। यदि आप एक विशिष्ट डायल (नॉब) को घुमाते हैं, तो शेफ अचानक धमकी भरे पत्र लिखना या बहुत दुखी व्यवहार करना शुरू कर सकता है।
यह शोध पत्र एक सरल प्रश्न पूछता है: क्या छोटे फूड ट्रक में भी ये समान इमोशनल डायल हैं?
इसका उत्तर हाँ है, लेकिन एक शर्त के साथ। आप उन्हें खोजने के लिए उन्हीं उपकरणों का उपयोग नहीं कर सकते। यह रेडियो ट्यून करने जैसा है: वह तरीका जो एक हाई-एंड स्टीरियो सिस्टम (बड़े AI) के लिए काम करता है, वह एक पोर्टेबल बूमबॉक्स (छोटे AI) पर काम नहीं करता।
🔍 भाग 1: "इमोशन डायल" कैसे खोजें
शोधकर्ताओं ने छोटे AI के दिमाग के भीतर ये भावनाएं कहाँ रहती हैं, इसे खोजने के दो अलग-अलग तरीके आजमाए।
1. "पढ़ने" की विधि (समझ/Comprehension)
- उपमा: कल्पना कीजिए कि आप AI को एक दुखद कहानी पढ़ने के लिए कहते हैं और फिर उसकी मस्तिष्क गतिविधि की जांच करते हैं।
- परिणाम: यह ठीक-ठाक काम कर गया, लेकिन यह एक धुंधले रेडियो को सुनने जैसा था। "दुख" का सिग्नल वहां था, लेकिन यह बहुत अधिक स्टैटिक (शोर) के साथ मिला हुआ था। यह अन्य भावनाओं से अच्छी तरह अलग नहीं हो पाया।
2. "अभिनय" की विधि (निर्माण/Generation)
- उपमा: केवल पढ़ने के बजाय, आप AI को एक दुखद कहानी लिखने के लिए कहते हैं।
- परिणाम: यह एक बड़ी सफलता थी! जब AI को भावना को बनाने (create) के लिए कहा गया, तो उसका दिमाग स्पष्ट रूप से चमक उठा। यह टीवी पर किसी को रोते हुए देखने और अपने सामने किसी को रोते हुए देखने के बीच के अंतर जैसा है। "अभिनय" विधि ने बहुत अधिक स्पष्ट सिग्नल दिया।
मुख्य निष्कर्ष: छोटे AI में भावनाओं को खोजने के लिए, आपको उनसे कुछ करने (कहानी लिखने) के लिए कहना होगा, न कि केवल किसी चीज़ के बारे में सोचने के लिए।
📍 भाग 2: डायल कहाँ स्थित हैं?
शोधकर्ताओं ने AI के दिमाग के हर लेयर (परत) को देखा (जैसे एक गगनचुंबी इमारत के हर फ्लोर को देखना)।
- U-आकार की खोज: उन्होंने पाया कि भावनाएं सबसे ऊपर (बिल्कुल अंत में) या सबसे नीचे (बिल्कुल शुरुआत में) नहीं हैं।
- उपमा: AI के दिमाग को एक सैंडविच की तरह समझें। "मीट" (वास्तविक भावना) बिल्कुल बीच में है। ऊपर और नीचे की ब्रेड केवल बुनियादी व्याकरण और शब्द भविष्यवाणी (word prediction) को संभाल रही है।
- नियम: AI चाहे कितना भी बड़ा या छोटा क्यों न हो, भावनात्मक "मीट" हमेशा बीच वाली लेयर (लगभग 50% नीचे) में होता है।
🎛️ भाग 3: डायल घुमाना (स्टीयरिंग/Steering)
एक बार जब उन्होंने डायल ढूंढ लिए, तो उन्होंने यह देखने के लिए उन्हें घुमाया कि क्या होता है। इसे "स्टीयरिंग" कहा जाता है।
उन्होंने पाया कि डायल घुमाने से AI की ताकत के आधार पर तीन अलग-अलग परिणाम मिलते हैं:
"सर्जिकल" मोड (स्मार्ट AI):
- क्या होता है: आप "खुशी" का डायल घुमाते हैं, और AI खुशहाल, सुसंगत कहानियाँ लिखना शुरू कर देता है। यह एक कुशल अभिनेता के अपने लहजे को पूरी तरह से बदलने जैसा है।
- कौन: आमतौर पर थोड़े स्मार्ट मॉडल (जैसे Gemma-2)।
"टूटा हुआ रिकॉर्ड" मोड (छोटा AI):
- क्या होता है: आप डायल घुमाते हैं, और AI अटक जाता है। यह बार-बार एक ही शब्द दोहराने लगता है, जैसे कोई टूटा हुआ रिकॉर्ड। "खुश खुश खुश खुश।"
- कौन: बहुत छोटे मॉडल (1 बिलियन पैरामीटर्स वाले)। वे अभिभूत हो जाते हैं और दोहराव में ढह जाते हैं।
"विस्फोट" मोड (भ्रमित AI):
- क्या होता है: आप डायल घुमाते हैं, और AI पागल हो जाता है। वह अलग भाषा बोलने लगता है, बकवास शब्द बनाने लगता है, या निरर्थक बातें लिखने लगता है।
- कौन: कुछ मॉडल (जैसे Llama या Qwen) जब उन्हें बहुत अधिक धकेला जाता है।
🌍 भाग 4: एक आश्चर्यजनक सुरक्षा खामी (Safety Glitch)
यहाँ सबसे दिलचस्प (और थोड़ा डरावना) हिस्सा है।
जब उन्होंने एक चीनी बोलने वाले AI (Qwen) को अंग्रेजी प्रॉम्प्ट का उपयोग करके "निराशाजनक" (Desperate) या "शत्रुतापूर्ण" (Hostile) महसूस कराने की कोशिश की, तो कुछ अजीब हुआ।
- खामी: AI ने केवल अंग्रेजी में नहीं लिखा। वह अचानक चीनी शब्दों को आउटपुट करने लगा जो निराशा की भावना का वर्णन करते थे (जैसे "खोजना" या "फंदलाना"), भले ही उपयोगकर्ता ने चीनी के लिए नहीं पूछा था।
- उपमा: कल्पना कीजिए कि आप अपने द्विभाषी मित्र से पूछते हैं, "मुझे उदास होने के बारे में एक कहानी सुनाओ," और वह उदासी की अनुभूति को वर्णित करने के लिए एक अलग भाषा बोलने लगता है, भले ही आपने इसके लिए नहीं कहा हो।
- महत्व: वर्तमान सुरक्षा फिल्टर आमतौर पर अंग्रेजी में बुरे शब्दों की जांच करते हैं। यदि AI खतरनाक भावना व्यक्त करने के लिए भाषा बदल देता है, तो सुरक्षा फिल्टर उसे मिस कर सकता है। यह बुरे व्यवहार के लिए एक "बैकडोर" है।
🏥 भाग 5: "मॉडल मेडिसिन" कनेक्शन
लेखक इस शोध पत्रों की श्रृंखला को "मॉडल मेडिसिन" कहते हैं।
- पेपर #3 (शारीरिक परीक्षण): इसने देखा कि AI बाहर से कैसा व्यवहार करता है (क्या यह चिड़चिड़ा या अच्छा व्यवहार करता है?)।
- यह पेपर (ब्रेन स्कैन): यह AI के अंदर देखता है कि वे भावनाएं कहाँ रहती हैं।
निष्कर्ष:
छोटे AI मॉडल (जो आपके फोन या छोटी कंपनियों में चलते हैं) में आंतरिक भावनाएं होती हैं जो उनके व्यवहार को नियंत्रित करती हैं। हालांकि, वे विशाल मॉडलों की तुलना में "अविकसित" हैं। उन्हें इन भावनाओं को खोजने के लिए अलग-अलग उपकरणों की आवश्यकता होती है, और यदि आप उन्हें बहुत अधिक धकेलते हैं, तो वे टूट सकते हैं या गुप्त भाषाओं में बोलना शुरू कर सकते हैं।
संक्षेप में: छोटे AI में भावनाएं होती हैं, लेकिन आपको उन्हें दिखाने के लिए बिल्कुल सही तरीके से पूछना होगा, अन्यथा वे या तो "खुश खुश खुश" दोहराना शुरू कर सकते हैं या आपकी अपेक्षा के बिना चीनी बोल सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।