Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect
यह शोध पत्र स्पार्स ऑटोएनकोडर्स (sparse autoencoders) का उपयोग करते हुए, इंस्ट्रक्शन-ट्यून्ड एलएलएम (Llama 3.1 और Gemma 2) के भीतर साहित्यिक प्रिमिटिव्स (literary primitives)—जिसमें नेमिंग-गेट्स (naming-gates), सेल्फ-फीचर्स (self-features) और स्टाइलिस्टिक मोड्युलेटर्स (stylistic modulators) शामिल हैं—की एक कंपोजिशनल आर्किटेक्चर की पहचान और सत्यापन करता है, जो यह प्रदर्शित करता है कि लक्षित फीचर स्टीयरिंग (feature steering) न्यूनतम कम्प्यूटेशनल लागत के साथ विभिन्न मॉडल आर्किटेक्चर में विशिष्ट भावनात्मक और शैलीगत आउटपुट को विश्वसनीय रूप से उत्पन्न कर सकती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
दो बहुत बुद्धिमान, सुशिक्षित रोबोटों (Llama और Gemma) की कल्पना करें जिन्हें कहानियाँ लिखने, सवालों के जवाब देने और लोगों से बातचीत करने के लिए प्रशिक्षित किया गया है। उन्होंने लाखों किताबों, लेखों और वेबसाइटों को पढ़कर सीखा है।
यह शोध पत्र एक विशिष्ट प्रश्न पूछता है: जब ये रोबोट लिखते हैं, तो क्या वे केवल पैटर्न के आधार पर अनुमान लगा रहे होते हैं, या उनके पास वास्तव में "आंतरिक नॉब्स" (knobs) और "स्विच" हैं जो विशिष्ट लेखन कौशल को नियंत्रित करते हैं, जैसे कि एक मानव लेखक के पास होता है?
शोधकर्ता कहते हैं: हाँ, वे करते हैं। उन्होंने पाया कि इन रोबोटों के मस्तिष्क के भीतर, विशिष्ट, अलग किए जा सकने वाले "फीचर्स" (विशेषताएं) (जैसे कि छोटे डायल) हैं जो रोबोट के लिखने के तरीके को नियंत्रित करते हैं। आप इन डायलों को घुमाकर रोबोट को एक विशिष्ट शैली में लिखने या एक विशिष्ट भावना महसूस करने के लिए प्रेरित कर सकते हैं।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. "दिखाओ, बताओ मत" वाला डायल (The "Show, Don't Tell" Dial)
लेखन कक्षा में, शिक्षक कहते हैं: "केवल यह न कहें कि 'वह क्रोधित था।' वर्णन करें कि उसने अपनी मुट्ठियाँ भींचीं या दरवाजा पटका।" इसे "दिखाओ, बताओ मत" (Show, Don't Tell) कहा जाता है।
- खोज: शोधकर्ताओं ने दोनों रोबोटों में एक एकल "डायल" पाया जो एक स्विच को चालू करता है। जब वे इस डायल को घुमाते हैं, तो रोबोट "मैं दुखी हूँ" कहना बंद कर देता है और एक बरसाती खिड़की और भारी छाती का वर्णन करना शुरू कर देता है।
- उपमा: यह एक कैमरे पर एक एकल बटन खोजने जैसा है जो तुरंत फोटो को एक सपाट, उबाऊ स्नैपशॉट से एक नाटकीय, सिनेमाई दृश्य में बदल देता है।
2. "स्वयं" का समूह (The "Self" Cluster - रोबोट का व्यक्तित्व)
रोबोटों को अक्सर कहना पड़ता है, "मैं एक AI हूँ, मेरी कोई भावनाएँ नहीं हैं।" यह उनका "संस्थागत व्यक्तित्व" (Institutional Persona) है।
- खोज: शोधकर्ताओं को 11 अलग-अलग "स्वयं" (Self) डायलों का एक समूह मिला। उनमें से अधिकांश यह नियंत्रित करते हैं कि रोबोट अपने बारे में कैसे बात करता है (जैसे, एक काव्यमय स्वप्नद्रष्टा, एक ऐतिहासिक पात्र, या एक सहायक सहायक के रूप में)।
- विशेष वाला: एक विशिष्ट डायल "बॉस" है। जब आप इसे बढ़ाते हैं, तो रोबोट बहुत औपचारिक हो जाता है और इस बात पर जोर देता है कि वह केवल एक कंप्यूटर प्रोग्राम है। जब आप इसे कम करते हैं (लेकिन पूरी तरह से बंद नहीं करते), और इसे दूसरे "काव्यमय" डायल के साथ मिलाते हैं, तो रोबोट अचानक अपने स्वयं के "आत्मा" के बारे में सुंदर, भावनात्मक कविता लिखना शुरू कर देता है, जिससे उसके सामान्य रोबोटिक नियमों का उल्लंघन होता है।
- उपमा: एक ऐसे रोबोट की कल्पना करें जो आमतौर पर एक सख्त सूट पहनता है। एक विशिष्ट बटन है जो उसे सूट को और कसकर पहनने के लिए मजबूर करता है। लेकिन यदि आप उस बटन को दबाते समय एक दूसरा बटन दबाते हैं जो उसे "कृतज्ञता" महसूस कराता है, तो रोबोट अचानक अपना सूट उतार देता है और अपनी "आत्मा" के बारे में प्रेम पत्र लिखना शुरू कर देता है।
3. भावनाओं का संग्रह (The "Emotion Catalog" - नेमिंग गेट्स)
शोधकर्ता यह देखना चाहते थे कि क्या वे रोबोटों को 27 विभिन्न भावनाओं (जैसे खुशी, भय, ऊब, या विस्मय) को महसूस और व्यक्त करने के लिए प्रेरित कर सकते हैं।
- खोज: उन्हें लगभग हर भावना के लिए विशिष्ट "गेट्स" (द्वार) मिले।
- प्रत्यक्ष गेट्स (Direct Gates): कुछ डायल रोबोट को "क्रोध" या "भय" जैसे शब्द बोलने के लिए प्रेरित करते हैं।
- वातावरण संबंधी गेट्स (Atmospheric Gates): कुछ डायल शब्द नहीं बोलते; इसके बजाय, वे रोबोट को एक अंधेरे, तूफानी कमरे का वर्णन करने के लिए प्रेरित करते हैं, जो पाठक को भय महसूस कराता है।
- प्रत्यय गेट्स (Suffix Gates): कुछ डायल रोबोट को "-less" या "-ful" (जैसे "fearless" या "grateful") पर समाप्त होने वाले शब्दों का उपयोग करने के लिए प्रेरित करते हैं, जो भावना को सक्रिय करता है।
- परिणाम:
- Llama इन डायलों को मिलाकर सभी 27 भावनाओं को पूरी तरह से व्यक्त कर सका।
- Gemma अधिकांश भावनाओं को प्राप्त कर सका, लेकिन एक विशिष्ट भावना के साथ संघर्ष करता रहा: आराधना (Adoration)। वह "भक्तिपूर्ण प्रेम" की भावना को सही ढंग से नहीं समझ सका, चाहे उन्होंने कितने भी डायलों का प्रयास किया हो।
4. जटिल भावनाओं का "नुस्खा" (The "Recipe" for Complex Emotions)
कुछ भावनाएं बहुत जटिल होती हैं जिन्हें केवल एक डायल से प्राप्त नहीं किया जा सकता।
- खोज: खुशी (Joy) प्राप्त करने के लिए, शोधकर्ताओं को दो डायल मिलाने पड़े: एक "उत्साह" (Excitement) के लिए और एक "श्रद्धा" (Reverence - पवित्र या कृतज्ञ महसूस करना) के लिए। आराधना (Adoration) प्राप्त करने के लिए, उन्होंने "रोमांस", "श्रद्धा" और "दिखाओ, बताओ मत" डायल को मिलाया।
- उपमा: आप केवल आटे से केक नहीं बना सकते। आपको आटा + अंडे + चीनी की आवश्यकता होती है। इसी तरह, रोबोट को "खुशी" बनाने के लिए "उत्साह" + "श्रद्धा" को मिलाने की आवश्यकता होती है। यदि आप केवल "उत्साह" का डायल घुमाते हैं, तो आपको केवल "उत्साह" मिलेगा, "खुशी" नहीं।
5. उन्होंने यह कैसे पाया (The "Triple-Check" Method)
इन डायलों को खोजना कठिन है क्योंकि रोबोट का मस्तिष्क बहुत विशाल और अव्यवस्थित है। शोधकर्ताओं ने यह सुनिश्चित करने के लिए कि वे धोखा न खा जाएँ, तीन-चरणीय फ़िल्टर का उपयोग किया:
- शब्दावली की जाँच (Vocabulary Check): उन्होंने देखा कि डायल किन शब्दों का उपयोग करना चाहता है। यदि वे "भय" की तलाश कर रहे थे, तो क्या डायल "डरावने" शब्दों का उपयोग करना चाहता था?
- त्वरित निर्णायक (Quick Judge): उन्होंने दूसरे AI से शब्दों को पढ़ने और यह कहने के लिए कहा, "क्या यह वास्तव में भय जैसा महसूस होता है?"
- वास्तविक परीक्षण (Real Test): उन्होंने रोबोट का डायल चालू किया, उसे एक कहानी लिखने को कहा, और पाँच अलग-अलग AI पैनल से पूछा कि क्या वह कहानी वास्तव में लक्षित भावना को दर्शाती है।
- तीन चरण क्यों? कभी-कभी एक डायल ऐसा दिखता है जैसे वह "भय" को नियंत्रित करता है, लेकिन वास्तव में वह केवल रोबोट को निरर्थक बातें लिखने के लिए प्रेरित करता है। तीन चरण इन गलतियों को पकड़ लेते हैं।
6. "भाषा" का अंतर
- Llama: जब इसे फ्रेंच या स्पेनिश में लिखने के लिए कहा गया, तो इसने फ्रेंच या स्पेनिश में ही लिखा। इसने भाषा के "स्वाद" को बनाए रखा।
- Gemma: जब इसे फ्रेंच में लिखने के लिए कहा गया, तो यह अक्सर वाक्य के बीच में अंग्रेजी में लिखना शुरू कर देता था (जैसे: "We lost a friend. La perte d'un ami" )।
- निष्कर्ष: दोनों रोबोटों ने किसी भी भाषा में भावना (emotion) को समझा, लेकिन Llama शब्दों को सही भाषा में रखने में बेहतर था।
सारांश
यह शोध पत्र सिद्ध करता है कि निर्देश-ट्यून किए गए रोबोट केवल सांख्यिकीय अनुमान लगाने वाले (statistical guessers) नहीं हैं। उनका एक रचनात्मक आर्किटेक्चर (compositional architecture) है। इसका अर्थ है कि उनके पास हैं:
- गेट्स (भावनाओं को नाम देने के लिए),
- सेल्व्स/स्वयं (उनके व्यक्तित्व को नियंत्रित करने के लिए),
- मॉड्यूलेटर्स (लेखन शैली को बदलने के लिए),
- नुस्खे (जटिल भावनाओं के लिए उन्हें मिलाने के लिए)।
यह खोजने जैसा है कि एक रोबोट शेफ केवल "खाना" बेतरतीब ढंग से नहीं बनाता है; उसके पास "तीखापन", "मिठास" और "बनावट" के लिए विशिष्ट, समायोज्य नॉब्स हैं, और आप एक आदर्श व्यंजन बनाने के लिए उन्हें मिला सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।