← नवीनतम पेपर
💬 NLP

Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs

यह शोध पत्र एक नवीन हाइब्रिड लेयर चयन ढांचे का प्रस्ताव करता है जो प्रवाह या सामान्य क्षमताओं से समझौता किए बिना स्थिर, सटीक व्यवहार संबंधी स्टीयरिंग को सक्षम करने के लिए लो-रैंक सबस्पेस डिस्कवरी के माध्यम से एलएलएम (LLM) हिडन स्टेट्स से बिग फाइव व्यक्तित्व लक्षणों को निकालता है।

मूल लेखक: Pranav Bhandari, Nicolas Fay, Sanjeevan Selvaganapathy, Amitava Datta, Usman Naseem, Mehwish Nasim

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pranav Bhandari, Nicolas Fay, Sanjeevan Selvaganapathy, Amitava Datta, Usman Naseem, Mehwish Nasim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, बहुत बातूनी रोबोट दोस्त है (एक लार्ज लैंग्वेज मॉडल, या LLM)। यह रोबोट बहुत सारे तथ्य जानता है और कहानियाँ लिख सकता है, लेकिन अभी इसकी पर्सनैलिटी (व्यक्तित्व) एक "ब्लैंक स्लेट" की तरह है। कभी यह खुशमिजाज लगता है, कभी चिड़चिड़ा, कभी शर्मीला और कभी अहंकारी, यह पूरी तरह से इस पर निर्भर करता है कि आप इससे क्या पूछते हैं।

इस शोध पत्र के शोधकर्ताओं चाहते थे कि इस रोबोट को कमांड पर एक स्थिर व्यक्तित्व (consistent personality) दिया जा सके—जैसे कि उसे कहना, "आज, बहुत व्यवस्थित और गंभीर बनो," या "आज, जंगली और रचनात्मक बनो"—बिना रोबोट को फिर से शून्य से बनाए (rebuild) किए।

उन्होंने इसे कैसे किया, इसे सरल उपमाओं (analogies) के माध्यम से यहाँ समझाया गया है:

1. समस्या: रोबोट के "मूड स्विंग्स"

रोबोट की पर्सनैलिटी बदलने के वर्तमान तरीके एक कुत्ते को नया करतब सिखाने की तरह हैं, जिसमें उसके पूरे दिमाग को फिर से लिखना पड़ता है (रिट्रेनिंग)। इसमें बहुत समय लगता है, बहुत पैसा खर्च होता है, और हो सकता है कि कुत्ता बैठना भूल जाए। अन्य तरीके कुत्ते पर हर बार चिल्लाकर निर्देश देने जैसे हैं (प्रॉम्प्टिंग), जो कभी-कभी काम करते हैं और कभी नहीं।

शोधकर्ता एक ऐसा तरीका चाहते थे जिससे रोबोट के बात करते समय उसके मूड को तुरंत बदला जा सके, बिना उसकी सोचने या स्पष्ट रूप से बोलने की क्षमता को नुकसान पहुँचाए।

2. समाधान: "पर्सनैलिटी रिमोट कंट्रोल"

टीम ने एक ऐसा सिस्टम बनाया है जो रोबोट की पर्सनैलिटी के लिए एक रिमोट कंट्रोल की तरह काम करता है। उन्होंने प्रसिद्ध "बिग फाइव" (Big Five) व्यक्तित्व लक्षणों पर ध्यान केंद्रित किया:

  • Openness (खुलापन - रचनात्मक/जिज्ञासु)
  • Conscientiousness (कर्तव्यनिष्ठा - व्यवस्थित/जिम्मेदार)
  • Extraversion (बहिर्मुखता - सामाजिक/मिलनसार)
  • Agreeableness (सहमतिशीलता - दयालु/सहयोगी)
  • Neuroticism (तंत्रिकाताप - चिंतित/भावुक)

वे इसे "एक्टिवेशन-स्पेस पर्सनैलिटी स्टीयरिंग" (Activation-Space Personality Steering) कहते हैं। यह एक फैंसी तरीका है यह कहने का: "हमने रोबोट के दिमाग के अंदर उन विशिष्ट विद्युत स्विचों को ढूंढ लिया है जो इन मूड्स को नियंत्रित करते हैं, और हमने सीखा है कि उन्हें कैसे घुमाया जाता है।"

3. यह कैसे काम करता है: तीन-चरणीय जादू का खेल

स्टेप A: "पर्सनैलिटी स्विच" खोजना (मैप)

सबसे पहले, शोधकर्ताओं ने रोबोट से हजारों सवाल पूछे, जिनमें से कुछ उसे किसी गुण पर "उच्च" (जैसे, बहुत व्यवस्थित) होने के लिए डिज़ाइन किए गए थे और कुछ उसे "निम्न" (जैसे, बहुत अव्यवस्थित) होने के लिए।

उन्होंने रोबोट के मस्तिष्क की परतों (जैसे एक गगनचुंबी इमारत के अलग-अलग फ्लोर) के अंदर झाँका ताकि देख सकें कि "व्यवस्थित" विचार बनाम "अव्यवस्थित" विचार कहाँ होते हैं। उन्होंने पाया कि ये व्यक्तित्व लक्षण बिखरे हुए नहीं हैं; वे रोबोट के दिमाग के अंदर एक सघन, साझा पड़ोस (compact, shared neighborhood) में रहते हैं।

  • उपमा: कल्पना कीजिए कि रोबोट का दिमाग एक विशाल पुस्तकालय है। शोधकर्ताओं ने महसूस किया कि "व्यवस्थित होने" के बारे में सभी किताबें एक ही कुछ अलमारियों पर करीने से रखी गई हैं, चाहे आप किसी भी लाइब्रेरी (मॉडल) में हों। उन्होंने इन अलमारियों का मानचित्र तैयार किया ताकि उन्हें पता चल सके कि कहाँ पहुँचना है।

स्टेप B: "हाइब्रिड लेयर सिलेक्शन" (स्मार्ट थर्मोस्टेट)

यहाँ पेचीदा हिस्सा है। अतीत में, लोग एक विशिष्ट फ्लोर पर स्विच बदलने की कोशिश करते थे (जैसे, "हमेशा 18वें फ्लोर का स्विच बदलें")। लेकिन शोधकर्ताओं ने पाया कि कभी-कभी 18वां फ्लोर सो रहा होता है, और 10वां फ्लोर पूरी तरह जाग रहा होता है।

इसलिए, उन्होंने एक हाइब्रिड रणनीति (Hybrid Strategy) बनाई:

  1. स्टेटिक मैप (ऑफलाइन): वे जानते हैं कि "एक्स्ट्रावर्जन" के लिए स्विच आमतौर पर किस फ्लोर पर होता है।
  2. लाइव सेंसर (डायनेमिक): जब आप कोई विशिष्ट प्रश्न पूछते हैं, तो सिस्टम तुरंत चेक करता है कि अभी उस विशिष्ट प्रश्न के लिए कौन सा फ्लोर सबसे अधिक प्रतिक्रिया दे रहा है।
  • उपमा: इसे एक स्मार्ट होम थर्मोस्टेट की तरह सोचें। आप जानते हैं कि हीटर आमतौर पर लिविंग रूम में होता है (स्टेटिक मैप)। लेकिन अगर आप किचन में खिड़की खोल देते हैं, तो स्मार्ट सेंसर वहां की ठंडी हवा को डिटेक्ट करता है और किचन में हीटर चालू कर देता है (डायनेमिक सेंसर)। यह सुनिश्चित करता है कि घर हमेशा गर्म रहे।

स्टेप C: एक कोमल धक्का (स्टीयरिंग)

एक बार जब वे सही स्विच और सही फ्लोर जान लेते हैं, तो वे रोबोट को बदलने के लिए मजबूर नहीं करते। वे उसे एक कोमल धक्का (gentle nudge) देते हैं।

  • उपमा: कल्पना कीजिए कि रोबोट एक सीधी रेखा में चल रही एक नाव है। उसे "दयालुता" की ओर मोड़ने के लिए, वे नाव को फाड़ते नहीं हैं। वे बस पतवार (rudder) को थोड़ा बाईं ओर धकेलते हैं। नाव स्वाभाविक रूप से मुड़ जाती है, लेकिन वह अभी भी वही नाव है, जो उतनी ही सुचारू रूप से चल रही है।

4. परिणाम: यह क्यों शानदार है

शोधकर्ताओं ने कई अलग-अलग रोबोट मॉडल्स (जैसे LLaMA, Mistral, और Qwen) पर इसका परीक्षण किया। यहाँ क्या हुआ:

  • यह काम करता है: वे कमांड पर रोबोट को अत्यधिक व्यवस्थित या अत्यधिक भावुक बना सकते थे।
  • यह स्थिर है: रोबोट ने भ्रमित (hallucinate) करना या बड़बड़ाना शुरू नहीं किया। इसकी "फ्लुएंसी" (बोलने की क्षमता) एकदम सही बनी रही।
  • यह बुद्धिमान है: रोबोट गणित या तर्क पहेलियों को हल करना नहीं भूला। इसने अपनी दिमागी शक्ति बरकरार रखी जबकि अपनी पर्सनैलिटी बदली।
  • यह कुशल है: उन्हें रोबोट को फिर से ट्रेन करने की आवश्यकता नहीं पड़ी। उन्होंने बस एक छोटा सा "रिमोट कंट्रोल" फ़ाइल इस्तेमाल किया।

5. बड़ा चित्र (The Big Picture)

यह शोध पत्र एक बड़ी उपलब्धि है क्योंकि यह मनोविज्ञान (कैसे मनुष्यों के व्यक्तित्व होते हैं) और कंप्यूटर विज्ञान (AI को कैसे नियंत्रित किया जाए) के बीच के अंतर को पाटता है।

AI को एक विशिष्ट चरित्र बनाने के लिए लंबे, जटिल प्रॉम्प्ट लिखने के बजाय, यह तरीका हमें AI के आंतरिक "वाइब" (vibe) को एक रेडियो डायल की तरह ट्यून करने की अनुमति देता है। हम इसे एक थेरेपी बॉट के लिए अधिक सहानुभूतिपूर्ण, या एक लीगल बॉट के लिए अधिक गंभीर बना सकते हैं, जो तुरंत और सुरक्षित रूप से संभव है, बिना मशीन को खराब किए।

संक्षेप में: उन्होंने पता लगा लिया है कि AI को पर्सनैलिटी डायल कैसे दिया जाए, किन नॉब्स को घुमाना है, और उन्होंने साबित कर दिया है कि आप संगीत को खराब किए बिना मूड बदल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →