← नवीनतम पेपर
💬 NLP

Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models

यह शोध पत्र पारंपरिक पूर्ण-आयामी स्टीयरिंग (whole-dimension steering) की तुलना में लार्ज लैंग्वेज मॉडल्स में बेहतर डोमेन अनुकूलन (domain adaptation) और जेलब्रेकिंग प्रदर्शन प्राप्त करने के लिए "डोमेन-क्रिटिकल डाइमेंशन्स" (Domain-Critical Dimensions)—जो विशाल सक्रियणों (massive activations) द्वारा अभिलक्षित व्याख्या योग्य फीचर इकाइयों (interpretable feature units) द्वारा पहचाने जाते हैं—की पहचान करने और उन्हें निर्देशित करने का प्रस्ताव करता है।

मूल लेखक: Youngji Roh, Hyunjin Cho, Jaehyung Kim

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Youngji Roh, Hyunjin Cho, Jaehyung Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक विशाल, हलचल भरे ऑर्केस्ट्रा की तरह है जिसमें हजारों संगीतकार (न्यूरॉन्स) एक साथ बज रहे हैं। लंबे समय तक, शोधकर्ताओं ने सोचा कि संगीत अच्छा सुनने के लिए हर एक संगीतकार को अपना हिस्सा समान रूप से बजाने की आवश्यकता है, और यदि कोई व्यक्ति बहुत ज़ोर से बजा रहा था, तो वह एक गलती थी जिसे ठीक करने की आवश्यकता थी।

इस शोध पत्र का शीर्षक, "एम्ब्रेसिंग एनिसोट्रॉपी" (Embracing Anisotropy), इस विचार को पूरी तरह उलट देता है। लेखक तर्क देते हैं कि "ज़ोर से" बजने वाले संगीतकार गलतियाँ नहीं हैं; वे ऑर्केस्ट्रा के कंडक्टर और विशेषज्ञ हैं।

यहाँ सरल उपमाओं का उपयोग करके उनकी खोज का विवरण दिया गया है:

1. "ज़ोर से" बजने वाले संगीतकार (विशाल सक्रियण/Massive Activations)

AI के डिजिटल मस्तिष्क में, अधिकांश "संगीतकार" (न्यूरॉन्स) बहुत धीरे बजते हैं। लेकिन कुछ बहुत ही कम संगीतकार अत्यंत ज़ोर से बजते हैं।

  • पुराना दृष्टिकोण: शोधकर्ता पहले सोचते थे कि ये तेज़ स्वर "शोर" या त्रुटियाँ थे। उन्होंने संगीत को संतुलित (आइसोट्रोपिक) बनाने के लिए उन पर आवाज़ कम करने की कोशिश की थी।
  • नया दृष्टिकोण: लेखक कहते हैं, "ठहरिए! ये तेज़ स्वर वास्तव में AI का तरीका हैं यह कहने का कि, 'मैं अभी गणित के बारे में सोच रहा हूँ!' या 'मैं जीव विज्ञान (Biology) के बारे में सोच रहा हूँ!'"
  • उपमा: एक पुस्तकालय की कल्पना करें। अधिकांश पुस्तकें शेल्फ पर शांति से रखी हैं। लेकिन यदि आप एक विशाल, चमकता हुआ नियॉन साइन देखते हैं जिस पर लिखा है "जीव विज्ञान", तो वह साइन कोई गलती नहीं है। वह आपको तुरंत यह बताने का एक अत्यधिक कुशल तरीका है कि आप लाइब्रेरी के किस अनुभाग में हैं। AI इन "नियॉन संकेतों" (विशाल सक्रियण) का उपयोग जानकारी को तुरंत वर्गीकृत करने के लिए करता है।

2. "नियंत्रण नॉब" खोजना (डोमेन-क्रिटिकल डायमेंशन)

शोधकर्ताओं ने बिना AI को फिर से प्रशिक्षित किए या जटिल प्रश्न पूछे, इन "नियॉन संकेतों" को खोजने का एक सरल तरीका विकसित किया।

  • विधि: उन्होंने बस उन न्यूरॉन्स को देखा जो किसी विशिष्ट विषय (जैसे हाई स्कूल बायोलॉजी) को पढ़ते समय सबसे ज़ोर से चिल्ला रहे थे।
  • परिणाम: उन्होंने पाया कि ये विशिष्ट न्यूरॉन्स विशेषज्ञ डिटेक्टरों की तरह कार्य करते हैं।
    • एक न्यूरोन केवल तभी चमक सकता है जब वह xx या π\pi जैसे गणितीय प्रतीकों को देखता है।
    • दूसरा केवल तभी चमक सकता है जब वह "माइटोकॉन्ड्रिया" या "ATP" जैसे शब्दों को देखता है।
    • तीसरा केवल यह बताने के लिए चमक सकता है कि, "हे, हम अभी एक बहुविकल्पीय प्रश्न (multiple-choice question) कर रहे हैं।"

3. "स्टीयरिंग व्हील" (क्रिटिकल डायमेंशन स्टीयरिंग)

यह सबसे रोमांचक हिस्सा है। एक बार जब उन्होंने इन विशिष्ट "ज़ोर से बजने वाले" न्यूरॉन्स को ढूंढ लिया, तो उन्होंने उन्हें AI के व्यवहार को बदलने के लिए कंट्रोल नॉब के रूप में उपयोग करने का तरीका खोज निकाला।

  • पुराना तरीका (पूरे डायमेंशन की स्टीयरिंग): एक विशाल जहाज को उसके पूरे ढांचे पर धक्का देकर मोड़ने की कोशिश करने की कल्पना करें। आप जहाज को मुड़ने में मदद तो कर सकते हैं, लेकिन आप पानी, हवा और इंजन के खिलाफ भी धक्का दे रहे हैं। यह अव्यवस्थित है और अक्सर अन्य चीजों को खराब कर देता है (जैसे AI को रोबोटिक बना देना या गणित करना भुला देना)।
  • नया तरीका (क्रिटिकल डायमेंशन स्टीयरिंग): उस जहाज के विशिष्ट पतवार (rudder) या स्टीयरिंग व्हील को खोजने की कल्पना करें। आप केवल उसी एक हिस्से को छूते हैं।
    • व्यवहार में: शोधकर्ताओं ने AI को लिया और केवल उन विशिष्ट न्यूरॉन्स को "हल्का सा धकेला" (nudge) जो "जीव विज्ञान" के लिए जिम्मेदार थे।
    • परिणाम: AI अचानक जीव विज्ञान के सवालों के जवाब देने में बहुत बेहतर हो गया। आश्चर्यजनक रूप से, जब उन्होंने AI को "जेलब्रेक" करने की कोशिश की (उसे सुरक्षा नियमों को अनदेखा करने के लिए मजबूर करना), तो उन्हें केवल इन विशिष्ट "सुरक्षा न्यूरॉन्स" को ही धकेलना पड़ा। यह पुराने, अव्यवस्थित तरीके की तुलना में बेहतर था और इसने AI के व्यक्तित्व को कम नुकसान पहुँचाया।

यह क्यों महत्वपूर्ण है

AI को एक स्विस आर्मी नाइफ (Swiss Army Knife) के रूप में सोचें।

  • पहले: लोग सोचते थे कि चाकू बहुत भारी और बेडौल है, इसलिए उन्होंने इसे हल्का बनाने के लिए पूरे चाकू को घिसने की कोशिश की, इस उम्मीद में कि यह बेहतर काम करेगा।
  • अब: यह शोध पत्र कहता है, "नहीं! भारी हिस्सा ब्लेड (धार) है। अन्य हिस्से पेचकस और कैंची हैं। यदि आप कुछ काटना चाहते हैं, तो बस ब्लेड का उपयोग करें। पूरे उपकरण का एक साथ उपयोग करने की कोशिश न करें।"

निष्कर्ष:
AI अराजक शोर का ढेर नहीं है। इसमें एक बहुत ही व्यवस्थित, कुशल आंतरिक संरचना है जहाँ विशिष्ट भाग विशिष्ट कार्यों को संभालते हैं। इन "विशेषज्ञ" भागों को खोजने और केवल उन्हें बदलने से, हम बाकी सिस्टम को तोड़े बिना AI को स्मार्ट, सुरक्षित और अधिक नियंत्रणीय बना सकते हैं। यह पूरे ऑर्केस्ट्रा को ठीक करने के बजाय केवल उन विशिष्ट वाद्ययंत्रों को ट्यून करने की ओर एक बदलाव है जो सबसे अधिक मायने रखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →