← नवीनतम पेपर
💬 NLP

Constructing Interpretable Features from Compositional Neuron Groups

यह शोध पत्र एमएलपी (MLP) सक्रियणों (activations) को सह-सक्रिय न्यूरॉन्स से बनी विरल (sparse), व्याख्या योग्य विशेषताओं में विघटित करने के लिए सेमी-नॉन-नेगेटिव मैट्रिक्स फैक्टराइजेशन (SNMF) का उपयोग करने का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण कॉज़ल स्टीयरिंग (causal steering) में स्पार्स ऑटोएनकोडर और सुपरवाइज्ड बेसलाइन्स से बेहतर प्रदर्शन करता है और बड़े भाषा मॉडलों में अवधारणात्मक निरूपणों की एक पदानुक्रमित संरचना को प्रकट करता है।

मूल लेखक: Or Shafran, Atticus Geiger, Mor Geva

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Or Shafran, Atticus Geiger, Mor Geva

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक विशाल, जटिल ऑर्केस्ट्रा की तरह है। लंबे समय से, वैज्ञानिक जो यह समझने की कोशिश कर रहे हैं कि यह ऑर्केस्ट्रा कैसे काम करता है, वे व्यक्तिगत संगीतकारों (न्यूरॉन्स) पर ध्यान केंद्रित कर रहे हैं। उन्होंने सोचा, "यदि मैं एक अकेले वायलिन वादक के कार्यों को समझ सकूँ, तो मैं संगीत को समझ जाऊँगा।"

हालाँकि, यह शोध पत्र तर्क देता है कि यह दृष्टिकोण त्रुटिपूर्ण है। वास्तव में, संगीतकार अक्सर विशिष्ट ध्वनियाँ उत्पन्न करने के लिए समूहों में एक साथ बजाते हैं। एक अकेला वायलिन वादक एक गाने में उदास स्वर बजा सकता है और दूसरे में खुशी भरा स्वर। "अर्थ" अकेले वायलिन वादक में नहीं है; यह उन संगीतकारों के संयोजन में है जो एक ही समय में साथ बजा रहे हैं।

यहाँ इस शोध पत्र की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "शब्दकोश" बहुत अव्यवस्थित था

पहले, शोधकर्ता इन संगीत समूहों को खोजने के लिए स्पार्स ऑटोएनकोडर (SAE) नामक उपकरण का उपयोग करते थे। आप एक SAE को एक बहुत ही महत्वाकांक्षी लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में देख सकते हैं जो एक अराजक पुस्तकालय को व्यवस्थित करने की कोशिश कर रहा है। यह डेटा (पुस्तकों) को छाँटने के लिए शून्य से नए "शेल्फ" (विशेषताओं) का आविष्कार करने की कोशिश करता है।

समस्या क्या थी? लाइब्रेरियन कभी-कभी ऐसे शेल्फ बनाता है जो मनुष्यों के लिए समझ में नहीं आते, या शेल्फ पर रखी किताबें वास्तव में वहाँ नहीं होनी चाहिए। जब शोधकर्ताओं ने इन शेल्फों का उपयोग ऑर्केस्ट्रा को नियंत्रित करने (एक विशिष्ट गाना बजाने) के लिए किया, तो लाइब्रेरियन की प्रणाली अक्सर विफल हो गई। यह बिना समुद्र को देखे हाथ से बनाए गए मानचित्र का उपयोग करके जहाज को चलाने की कोशिश करने जैसा था।

2. समाधान: "कंपोजिशनल" दृष्टिकोण

लेखक एक नई विधि प्रस्तावित करते हैं जिसे SNMF (सेमी-नॉन-नेगेटिव मैट्रिक्स फैक्टराइजेशन) कहा जाता है।

नए शेल्फ का आविष्कार करने के बजाय, SNMF ऑर्केस्ट्रा के शीट संगीत (मॉडल के आंतरिक गणित) को देखता है और पूछता है: "अभी कौन से संगीतकार एक साथ बजा रहे हैं?"

  • सादृश्य (Analogy): कल्पना कीजिए कि ऑर्केस्ट्रा "बारिश" के बारे में एक गाना बजा रहा है। SNMF एक नया "बारिश" बटन का आविष्कार नहीं करता है। इसके बजाय, यह देखता है कि फ्लूट (बांसुरी), सेलो और टिम्पानी सभी एक ही समय में ज़ोर से बज रहे हैं। यह उन्हें एक साथ समूहित करता है और कहता है, "यह विशिष्ट तिकड़ी ही 'बारिश' की विशेषता है।"
  • मुख्य अंतर: क्योंकि SNMF इन समूहों को सीधे उन संगीतकारों से बनाता है जो वास्तव में बजा रहे हैं, यह जानता है कि किन नोट्स (इनपुट) ने उस समूह को सक्रिय किया। यह कंडक्टर के पास एक सीधी रेखा रखने जैसा है जो कह रहा है, "जब आप इन तीन वाद्य यंत्रों को देखते हैं, तो आप जानते हैं कि बारिश हो रही है।"

3. परिणाम: बेहतर नियंत्रण और स्पष्ट अर्थ

शोधकर्ताओं ने कई प्रसिद्ध AI मॉडलों (जैसे Llama 3.1 और Gemma 2) पर इस नई विधि का परीक्षण किया। उन्होंने इसकी तुलना पुराने "लाइब्रेरियन" तरीके (SAE) और एक बहुत ही सख्त, पर्यवेक्षित पद्धति (जहाँ मनुष्य कंप्यूटर को ठीक से बताता है कि क्या खोजना है) से की।

  • "स्टीयरिंग" परीक्षण: उन्होंने AI को विशिष्ट विषयों (जैसे "पुलिस" या "इतिहास") के बारे में बात करने के लिए "स्टीयर" करने की कोशिश की। SNMF इस मामले में बहुत बेहतर था। यह पुराने तरीकों की तुलना में AI के आउटपुट को वांछित विषय की ओर अधिक प्रभावी ढंग से मोड़ सका, जबकि वाक्य व्याकरणिक रूप से सही और प्रवाहपूर्ण रहे।
  • "डिटेक्शन" (पहचान) परीक्षण: उन्होंने जाँच की कि क्या AI यह पहचान सकता है कि किसी विषय पर चर्चा की जा रही है। SNफो (SNMF) ने इन अवधारणाओं को पहचानने में मौजूदा सर्वोत्तम विधियों के समान ही प्रदर्शन किया।

4. बड़ी खोज: "लेगो" संरचना

इस शोध पत्र का सबसे दिलचस्प हिस्सा वह है जो उन्होंने इन समूहों के निर्माण के बारे में पाया।

उन्होंने पाया कि AI सरल विचारों को एक के ऊपर एक रखकर जटिल विचार बनाता है, जैसे लेगो ब्रिक्स (Lego bricks)

  • सादृश्य: कल्पना कीजिए कि आपके पास न्यूरॉन्स का एक समूह है जो "दिन" का प्रतिनिधित्व करता है। फिर, आपके पास एक थोड़ा अलग समूह है जो "कार्यदिवस" (Weekday) का प्रतिनिधित्व करता है। "कार्यदिवस" समूह, "दिन" समूह और कुछ अतिरिक्त न्यूरॉन्स का संयोजन है जो कहते हैं, "नहीं, यह शनिवार या रविवार नहीं है।"
  • पदानुक्रम (Hierarchy): अपने तरीके को बार-बार (रिकर्सिवली) लागू करके, उन्होंने एक वृक्ष संरचना (tree structure) देखी।
    • निचला स्तर: "सोमवार", "मंगलवार" आदि के लिए विशिष्ट न्यूरॉन्स।
    • मध्य स्तर: "कार्यदिवस" (सोमवार-शुक्रवार के संयोजन) के लिए एक समूह।
    • शीर्ष स्तर: "सप्ताह के दिनों" (कार्यदिवस और सप्ताहांत के संयोजन) के लिए एक समूह।

यह दर्शाता है कि AI के पास केवल यादृच्छिक न्यूरॉन्स नहीं हैं; इसके पास एक पदानुक्रमित वास्तुकला (hierarchical architecture) है। यह अधिक जटिल विचारों को बनाने के लिए एक ही मूल "बिल्डिंग ब्लॉक्स" (न्यूरॉन्स) का पुन: उपयोग करता है। उदाहरण के लिए, "दिन" के लिए मूल न्यूरॉन्स का पुन: उपयोग "सोमवार", "मंगलवार" और "सप्ताहांत" के लिए किया जाता है, जिसमें केवल कुछ अतिरिक्त न्यूरॉन्स जोड़े जाते हैं ताकि उन्हें अलग पहचाना जा सके।

सारांश

शोध पत्र का दावा है कि न्यूरॉन्स के समूहों (व्यक्तिगत न्यूरॉन्स के बजाय) के काम करने के तरीके को देखकर और एक ऐसे गणितीय उपकरण का उपयोग करके जो यह सम्मान करता है कि मॉडल वास्तव में चीजें कैसे कैलकुलेट करता है, हम:

  1. ऐसे विचार/अवधारणाएं पा सकते हैं जिन्हें मनुष्य आसानी से समझ सकते हैं।
  2. पहले की तुलना में AI के आउटपुट को बहुत अधिक प्रभावी ढंग से नियंत्रित कर सकते हैं।
  3. देख सकते हैं कि AI सरल, पुन: प्रयोज्य भागों को जोड़कर जटिल विचार बनाता है, ठीक वैसे ही जैसे ईंटों से घर बनाया जाता है।

लेखक निष्कर्ष निकालते हैं कि यह विधि एक सरल, प्रभावी तरीका है जिससे AI मॉडल कैसे सोचते हैं, उसका "विच्छेदन" (dissect) किया जा सकता है, जो यह प्रकट करता है कि वे एक तार्किक, पदानुक्रमित तरीके से व्यवस्थित हैं जिसे अब हम देख और उपयोग कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →