← नवीनतम पेपर
🤖 AI

StructLens: A Structural Lens for Language Models via Maximum Spanning Trees

यह शोध पत्र StructLens प्रस्तुत करता है, जो एक नवीन ढांचा है जो भाषा मॉडलों में वैश्विक अंतर-परत संरचनात्मक संबंधों का विश्लेषण करने के लिए अवशिष्ट स्ट्रीम (residual stream) निरूपणों से प्राप्त अधिकतम स्पैनिंग वृक्षों (maximum spanning trees) का उपयोग करता है, जो लेयर प्रूनिंग जैसे कार्यों में पारंपरिक मेट्रिक्स से बेहतर विशिष्ट समानता पैटर्न को प्रकट करता है।

मूल लेखक: Haruki Sakajo, Frederikus Hudi, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

प्रकाशित 2026-03-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haruki Sakajo, Frederikus Hudi, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) जैसे कि Llama या Qwen की कल्पना एक विशाल, बहु-मंजिला फैक्ट्री के रूप में करें। जब आप मॉडल से कोई प्रश्न पूछते हैं, तो जानकारी (आपके शब्द) ग्राउंड फ्लोर (इनपुट) से ऊपर 30 या 40 अलग-अलग मंजिलों (लेयर्स) तक यात्रा करती है, इससे पहले कि एक अंतिम उत्तर तैयार हो सके।

लंबे समय तक, शोधकर्ता जो यह समझने की कोशिश कर रहे थे कि ये फैक्ट्रियां कैसे काम करती हैं, उन्होंने एक एकल मंजिल के श्रमिकों को देखा है। उन्होंने पूछा है, "यह विशिष्ट कार्यकर्ता क्या सोच रहा है?" या "यह कार्यकर्ता अपने बगल वाले व्यक्ति से कैसे बात करता है?"

समस्या:
पेपर का तर्क है कि यह दृष्टिकोण बड़े चित्र (बिग पिक्चर) को मिस कर देता है। यह एक सिम्फनी को समझने की कोशिश करने जैसा है जहाँ आप केवल एक समय में एक वायलिन वादक को सुन रहे हैं। आप यह नहीं देख पाते कि कैसे विभिन्न विभाग (स्ट्रिंग्स, ब्रास, परकशन) मिलकर संगीत बनाते हैं। मौजूदा तरीके अक्सर केवल "फ्लोर 5 पर वर्कर A" की तुलना "फ्फोोर 6 पर वर्कर A" से करते हैं, और इस बात को नजरअंदाज कर देते हैं कि फ्लोर 5 पर मौजूद पूरा समूह फ्लोर 6 पर मौजूद पूरे समूह की तुलना में कैसे व्यवस्थित है।

समाधान: StructLens
लेखक StructLens पेश करते हैं, जो एक नया टूल है जो इन AI फैक्ट्रियों के लिए "स्ट्रक्चरल एक्स-रे" की तरह काम करता है। व्यक्तिगत श्रमिकों को देखने के बजाय, StructLens एक वाक्य में सभी शब्दों के बीच के संबंधों को देखता है जब वे प्रत्येक लेयर से गुजरते हैं।

यह इस प्रकार काम करता है, कुछ रचनात्मक उपमाओं का उपयोग करते हुए:

1. "मैक्सिमम स्पैनिंग ट्री" (सोशल नेटवर्क मैप)

कल्पना कीजिए कि आप एक भीड़ भरे कमरे में कदम रखते हैं जहाँ हर कोई बात कर रहा है।

  • पुराना तरीका: आप बस यह मापते हैं कि व्यक्ति A व्यक्ति B की तुलना में कितना तेज़ बोल रहा है।
  • StructLens का तरीका: आप एक नक्शा बनाते हैं जो उन सभी लोगों को जोड़ता है जो सबसे महत्वपूर्ण बातचीत कर रहे हैं। आप उन लोगों को जोड़ते हैं जो विचारों में सबसे अधिक समान हैं, जिससे एक विशाल, एकल पेड़ (ट्री) बनता है जो सभी को एक साथ जोड़ता है।

AI में, "लोग" आपके वाक्य के शब्द हैं। StructLens एक विशिष्ट लेयर पर प्रत्येक शब्द की दूसरे प्रत्येक शब्द के साथ समानता की गणना करता है। फिर यह एक मैक्सिमम स्पैनिंग ट्री (MST) बनाता है। इसे उस विशिष्ट क्षण में बातचीत की "रीढ़ की हड्डी" (बैकबोन) के रूप में समझें। यह दिखाता है कि कौन से शब्द संरचना को थामे हुए हैं।

2. समानता के "द्वीप" (Islands)

जब शोधकर्ताओं ने StructLens का उपयोग करके AI की आंतरिक संरचना को देखा, तो उन्हें कुछ आश्चर्यजनक मिला।

  • पुराना दृष्टिकोण: वे एक सहज, क्रमिक विकास की उम्मीद कर रहे थे, जैसे एक सीढ़ी जहाँ हर पायदान पिछले पायदान से थोड़ा अलग होता है।
  • StructLens का दृष्टिकोण: उन्होंने "द्वीप" (Islands) पाए।

कल्पना कीजिए कि फैक्ट्री की मंजिलें एक चिकनी सीढ़ी नहीं हैं, बल्कि पुलों से जुड़े द्वीपों की एक श्रृंखला हैं।

  • द्वीप 1 (प्रारंभिक लेयर्स): AI केवल कच्चे शब्दों को व्यवस्थित कर रहा है, जैसे लेगो ब्रिक्स को उनके रंग के आधार पर छाँटना।
  • द्वीप 2 (मध्यवर्ती लेयर्स): AI छोटे ढांचे बनाना शुरू करता है, संबंधित शब्दों को एक साथ समूहित करता है (जैसे एक दीवार या खिड़की बनाना)।
  • द्वीप 3 (अंतिम लेयर्स): AI अब अंतिम किला असेंबल कर रहा है, उच्च-स्तरीय निर्णय ले रहा है।

StructLens ने खुलासा किया कि एक ही "द्वीप" के भीतर की लेयर्स एक-दूसरे के बहुत समान हैं, लेकिन अगले द्वीप से बहुत भिन्न हैं। यह शोधकर्ताओं को यह देखने में मदद करता है कि AI अपनी सोचने की शैली कहाँ बदलता है।

3. "ट्री एडिट डिस्टेंस" (ब्लूप्रिंट की तुलना)

दो मंजिलों के बीच के अंतर को मापने के लिए, StructLens केवल ईंटों की तुलना नहीं करता है; यह ब्लूप्रिंट (पेड़/ट्री) की तुलना करता है।

  • यदि फ्लोर 10 और फ्लोर 11 का ट्री स्ट्रक्चर लगभग एक जैसा है, तो वे "करीब" (रिडंडेंट) हैं।
  • यदि फ्लोर 10 में एक ऐसा ट्री है जो एक फैमिली ट्री जैसा दिखता है, और फ्लोर 11 में एक ऐसा ट्री है जो कॉर्पोरेट ऑर्ग चार्ट जैसा दिखता है, तो वे "दूर" (अलग काम करने वाले) हैं।

इसे Tree Edit Distance कहा जाता है। यह पूछने जैसा है कि, "फ्लोर 10 के ब्लूप्रिंट को फ्लोर 11 के ब्लूप्रिंट में बदलने के लिए कितने कट और पेस्ट की आवश्यकता होगी?"

यह क्यों मायने रखता है? (व्यावहारिक जादू)

पेपर दिखाता है कि यह स्ट्रक्चरल दृश्य केवल विज्ञान के लिए नहीं है; यह प्रूनिंग (छंटाई) के लिए उपयोगी है।

  • लक्ष्य: AI मॉडल बहुत बड़े और चलाने में महंगे होते हैं। हम मॉडल की बुद्धिमत्ता को नुकसान पहुँचाए बिना "अतिरिक्त चर्बी" (रिडंडेंट लेयर्स) को हटाना चाहते हैं।
  • गलती: यदि आप पुराने तरीकों (जैसे केवल शब्द की स्थिति की तुलना करना) का उपयोग करते हैं, तो आप एक ऐसी लेयर को काट सकते हैं जो अपने पड़ोसी के समान दिखती है लेकिन वास्तव में संरचना के लिए एक महत्वपूर्ण, अद्वितीय कार्य कर रही है।
  • सुधार: StructLens का उपयोग करते हुए, शोधकर्ताओं ने पाया कि वे यह पहचान सकते थे कि कौन सी लेयर्स वास्तव में रिडंडेंट थीं। केवल कच्चे डेटा के बजाय पेड़ों की संरचना के आधार पर लेयर्स को काटकर, वे मॉडल को उतना ही स्मार्ट (या कभी-कभी उससे भी स्मार्ट!) रखते हुए उसके 10-25% लेयर्स को हटा सके।

सारांश

StructLens ऐसा है जैसे शोधकर्ताओं को एक नया चश्मा दे दिया गया हो।

  • पहले: वे शब्दों और लेयर्स का एक धुंधला दृश्य देखते थे।
  • अब: वे AI की विचार प्रक्रिया का कंकाल (स्केलेटन) देख सकते हैं। वे प्रोसेसिंग के "द्वीप", उनके बीच के "पुल", और यह देख सकते हैं कि फैक्ट्री के कौन से हिस्से भारी काम कर रहे हैं और कौन से बस खड़े हैं।

यह हमें न केवल यह समझने में मदद करता है कि AI क्या जानता है, बल्कि यह भी कि वह उस ज्ञान को कैसे व्यवस्थित करता है, जिससे हम छोटे, तेज़ और अधिक कुशल AI मॉडल बना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →