← नवीनतम पेपर
💬 NLP

What Makes Two Language Models Think Alike?

यह शोध पत्र तंत्रिका गतिविधि (neural activity) को व्याख्या योग्य भाषाई विशेषताओं में मैप करने की एक नवीन विधि प्रस्तुत करता है ताकि यह प्रकट किया जा सके कि 43 विविध भाषा मॉडलों के बीच समानताएं मुख्य रूप से उनके रिलीज होने की तिथि और मॉडल परिवार द्वारा संचालित होती हैं, न कि उनके पैमाने या आर्किटेक्चरल क्लास द्वारा।

मूल लेखक: Louis Jalouzot, Christophe Pallier, Emmanuel Chemla, Yair Lakretz

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Louis Jalouzot, Christophe Pallier, Emmanuel Chemla, Yair Lakretz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास अलग-अलग तरह के शेफ से भरा एक कमरा है। कुछ को फ्रांसीसी व्यंजन (French cuisine) का प्रशिक्षण मिला है, कुछ को जापानी का, और कुछ स्व-शिक्षित (self-taught) हैं। उन सभी का एक ही काम है: रेसिपी में अगले घटक (ingredient) की भविष्यवाणी करना।

बड़ा सवाल जो शोधकर्ताओं ने पूछा: क्या ये शेफ वास्तव में सामग्रियों के बारे में एक ही तरह से सोचते हैं?

उदाहरण के लिए, जब एक शेफ एक वाक्य देखता है जैसे "The cat chased the mouse" (बिल्ली ने चूहे का पीछा किया), तो क्या वे इस बात पर ध्यान केंद्रित करते हैं कि यह जानवरों के बारे में एक कहानी है (syntax/वाक्य संरचना), या वे केवल "cat" और "mouse" जैसे विशिष्ट शब्दों पर ध्यान केंद्रित करते हैं (vocabulary/शब्दावली)?

पुराना तरीका: "आकार" को मापना

पहले, वैज्ञानिक इन शेफ (AI मॉडल्स) की तुलना उनके आंतरिक विचारों के "आकार" को देखकर करने की कोशिश करते थे। कल्पना कीजिए कि आप प्रत्येक शेफ द्वारा काउंटर पर सामग्रियों को व्यवस्थित करने के तरीके की फोटो ले रहे हैं। यदि फोटो ज्यामितीय रूप से समान दिखती हैं, तो वैज्ञानिकों ने माना कि शेफ एक ही तरह से सोच रहे हैं।

लेकिन इसमें एक समस्या थी: यह एक ब्लैक बॉक्स की तरह था। यह आपको यह तो बता सकता था कि दो शेफ ने सामग्रियों को समान रूप से व्यवस्थित किया है, लेकिन यह नहीं बता सकता था कि क्यों। शायद दोनों ने चीजों को रंग के आधार पर समूहबद्ध किया, या शायद दोनों ने वजन के आधार पर। पुराना तरीका "क्यों" को स्पष्ट नहीं कर सका।

नया तरीका: "भाषाई हस्ताक्षर" (Linguistic Signature)

यह पेपर शेफ के दिमाग के अंदर झांकने का एक नया, सरल तरीका पेश करता है। केवल व्यवस्था के आकार को देखने के बजाय, वे पूछते हैं: "इस शेफ के लिए प्रत्येक विशिष्ट नियम कितना महत्वपूर्ण है?"

उन्होंने Metric-Learning Encoding Model (MLEM) नामक एक टूल बनाया। इसे एक अनुवादक (translator) के रूप में समझें जो शेफ के अव्यवस्थित, जटिल आंतरिक विचारों को भाषाई विशेषताओं (Linguistic Features) के एक सरल रिपोर्ट कार्ड में बदल देता है।

यह रिपोर्ट कार्ड ऐसी चीजों को सूचीबद्ध करता है जैसे:

  • काल (Tense): क्या वाक्य भूतकाल के बारे में है या भविष्य के बारे में?
  • विषय (Subject): क्या वाक्य एक व्यक्ति के बारे में है या कई लोगों के बारे में?
  • वाक्य संरचना (Sentence Structure): क्या यह एक सरल वाक्य है या एक जटिल वाक्य जिसमें "relative clause" (जैसे "The man who is wearing a hat..." - वह आदमी जिसने टोपी पहनी है) है?

यह टूल मापता है कि जब ये नियम बदलते हैं, तो शेफ के आंतरिक विचार कितने बदलते हैं। यदि भूतकाल से भविष्य काल में स्विच करने पर शेफ के विचार बहुत तेजी से बदलते हैं, तो उस विशेषता का उनके रिपोर्ट कार्ड पर उच्च स्कोर (high score) है। इस रिपोर्ट कार्ड को "भाषाई हस्ताक्षर" (Linguistic Signature) कहा जाता है।

प्रयोग: 43 शेफ, 10 परिवार

शोधकर्ताओं ने 43 अलग-अलग AI मॉडल (शेफ) का परीक्षण किया। ये मॉडल विभिन्न "परिवारों" (जैसे Llama परिवार, GPT परिवार, या Mamba परिवार) से आए थे और उनके आकार (छोटे से लेकर विशाल तक) और आर्किटेक्चर (मस्तिष्क बनाने के अलग-अलग तरीके) भी अलग-अलग थे।

उन्होंने प्रत्येक मॉडल की भाषाई हस्ताक्षर की तुलना हर दूसरे मॉडल के साथ की।

बड़ी खोज: यह "परिवार" और "युग" के बारे में है, "आकार" के बारे में नहीं

परिणाम आश्चर्यजनक थे। शोधकर्ताओं ने पाया कि दो मॉडलों को एक जैसा सोचने के लिए क्या बनाता है, यह इस पर निर्भर नहीं करता कि वे कितने बड़े हैं, बल्कि इस पर कि उनके माता-पिता कौन हैं और वे कब पैदा हुए थे।

  1. परिवार सबसे अधिक मायने रखता है: एक ही परिवार के मॉडल (जैसे, सभी "Llama" मॉडल) के बहुत समान हस्ताक्षर होते हैं, भले ही उनमें से एक छोटा हो और दूसरा बहुत बड़ा। उन्हें एक ही "प्रशिक्षण रेसिपी" और आर्किटेक्चरल ब्लूप्रिंट के साथ पाला गया था, इसलिए उन्होंने समान भाषाई नियमों को प्राथमिकता देना सीखा।
  2. रिलीज़ की तारीख मायने रखती है: मॉडल रिलीज़ होने की तारीख समानता का सबसे मजबूत भविष्यवक्ता थी। यह कहने के समान है कि, "2024 में प्रशिक्षित शेफ 2020 में प्रशिक्षित शेफ की तरह सोचते हैं।" ऐसा इसलिए है क्योंकि पूरा उद्योग समय के साथ अपनी तकनीकों को एक साथ बदलता है (नए एक्टिवेशन फंक्शन, बेहतर ट्रेनिंग डेटा, आदि)।
  3. आकार शैली को निर्धारित नहीं करता: केवल एक मॉडल को बड़ा बनाने (अधिक पैरामीटर जोड़ने) से वह अचानक पूरी तरह से अलग प्रकार के मॉडल की तरह सोचना शुरू नहीं कर देता। एक ही परिवार का एक छोटा मॉडल और एक विशाल मॉडल अभी भी एक ही "भाषाई प्राथमिकताओं" को साझा करते हैं।

विचार का "लूप" (The "Loop" of Thought)

शोधकर्ताओं ने यह भी देखा कि जैसे-जैसे जानकारी मॉडल की परतों (layers) के माध्यम से आगे बढ़ती है (जैसे रिले रेस में संदेश का गुजरना), ये हस्ताक्षर कैसे बदलते हैं।

उन्होंने पाया कि एक ही परिवार के मॉडल एक ही पथ का अनुसरण करते हैं। वे एक निश्चित फोकस के साथ शुरू करते हैं, मध्य परतों में जटिलता के शिखर पर पहुँचते हैं, और फिर अंत में एक सरल फोकस की ओर वापस लौट आते हैं। यह एक लूप की तरह है। यह बताता है कि भले ही मॉडल अलग-अलग आकार के हों, वे भाषा की समस्या को एक ही "डांस स्टेप्स" में हल करते हैं।

निष्कर्ष

संक्षेप में, यह पेपर तर्क देता है कि हमें यह समझने के लिए कि कोई AI कैसे सोचता है, केवल यह नहीं देखना चाहिए कि वह कितना "बड़ा" या "जटिल" है। इसके बजाय, हमें उसके भाषाई हस्ताक्षर को देखना चाहिए—एक प्रोफाइल कि वह किन नियमों की परवाह करता है।

अध्ययन दिखाता है कि मॉडल की आर्किटेक्चर और स्केल (पैमाना) से अधिक महत्वपूर्ण उसका "परिवार" और "पीढ़ी" है। दो मॉडल अलग तरह से बनाए जा सकते हैं और वे अलग आकार के हो सकते हैं, लेकिन यदि वे एक ही परिवार और युग से आते हैं, तो वे संभवतः समान भाषाई विशेषताओं को प्राथमिकता देंगे, जिससे वे एक जैसा "सोचते" हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →