← नवीनतम पेपर
💬 NLP

Matrix-Driven Identification and Reconstruction of LLM Weight Homology

यह शोध पत्र MDIR प्रस्तुत करता है, जो एक नवीन, इन्फरेंस-मुक्त विधि है जो मैट्रिक्स विश्लेषण और लार्ज डेविएशन थ्योरी का लाभ उठाकर बड़े भाषा मॉडलों के बीच वेट होमोलॉजी (weight homology) का सटीक रूप से पता लगाने और सांख्यिकीय रूप से मान्य करने के लिए है, जिसने LeaFBench बेंचमार्क पर पूर्ण प्रदर्शन प्राप्त किया है।

मूल लेखक: Ruichong Zhang, Daniel Goldstein

प्रकाशित 2026-02-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruichong Zhang, Daniel Goldstein

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास अरबों छोटे, आपस में जुड़े हुए गियरों से बनी दो विशाल, जटिल मशीनें हैं। एक मशीन मूल ब्लूप्रिंट (खाका) है, और दूसरी उसका एक संशोधित संस्करण है। शायद किसी ने मूल को लिया, उसके कुछ गियरों को पुनर्व्यवस्थित किया, उन्हें एक अलग रंग से रंगा, या यहाँ तक कि कुछ हिस्सों को थोड़े बड़े संस्करण से बदल दिया।

बड़ा सवाल यह है: क्या दूसरी मशीन वास्तव में पहली वाली से ही बनी है, या किसी ने बस एक नई मशीन शून्य से बनाई है जो दिखने में समान है?

यह समस्या है जिसे पेपर "Matrix-Driven Identification and Reconstruction of LLM Weight Homology" हल करता है। लेखकों, रुइचोंग झांग और डैनियल गोल्डस्टीन ने इस सवाल का जवाब देने के लिए एक नया टूल बनाया है जिसे MDIR कहा जाता है।

MDIR कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: एक "दिखने में समान" मशीन

AI की दुनिया में, कंपनियाँ अक्सर मौजूदा मॉडल को लेकर उसमें बदलाव करती हैं। वे ऐसा कर सकते हैं:

  • Fine-tune करना: उन्हें नए कौशल सिखाना।
  • Prune करना: उन्हें छोटा और तेज़ बनाने के लिए काट-छाँट करना।
  • Upcycle करना: एक छोटे मॉडल को लेकर उसे एक विशाल मॉडल में बदलना।
  • Obfuscate करना: अंदर के नंबरों (weights) को बदलकर बदलावों को छिपाने की कोशिश करना।

पुराने तरीके इन संबंधों का पता लगाने के लिए मॉडलों से सवाल पूछते थे (जैसे ब्लैक-बॉक्स टेस्ट) या इस बात की तुलना करते थे कि डेटा को प्रोसेस करते समय वे कैसा "महसूस" करते हैं। लेकिन ये तरीके ऐसे हैं जैसे दो लोगों को कविता सुनाने के लिए कहकर यह बताने की कोशिश करना कि क्या वे संबंधित हैं। यदि दोनों ने एक ही कविता याद की है, तो वे समान लग सकते हैं भले ही वे संबंधित न हों।

2. समाधान: "DNA" की जाँच

MDIR मॉडलों से बात नहीं करता है। इसके बजाय, यह सीधे मशीन के भीतर के ब्लूप्रिंट्स (गणितीय भार/weights) को देखता है।

मॉडल के वेट्स को एक विशाल, जटिल DNA स्ट्रैंड के रूप में सोचें। भले ही कोई DNA को पुनर्व्यवस्थित करे (permutation) या उसे खींचे (scaling), मौलिक "अनुक्रम" बना रहता है। MDIR इस अनुक्रम को खोजने के लिए एक विशेष गणितीय लेंस का उपयोग करता है।

प्रक्रिया:

  1. "फिंगरप्रिंट" स्कैन: MDIR मॉडलों के "एम्बेडिंग" लेयर को देखता है। यह एक इमारत की नींव को देखने जैसा है। यदि दो इमारतें एक ही नींव पर बनी हैं, तो नींव के पत्थर मेल खाएंगे, भले ही ऊपरी मंजिलें अलग दिखें।
  2. "पहेली" सुलझाना: यह टूल मॉडल A के टुकड़ों को मॉडल B में फिट करने की कोशिश करता है। यह पूछता है: "यदि मैं इन नंबरों को घुमाऊं या पलट दूं, तो क्या वे पूरी तरह से मेल खाते हैं?" यह इस पहेली को सुलझाने के लिए एक प्रसिद्ध एल्गोरिदम (हंगेरियन एल्गोरिदम) का उपयोग करता है, जिससे यह पता चलता है कि गियरों को किस तरह से पुनर्व्यवस्थित किया गया था।
  3. "सिक्का उछालने" का परीक्षण: यह सबसे चतुर हिस्सा है। एक बार जब MDIR को मिलान मिल जाता है, तो वह एक सांख्यिकीय प्रश्न पूछता है: "दो पूरी तरह से असंबंधित मशीनों के संयोग से इस तरह से मेल खाने की क्या संभावना है?"
    • Large Deviation Theory नामक गणित की एक शाखा का उपयोग करके, MDIR एक p-value की गणना करता है।
    • यदि p-value बहुत कम है (जैसे 1 नील में 1), तो इसका मतलब है कि मिलान कोई संयोग नहीं है। यह उनके पारिवारिक संबंध का प्रमाण है।
    • पेपर का दावा है कि ये p-values इतने छोटे (जैसे 10100010^{-1000}) हैं कि इनका संयोग से होना लगभग असंभव है।

3. MDIR क्या कर सकता है (इसकी महाशक्तियाँ)

पेपर उन चीजों पर प्रकाश डालता है जो MDIR कर सकता है जो पिछले टूल्स नहीं कर सके:

  • यह "स्कैम्बल" के पार देख सकता है: भले ही कोई गियरों के क्रम को बदलकर (permutation) या उनके आकार को बदलकर (scaling) संबंध को छिपाने की कोशिश करे, MDIR फिर भी कनेक्शन ढूंढ सकता है। यह किसी व्यक्ति को पहचानने जैसा है भले ही वह मास्क पहने हो और पीछे की ओर चल रहा हो।
  • यह विभिन्न "ब्लूप्रिंट्स" पर काम करता है: यह उन मॉडलों की तुलना कर सकता है जिनके शब्दकोश (शब्दों का सेट) अलग हैं या यहाँ तक कि अलग संख्या में लेयर्स (अलग ऊँचाई) वाले मॉडल हैं। यह साझा शब्दावली को खोजने के लिए "साझा शब्दावली" का उपयोग करता है।
  • यह "फैमिली ट्री" बनाता है: यह केवल यह नहीं कहता कि "हाँ, वे संबंधित हैं।" यह दिखा सकता है कि कैसे। उदाहरण के लिए, यह प्रकट कर सकता है कि एक छोटा मॉडल एक बड़े मॉडल के पहले 10 लेयर्स और अंतिम 10 लेयर्स से बना है, बीच के हिस्से को छोड़कर। यह एक नक्शा बनाता है कि कौन सा हिस्सा कहाँ से आया है।
  • यह तेज़ और हल्का है: इसे टेक्स्ट जेनरेट करने के लिए मॉडल चलाने की आवश्यकता नहीं है। यह केवल नंबरों को देखता है। इसका मतलब है कि यह सुपरकंप्यूटर के बजाय एक लैपटॉप पर भी चल सकता है।

4. परिणाम: पूर्ण स्कोर

लेखकों ने LeaFBench नामक बेंचमार्क पर अन्य तरीकों के मुकाबले MDIR का परीक्षण किया।

  • अन्य तरीकों ने 80% से 99% के आसपास स्कोर प्राप्त किया।
  • MDIR ने सटीकता (accuracy) पर 100% और एरिया-अंडर-द-कर्व (area-under-the-curve) मीट्रिक पर 100% प्राप्त किया।
  • सरल शब्दों में: इसने कभी भी संबंध को मिस नहीं किया, और इसने कभी भी असंबंधित मॉडलों पर संबंध होने का गलत आरोप नहीं लगाया।

5. यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर MDIR को जवाबदेही और पारदर्शिता के उपकरण के रूप में प्रस्तुत करता है।

  • यदि कोई कंपनी दावा करती है कि उन्होंने शून्य से एक मॉडल बनाया है, लेकिन MDIR दिखाता है कि यह वास्तव में एक प्रतिस्पर्धी के मॉडल की नकल है जिसमें कुछ नंबरों को बदला गया है, तो यह साहित्यिक चोरी (plagiarism) का सबूत है।
  • यह बौद्धिक संपदा की रक्षा करने में मदद करता है क्योंकि यह एक कठोर, गणितीय "स्मोकिंग गन" (ठोस सबूत) प्रदान करता है जिसे चुनौती देना कठिन है।

सारांश उपमा

दो शेफ की कल्पना करें।

  • पुराना तरीका: आप उनसे एक व्यंजन बनाने के लिए कहते हैं। यदि वे दोनों लाज़ानिया (lasagna) बनाते हैं, तो आप मान लेते हैं कि वे संबंधित हो सकते हैं। लेकिन हो सकता है कि वे दोनों बस एक प्रसिद्ध कुकबुक से सीखे हों।
  • MDIR: आप उनके किचन में जाते हैं और उनके मसालों के जार देखते हैं। आप देखते हैं कि शेफ B का "सीक्रेट स्पाइस" का जार वास्तव में शेफ A का जार है, लेकिन लेबल उल्टा है और जार थोड़ा बड़ा है। आप गणना करते हैं कि दो रैंडम शेफ के पास बिल्कुल एक जैसा अनूठा मसाला मिश्रण और ठीक उसी आकार का जार होने की क्या संभावना है। संभावना शून्य है। इसलिए, शेफ B को शेफ A से मसाला चुराया हुआ ही माना जाएगा।

MDR AI मॉडलों के लिए वही मसाला निरीक्षक (spice jar inspector) है। यह केवल अंतिम आउटपुट को देखकर नहीं, बल्कि गणितीय DNA को देखकर साबित करता है कि किसने किससे नकल की है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →