← नवीनतम पेपर
🤖 machine learning

modelDNA: Calibrated Lineage Verification and Merge Decomposition from Sampled Weight Fingerprints

यह शोध पत्र modelDNA प्रस्तुत करता है, जो एक ऐसा टूल है जो आंशिक HTTP रीड्स से प्राप्त कैलिब्रेटेड फिंगरप्रिंट्स का उपयोग करके मॉडल वंशावली (lineage) को सत्यापित करता है और वेट मर्जेस (weight merges) को डिकम्पोज़ करता है, जिससे पूर्ण मॉडल डाउनलोड की आवश्यकता के बिना बेंचमार्क पर सटीक परिणाम प्राप्त होते हैं।

मूल लेखक: Muhammad Awais Bin Adil, Saad Aamir

प्रकाशित 2026-07-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Awais Bin Adil, Saad Aamir

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

AI मॉडल्स के लिए DNA डिटेक्टिव

कल्पना कीजिए कि इंटरनेट की सबसे बड़ी AI मस्तिष्क लाइब्रेरी (जिसे Hugging Face कहा जाता है) लगभग तीस लाख मॉडल "घरों" वाला एक अराजक शहर है। इस शहर में, कोई भी घर बना सकता है, लेकिन सामने के दरवाजे पर "हाउस X के ब्लूप्रिंट से निर्मित" का साइन लगाना वैकल्पिक है। वास्तव में, इनमें से 60% से अधिक घरों पर कोई साइन ही नहीं है। कभी-कभी, एक निर्माता दावा करता है कि उन्होंने शून्य से एक नया घर बनाया है, लेकिन वास्तव में, उन्होंने बस किसी और के ब्लूप्रिंट की नकल की है, उन पर पेंट कर दिया है, या दो घरों को आपस में मिला दिया है।

लंबे समय तक, यह पता लगाने के लिए कि किसने किसकी नकल की, एक सुपरकंप्यूटर, एक पूरा सप्ताहांत और बहुत सारी किस्मत वाले जासूस की आवश्यकता होती थी। यदि कोई विवाद छिड़ जाता—जैसे कि जब दो कंपनियां इस बात पर बहस करती हैं कि किसका विशिष्ट AI मस्तिष्क है—तो स्कोर तय करने के लिए कोई तटस्थ उपकरण नहीं था।

पेश है modelDNA। इसे एक फॉरेंसिक स्कैनर के रूप में समझें जिसे घर में रहने या पूरी चीज़ को डाउनलोड करने की आवश्यकता नहीं है। इसके बजाय, यह मॉडल की वेट फाइलों (weight files) का एक त्वरित "फिंगरप्रिंट" लेता है।

"त्वरित स्कैन" का जादू

सामान्य रूप से, एक मानक 7-बिलियन-पैरामीटर वाले AI मॉडल को डाउनलोड करना पूरे समुद्र को पीने की कोशिश करने जैसा है; यह एक विशाल 15 GB की फ़ाइल है। modelDNA अधिक स्मार्ट है। इसे केवल फ़ाइल के लगभग 100 से 300 MB को देखने की आवश्यकता होती है।

कैसे? कल्पना कीजिए कि फ़ाइल एक विशाल पुस्तक है। हर शब्द पढ़ने के बजाय, modelDNA के पास एक गुप्त मानचित्र है जो इसे बताता है कि किन पृष्ठों को पलटना है। यह केवल सही पैराग्राफ (मॉडल के अंदर के विशिष्ट गणितीय भाग) पढ़ता है ताकि एक अद्वितीय आईडी कार्ड बनाया जा सके। इसमें एक सामान्य लैपटॉप पर लगभग दो मिनट का समय लगता है, किसी ग्राफ़िक्स कार्ड की आवश्यकता नहीं है।

यह स्कैनर गणित के भीतर छिपे चार अलग-अलग प्रकार के "सुरागों" (सिग्नल्स) की तलाश करता है:

  1. लय (The Rhythm): अटेंशन लेयर्स कैसे "धड़कती" हैं (स्टैंडर्ड डेविएशन)।
  2. आकार (The Shape): संख्याओं का समग्र आकार और दिशा।
  3. पैटर्न (The Pattern): संख्याओं के विशिष्ट नमूनों की सीधे तुलना।
  4. स्पेक्ट्रम (The Spectrum): डेटा में छिपी आवृत्तियाँ (frequencies) जो डेटा के इधर-उधर होने पर भी जीवित रहती हैं।

निर्णय: "सांख्यिकीय रूप से सुसंगत," न कि "दोषी"

इस टूल को अविश्वसनीय रूप से सावधान रहने के लिए डिज़ाइन किया गया है। यह किसी निर्दोष मॉडल पर कॉपीकैट होने का आरोप लगाने के बजाय "मुझे यकीन नहीं है" कहना पसंद करेगा। जब यह एक मॉडल को स्कैन करता है, तो यह अपने फिंगरप्रिंट की तुलना 37 ज्ञात "पैरेंट" मॉडल्स (जैसे Llama, Mistral, Qwen और अन्य) के डेटाबेस से करता है।

फिर यह आपको आठ प्रकार के निर्णय देता है:

  • सटीक प्रतिलिपि (Exact Copy): "यह एक क्लोन है।"
  • क्वांटाइज्ड प्रतिलिपि (Quantized Copy): "यह एक क्लोन है, लेकिन इसे एक छोटे बॉक्स में फिट होने के लिए सिकोड़ा गया है।"
  • फाइन-ट्यून (Fine-Tune): "यह उस पैरेंट का बच्चा है, जिसे नए डेटा पर प्रशिक्षित किया गया है।"
  • संभावित मिश्रण (Likely Merge): "यह दो या अधिक पैरेंट्स का मिश्रण है।"
  • एक ही परिवार (अनिर्णीत) (Same Family - Unresolved): "वे चचेरे भाई हैं, लेकिन मैं यह नहीं बता सकता कि कौन सा सीधा पैरेंट है।"
  • कोई मिलान नहीं (No Match): "यह हमारे डेटाबेस में किसी से भी संबंधित नहीं लगता है।"
  • अपर्याप्त (Insufficient): "मुझे निर्णय लेने के लिए पर्याप्त सुराग नहीं मिले।"
  • परहेज (Abstention): "मैं कुछ भी कहने के लिए पर्याप्त आश्वस्त नहीं हूँ।"

यदि टूल को कोई मिलान मिलता है, तो यह एक प्रायिकता स्कोर (probability score) देता है। उदाहरण के लिए, यह कह सकता है, "वेट्स (weights) Mistral-7B से व्युत्पन्न होने के लिए सांख्यिकीय रूप से सुसंगत हैं, जिसकी प्रायिकता 0.99 है।" यह कभी नहीं कहता कि "यह एक कॉपी है"; यह कहता है कि गणित उस कहानी के साथ मेल खाता है।

"स्मूदी" रहस्य: मिश्रणों को अनमिक्स करना

one of the coolest tricks modelDNA जो कर सकता है वह है मर्ज डिकंपोजिशन (merge decomposition)। कल्पना कीजिए कि कोई स्ट्रॉबेरी स्मूदी और ब्लूबेरी स्मूदी लेता है, उन्हें मिलाता है, और दावा करता है कि यह एक नया "बेरी ब्लास्ट" फ्लेवर है। क्या आप बता सकते हैं कि इसमें कितना स्ट्रॉबेरी और कितना ब्लूबेरी है?

AI की दुनिया में, लोग मॉडल्स को आपस में मिलाते हैं (mergekit जैसे टूल्स का उपयोग करके)। modelDNA उस "बेरी ब्लास्ट" फिंगरप्रिंट को देख सकता है और गणितीय रूप से रेसिपी को रिवर्स-इंजीनियर कर सकता है। क्योंकि मिश्रण की प्रक्रिया रैखिक (linear) होती है (जैसे संख्याओं को जोड़ना), टूल सटीक प्रतिशत खोजने के लिए एक पहेली को हल कर सकता है।

परीक्षणों में, इसने एक "slerp" मर्ज (मिश्रण का एक विशिष्ट प्रकार) के लिए रेसिपी को 0.999 के सहसंबंध (correlation) के साथ सफलतापूर्वक रिकवर किया, और इसने "dare_ties" मर्ज के प्रतिशत को मूल रेसिपी के भीतर 0.011 के भीतर प्राप्त किया। इसने यह बिना कभी पूरे मॉडल्स को डाउनलोड किए किया, केवल छोटे फिंगरप्रिंट्स का उपयोग करके।

यह क्या नहीं कर सकता (नियम)

यह पेपर इस टूल के बारे में बहुत ईमानदार है कि यह क्या नहीं कर सकता:

  • "मन पढ़ना" नहीं (No Mind Reading): यह पता नहीं लगा सकता कि क्या किसी मॉडल को "डिस्टिल" (दूसरे मॉडल के उत्तरों द्वारा सिखाया गया, न कि उसके वेट्स द्वारा) किया गया था। यदि शिक्षक ने छात्र के वेट्स को कभी छुआ ही नहीं, तो फिंगरप्रिंट इसे नहीं दिखा पाएगा।
  • "जादुई उम्मीदवार सूची" नहीं (No Magic Candidate List): स्मूदी को अनमिक्स करने के लिए, आपको यह जानना होगा कि कौन से फल हो सकते हैं। यदि आप modelDNA को एक मॉडल को अनमिक्स करने के लिए कहते हैं लेकिन आपको संभावित पैरेंट्स की सूची प्रदान नहीं करते हैं, तो यह तत्काल रेसिपी के बजाय "वंशानुक्रम" (पूर्वजों) का अनुमान लगा सकता है।
  • "पूर्ण प्रमाण" नहीं (No Perfect Proof): टूल स्वीकार करता है कि एक दृढ़ निश्चयी हैकर फिंगरप्रिंट को नकली बनाने की कोशिश कर सकता है। हालांकि टूल चार अलग-अलग सुरागों का उपयोग करता है जिससे नकली बनाना कठिन हो जाता है, यह अभेद्य होने का दावा नहीं करता है।
  • ऑन-द-फ्लाई "डीप लर्निंग" नहीं (No Deep Learning on the Fly): यह यह देखने के लिए मॉडल को नहीं चलाता है कि वह सवालों के जवाब कैसे देता है; यह केवल स्थिर गणितीय फाइलों को देखता है।

ट्रैक रिकॉर्ड

लेखकों ने इसका परीक्षण 15 वास्तविक मॉडल्स पर किया जिनके ज्ञात पैरेंट्स थे (जिन्हें बनाने वाली संस्थाओं द्वारा सत्यापित किया गया था)। उन्होंने इन्हें 107 "हार्ड नेगेटिव्स" (ऐसे मॉडल्स जो समान दिखते हैं लेकिन संबंधित नहीं हैं) के खिलाफ रखा।

परिणाम सटीक थे:

  • AUROC 1.0: यह वास्तविक मिलानों को नकली से अलग करने के लिए एक आदर्श स्कोर है।
  • शून्य गलत सकारात्मक (Zero False Positives): इसने कभी भी एक असंबंधित मॉडल पर पैरेंट होने का आरोप नहीं लगाया।
  • 13/13 सही: इसने प्रत्येक परीक्षण मामले के लिए शीर्ष पैरेंट की सही पहचान की।

हालाँकि, पेपर नोट करता है कि यह एक "छोटा शहर" वाला परीक्षण है (15 मॉडल्स)। जबकि परिणाम अब तक एकदम सही हैं, लेखक सावधान करते हैं कि इसका मतलब यह नहीं है कि कभी भी गलत होना असंभव है। वे सुनिश्चित करने के लिए एक बड़ा परीक्षण बना रहे हैं।

निचोड़

modelDNA एक ऐसा टूल है जो अराजक AI शहर में व्यवस्था लाता है। यह आरोप नहीं लगाता; यह साक्ष्य प्रस्तुत करता है। यह कहता है, "गणित के आधार पर जिसे हमने देखा, वह मॉडल उस एक का बच्चा होने की 99% संभावना रखता है।" यह एक अव्यवस्थित, अपुष्ट इंटरनेट को एक ऐसी जगह में बदल देता है जहाँ वंश को जांचा, सत्यापित किया जा और यहाँ तक कि अन-मिक्स भी किया जा सकता है, और यह सब कॉफी बनाने के समय में होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →