← नवीनतम पेपर
💬 NLP

Learning the Signature of Memorization in Autoregressive Language Models

यह शोध पत्र Learned Transfer MIA (LT-MIA) को प्रस्तुत करता है, जो पहला हस्तांतरणीय (transferable) सीखा हुआ मेंबरशिप इन्फरेंस अटैक (membership inference attack) है, जो फाइन-ट्यूनिंग द्वारा उत्पन्न अपरिवर्तनीय "मेमोराइजेशन के सिग्नेचर" (signature of memorization) का लाभ उठाकर, हैंड-क्राफ्टेड ह्यूरिस्टिक्स या शैडो मॉडल्स पर निर्भर रहे बिना, विविध आर्किटेक्चरल परिवारों (मैम्बा और RWKV सहित) और डेटा डोमेन (प्राकृतिक भाषा और कोड) में उत्कृष्ट, ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त करता है।

मूल लेखक: David Ilić, Kostadin Cvejoski, David Stanojević, Evgeny Grigorenko

प्रकाशित 2026-04-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: David Ilić, Kostadin Cvejoski, David Stanojević, Evgeny Grigorenko

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास किताबों का एक विशाल पुस्तकालय है (इंटरनेट)। कोई उस पुस्तकालय से किताबों का एक विशिष्ट सेट लेता है, उन्हें पढ़ता है, और फिर उन पर आधारित एक नया, बेहतर संस्करण लिखता है। यह नया पुस्तक एक "फाइन-ट्यून्ड" (fine-tuned) भाषा मॉडल है।

बड़ा सवाल यह है: क्या हम बता सकते हैं कि क्या कोई विशिष्ट वाक्य मूल रूप से उपयोग की गई किताबों के सेट में मौजूद था?

लंबे समय तक, सुरक्षा विशेषज्ञों ने इस उत्तर को खोजने के लिए "हस्त-निर्मित" (hand-crafted) नियमों को बनाने की कोशिश की। यह एक भीड़ में किसी विशिष्ट व्यक्ति को खोजने जैसा था जैसे कि कहना, "लाल टोपी पहने और नीले छाते के साथ किसी को ढूँढो।" कभी-कभी यह काम करता था, लेकिन यह पूरी तरह से डिजाइनर के अनुमान पर निर्भर था। यदि व्यक्ति ने हरे रंग की टोपी पहनी होती, तो नियम विफल हो जाता।

यह नया शोध पत्र इसे करने का एक स्मार्ट तरीका पेश करता है, जिसे LT-MIA (Learned Transfer MIA) कहा जाता है। यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है:

1. "अनंत क्लास" (Infinite Class) की ट्रिक

आमतौर पर, कंप्यूटर को पैटर्न पहचानने के लिए सिखाने के लिए, आपको एक "शैडो क्लास" (shadow class) की आवश्यकता होती है। आपको 100 अलग-अलग मॉडल प्रशिक्षित करने होंगे, कंप्यूटर को बताना होगा कि किन लोगों ने विशिष्ट डेटा को याद किया है, और फिर उसे अंतर पहचानना सिखाना होगा। लेकिन विशाल AI मॉडल के साथ, 100 मॉडल को प्रशिक्षित करना बहुत महंगा और धीमा है।

पेपर का अंतर्दृष्टि (Insight):
लेखकों ने महसूस किया कि उन्हें शैडो मॉडल बनाने की आवश्यकता नहीं है। उन्होंने महसूस किया कि जब भी आप किसी मॉडल को लेते हैं और उसे नई चीजें सिखाते हैं (फाइन-ट्यूनिंग), तो आप स्वचालित रूप से एक आदर्श "लेबल वाला डेटासेट" बना देते हैं।

  • उपमा: कल्पना कीजिए कि आप एक जासूस हैं। संदिग्धों पर नज़र रखने के लिए 100 जासूसों को काम पर रखने के बजाय, आप महसूस करते हैं कि हर बार जब संदिग्ध कॉफी खरीदता है, तो रसीद पर स्वचालित रूप से "संदेशित यहाँ था" की मुहर लग जाती है। आपके पास रसीदों का एक अनंत भंडार है बस संदिग्ध द्वारा कॉफी खरीदने के माध्यम से। आपको जासूसों को काम पर रखने की आवश्यकता नहीं है; आपको बस रसीदें पढ़ने की आवश्यकता है।

2. "यूनिवर्सल फिंगरप्रिंट" (Universal Fingerprint)

शोधकर्ताओं ने अपने AI जासूस को विशेष रूप से ट्रांसफॉर्मर्स (Transformers - सबसे सामान्य प्रकार का AI आर्किटेक्चर, जैसे ChatGPT के पीछे का है) पर प्रशिक्षित किया।

फिर, उन्होंने इसे पूरी तरह से अलग प्रकार के AI आर्किटेक्चर पर परखा:

  • Mamba: "स्टेट स्पेस" (मेमोरी बैंक की तरह) का उपयोग करता है।
  • RWKV: "लीनियर अटेंशन" (एक तेज़, लीनियर स्कैन की तरह) का उपयोग करता है।
  • RecurrentGemma: "गेटेड रिकरेंस" (एक लूप की तरह) का उपयोग करता है।

चौंकाने वाला परिणाम:
उनका AI जासूस, जिसे केवल ट्रांसफॉर्मर्स पर प्रशिक्षित किया गया था, इन पूरी तरह से अलग AI प्रकारों पर भी पूरी तरह से काम कर गया।

  • उपमा: कल्पना कीजिए कि आप एक कुत्ते को "गोल्डन रिट्रीवर" को पहचानने के लिए सिखाते हैं। आप उम्मीद करते हैं कि वह "सियामीज़ बिल्ली" दिखाने पर विफल हो जाएगा। लेकिन इस मामले में, AI ने कुत्ते के आकार को नहीं, बल्कि प्रशिक्षण की गंध (scent of the training) को सीखा।
  • यह पता चला कि जब कोई भी AI डेटा से सीखता है, तो वह अपनी भविष्यवाणियों पर एक विशिष्ट "गंध" (सांख्यिकीय हस्ताक्षर) छोड़ देता है। चाहे AI एक ट्रांसफॉर्मर की तरह सोचे, स्टेट-स्पेस मॉडल की तरह, या रिकरेंट लूप की तरह, डेटा को याद करने की क्रिया एक ही फिंगरप्रिंट छोड़ती है।

3. सीखना बनाम डिजाइन करना (Learning vs. Designing)

पिछले तरीके एक ऐसे शेफ की तरह थे जो किसी व्यंजन को एक बार चखकर और अनुमान लगाकर यह बताने की कोशिश कर रहा था कि "शायद इसमें नमक की अधिक आवश्यकता है?"
यह नया तरीका एक ऐसे शेफ की तरह है जो 30 अलग-अलग रसोईघरों के 30 अलग-अलग व्यंजनों को चखता है। AI सीखता है, "आह, जब भी कोई व्यंजन इस विशिष्ट सामग्री के साथ बनाया जाता है, तो स्वाद का प्रोफाइल इस विशिष्ट तरीके से बदल जाता है।" यह अनुमान लगाना बंद कर देता है और वास्तव में क्या महत्वपूर्ण है, उसे सीखना शुरू कर देता है।

4. यह क्यों मायने रखता है (The "Smoking Gun")

यह पेपर साबित करता है कि मेमोराइजेशन (याद रखना) इन AI के सीखने के तरीके का एक मौलिक दुष्प्रभाव है, न कि कोई बग जिसे AI के आर्किटेक्चर को बदलकर ठीक किया जा सके।

  • उपमा: यदि आप एक गुप्त डायरी के आधार पर कहानी लिखते हैं, तो कहानी में अनिवार्य रूप से उस डायरी के निशान होंगे, चाहे आप उसे पेन, टाइपराइटर या वॉयस रिकॉर्डर के साथ लिखें। उपकरण (आर्किटेक्चर) को बदलना रहस्य को नहीं छिपाता है; "लीकेज" लिखने की क्रिया में ही निहित है।

परिणाम

  • सटीकता (Accuracy): नया तरीका सभी पिछले "अनुमान लगाने वाले" तरीकों की तुलना में काफी बेहतर है।
  • गति (Speed): यह उन मॉडलों पर तुरंत काम करता है जिन्हें इसने पहले कभी नहीं देखा (Zero-Shot)।
  • दायरा (Scope): यह कोड पर भी काम करता है, भले ही इसे केवल प्राकृतिक भाषा पाठ (natural language text) पर प्रशिक्षित किया गया हो।

निचोड़ (The Bottom Line)

यह पेपर खेल बदल देता है। यह मेंबरशिप इन्फरेंस (यह जांचना कि डेटा का उपयोग किया गया था या नहीं) को "नियमों के अनुमान" के खेल से बदलकर "डीप लर्निंग" के खेल में ले जाता है। यह हमें बताता है कि जब तक AI मॉडल को मानक तरीकों का उपयोग करके प्रशिक्षित किया जाता है, वे हमेशा उस डेटा का एक पता लगाने योग्य "हस्ताक्षर" छोड़ेंगे जिसे उन्होंने याद किया है, चाहे उनका आंतरिक मस्तिष्क संरचना कितनी भी शानदार या भिन्न क्यों न हो।

संक्षेप में: आप केवल AI के आर्किटेक्चर को बदलकर अपने प्रशिक्षण डेटा को नहीं छिपा सकते। "मेमोरी" एक ऐसा फिंगरप्रिंट छोड़ती है जिसे एक स्मार्ट, प्रशिक्षित डिटेक्टर हमेशा ढूंढ सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →