← नवीनतम पेपर
🤖 machine learning

Membership Inference Attacks on Discrete Diffusion Language Models

यह शोध पत्र प्रदर्शित करता है कि फाइन-ट्यून्ड मास्कड डिफ्यूजन लैंग्वेज मॉडल्स (Masked Diffusion Language Models), रिकंस्ट्रक्शन लॉस-आधारित क्लासिफायर और व्यावहारिक शैडो मॉडल ट्रांसफर हमलों के माध्यम से उच्च सफलता दर प्राप्त करके, पहले की तुलना में काफी अधिक मेंबरशिप इन्फरेंस हमलों के प्रति संवेदनशील हैं।

मूल लेखक: Shailesh Kasivelrajan

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shailesh Kasivelrajan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र है जिसने गुप्त पाठ्यपुस्तकों का एक विशिष्ट सेट पढ़ा है। आप जानना चाहते हैं कि क्या उसके द्वारा लिखा गया एक विशेष वाक्य उन गुप्त पाठ्यपुस्तकों से आया है या उसने उसे बस मौके पर ही बना लिया है। यह मेंबरशिप इन्फरेंस अटैक (MIA) का मूल समस्या है: यह पता लगाना कि क्या डेटा का एक टुकड़ा मॉडल की प्रशिक्षण "स्मृति" (मेमोरी) का हिस्सा था।

यह शोध पत्र एक नए प्रकार के AI छात्र की जांच करता जिसे मास्क्ड डिफ्यूजन लैंग्वेज मॉडल (MDLM) कहा जाता है। पारंपरिक AI के विपरीत जो एक बार में एक शब्द लिखता है (जैसे क्रॉसवर्ड पहेली भरना), यह नया AI एक वाक्य को देखकर काम करता है जिसमें कुछ शब्द रैंडम तरीके से छिपे हुए (मास्स्ड) होते हैं और फिर वह अनुमान लगाने की कोशिश करता है कि वे क्या थे।

यहाँ शोधकर्ताओं ने जो पाया है उसका सरल विवरण दिया गया है:

1. नया "मेमोरी टेस्ट"

शोधकर्ताओं ने पाया कि ये नए AI मॉडल अपने रहस्यों को उजागर करने के प्रति हमारी सोच से कहीं अधिक असुरक्षित हैं।

  • पुराना तरीका ("वन-शॉट" अनुमान): पिछले तरीकों ने यह अनुमान लगाने की कोशिश की कि क्या कोई वाक्य प्रशिक्षण सेट में था या नहीं, इसके लिए एक एकल स्कोर को देखा: "मॉडल ने गायब शब्दों का कितनी अच्छी तरह से अनुमान लगाया?" यह छात्र से पूछने जैसा था, "क्या आपने इसे सही बताया?"
  • नया तरीका ("ट्रैजेक्टरी" टेस्ट): शोधकर्ताओं ने महसूस किया कि अंतिम स्कोर की तुलना में अनुमान लगाने की प्रक्रिया अधिक महत्वपूर्ण है। उन्होंने यह देखा कि जैसे-जैसे अधिक शब्दों को छिपाया जाता है, मॉडल के प्रदर्शन में कैसे बदलाव आता है।
    • उपमा: कल्पना कीजिए कि छात्र को एक वाक्य को फिर से बनाने के लिए कहा जा रहा है।
      • यदि वाक्य नया है (उनकी स्मृति में नहीं है), तो जैसे-जैसे अधिक शब्द छिपाए जाते हैं, वे अधिक संघर्ष करते हैं। उनका प्रदर्शन लगातार गिरता जाता है।
      • यदि वाक्य पुराना है (उनके प्रशिक्षण से है), तो वे इसमें बहुत आसानी से काम करते हैं। भले ही आप वाक्य का आधा हिस्सा छिपा दें, वे इसे इतनी अच्छी तरह से याद रखते हैं कि उनका प्रदर्शन उच्च और सुचारू बना रहता है।
    • इस "परफॉरमेंस कर्व" (प्रदर्शन वक्र) या ट्रैजेक्टरी को कठिनाई के चार अलग-अलग स्तरों पर ट्रैक करके, शोधकर्ता उच्च सटीकता के साथ बता सके कि क्या वह वाक्य प्रशिक्षण सेट में शामिल था।

2. परिणाम: एक स्मार्ट जासूस

शोधकर्ताओं ने एक "जासूस" (एक कंप्यूटर प्रोग्राम) बनाया जो इन प्रदर्शन वक्रों को देखता है।

  • स्कोर: छह विभिन्न प्रकार के टेक्स्ट (जैसे मेडिकल पेपर, कोड और विकिपीडिया) वाले एक मानक परीक्षण में, उनका जासूस लगभग 88% बार सही था।
  • प्रतिद्वंद्विता को हराना: यह पिछले सबसे अच्छे तरीके (जिसे SAMA कहा जाता है) से काफी बेहतर था, जो केवल 82% बार सही था। नया तरीका एक आवर्धक लेंस (magnifying glass) से उच्च-शक्ति वाले सूक्ष्मदर्शी (microscope) में अपग्रेड करने जैसा है।

3. "शैडो" ट्रिक (लक्ष्य के बिना हमला करना)

आमतौर पर, इस तरह के हमले को अंजाम देने के लिए, आपको उस विशिष्ट मॉडल को देखने की आवश्यकता होती है जिस पर आप हमला कर रहे हैं। लेकिन क्या होगा यदि आप ऐसा नहीं कर सकते?

  • उपमा: कल्पना कीजिए कि आप जानना चाहते हैं कि क्या किसी विशिष्ट व्यक्ति ने एक किताब याद की है, लेकिन आपको उस व्यक्ति से बात करने की अनुमति नहीं है। इसके बजाय, आप तीन अन्य छात्रों को बिल्कुल उसी शिक्षण पद्धति का उपयोग करके अलग-अलग किताबों पर प्रशिक्षित करते हैं।
  • परिणाम: शोधकर्ताओं ने इन "शैडो" छात्रों को असंबंधित डेटा पर प्रशिक्षित किया। फिर, उन्होंने इन शैडो छात्रों से सीखे गए पैटर्न का उपयोग करके लक्षित मॉडल पर हमला किया। आश्चर्यजनक रूप से, यह "शैडो" हमला लक्षित मॉडल तक सीधी पहुंच होने के लगभग उतना ही प्रभावी रहा! यह केवल 2% कम सटीक था। यह साबित करता है कि आपको अपने रहस्यों को चुराने के लिए मूल मॉडल की आवश्यकता नहीं है; आपको बस यह समझने की आवश्यकता है कि इसे कैसे प्रशिक्षित किया गया है।

4. वास्तव में क्या मायने रखता है? (असली "सीक्रेट सॉस")

शोधकर्ताओं ने अपने "जासूस" का विश्लेषण किया ताकि यह देखा जा सके कि कौन से सुराग वास्तव में उपयोगी थे। उन्होंने दो आश्चर्यजनक चीजें पाईं:

  • विजेता: परफॉरमेंस कर्व (जैसे-जैसे शब्द छिपाए जाते हैं, मॉडल का आत्मविश्वास कैसे बदलता है) सबसे महत्वपूर्ण सुराग था। यदि आप इसे हटा देते, तो जासूस की सटीकता गिर जाती।
  • हारने वाला: उन्होंने मॉडल के आंतरिक "अटेंशन मैप्स" (वह हिस्सा जिस पर मॉडल ने वाक्य के लिए ध्यान केंद्रित किया) को देखा। उन्होंने पाया कि ये इस विशिष्ट हमले के लिए बेकार थे।
    • उपमा: यह किसी के द्वारा पढ़ी गई किताब का अनुमान लगाने के लिए यह देखने जैसा है कि उन्होंने किन शब्दों को रेखांकित (underline) किया है। शोधकर्ताओं ने पाया कि रेखांकन की शैली विषय (जैसे कोड मेडिकल टेक्स्ट से अलग दिखता है) के लिए बहुत विशिष्ट थी, जिससे यह विभिन्न पुस्तकों के बीच उपयोगी नहीं रही। हालांकि, उनके द्वारा टेक्स्ट को याद करने की गति एक सार्वभौमिक संकेत था।

5. निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि ये नए "डिफ्यूजन" भाषा मॉडल अपने प्रशिक्षण डेटा को प्रकट करने के लिए आश्चर्यजनक रूप से आसान हैं।

  • केवल यह देखकर कि जैसे-जैसे अधिक शब्द छिपाए जाते हैं, मॉडल का आत्मविश्वास कैसे बदलता है, एक हमलावर उच्च सटीकता के साथ बता सकता है कि क्या कोई टेक्स्ट प्रशिक्षण सेट का हिस्सा था।
  • यह भेद्यता (vulnerability) तब भी मौजूद रहती है जब हमलावर के पास मूल मॉडल न हो, बशर्ते कि वे व्यवहार की नकल करने के लिए एक "शैडो" मॉडल को प्रशिक्षित कर सकें।

संक्षेप में: इन नए AI मॉडलों का एक "कौशल" (tell) है। जब वे उस टेक्स्ट को याद करने की कोशिश कर रहे होते हैं जिसे उन्होंने पहले देखा है, तो वे नए टेक्स्ट का अनुमान लगाने की तुलना में अलग तरह से व्यवहार करते हैं। शोधकर्ताओं ने उस कौशल को पहचानने का एक तरीका खोज लिया है, जो यह साबित करता है कि ये मॉडल उतने निजी नहीं हो सकते जितना हम उम्मीद करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →