← नवीनतम पेपर
💬 NLP

Extracting Training Data from Diffusion Language Models via Infilling

यह शोध पत्र "इनफिलिंग एक्सट्रैक्शन" (infilling extraction) को प्रस्तुत करता है यह प्रदर्शित करने के लिए कि डिफ्यूजन लैंग्वेज मॉडल, ऑटोरिग्रेसिव मॉडलों की तुलना में प्रशिक्षण डेटा मेमोराइजेशन (memorization) के प्रति काफी अधिक संवेदनशील हैं, क्योंकि उनकी द्विदिश डिनोइजिंग (bidirectional denoising) क्षमताएं हमलावरों को एज-कंडीशन्ड मास्क (edge-conditioned masks) का उपयोग करके, रेडैक्टेड व्यक्तिगत पहचान योग्य जानकारी सहित, तीन गुना अधिक वर्बेटिम (verbatim) अनुक्रमों को निकालने की अनुमति देती हैं।

मूल लेखक: Yihan Wang, N. Asokan

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yihan Wang, N. Asokan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अत्यंत बुद्धिमान पुस्तकालय सहायक (एक लार्ज लैंग्वेज मॉडल) है जिसने लाखों किताबें, ईमेल और दस्तावेज़ पढ़े हैं। आप जानना चाहते हैं: यदि कोई इस सहायक से उसकी याददाश्त से एक विशिष्ट वाक्य दोहराने के लिए कहता है, तो इसकी कितनी संभावना है कि वह राज उगल दे?

लंबे समय तक, शोधकर्ताओं ने केवल इसे शुरुआत से "वाक्य पूरा करने" के लिए कहकर टेस्ट किया है। यह किसी को कहानी का पहला आधा हिस्सा दिखाने और फिर उसे बाकी हिस्सा अनुमान लगाने के लिए कहने जैसा है। यह मानक एआई मॉडलों के लिए अच्छा काम करता है जो इंसानों की तरह बाएं-से-दाएं पढ़ते हैं।

लेकिन यह पेपर एक नए प्रकार के एआई को पेश करता है जिसे डिफ्यूजन लैंग्वेज मॉडल (DLM) कहा जाता है। एक DLM को केवल एक पाठक के रूप में नहीं, बल्कि एक क्षतिग्रस्त पेंटिंग को बहाल करने वाले (restorer) के रूप में सोचें। यदि आप एक उत्कृष्ट कृति (masterpiece) लेते हैं और उसके यादृच्छिक हिस्सों को सफेद पेंट (मास्क) से ढक देते हैं, तो DLM का काम पूरे चित्र को देखना है—जो बाईं ओर है, जो दाईं ओर है, और जो बीच में है—और यह अनुमान लगाना है कि छिपे हुए हिस्से क्या होने चाहिए।

लेखक कहते हैं: "हे, हम इन पेंटिंग रिस्टोरर्स को गलत तरीके से टेस्ट कर रहे हैं!"

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. पुराना तरीका बनाम नया तरीका

  • पुराना तरीका (प्रिफिक्स-कंडीशन्ड): कल्पना कीजिए कि आप रिस्टोरर को पेंटिंग का केवल बायां किनारा दिखाते हैं और पूछते हैं, "आगे क्या आता है?" पेपर में पाया गया कि यदि आप केवल ऐसा करते हैं, तो DLM काफी सुरक्षित दिखता है। यह बहुत अधिक गुप्त जानकारी लीक नहीं करता है।
  • नया तरीका (इनफिलिंग एक्सट्रैक्शन): लेखकों ने महसूस किया कि क्योंकि DLM दोनों तरफ देख सकते हैं, इसलिए एक चालाक हमलावर वाक्य के बीच के हिस्से को ढक सकता है और पूछ सकता है, "खाली स्थान भरें।" या, वे सिरों को ढक सकते हैं और पूछ सकते हैं, "बीच में क्या है?"
    • उपमा: यह "मैड लिब्स" (Mad Libs) जैसा खेल खेलने जैसा है। यदि आप एआई को वाक्य की शुरुआत और अंत देते हैं, तो यह बीच के शब्द का सटीक अनुमान लगाने में सक्षम हो सकता है, भले ही यह केवल शुरुआत मिलने पर अंत का अनुमान न लगा पाता।

2. बड़ी खोज: "एज" (किनारा) खतरे का क्षेत्र है

शोधकर्ताओं ने टेक्स्ट को छिपाने के विभिन्न तरीकों (मास्किंग) का परीक्षण किया। उन्होंने पाया कि आप टेक्स्ट को कैसे छिपाते हैं, यह आपकी सोच से कहीं अधिक महत्वपूर्ण है।

  • "एज" प्रभाव: यदि आप वाक्य की शुरुआत और अंत दोनों को प्रकट करते हैं (बीच को छिपाते हैं), तो DLM सटीक शब्दों को लीक करने की तीन गुना अधिक संभावना रखता है, बजाय इसके कि आप केवल शुरुआत प्रकट करें।
  • क्यों? क्योंकि DLM दोनों तरफ के सुरागों का उपयोग करके बीच के हिस्से को पुनर्गठित करता है। यह एक तीसरे व्यक्ति को एक गुप्त बात का शुरू और अंत फुसफुसाने वाले दो लोगों की तरह है; वे पूरे रहस्य को बहुत आसानी से समझ सकते हैं, जितना कि यदि केवल एक व्यक्ति शुरुआत फुसफुसाता।

3. "रिडैक्टेड डॉक्यूमेंट" (संशोधित दस्तावेज़) परिदृश्य

यह पेपर एक बहुत ही वास्तविक डरावनी स्थिति को देखता है:

  • कल्पना कीजिए कि एक कंपनी अपने निजी ईमेल पर एआई को प्रशिक्षित करती है लेकिन मॉडल या डेटा जारी करने से पहले सभी फोन नंबरों और नामों को ब्लैक आउट (रिडैक्ट) कर देती है।
  • हमला: एक हैकर मॉडल लेता है और कहता है, "मेरे पास वह ईमेल है जिसमें नाम को ब्लैक आउट किया गया है। कृपया खाली स्थान भरें।"
  • परिणाम: भले ही एआई को रिडैक्टेड डेटा पर प्रशिक्षित किया गया था, लेकिन "पेंटिंग रिस्टोरर" (DLM) इतना अच्छा है कि वह आसपास के संदर्भ (context) को देखकर, अक्सर ब्लैक-आउट किए गए नाम या नंबर का अनुमान लगा सकता है, जो एक मानक "किताब पढ़ने वाले" एआई की तुलना में बेहतर है।
  • सीख: केवल इसलिए कि आपने प्रशिक्षण डेटा में संवेदनशील जानकारी को ब्लैक आउट कर दिया है, इसका मतलब यह नहीं है कि एआई उसे याद नहीं रखेगा। वास्तव में, इस प्रकार के एआई के लिए, यदि आप उसे दोनों तरफ से संदर्भ देते हैं, तो गुप्त जानकारी का अनुमान लगाना आसान हो सकता है।

4. "रेस्टोरेशन" सेटिंग्स को ट्यून करना

शोधकर्ताओं ने यह भी पाया कि टेक्स्ट को "बहाल" करने के लिए उपयोग किए जाने वाले सेटिंग्स (जैसे कि एआई कितने स्टेप्स लेता है) बदल देते हैं कि यह कितना लीक करता है।

  • धीमा और स्थिर: यदि आप एआई को खाली स्थानों को भरने के लिए कई छोटे, सावधानीपूर्ण कदम उठाने के लिए मजबूर करते हैं, तो यह अधिक गुप्त जानकारी लीक करता है।
  • तेज़ और लापरवाह: यदि आप इसे जल्दी से अनुमान लगाने के लिए कहते हैं, तो यह कम लीक करता है।
  • सबक: आप जो "नॉब्स" (knobs) गति या बुद्धिमत्ता के लिए घुमाते हैं, वे यह भी नियंत्रित करते हैं कि यह कितना याद रखता है। आप गति के लिए एक नॉब को बिना सुरक्षा को प्रभावित किए नहीं बदल सकते।

5. फाइन-ट्यूनिंग इसे ठीक नहीं करती है

अंत में, उन्होंने पूछा: "यदि हम बाद में एआई को एक विनम्र चैटबॉट बनने के लिए सिखाते हैं (जिसे SFT कहा जाता है), तो क्या वह रहस्य भूल जाता है?"

  • उत्तर: नहीं। यह एक तोते को नए शब्द सिखाकर गाली देने से रोकने की कोशिश करने जैसा है। तोता शायद कभी-कभी बोलना बंद कर दे, लेकिन यदि आप सही सवाल पूछते हैं (उस "एज" ट्रिक का उपयोग करके), तो वह अभी भी पुराना रहस्य उगल देगा। स्मृति अभी भी वहीं है; बस उसे पुनर्व्यवस्थित किया गया है।

सारांश

यह पेपर चेतावनी देता है कि डिफ्यूजन लैंग्वेज मॉडल केवल किताब पढ़ने वाले नहीं, बल्कि पेंटिंग रिस्टोरर्स की तरह हैं। यदि आप केवल उन्हें शुरुआत से वाक्य पूरा करने के लिए कहकर टेस्ट करते हैं, तो आपको लगता है कि वे सुरक्षित हैं। लेकिन यदि आप उन्हें वाक्य के बीच को भरने के लिए टेस्ट करते हैं (दोनों तरफ के सुरागों का उपयोग करके), तो उनके द्वारा निजी जानकारी लीक करने की संभावना बहुत अधिक होती है, भले ही वह जानकारी उनके प्रशिक्षण डेटा से हटा दी गई हो।

मुख्य निष्कर्ष: हमें इन मॉडलों को केवल एक आँख खुली रखकर (बाएं-से-दाएं देखते हुए) टेस्ट करना बंद करना होगा और उन्हें दोनों आँखें खोलकर (पूरी तस्वीर देखते हुए) टेस्ट करना शुरू करना होगा, अन्यथा हम बहुत कम अनुमान लगाएंगे कि वे कितनी निजी जानकारी अपने पास रखे हुए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →