← नवीनतम पेपर
💬 NLP

Can We Infer Confidential Properties of Training Data from LLMs?

यह शोध पत्र PropInfer को प्रस्तुत करता है, जो यह मूल्यांकन करने के लिए एक बेंचमार्क है कि क्या लार्ज लैंग्वेज मॉडल्स (LLMs) प्रॉपर्टी इन्फरेंस हमलों के प्रति संवेदनशील हैं, और नए हमले के तरीकों के माध्यम से यह प्रदर्शित करता है कि फाइन-ट्यूनिंग के दौरान LLMs वास्तव में संवेदनशील, डेटासेट-स्तरीय गोपनीय जानकारी लीक कर सकते हैं।

मूल लेखक: Pengrun Huang, Chhavi Yadav, Kamalika Chaudhuri, Ruihan Wu

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Pengrun Huang, Chhavi Yadav, Kamalika Chaudhuri, Ruihan Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक खास सूप की एक गुप्त रेसिपी है। आप किसी को यह नहीं बताना चाहते कि आप उसमें कितना नमक या लहसुन इस्तेमाल करते हैं क्योंकि वह आपका "व्यापारिक रहस्य" है। रेसिपी पूरी तरह बताने के बजाय, आप बस लोगों को सूप चखने देते हैं। आप सोच सकते हैं, "जब तक मैं उन्हें रेसिपी कार्ड नहीं देता, मेरा रहस्य सुरक्षित है।"

लेकिन क्या होगा अगर कोई चतुर फूड क्रिटिक (खाद्य समीक्षक) आपके सूप का स्वाद ले ले और स्वाद के सूक्ष्म संकेतों का विश्लेषण करके यह पता लगा ले कि आपके लहसुन और प्याज के अवयवों का सटीक प्रतिशत क्या है?

यह शोध पत्र बिल्कुल इसी बारेंे में है।

मुख्य समस्या: डेटा का "स्वाद" (The "Flavor" of Data)

जब कंपनियाँ या अस्पताल लार्ज लैंग्वेज मॉडल्स (जैसे ChatGPT) को प्रशिक्षित करते हैं, तो वे विशेष डेटासेट्स का उपयोग करते हैं। उदाहरण के लिए, एक अस्पताल चिकित्सा संबंधी सलाह देने के लिए AI को सिखाने हेतु हजारों डॉक्टर-मरीज संवादों का उपयोग कर सकता है।

शोधकर्ताओं ने पाया कि भले ही आप किसी विशिष्ट मरीज का नाम "लीक" न करें (व्यक्तिगत गोपनीयता), AI अनजाने में पूरे समूह का "स्वाद" (डेटासेट-लेवल प्रॉपर्टी) सीख लेता है।

यदि अस्पताल के प्रशिक्षण डेटा में बहुत अधिक महिला मरीज हैं, तो AI सूक्ष्म भाषाई संकेतों का उपयोग करना शुरू कर सकता—जैसे "गर्भावस्था" या "स्त्री रोग विशेषज्ञ" का उल्लेख करना। एक हमलावर इन भाषाई संकेतों को "चखकर" यह पता लगा सकता है कि, "आहा! इस अस्पताल के निजी डेटाबेस में 70% लोग महिलाएं हैं।" यह गोपनीयता (confidentiality) का उल्लंघन है, भले ही किसी एक व्यक्ति की पहचान चोरी न हुई हो।

दो "मास्टर शेफ" (हमले के प्रकार)

शोधकर्ताओं ने इन रहस्यों को चुराने के लिए AI को "चखने" के दो तरीके बनाए:

  1. "नमूना ऑर्डर करें" हमला (ब्लैक-बॉक्स जनरेशन):
    कल्पना कीजिए कि आप एक रेस्तरां में जाते हैं और 100 अलग-अलग कटोरे सूप का ऑर्डर देते हैं। आपको रेसिपी नहीं पता, और आप रसोई देख नहीं सकते। आप बस हर कटोरे का स्वाद लेते हैं और गिनती रखते हैं: "यह लहसुन जैसा है, यह नहीं है, यह है..." जब तक आप 100 कटोरे खा लेते हैं, आप शेफ के गुप्त अनुपात का बहुत सटीक अनुमान लगा सकते हैं। शोधकर्ताओं ने इसी तरह प्रॉम्प्ट्स का उपयोग करके AI को "बात" करने के लिए प्रेरित किया और फिर कुछ विषयों का उल्लेख कितनी बार किया, इसकी गिनती की।

  2. "इमिटेशन शेफ" हमला (शैडो-मॉडल/शब्द आवृत्ति):
    यह अधिक परिष्कृत है। कल्पना कीजिए कि आप एक प्रसिद्ध शेफ के गुप्त अनुपात को जानना चाहते हैं। आप घर जाते हैं और 50 अलग-अलग संस्करणों में सूप पकाते हैं, जिसमें आप जानबूझकर लहसुन के स्तर को बदलते हैं। आप इस बात के विशेषज्ञ बन जाते हैं कि "अधिक लहसुन" से गंध और रूप कैसे बदलता है। फिर, आप प्रसिद्ध शेफ के रेस्तरां में जाते हैं, उनके बर्तन से उठती भाप को देखते हैं, और कहते हैं, "लहसुन के कणों के उड़ने के विशिष्ट तरीके के आधार पर, मुझे दावानुसार लगता है कि आपका अनुपात ठीक 12% है।" शोधकर्ताओं ने ऐसा करने के लिए "शैडो" AI को प्रशिक्षित किया ताकि यह सीखा जा सके कि विशिष्ट शब्द आवृत्तियाँ (word frequencies) डेटा के आधार पर कैसे बदलती हैं।

निष्कर्ष: यह इस पर निर्भर करता है कि आप कैसे "पकाते" हैं

शोधकर्ताओं ने पाया कि इन हमलों की सफलता इस बात पर निर्भर करती है कि AI को कैसे प्रशिक्षित किया गया था:

  • "प्रश्न-उत्तर" शैली: यदि AI को केवल उत्तर प्रदान करने के लिए प्रशिक्षित किया जाता है (जैसे एक पाठ्यपुस्तक), तो सरल जनरेशन के माध्यम से रहस्य चुराना कठिन है, लेकिन "इमिटेशन शेफ" (शब्द आवृत्ति) हमला अविश्वसनीय रूप से प्रभावी होता है।
  • "चैट" शैली: यदि AI को एक पूर्ण बातचीत की नकल करने के लिए प्रशिक्षित किया जाता है (जैसे एक वास्तविक व्यक्ति), तो "नमूना ऑर्डर करें" हमले का उपयोग करना बहुत आसान है क्योंकि AI लगातार बातचीत का "स्वाद" लीक करता रहता है।

यह क्यों मायने रखता है?

यह शोध पत्र एक चेतावनी है। यह कंपनियों को बताता है: "सिर्फ इसलिए कि आप कच्चा डेटा नहीं दिखा रहे हैं, इसका मतलब यह नहीं है कि आपके रहस्य सुरक्षित हैं।"

यदि कोई AI संवेदनशील डेटा पर प्रशिक्षित है—जैसे कि किसी निश्चित शहर में कितने लोगों को एक विशिष्ट बीमारी है या कितने ग्राहक कम आय वाले हैं—तो वह जानकारी AI के व्यक्तित्व में "पकी हुई" (baked into) होती है। शोधकर्ता बेहतर "रेसिपी" और "रक्षा प्रणालियों" का आह्वान कर रहे हैं ताकि यह सुनिश्चित हो सके कि जब हम AI को नई चीजें सिखाते हैं, तो हम अनजाने में उसे अपने रहस्य उगलना न सिखा दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →