← नवीनतम पेपर
🤖 machine learning

It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs

यह शोध पत्र SELFCI को प्रस्तुत करता है, जो एक पूरक स्व-विमर्दीकरण (self-distillation) ढांचा है जो 'प्रोडक्ट-ऑफ-एक्सपर्ट्स' दृष्टिकोण के माध्यम से कार्य प्रदर्शन और प्रासंगिक अखंडता (contextual-integrity) को संयुक्त रूप से अनुकूलित करके लार्ज लैंग्वेज मॉडल्स में गोपनीयता-उपयोगिता के बीच के संतुलन को हल करता है, और महंगी बाहरी पर्यवेक्षण की आवश्यकता के बिना मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Sangwoo Park, Woongyeong Yeo, Seanie Lee, Yumin Choi, Hyomin Lee, Kangsan Kim, Jinheon Baek, Seong Joon Oh, Sung Ju Hwang

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sangwoo Park, Woongyeong Yeo, Seanie Lee, Yumin Choi, Hyomin Lee, Kangsan Kim, Jinheon Baek, Seong Joon Oh, Sung Ju Hwang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक व्यक्तिगत सहायक (एक बड़े लैंग्वेज मॉडल की तरह) है जो आपके बारे में सब कुछ जानता है: आपका नाम, आपका मेडिकल इतिहास, आपका पासपोर्ट नंबर, आपकी पसंदीदा कॉफी का ऑर्डर और आपकी गुप्त डायरी के नोट्स।

आपका लक्ष्य इस सहायक को आपके लिए होटल का कमरा बुक करने में मदद करने के लिए तैयार करना है। आप चाहते हैं कि यह आपके नाम और आपके पसंदीदा चेक-इन की तारीख का उपयोग करके आरक्षण करे। हालाँकि, आप नहीं चाहते कि यह गलती से आपका पासपोर्ट नंबर या आपका मेडिकल इतिहास होटल क्लर्क को बता दे, भले ही यह चीजें उसे पता हों।

यह उस शोध पत्र का मुख्य विषय है, जिसे कॉन्टेक्स्टुअल इंटीग्रिटी (Contextual Integrity) कहा जाता है। यह विचार है कि गोपनीयता केवल जानकारी को "छिपाने" के बारे में नहीं है; यह इस बारे में है कि सही जानकारी को सही संदर्भ में साझा करना। होटल क्लर्क के साथ अपना पासपोर्ट साझा करना वीज़ा के लिए आवश्यक हो सकता है, लेकिन केवल एक ट्विन रूम बुक करने के लिए अपना पासपोर्ट साझा करना गोपनीयता का उल्लंघन है।

समस्या: "सब-या-कुछ-नहीं" का जाल (The "All-or-Nothing" Trap)

शोधकर्ताओं ने पाया कि मौजूदा AI सहायक इस संतुलन बनाने में संघर्ष करते हैं।

  • बहुत अधिक निजी (Too Private): यदि आप AI को कहते हैं "बहुत निजी रहो," तो यह कुछ भी साझा करने से डर सकता है। यह होटल को आपका नाम या चेक-इन की तारीख बताना भूल सकता है, और अंततः आपके पास कोई कमरा नहीं बचेगा। यह एक घबराए हुए वेटर की तरह है जो गलती करने के डर से आपका ऑर्डर लेने से मना कर देता है।
  • बहुत अधिक खुला (Too Open): यदि आप AI को अपनी मर्जी से काम करने देते हैं, तो यह आपके रहस्य उगल सकता है। यह कह सकता है, "ज़रूर, मैं कमरा बुक कर दूँगा, और वैसे, यह रहा आपका पासपोर्ट नंबर और आपका मेडिकल इतिहास!" क्योंकि इसे लगता है कि "अधिक जानकारी = बेहतर सेवा।"

इसे ठीक करने के मौजूदा तरीके आमतौर पर AI को निजी बनाने के लिए एक एकल, सीधा निर्देश (जैसे एक रिवॉर्ड स्कोर) देने की कोशिश करते हैं। शोध पत्र का तर्क है कि यह किसी को केवल यह कहकर गाड़ी चलाना सिखाने जैसा है कि "दुर्घटना न करें।" यह उसे एक साथ स्टीयरिंग चलाने और ब्रेक लगाने के बारे में नहीं सिखाता है।

समाधान: SELFCI (दो-शिक्षक प्रणाली)

शोध पत्र एक नया तरीका प्रस्तावित करता है जिसे SELFCI कहा जाता है। एक महंगे बाहरी विशेषज्ञ को AI को सिखाने के बजाय, AI अपने ही दिमाग से एक चतुर "दो-शिक्षक" प्रणाली का उपयोग करके खुद को सिखाता है।

AI को एक ऐसे छात्र के रूप में सोचें जो एक आदर्श ईमेल लिखना सीखने की कोशिश कर रहा है। सीखने के लिए, वह अपने ही मस्तिष्क से दो काल्पनिक शिक्षक बनाता है:

  1. "उपयोगिता" शिक्षक (The Helpful Expert): यह शिक्षक कार्य को देखता है और कहता है, "इस कमरे को बुक करने के लिए, आपको नाम, तारीख और कमरे का प्रकार शामिल करना अनिवार्य है। यदि आप इन्हें छोड़ देते हैं, तो कार्य विफल हो जाएगा।" यह शिक्षक सुनिश्चित करता है कि AI मददगार बना रहे और काम पूरा करे।
  2. "गोपनीयता" शिक्षक (The Security Guard): यह शिक्षक उसी कार्य को देखता है और कहता है, "इस कमरे को बुक करने के लिए, आपको पासपोर्ट नंबर या मेडिकल इतिहास शामिल नहीं करना चाहिए। यदि आप इसे शामिल करते हैं, तो आप गोपनीयता नियमों का उल्लंघन कर रहे हैं।" यह शिक्षक सुनिश्चित करता है कि AI सुरक्षित रहे।

यह कैसे काम करता है: अच्छे व्यवहार का "वेन आरेख" (Venn Diagram)

SELFCI का जादू यह है कि यह AI को इन दोनों शिक्षकों में से किसी एक को चुनने के लिए नहीं कहता है। इसके बजाय, यह AI से उस प्रतिच्छेदन (Intersection) को खोजने के लिए कहता है जहाँ दोनों शिक्षक सहमत हों।

एक वेन आरेख की कल्पना करें:

  • एक घेरा है "उपयोगी चीजें" (Helpful Stuff)।
  • दूसरा घेरा है "सुरक्षित चीजें" (Safe Stuff)।
  • बीच का स्वीट स्पॉट (Sweet Spot) है "उपयोगी और सुरक्षित" (Helpful AND Safe)।

AI केवल वही जानकारी आउटपुट करना सीखता है जो उस बीच वाले स्थान में आती है। यह सीखता है कि, "मैं नाम साझा करूँगा (उपयोगी + सुरक्षित) लेकिन पासपोर्ट को छिपा दूँगा (सुरक्षित नहीं)।"

शोध पत्र इसे प्रोडक्ट-ऑफ-एक्सपर्ट्स (Product-of-Experts) कहता है। इसे एक सुरक्षा चेकपॉइंट की तरह समझें जहाँ आपको पास होने के लिए दो अलग-अलग गार्डों से अपने पासपोर्ट पर स्टैम्प लगवाना होता है। यदि एक गार्ड "ना" कहता है (गोपनीयता शिक्षक), तो आप पास नहीं होते, भले ही दूसरा गार्ड "हाँ" कहे (उपयोगिता शिक्षक)। यदि दोनों "हाँ" कहते हैं, तभी आप पास होते हैं।

यह बेहतर क्यों है?

शोधकर्ताओं ने विभिन्न AI मॉडलों (जैसे Qwen और Llama) पर इसका परीक्षण किया और पाया कि:

  • यह तेज़ और सस्ता है: अन्य तरीकों के विपरीत जिनमें हजारों परीक्षण-और-त्रुटि (Reinforcement Learning की तरह) की आवश्यकता होती है, SELFCI अपने स्वयं के तर्क को देखकर कुशलतापूर्वक सीखता है।
  • यह AI को खराब नहीं करता: अन्य तरीके अक्सर AI को इतना सतर्क बना देते हैं कि वह मददगार होना बंद कर देता है। SELFCI AI को स्मार्ट और सक्षम बनाए रखते हुए उसे निजी बनाता है।
  • यह वास्तविक दुनिया में काम करता है: उन्होंने जटिल परिदृश्यों पर इसका परीक्षण किया जहाँ AI को बातचीत की एक लंबी सूची (संचित स्मृति/accumulated memory) को याद रखना होता है और यह तय करना होता है कि अभी क्या साझा किया जाए। पुराने तरीकों की तुलना में SELFCI यह याद रखने में बहुत बेहतर था कि क्या प्रासंगिक है और किसे भूलना है।

संक्षेप में

यह शोध पत्र AI सहायकों को संदर्भगत रूप से स्मार्ट (Contextually Smart) बनाने का एक तरीका पेश करता है। केवल "गुप्त" या "बातूनी" होने के बजाय, AI एक पेशेवर बटलर (बड़ा नौकर) की तरह कार्य करना सीखता है: वह जानता है कि वर्तमान कार्य (जैसे कमरा बुक करना) के लिए कौन सी जानकारी आवश्यक है और कौन सी जानकारी को तिजोरी में रखा जाना चाहिए (जैसे आपका मेडिकल इतिहास), और यह सब बिना अपनी क्षमता खोए करता है। यह ऐसा तब करता है जब वह दो अलग-अलग दृष्टिकोणों से खुद के साथ बहस करता है जब तक कि वह पूर्ण संतुलन न पा ले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →