← नवीनतम पेपर
🤖 AI

Differentially Private Preference Data Synthesis for Large Language Model Alignment

यह शोध पत्र DPPrefSyn को प्रस्तुत करता है, जो DP-PCA के साथ एक निजी ब्रैडली-टेरी मॉडल को सीखकर और उपयोगकर्ता गोपनीयता से समझौता किए बिना मानवीय मूल्यों को बनाए रखने के लिए सार्वजनिक प्रॉम्प्ट्स का लाभ उठाकर, लार्ज लैंग्वेज मॉडल अलाइनमेंट के लिए डिफरेंशियल प्राइवेट सिंथेटिक प्रिफरेंस डेटा उत्पन्न करने वाला पहला फ्रेमवर्क है।

मूल लेखक: Fengyu Gao, Jing Yang

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fengyu Gao, Jing Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन अनुभवहीन रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है। इसे मददगार, विनम्र और सुरक्षित बनने के लिए सिखाने हेतु, आपको इसे "अच्छे" उत्तरों बनाम "बुरे" उत्तरों के उदाहरण दिखाने की आवश्यकता है। इस प्रक्रिया को प्रिफरेंस अलाइनमेंट (preference alignment) कहा जाता है।

हालाँकि, इस रोबोट को सिखाने के लिए उपयोग किया जाने वाला वास्तविक डेटा अक्सर लोगों के निजी रहस्य, स्वास्थ्य संबंधी मुद्दे या संवेदनशील विचार भी समाहित करता है। इस कच्चे डेटा का सीधे उपयोग करना किसी की निजी डायरियों को जोर से पढ़कर किसी को सिखाने जैसा है—यह सीखने के लिए तो काम करता है, लेकिन यह गोपनीयता का एक बड़ा संकट है।

यह शोध पत्र एक नई विधि पेश करता है जिसे DPPrefSyn (डिफरेंशियल प्राइवेसी प्रिफरेंस सिंथेसिस) कहा जाता है। इसे एक "गोपनीयता-सुरक्षित रेसिपी बुक" के रूप में समझें जो हमें मूल डायरियों को कभी उजागर किए बिना रोबोट को सिखाने की अनुमति देती है।

यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. समस्या: "निजी डायरी" की दुविधा

आमतौर पर, रोबोट के व्यवहार को ठीक करने के लिए, हम उसे हजारों वास्तविक उदाहरण देते हैं जहाँ मनुष्यों ने कहा, "मुझे उत्तर B की तुलना में उत्तर A अधिक पसंद आया।"

  • जोखिम: इन उदाहरणों में अक्सर निजी विवरण होते हैं (जैसे, "मैं अपने अवसाद को कैसे छिपाऊं?" या "मेरा बॉस चोरी कर रहा है")। यदि हम इस पर सीधे रोबोट को प्रशिक्षित करते हैं, तो यह अनजाने में उन रहस्यों को याद रख सकता है और बाद में उन्हें लीक कर सकता है।
  • पुराना समाधान: कुछ पिछले तरीकों ने केवल नाम या केवल लेबल को छिपाने की कोशिश की, लेकिन वे अन्य रहस्यों को खुला छोड़ देते थे। यह रोबोट की आँखों पर पट्टी बांधने जैसा था लेकिन डायरी को मेज पर खुला छोड़ देने जैसा था।

2. समाधान: DPPrefSyn (द "प्राइवेसी शेफ")

वास्तविक डायरियों को खिलाने के बजाय, DPPefSyn एक शेफ की तरह काम करता है जो डायरियों को पढ़ता है, प्राथमिकताओं के "स्वाद" को समझता है, और फिर बिल्कुल नए, नकली व्यंजन (recipes) तैयार करता है जिनमें वही स्वाद हो लेकिन कोई वास्तविक सामग्री न हो।

यहाँ 3-चरणीय कुकिंग प्रक्रिया दी गई है:

चरण 1: "स्वाद" के आधार पर समूहीकरण (Clustering)

मानवीय प्राथमिकताएं अव्यवस्थित होती हैं। कुछ लोग छोटे, प्रभावशाली उत्तर पसंद करते हैं; अन्य विस्तृत, विनम्र उत्तर पसंद करते हैं।

  • उपमा: कल्पना करें कि आपके पास मिश्रित कैंडी का एक बड़ा बैग है। कुछ लोगों को खट्टा पसंद है, कुछ को मीठा, कुछ को तीखा।
  • विधि: एल्गोरिदम निजी डेटा को देखता है और समान "स्वादों" को एक साथ समूहित करता है। यह एक विशेष गोपनीयता कवच (जिसे DP-PCA कहा जाता है) का उपयोग करता है ताकि जटिल डेटा को बिना उसका "स्वाद" खोए एक सरल आकार में छोटा किया जा सके, और फिर यह तय करता है कि किस तरह की प्राथमिकता का प्रतिनिधित्व करने के लिए कैंडी को किन जार (clusters) में रखा जाए।

चरण 2: "फ्लेवर प्रोफाइल" सीखना (Reward Models)

एक बार जब डेटा जार में छाँट दिया जाता है, तो एल्गोरिदम प्रत्येक जार के लिए एक सरल नियम सीखता है।

  • उपमा: "खट्टे" जार के लिए, नियम हो सकता है "अधिक नींबू डालें।" "मीठे" जार के लिए, नियम हो सकता है "अधिक चीनी डालें।"
  • विधि: यह प्रत्येक जार के लिए एक छोटा, निजी "जज" प्रशिक्षित करता है। यह जज उस विशिष्ट समूह के स्वाद के आधार पर उत्तरों को स्कोर करना सीखता है, लेकिन यह यह सब एक गोपनीयता तकनीक (DP-SGD) का उपयोग करके करता है जो सीखने की प्रक्रिया में थोड़ा सा "स्टैटिक नॉइज़" (शोर) जोड़ देती है। यह शोर यह सुनिश्चित करता है कि जज किसी व्यक्ति की विशिष्ट डायरी प्रविष्टि को याद न रख सके, केवल सामान्य पैटर्न को याद रखे।

चरण 3: नई रेसिपी बनाना (Synthesis)

अब, एल्गोरिदम एक सार्वजनिक पुस्तकालय (उपयोग में पब्लिक प्रॉम्प्ट्स जो रहस्यों से मुक्त हों) के पास जाता है और एक शक्तिशाली रोबोट से उन सार्वजनिक प्रश्नों के कई अलग-अलग उत्तर लिखने के लिए कहता है।

  • उपमा: शेफ एक खाली पन्ने पर सार्वजनिक प्रश्न लेता है, एक लेखक को 5 अलग-अलग कहानियाँ लिखने के लिए कहता है, और फिर चरण 2 के "फ्लेवर जजों" का उपयोग करके सबसे अच्छे और सबसे खराब संस्करणों को चुनता है।
  • परिणाम: एल्गोरिदम "अच्छे बनाम बुरे" उत्तरों का एक बिल्कुल नया डेटासेट बनाता है। ये उत्तर सिंथेटिक (नकली) हैं, इसलिए इनमें कोई वास्तविक निजी डेटा नहीं होता है। हालाँकि, क्योंकि इन्हें गोपनीयता-संरक्षित जजों द्वारा चुना गया था, वे मूल निजी डेटा की शैली और मूल्यों की सटीक नकल करते हैं।

3. यह एक बड़ी बात क्यों है

शोध पत्र का दावा है कि यह विधि तीन कारणों से गेम-चेंजर है:

  1. यह सुरक्षित है: क्योंकि अंतिम डेटासेट नकली डेटा से बना है, आप इसे बिना किसी निजी रहस्य के लीक होने की चिंता के किसी के भी साथ साझा कर सकते हैं। यह मूल पारिवारिक डायरियों के बजाय एक रेसिपी बुक साझा करने जैसा है।
  2. यह स्मार्ट है: आश्चर्यजनक रूप से, शोध पत्र में पाया गया कि रोबोट को इन "नकली" रेसिपी पर प्रशिक्षित करना अक्सर वास्तविक, अव्यवस्थित निजी डेटा पर प्रशिक्षित करने की तुलना में बेहतर काम करता है। सिंथेटिक डेटा अधिक साफ और कम शोर वाला होता है।
  3. यह लचीला है: पुराने तरीकों के विपरीत जो केवल रोबोट प्रशिक्षण के विशिष्ट प्रकारों के लिए काम करते थे, इस "रेसिपी बुक" का उपयोग किसी भी आधुनिक प्रशिक्षण पद्धति (जैसे DPO या RLHF) का उपयोग करके रोबोट को सिखाने के लिए किया जा सकता है।

निचोड़

DPPrefSyn एक तरीका है जिससे हम AI को मददगार और मानव जैसा बनाने के लिए सिखा सकते हैं, पहले गोपनीयता-सुरक्षित तरीके से मानवीय प्राथमिकताओं के पैटर्न को सीखकर, और फिर उन पैटर्न का उपयोग करके नए, नकली डेटा उत्पन्न करना जो प्रशिक्षण के लिए सुरक्षित है। यह हमें बड़े डेटा के लाभ प्राप्त करने की अनुमति देता है बिना निजी जीवन को उजागर करने के जोखिम के।

शोध पत्र क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह चिकित्सा निदान या नैदानिक उपचारों के लिए काम करता है।
  • यह दावा नहीं करता कि यह सभी गोपनीयता जोखिमों को हमेशा के लिए समाप्त कर देता है (यह "डिफरेंशियल प्राइवेसी" नामक गणितीय गारंटियों पर निर्भर करता है)।
  • यह दावा नहीं करता कि यह छवियों या वीडियो के लिए काम करता है, केवल टेक्स्ट के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →