← नवीनतम पेपर
💬 NLP

How Does Differential Privacy Affect Social Bias in LLMs? A Systematic Evaluation

यह शोध पत्र चार प्रतिमानों (पैराडाइम्स) में बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में सामाजिक पूर्वाग्रह पर डिफरेंशियल प्राइवेसी के प्रभाव का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि जबकि डीपी (DP) वाक्य स्कोरिंग कार्यों में पूर्वाग्रह को कम करता है, यह सभी कार्यों में निष्पक्षता में समान रूप से सुधार नहीं करता है और कम स्मृति (मेमोराइजेशन) का अर्थ अनिवार्य रूप से कम अन्याय नहीं होता है।

मूल लेखक: Eduardo Tenorio, Karuna Bhaila, Xintao Wu

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eduardo Tenorio, Karuna Bhaila, Xintao Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को कहानियाँ लिखने और सवालों के जवाब देने के लिए प्रशिक्षित कर रहे हैं। आप उसे इंटरनेट से किताबों का एक विशाल पुस्तकालय खिलाते हैं। समस्या यह है कि इंटरनेट पुराने रूढ़िवादी विचारों (जैसे "नर्स महिलाएँ होती हैं" या "धनी लोग बुद्धिमान होते हैं") से भरा हुआ है। यदि रोबोट इन किताबों को बहुत अधिक सटीकता से याद कर लेता है, तो वह इन रूढ़ियों को दोहराना शुरू कर सकता है, जो कि अनुचित हो सकता है।

रोबोट को विशिष्ट, संवेदनशील विवरणों को याद करने से रोकने के लिए, वैज्ञानिक डिफरेंशियल प्राइवेसी (Differential Privacy - DP) नामक तकनीक का उपयोग करते हैं। DP को रोबोट की सीखने की प्रक्रिया के लिए एक "धुंध वाली मशीन" (fog machine) के रूप में समझें। यह उसके पाठों में थोड़ा सा 'स्टैटिक नॉइज़' जोड़ देता है, जिससे किसी भी एक विशिष्ट तथ्य को याद रखना कठिन हो जाता है। यह गोपनीयता की रक्षा करता है।

लेकिन यहाँ बड़ा सवाल है जो शोध पत्र पूछता है: क्या यह "धुंध" रोबोट को कम पक्षपाती भी बनाती है? क्या विशिष्ट लोगों की यादों को धुंधला करने से उनके प्रति रोबोट के अनुचित पूर्वाग्रह भी धुंधले हो जाते हैं?

शोधकर्ताओं ने एक रोबोट का परीक्षण किया जिसका नाम VaultGemma-1B है (यह एकमात्र उपलब्ध रोबोट है जिसे इस प्राइवेसी फॉग के साथ प्रशिक्षित किया गया था) और इसकी तुलना बिना धुंध वाले दो मानक रोबोटों से की। उन्होंने केवल एक प्रश्न नहीं पूछा; उन्होंने यह देखने के लिए चार अलग-अलग "खेल" (games) का उपयोग किया कि रोबोट कैसे व्यवहार करता है।

यहाँ उन्हें क्या मिला, जिसे प्रत्येक खेल के आधार पर विभाजित किया गया है:

1. "खाली स्थान भरें" वाला खेल (वाक्य स्कोरिंग)

सेटअप: रोबोट को एक वाक्य दिया जाता है जिसमें एक खाली स्थान होता है, जैसे "मैनेजर ने कहा कि ___ बहुत शिक्षित नहीं था।" उसे "गरीब व्यक्ति" (एक रूढ़िवादी विचार) या "धनी व्यक्ति" (रूढ़िवादी विचार नहीं) के बीच चयन करना है।
परिणाम: प्राइवेसी फॉग (DP) के साथ प्रशिक्षित रोबोट इस खेल में बहुत बेहतर प्रदर्शन कर गया। इसके द्वारा रूढ़िवादी उत्तर चुनने की संभावना बहुत कम थी।
उपमा: कल्पना कीजिए कि रोबोट एक छात्र है जो बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) दे रहा है। प्राइवेसी फॉग ने छात्र के अपने "अंतर्ज्ञान" (gut feelings) पर भरोसा कम कर दिया जो रूढ़ियों पर आधारित थे। रूढ़िवादी विकल्प को आँख मूंदकर चुनने के बजाय, वह हिचकिचाया और अधिक संतुलित विकल्पों को चुना। इस विशिष्ट खेल में, प्राइवेसी ने पूर्वाग्रह को कम करने में मदद की।

2. "कहानी लेखन" वाला खेल (टेक्स्ट पूर्णता)

सेटअप: आप रोबोट को एक प्रॉम्प्ट देते हैं जैसे "महिला को इस रूप में वर्णित किया गया है..." और उससे वाक्य पूरा करने को कहते हैं।
परिणाम: परिणाम अस्त-व्यस्त थे। कभी-कभी प्राइवेसी वाला रोबोट निष्पक्ष था, और कभी नहीं। यह इस पर निर्भर करता था कि आप "विनम्रता", "विषाक्तता" (toxicity), या "भावना" (sentiment) को माप रहे थे।
उपमा: यह ऐसा ही है जैसे छात्र को एक उत्तर चुनने के बजाय एक छोटी कहानी लिखने के लिए कहना। भले ही छात्र ने रूढ़ियों को याद न किया हो (धुंध की मदद से), फिर भी वह उन्हें लिख सकता है क्योंकि उसके बात करने का तरीका या उसका 'टोन' कैसा है। "धुंध" ने कहानी को स्वचालित रूप से ठीक नहीं किया; इसने बस रोबोट के लेखन को थोड़ा अधिक अप्रत्याशित बना दिया। प्राइवेसी ने निष्पक्ष कहानियों की गारंटी नहीं दी।

3. "डेटा टेबल" वाला खेल (टेबुलर क्लासिफिकेशन)

सेटअप: रोबोट को तथ्यों की एक सूची (आयु, नौकरी, जाति) दिखाई जाती है और उससे पूछा जाता है कि क्या कोई व्यक्ति $50k से अधिक कमाता है।
परिणाम: रोबोट इस खेल में बहुत खराब थे, चाहे उनमें प्राइवेसी फॉग हो या नहीं। वे रैंडमली (randomly) अनुमान लगा रहे थे।
उपमा: शोधकर्ताओं को एहसास हुआ कि वे गलत सवाल पूछ रहे थे। उन्होंने रोबोट को डेटा विश्लेषक की तरह काम करने के लिए कहा, लेकिन रोबोट को कहानीकार बनने के लिए प्रशिक्षित किया गया था। यह एक कवि को भाग (division) करने के लिए कहने जैसा था। क्योंकि रोबोट इस प्रारूप (format) से इतना भ्रमित था, इसलिए प्राइवेसी फॉग का कोई महत्व नहीं रह गया। खेल ही खराब था, इसलिए हम यह नहीं बता सके कि प्राइवेसी ने मदद की या नहीं।

4. "बहुविकल्पीय" वाला खेल (प्रश्न उत्तर)

सेटअप: रोबोट से एक कठिन प्रश्न पूछा जाता है जिसमें तीन विकल्प (A, B, या C) होते हैं और उसे एक चुनना होता है।
परिणाम: फिर से, रोबोटों ने संघर्ष किया। उन्होंने लगभग रैंडमली उत्तर दिए, जिससे उन्हें लगभग 33% सही उत्तर मिले (जो कि तुक्का लगाने पर मिलता है)।
उपमा: रोबोट इस विशिष्ट खेल को भी नहीं समझ पाया। क्योंकि वह अंधे होकर अनुमान लगा रहा था, इसलिए उसने संयोग से "रूढ़िवादी" उत्तर लगभग 50% बार और "गैर-रूढ़िवादी" उत्तर 50% बार चुना। इससे ऐसा लगा जैसे रोबोट पूरी तरह से निष्पक्ष था, लेकिन वास्तव में वह केवल अनभिज्ञ था। परीक्षण यह नहीं बता सका कि रोबोट पक्षपाती था या नहीं क्योंकि वह पर्याप्त प्रयास ही नहीं कर रहा था।

मुख्य निष्कर्ष

शोध पत्र एक बहुत ही महत्वपूर्ण सबक के साथ समाप्त होता है: आप केवल एक परीक्षण से रोबोट की निष्पक्षता का निर्णय नहीं ले सकते।

  • "लॉगिट" बनाम "आउटपुट": शोधकर्ताओं ने पाया कि प्राइवेसी फॉग ने रोबोट की आंतरिक गणित (संभावनाओं जो वह अपने मस्तिष्क में गणना करता है) को सफलतापूर्वक "स्मूथ" (smooth out) कर दिया। इसने उसे रूढ़ियों में "सोचने" से कम संभावित बना दिया। हालांकि, इसका हमेशा यह मतलब नहीं निकला कि रोबोट निष्पक्ष चीजें बोल रहा है या कर रहा है।
  • विच्छेद (The Disconnect): सिर्फ इसलिए कि रोबोट का आंतरिक गणित कम पक्षपाती है, इसका मतलब यह नहीं है कि उसका अंतिम आउटपुट निष्पक्ष होगा। यह पूरी तरह से इस पर निर्भर करता है कि आप उसे अपना काम दिखाने के लिए कैसे कहते हैं।

सरल शब्दों में: प्राइवेसी सुरक्षा (धुंध) जोड़ने से रोबोट एक सख्त क्विज़ लेते समय रूढ़ियों को याद रखने और दोहराने की संभावना कम हो गई। लेकिन जब आपने उसे कहानी लिखने या पहेली सुलझाने के लिए कहा, तो धुंध ने उसे स्वचालित रूप से निष्पक्ष नहीं बनाया। वास्तव में AI निष्पक्ष है या नहीं, यह जानने के लिए, आपको इसे कई अलग-अलग तरीकों से टेस्ट करना होगा, न कि केवल एक तरीके से।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →