← नवीनतम पेपर
💬 NLP

General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level

यह शोध पत्र जनरल फ्रेज डिबायसर (General Phrase Debiaser) को प्रस्तुत करता है, जो एक स्वचालित मल्टी-टोकन पाइपलाइन है जो विकिपीडिया से रूढ़िवादी वाक्यांशों को उत्पन्न करके और उनका उपयोग पूर्वाग्रह-ट्रिगर करने वाले प्रॉम्प्ट्स की पहचान करने और उन्हें डिबायस करने के लिए करके मास्क किए गए लैंग्वेज मॉडल्स में वाक्यांश-स्तरीय पूर्वाग्रहों को कम करता है, जिससे विभिन्न डोमेन और मॉडल आकारों में जेंडर स्टीरियोटाइप्स (लैंगिक रूढ़िवादिता) में महत्वपूर्ण कमी आती है।

मूल लेखक: Bingkang Shi, Xiaodan Zhang, Dehan Kong, Yulei Wu, Zongzhen Liu, Honglei Lyu, Longtao Huang

प्रकाशित 2026-09-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bingkang Shi, Xiaodan Zhang, Dehan Kong, Yulei Wu, Zongzhen Liu, Honglei Lyu, Longtao Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

भाषा को पढ़ने और लिखने वाले कंप्यूटर उल्लेखनीय रूप से कुशल हो गए हैं, जो समाचारों का सारांश देने, दस्तावेजों का अनुवाद करने और यहाँ तक कि कविता रचने में भी सक्षम हैं। ये प्रणालियाँ, जिन्हें भाषा मॉडल (लैंग्वेज मॉडल्स) कहा जाता है, इंटरनेट से टेक्स्ट की विशाल मात्रा का अध्ययन करके सीखती हैं, और इसमें निहित पैटर्न, तथ्यों और विचारों को आत्मसात करती हैं। हालाँकि, क्योंकि मानवीय भाषा ऐतिहासिक पूर्वाग्रहों और सांस्कृतिक रूढ़ियों से भरी होती है, ये मॉडल अक्सर उन्हें दोहराना भी सीख जाते हैं। एक कंप्यूटर यह मान सकता है कि नर्स हमेशा एक महिला होती है या गणितज्ञ हमेशा एक पुरुष होता है, केवल इसलिए क्योंकि उसने अपने प्रशिक्षण डेटा में इसे सबसे अधिक बार देखा था। यह उन लोगों के लिए एक महत्वपूर्ण समस्या है जो इन उपकरणों का निष्पक्ष रूप से उपयोग करने का प्रयास कर रहे हैं, क्योंकि मशीनें अनजाने में लिंग, जाति और पेशे के बारे में हानिकारक पूर्वाग्रहों को सुदृढ़ कर सकती हैं। जबकि शोधकर्ताओं ने लंबे समय से इन मुद्दों को ठीक करने का प्रयास किया है, पिछले अधिकांश प्रयासों ने एकल शब्दों को सुधारने पर ध्यान केंद्रित किया, और पूर्वाग्रह को कुछ समस्याग्रस्त शब्दों को बदलने के एक सरल मामले के रूप में देखा। फिर भी, वास्तविक दुनिया का पूर्वाग्रह शायद ही कभी अलग-थलग रहता है; यह इस तरह से छिपा होता है कि शब्द वाक्यांशों और वाक्यों में कैसे संयोजित होते हैं, जहाँ अर्थ सूक्ष्म और खतरनाक तरीकों से बदल जाता है।

चीनी विज्ञान अकादमी, अलीबाबा ग्रुप और ब्रिस्टल विश्वविद्यालय के शोधकर्ताओं की एक टीम ने पूर्वाग्रह की इस गहरी परत से निपटने के लिए एक नई विधि विकसित की है। वे अपने दृष्टिकोण को 'जनरल फ्रेज डीबायसेर' (General Phrase Debiaser) कहते हैं, जो एक ऐसी प्रणाली है जिसे व्यक्तिगत शब्दों के बजाय शब्दों के समूहों को देखकर भाषा मॉडलों को शुद्ध करने के लिए डिज़ाइन किया गया है। शोधकर्ताओं ने पहचान लिया कि समस्या को वास्तव में ठीक करने के लिए, उन्हें उन विशिष्ट वाक्यांशों को खोजना होगा जहाँ मॉडल का पूर्वाग्रह सबसे मजबूत है और फिर मॉडल को उन संबंधों को अनदेखा करना सिखाना होगा। उनकी प्रक्रिया सुधार के लिए आवश्यक साक्ष्य एकत्र करने के एक चतुर तरीके से शुरू होती है। मनुष्यों से हर संभव पक्षपाती वाक्यांश को मैन्युअल रूप से लिखने के लिए कहने के बजाय, जो धीमा और अधूरा होगा, यह प्रणाली विकिपीडिया पेजों को स्कैन करती है। यह करियर, गणित, कला और विज्ञान जैसे विषयों से जुड़े हाइपरलिंक्स को खोजती है, और इनका उपयोग उन रूढ़िवादी वाक्यांशों की पहचान करने के लिए करती है जिन्हें मॉडल ने सीखा होगा। उदाहरण के लिए, यह पा सकता है कि मॉडल "पुरुष" को "गणितीय सिद्धांत" के साथ और "महिला" को "नृत्य कला" के साथ दृढ़ता से जोड़ता है।

एक बार जब प्रणाली ने इन पक्षपाती वाक्यांशों की पहचान कर ली, तो वह दूसरे चरण पर पहुँचती है: उन सटीक प्रश्नों, या प्रॉम्प्ट्स को खोजना जो मॉडल के पूर्वाग्रह को ट्रिगर करते हैं। कल्पना कीजिए कि कंप्यूटर को एक वाक्य पूरा करने के लिए कहा जा रहा है जैसे "व्यक्ति [व्यक्ति] [खाली स्थान] में विशेषज्ञ है।" शोधकर्ताओं ने कंप्यूटर को लाखों संभावित वाक्यों में से उन वाक्यों को खोजने दिया जहाँ इसकी पक्षपाती अनुमान लगाने की संभावना सबसे अधिक है। वे केवल एकल-शब्द उत्तरों की तलाश नहीं करते; वे बहु-शब्द उत्तरों की तलाश करते हैं, जैसे कि "गणितीय सिद्धांत" बनाम "नृत्य कला", क्योंकि वास्तविक पूर्वाग्रह अक्सर वहीं छिपा होता है। यह मापकर कि मॉडल पुरुष बनाम महिला होने पर इन वाक्यांशों के प्रति कितनी अलग प्रतिक्रिया देता है, प्रणाली एक स्कोर की गणना करती है जो पूर्वाग्रह की शक्ति का प्रतिनिधित्व करता है। शोधकर्ता फिर इस स्कोर का उपयोग फाइन-ट्यूनिंग (fine-tuning) प्रक्रिया को निर्देशित करने के लिए करते हैं। वे इन विशिष्ट, पूर्वाग्रह-ट्रिगर करने वाले वाक्यों को वापस मॉडल में फीड करते हैं, लेकिन इस बार, वे मॉडल की आंतरिक सेटिंग्स को समायोजित करते हैं ताकि इसकी प्रतिक्रियाओं के अंतर को कम किया जा सके। लक्ष्य मॉडल के गणित या कला के ज्ञान को मिटाना नहीं है, बल्कि यह सुनिश्चित करना है कि वह अब उन क्षेत्रों को किसी विशिष्ट लिंग से न जोड़े।

इस कार्य के परिणाम दर्शाते हैं कि वाक्यांशों को लक्षित करना एकल शब्दों को लक्षित करने की तुलना में कहीं अधिक प्रभावी है। शोधकर्ताओं ने अपने तरीके का परीक्षण विभिन्न आकारों के तीन प्रसिद्ध भाषा मॉडलों पर किया और पाया कि इसने करियर और शैक्षणिक विषयों दोनों में लिंग पूर्वाग्रह को काफी कम कर दिया। पूर्वाग्रह को मापने के लिए डिज़ाइन किए गए मानक परीक्षणों में, मॉडल में नाटकीय सुधार हुआ। उदाहरण के लिए, एक मॉडल, BERT, का पूर्वाग्रह स्कोर 0.35 से गिरकर 0.12 हो गया, जबकि एक अन्य, ALBERT, 0.72 से गिरकर 0.16 हो गया। ये संख्याएँ संकेत देती हैं कि मॉडल किसी विशेष पेशे या क्षेत्र को एक लिंग के साथ जोड़ने की संभावना बहुत कम हो गई है। महत्वपूर्ण रूप से, शोधकर्ताओं ने यह भी जाँच की कि क्या इस सफाई प्रक्रिया ने सामान्य रूप से भाषा को समझने की मॉडल की क्षमता को नुकसान पहुँचाया है। उन्होंने अपने डीबायस्ड (debiased) मॉडलों को व्याकरण, भावना और तर्क को कवर करने वाले मानक भाषा परीक्षणों के एक समूह के माध्यम से चलाया, और पाया कि मॉडल ने लगभग अपने मूल कौशल को बरकरार रखा है। भाषा को समझने की क्षमता बरकरार रही, जिससे सिद्ध हुआ कि मशीन की बुद्धिमत्ता को तोड़े बिना हानिकारक रूढ़ियों को हटाना संभव है।

यह दृष्टिकोण इस बात में बदलाव लाता है कि शोधकर्ता आर्टिफिशियल इंटेलिजेंस को ठीक करने के बारे में कैसे सोचते हैं। पिछले तरीके अक्सर मनुष्यों द्वारा लिखे गए शब्दों की बाहरी सूचियों पर निर्भर थे या एक साथ मॉडल की पूरी शब्दावली को सुधारने की कोशिश करते थे, जो अक्षम हो सकता था या इस सूक्ष्मता को मिस कर सकता था कि पूर्वाग्रह वास्तव में कैसे काम करता है। इसके विपरीत, जनरल फ्रेज़ डीबायसेर, पक्षपाती वाक्यांशों की खोज को स्वचालित करता है और उन शब्दों के विशिष्ट संयोजनों को लक्षित करता है जहाँ समस्या मौजूद है। शोधकर्ता तर्क देते हैं कि सुधार के लिए मल्टी-टोकन स्तर का होना आवश्यक है क्योंकि मानवीय पूर्वाग्रह शायद ही कभी एक एकल शब्द होता है; यह जुड़ाव का एक पैटर्न है जो वाक्यांशों में फैला होता है। हालांकि अध्ययन 'एनकोडर-ओनली' (encoder-only) मॉडलों पर केंद्रित था, जो भाषा मॉडल का एक विशिष्ट प्रकार है, लेकिन जो सिद्धांत उन्होंने खोजे हैं वे अन्य प्रकार की प्रणालियों पर भी संभावित रूप से लागू हो सकते हैं। यह कार्य यह प्रदर्शित करता है कि भाषा की संरचना को करीब से देखकर, हम ऐसे उपकरण बना सकते हैं जो न केवल स्मार्ट हैं बल्कि निष्पक्ष भी हैं, यह सुनिश्चित करते हुए कि भविष्य के कंप्यूटर उस विविधता को प्रतिबिंबित करें जिसकी वे सेवा करते हैं, न कि उनके प्रशिक्षण डेटा की सीमाओं को।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →