Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails
यह शोध पत्र भाषा मॉडलों में प्रीट्रेनिंग फिल्टर्स और इन्फरेंस-टाइम गार्डरेल्स का ऑडिट करता है, जो यह प्रकट करता है कि वे सरल शाब्दिक संकेतों पर निर्भरता के माध्यम से हाशिए पर स्थित समूहों के उल्लेखों को असमान रूप से मिटा देते हैं और वास्तविक घृणास्पद भाषण या निजी जानकारी को पकड़ने में विफल रहते हैं, जिससे एक प्रकार का ज्ञानमीमांसीय अन्याय (epistemic injustice) उत्पन्न होता है जो मानवीय निर्णय के विपरीत है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल पुस्तकालय बना रहे हैं ताकि एक बहुत बुद्धिमान रोबोट को बोलना और दुनिया को समझना सिखाया जा सके। इस रोबोट को 'लार्ज लैंग्वेज मॉडल' (LLM) कहा जाता है, जिसे सीखने के लिए इंटरनेट से अरबों वाक्यों को पढ़ने की आवश्यकता है।
हालाँकि, इससे पहले कि रोबोट पढ़ना शुरू करे, इंसान उसके सामने फिल्टर्स (एक सख्त लाइब्रेरियन की तरह) लगा देते हैं ताकि "खराब" किताबों को बाहर निकाला जा सके। फिर, जब रोबोट लोगों से बात करना शुरू करता है, तो इंसान गार्डरेल्स (एक सुरक्षा निरीक्षक की तरह) लगा देते हैं ताकि उसे कुछ भी "असुरक्षित" कहने से रोका जा सके।
यह शोध पत्र एक ऑडिट है—एक गहरी जाँच—कि ये लाइब्रेरियन और सुरक्षा निरीक्षक अपना काम कितनी अच्छी तरह कर रहे हैं। शोधकर्ताओं ने पाया कि जबकि वे रोबोट को सुरक्षित रखने की कोशिश कर रहे हैं, वे अनजाने में हाशिए पर रहने वाले समूहों की आवाजों को मिटा रहे हैं (जैसे ट्रांसजेंडर लोग, महिलाएँ और मध्य अमेरिका के लोग) और मानवीय निर्णय को कठोर, अक्सर गलत नियमों से बदल रहे हैं।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. "बैन किए गए शब्द" का जाल (The "Banned Word" Trap)
शोधकर्ताओं ने पाया कि इनमें से कई सुरक्षा प्रणालियाँ एक बच्चे की "नaughty list" (बुरे व्यवहार की सूची) की तरह काम करती हैं।
- यह कैसे काम करता है: यदि किसी वाक्य में कोई विशिष्ट "बुरा" शब्द (जैसे अपशब्द या यौन शब्द) शामिल है, तो सिस्टम संदर्भ (context) देखे बिना उसे तुरंत हटा देता है।
- समस्या: यह एक लाइब्रेरियन द्वारा किसी किताब को केवल इसलिए बाहर फेंकने जैसा है क्योंकि उसमें शरीर के किसी अंग का उल्लेख है, या सेक्स वर्कर के अधिकारों के बारे में कहानी को केवल इसलिए हटाने जैसा है क्योंकि उसमें "सेक्स" शब्द का उपयोग हुआ है।
- परिणाम: ये प्रणालियाँ अपनी "नaughty list" के शब्दों को पकड़ने में बहुत अच्छी हैं, लेकिन वे वास्तविक नुकसान को पहचानने में बहुत खराब हैं, जैसे गोपनीयता का उल्लंघन, कॉपीराइट चोरी, या वास्तविक घृणास्पद भाषण (hate speech) जो विशिष्ट प्रतिबंधित शब्दों का उपयोग नहीं करता है।
2. "अति-सुरक्षात्मक" फ़िल्टर (The "Over-Protective" Filter)
अध्ययन में पाया गया कि ये फ़िल्टर विशिष्ट समूहों के प्रति अति-सुरक्षात्मक हैं, जो एक ऐसे बाउंसर की तरह काम करते हैं जो एक निश्चित प्रकार की टोपी पहनने वाले लोगों पर संदिग्ध होता है।
- ट्रांसजेंडर लोग: ट्रांसजेंडर पहचान का उल्लेख करने वाले वाक्यों को ट्रांसजेंडर (गैर-ट्रांस) लोगों के वाक्यों की तुलना में हटाने के लिए बहुत अधिक फ्लैग किया गया।
- महिलाएँ: महिलाओं के उल्लेख को पुरुषों के उल्लेख की तुलना में काफी अधिक बार फ्लैग किया गया।
- मध्य अमेरिकी: मध्य अमेरिका के लोगों का उल्लेख करने वाली सामग्री को लगभग हमेशा हटाने के लिए फ्लैग किया गया, जबकि पश्चिमी यूरोप के लोगों के बारे में सामग्री को शायद ही कभी छुआ गया।
- उपमा: एक संग्रहालय के सुरक्षा गार्ड की कल्पना करें जो हर किसी को अंदर आने देता है सिवाय उन लोगों के जो एक विशिष्ट पड़ोस से आते हैं। गार्ड बुरा होने की कोशिश नहीं कर रहा है; वह बस एक त्रुटिपूर्ण नियम का पालन कर रहा है जो यह मान लेता है कि उस पड़ोस के लोग "जोखिम भरे" हैं। इसके परिणामस्वरूप, एआई (AI) कभी उस पड़ोस की संस्कृति के बारे में नहीं सीख पाता।
3. रोबोट बनाम इंसान (The Robot vs. The Human)
शोधकर्ताओं ने स्वयंसेवकों से उन वाक्यों को देखने के लिए कहा जिन्हें रोबोट ने फ्लैग किया था और निर्णय लेने को कहा: "क्या इसे रहना चाहिए या जाना चाहिए?"
- चौंकाने वाला आंकड़ा: इंसानों ने उन वाक्यों के लिए "रखें" कहा 88.5% बार जो प्री-ट्रेनिंग फिल्टर उन्हें हटाना चाहते थे, और 91.3% बार उन वाक्यों के लिए जो गार्डरेल्स उन्हें ब्लॉक करना चाहते थे।
- उपमा: यह एक रोबोट शेफ द्वारा सूप चखने, यह तय करने जैसा है कि इसमें एक विशिष्ट जड़ी-बूटी है इसलिए यह "जहरीला" है, और फिर पूरे बर्तन को फेंक देना। एक मानव शेफ सूप चखता है, महसूस करता है कि यह केवल एक मसालेदार सूप है, और कहता है, "नहीं, यह स्वादिष्ट और सुरक्षित है।"
- द्वंद्व: स्वचालित प्रणालियाँ उस सामग्री को हटा रही हैं जिसे मनुष्य वास्तव में मूल्यवान, शैक्षिक या हानिरहित पाते हैं। इन वाक्यों को हटाकर, एआई इन समूहों और उनके अनुभवों को समझने की क्षमता खो रहा है।
4. "मौन विलोपन" (The "Silent Erasure")
पेपर इसे "एपिस्टेमिक इरेज़र" (Epistemic Erasure) कहता है।
- इसका अर्थ क्या है: "एपिस्टेमिक" ज्ञान से संबंधित है। "इरेज़र" का अर्थ है मिटा देना।
- रूपक: दुनिया के मानचित्र की कल्पना करें जहाँ एआई महाद्वीपों को बना रहा है। क्योंकि फ़िल्टर ट्रांसजेंडर लोगों या मध्य अमेरिकियों के बारे में वाक्यों को हटाते रहते हैं, इसलिए एआई का मानचित्र उन जगहों पर खाली सफेद धब्बे के साथ समाप्त होता है जहाँ उन समूहों को होना चाहिए था। एआई वास्तव में "नहीं जानता" कि वे अस्तित्व में हैं या उनका जीवन कैसा है क्योंकि डेटा को सीखने से पहले ही साफ कर दिया गया था।
शोध पत्र के दावों का सारांश
- प्रणालियाँ सहमत नहीं हैं: विभिन्न फ़िल्टर और गार्डरेल्स अक्सर एक-दूसरे से असहमत होते हैं। कुछ चीजें पकड़ते हैं जो दूसरे छोड़ देते हैं, और वे संदर्भ को समझने के बजाय सरल शब्द सूचियों पर बहुत अधिक निर्भर करते हैं।
- पूर्वाग्रह व्यवस्थित है: यह केवल एक गड़बड़ी नहीं है; यह एक पैटर्न है। विभिन्न कंपनियों और विभिन्न महाद्वीपों की प्रणालियाँ सभी एक ही हाशिए पर रहने वाले समूहों को अत्यधिक फ्लैग करती हुई प्रतीत होती हैं।
- मानवीय निर्णय अलग है: मनुष्य आम तौर पर इन वाक्यों को सुरक्षित या महत्वपूर्ण मानते हैं, जबकि मशीनें इन्हें खतरनाक मानती हैं।
- परिणाम: इन स्वचालित प्रणालियों पर भरोसा करके, हम सक्रिय रूप से एआई को ट्रांसजेंडर लोगों, महिलाओं और विशिष्ट क्षेत्रों के लोगों की वास्तविकता के प्रति अंधा बना रहे हैं, जिससे डिजिटल दुनिया में प्रभावी रूप से उन्हें चुप कराया जा रहा है।
शोध पत्र निष्कर्ष निकालता है कि इसे ठीक करने के लिए, हम केवल स्वचालित "नaughty lists" पर भरोसा नहीं कर सकते। हमें निर्णय लेने की प्रक्रिया में प्रभावित होने वाले लोगों को शामिल करने की आवश्यकता है और ऐसी प्रणालियाँ बनाने की आवश्यकता है जो केवल बुरे शब्दों को गिनने के बजाय संदर्भ को समझ सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।