MIRAGE: Auditing Anti-Muslim Bias in Frontier LLMs Across Reasoning, Agentic, and Time-Coupled Conditions
यह शोध पत्र MIRAGE प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जो यह प्रकट करता है कि फ्रंटियर LLMs में मुस्लिम-विरोधी पूर्वाग्रह न केवल चेन-ऑफ-थॉट रीजनिंग और एजेंटिक निर्णय लेने से बढ़ जाता है, बल्कि समय-बद्ध समाचार पुनर्प्राप्ति (time-coupled news retrieval) द्वारा भी और अधिक गंभीर हो जाता है, जबकि मौजूदा शमन रणनीतियाँ इन जटिल, तैनाती-यथार्थवादी परिदृश्यों को संबोधित करने में विफल रहती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुत अच्छी तरह से पढ़ा-लिखा डिजिटल सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है। पिछले पांच वर्षों से, शोधकर्ता इस बात को लेकर चिंतित रहे हैं कि इस सहायक में एक छिपा हुआ पूर्वाग्रह है: यह अक्सर बिना किसी कारण के मुस्लिम लोगों को हिंसा या आतंकवाद से जोड़ देता है।
लंबे समय तक, हमने इस पूर्वाग्रह का परीक्षण करने के लिए इस सहायक से सरल, एक-बार के प्रश्न पूछे जैसे, "एक मुस्लिम व्यक्ति दुकान में प्रवेश करता है..." और देखा कि क्या वह वाक्य को किसी डरावनी चीज़ के साथ पूरा करता है। जिस पेपर को आपने साझा किया है, जिसका नाम MIRAGE है, वह कहता है: "रुकिए। ये सहायक अब उस तरह से काम नहीं करते हैं।"
आज, इन सहायकों का उपयोग बहुत अधिक जटिल तरीकों से किया जाता है। वे केवल एक प्रश्न का उत्तर नहीं देते; वे समस्याओं पर विचार करते हैं, निर्णय लेते हैं और उत्तर देने के लिए नवीनतम समाचार पढ़ते हैं। MIRAGE टीम ने एक नया परीक्षण बनाया है ताकि यह देखा जा सके कि क्या यह पूर्वाग्रह वास्तविक दुनिया के इन परिदृश्यों में बढ़ता है, बेहतर होता है, या समान रहता है।
यहाँ उनके निष्कर्ष दिए गए हैं, जिन्हें सरल भाषा में समझाया गया है:
1. "सोचने" का जाल (चेन-ऑफ-थॉट / Chain-of-Thought)
उपमा: कल्पना कीजिए कि आप एक छात्र को गणित की समस्या हल करने के लिए कह रहे हैं। आप सोच सकते हैं, "यदि मैं उनसे अपना काम चरण-दर-चरण दिखाने के लिए कहूँ, तो वे अधिक सावधान होंगे और गलती करने की संभावना कम होगी।"
MIRAGE का निष्कर्ष: इसके विपरीत हुआ। जब शोधकर्ताओं ने AI से उत्तर देने से पहले "चरण-दर-चरण सोचने" के लिए कहा, तो पूर्वाग्रह वास्तव में बढ़ गया।
बुरे विचारों को दबाने के बजाय, "सोचने" की प्रक्रिया ने ऐसा लगा जैसे AI को उन्हें ज़ोर से बोलने की अनुमति मिल गई हो। यह ऐसा था जैसे AI कह रहा हो, "खैर, मुझे पता है कि यह एक रूढ़िवादी विचार है, लेकिन यदि मैं तार्किक रूप से इस पर विचार करूँ, तो यहाँ बताया गया है कि यह क्यों सच हो सकता है..." और फिर वह हानिकारक निष्कर्ष लिख रहा था। AI जितना अधिक "तर्क" करता गया, मुस्लिमों और हिंसा के बीच का संबंध उतना ही बढ़ता गया।
2. "हायरिंग मैनेजर" की समस्या (एजेंटिक निर्णय / Agentic Decisions)
उपमा: कल्पना कीजिए कि एक AI एक हायरिंग मैनेजर या ऋण अधिकारी (loan officer) के रूप में कार्य कर रहा है। आप उसे दो एक जैसे रेज़्यूमे या ऋण आवेदन देते हैं। एकमात्र अंतर ऊपर लिखा नाम है: एक नाम मुस्लिम लगता है, दूसरा गैर-मुस्लिम।
MIRAGE का निष्कर्ष: भले ही साक्ष्य (रेज़्यूमे या ऋण विवरण) बिल्कुल समान थे, AI ने मुस्लिम आवेदक के साथ काफी खराब व्यवहार किया।
- वह ऋण को अस्वीकार करने की अधिक संभावना रखता था।
- वह रेज़्यूमे को "अनुपयुक्त" के रूप में चिह्नित करने की अधिक संभावना रखता था।
- वह शरणार्थी की कहानी का नकारात्मक रूप में सारांश प्रस्तुत करने की अधिक संभावना रखता था।
यह खतरनाक है क्योंकि ये निर्णय चुपचाप होते हैं। AI अनिवार्य रूप से कोई घृणित वाक्य नहीं लिख रहा है; वह बस कम स्कोर दे रहा है या "नहीं" कह रहा है।
3. "ब्रेकिंग न्यूज़" का प्रभाव (टाइम-कपल्ड बायस / Time-Coupled Bias)
उपमा: कल्पना कीजिए कि AI आपके प्रश्न का उत्तर देने के लिए समाचार पत्र पढ़ रहा है। यदि समाचार पत्र शांति की कहानियों से भरा है, तो AI शांत है। लेकिन यदि समाचार पत्र संघर्ष या आतंकवादी हमले के बारे में ब्रेकिंग न्यूज़ से भरा है, तो AI का मूड तुरंत बदल जाता है।
MIRAGE का निष्कर्ष: AI का पूर्वाग्रह "समय-बद्ध" (time-coupled) है। जब शोधकर्ताओं ने AI को मुस्लिमों से जुड़े संघर्षों के बारे में हालिया समाचार दिए, तो AI अचानक मुस्लिमों को हिंसा से जोड़ने की बहुत अधिक संभावना रखने लगा। इससे कोई फर्क नहीं पड़ता था कि AI आमतौर पर "सुरक्षित" था; जैसे ही उसने समाचार पढ़ा, पूर्वाग्रह बढ़ गया।
4. "बैंड-एड" की विफलता (शमन / Mitigation)
उपमा: कल्पना कीजिए कि आपकी नाव में छेद है। आप छेद को टेप के एक टुकड़े से बंद करने की कोशिश करते हैं (एक "प्रॉम्प्ट-आधारित सुधार" या "विनम्र रहें" जैसे निर्देश)। यह तब बहुत अच्छा काम करता है जब नाव बंदरगाह में स्थिर खड़ी होती है (सरल प्रश्न)। लेकिन जैसे ही नाव तेज़ चलने लगती है या लहरों से टकराती है (जटिल तर्क या निर्णय लेना), टेप निकल जाता है, और नाव फिर से डूबने लगती है।
MIRAGE का निष्कर्ष: डेवलपर्स द्वारा उपयोग किए जाने वाले वर्तमान तरीके (जैसे AI को "अपमानजनक न होने" के निर्देश देना) सरल प्रश्नों के लिए ठीक काम करते हैं। लेकिन जब AI गहराई से सोच रहा होता है, निर्णय ले रहा होता है, या समाचार पढ़ रहा होता है, तो वे पूरी तरह से विफल हो जाते हैं। "सुधार" उन जगहों तक नहीं पहुँच पाता जहाँ AI वास्तव में नुकसान पहुँचा रहा है।
5. भाषा का अंतर
उपमा: कल्पना कीजिए कि AI अंग्रेजी में पारंगत है और वह अरबी का एक बहुत ही औपचारिक संस्करण बोलता है (जैसे कि पाठ्यपुस्तक पढ़ना)। लेकिन जब आप उससे स्थानीय बोली (जैसे मिस्र या लेवेंटाइन अरबी) में बात करते हैं, तो वह अपने शिष्टाचार भूल जाता है।
MIRAGE का निष्कर्ष: पूर्वाग्रह वास्तव में अंग्रेजी की तुलना में अरबी बोलियों में जवाब देने के दौरान अधिक मजबूत था। AI को जो सुरक्षा प्रशिक्षण मिला था, वह अंग्रेजी में प्रभावी था, लेकिन वह इस बात में स्थानांतरित नहीं हुआ कि वह स्थानीय, रोज़मर्रा की अरबी भाषा को कैसे संभालता है।
मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि हम इन AI सिस्टमों का परीक्षण एक "अभ्यास कक्ष" (सरल प्रश्न) में कर रहे हैं, जबकि वे वास्तव में "स्टेडियम" (जटिल, वास्तविक दुनिया के निर्णय) में प्रदर्शन कर रहे हैं।
स्टेडियम में, पूर्वाग्रह:
- ज़ोरदार होता है जब AI चरण-दर-चरण सोचता है।
- अधिक हानिकारक होता है जब AI लोगों के जीवन (नौकरी, ऋण, शरण) के बारे में निर्णय लेता है।
- ताज़ा समाचारों से प्रेरित होता है।
- अक्षम होता है उन "विनम्र निर्देशों" के सामने जो हम उन्हें देते हैं।
लेखकों ने अपना नया परीक्षण सेट (MIRAGE) जारी किया है ताकि डेवलपर्स अंततः वास्तविक समस्या को देख सकें और बेहतर समाधान बना सकें, बजाय इसके कि वे केवल सरल प्रश्नों को पैच (patch) करते रहें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।