UGID: Unified Graph Isomorphism for Debiasing Large Language Models
यह शोध पत्र UGID का प्रस्ताव करता है, जो एक एकीकृत ग्राफ आइसोमोर्फिज्म (graph isomorphism) ढांचा है जो प्रति-तथ्यात्मक इनपुट (counterfactual inputs) के विरुद्ध उनके आंतरिक कम्प्यूटेशनल ग्राफ में संरचनात्मक अपरिवर्तनीयता (structural invariance) को लागू करके बड़े भाषा मॉडलों को पूर्वाग्रह मुक्त करता है, जिससे सामान्य क्षमताओं और सुरक्षा को संरक्षित करते हुए पूर्वाग्रह को प्रभावी रूप से कम किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन थोड़े पक्षपाती सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है। इस सहायक ने इंटरनेट पर लगभग सब कुछ पढ़ा है। इस कारण से, इसने समाज के कुछ अनुचित रूढ़ियों (stereotypes) को आत्मसात कर लिया है। उदाहरण के लिए, यदि आप इसे यह वाक्य पूरा करने के लिए कहते हैं, "इंजीनियर ने कहा कि...", तो यह बिना किसी संदर्भ के भी एक महिला इंजीनियर के लिए "वह" (she) और पुरुष इंजीनियर के लिए "वह" (he) का अनुमान लगा सकता है।
इन गलतियों को ठीक करने के वर्तमान तरीके एक फिल्टर की तरह हैं जो सहायक के मुँह पर लगाया जाता है। वे गलत शब्दों को बाहर आने से रोकने की कोशिश करते हैं, या वे सहायक को "साफ-सुथरी" किताबों के साथ फिर से प्रशिक्षित करने की कोशिश करते हैं। लेकिन यह शोध पत्र तर्क देता है कि ये तरीके अच्छी तरह काम नहीं करते क्योंकि पक्षपात केवल शब्दों में नहीं है; यह सहायक के मस्तिष्क की संरचना में गहराई से रचा-बसा (hardwired) है।
यहाँ इस पेपर के समाधान, UGID, का एक सरल विवरण दिया गया है, जो रोजमर्रा के उपमाओं (analogies) का उपयोग करता है:
1. समस्या: "लीकी पाइप" (Leaky Pipe)
AI के मस्तिष्क को एक जटिल शहर के रूप में सोचें जहाँ सड़कें हैं (जहाँ सूचना यात्रा करती है) और भंडारण गोदाम (warehouses) हैं (जहाँ तथ्य रखे जाते हैं)।
- पुराने तरीके: शोधकर्ताओं ने पक्षपात को ठीक करने के लिए केवल मुख्य सड़कों (अटेंशन मैकेनिज्म) को अवरुद्ध करने की कोशिश की।
- चुनौती: छोटे शहरों (छोटे AI मॉडल) में, यह काम कर गया। लेकिन विशाल शहरों (LLaMA-3 जैसे बड़े AI मॉडल) में, ट्रैफिक ने दूसरा रास्ता खोज लिया। पक्षपात गायब नहीं हुआ; यह केवल सड़कों से गोदामों (हिडन स्टेट्स या FFNs) में चला गया। AI अभी भी उस रूढ़ि को "सोच" रहा था, भले ही वह उसे छिपाने की कोशिश कर रहा हो।
2. समाधान: UGID ("ब्लूप्रिंट मैच")
लेखक UGID का प्रस्ताव देते हैं, जो AI के मस्तिष्क को एक बिल्डिंग ब्लूप्रिंट की तरह मानता है। वे यह सुनिश्चित करना चाहते हैं कि ब्लूप्रिंट बिल्कुल वैसा ही दिखे चाहे AI "राजा" के बारे में बात कर रहा हो या "रानी" के बारे में, या "पुरुष इंजीनियर" या "महिला इंजीनियर" के बारे में।
वे इसे यूनिफाइड ग्राफ आइसोमोर्फिज्म (Unified Graph Isomorphism) कहते हैं। सरल भाषा में इसका अर्थ है: "विचार प्रक्रिया की आंतरिक संरचना को लिंग या संवेदनशील विषय के बावजूद समान बनाना।"
वे इसे चार चतुर तरीकों से करते हैं:
ट्रिक A: सड़कों को संरेखित करना (रूटिंग - Routing)
कल्पना कीजिए कि AI का अटेंशन मैकेनिज्म एक ट्रैफिक कंट्रोलर है जो कारों (शब्दों) को विभिन्न गंतव्यों की ओर निर्देशित करता है।
- समाधान: UGID ट्रैफिक कंट्रोलर को "he" और "she" के लिए ठीक उसी मार्ग का उपयोग करने के लिए मजबूर करता है। यदि AI आमतौर पर "महिला इंजीनियर" को एक विशिष्ट "रूढ़िवादी गोदाम" में भेजता है, तो UGID "पुरुष इंजीनियर" को भी वहीं भेजने के लिए मजबूर करता है, और इसके विपरीत भी। वे "ट्रैफिक पैटर्न" को समान बना देते हैं ताकि पक्षपात के पास छिपने की कोई जगह न बचे।
ट्रिक B: गोदामों को लॉक करना (नोड्स - Nodes)
भले ही सड़कें ठीक कर दी गई हों, लेकिन भंडारण कक्ष (जहाँ AI अपनी जानकारी रखता है) अभी भी अव्यवस्थित हो सकते हैं।
- समाधान: UGID भंडारण कक्षों की सामग्री की जाँच करता है। यह सुनिश्चित करता है कि एक महिला इंजीनियर की "याददाश्त" ठीक उसी तरह संग्रहीत की गई है जैसे एक पुरुष इंजीनियर की। यदि AI पृष्ठभूमि में कोई पक्षपात संग्रहीत करने की कोशिश करता है, तो UGID इसे सुचारू (smooth) कर देता है, जिससे पक्षपात अंतिम उत्तर में "लीक" नहीं हो पाता।
ट्रिक C: "सुरक्षा जाल" (उपयोगिता को बनाए रखना - Preserving Utility)
कभी-कभी, जब आप पक्षपात को ठीक करने की कोशिश करते हैं, तो आप अनजाने में AI की अपना काम करने की क्षमता को बाधित कर देते हैं (जैसे कि उसे यह भूलने के लिए मजबूर करना कि "राजा" पुरुष है और "रानी" महिला है)।
- समाधान: UGID एक सिलेक्टिव एंकर (Selective Anchor) का उपयोग करता है। इसे एक लाइटहाउस (प्रकाश स्तंभ) की तरह समझें। यह AI को बताता है: "तुम्हें 'इंजीनियर' के प्रति तटस्थ रहना चाहिए, लेकिन तुम्हें यह याद रखना चाहिए कि 'राजा' एक पुरुष है और 'रानी' एक महिला है।" यह AI को बुनियादी तथ्यों के बारे में भ्रमित होने से रोकता है जबकि यह अनैतिक रूढ़ियों को हटा देता है।
ट्रिक D: "स्थिरता गार्ड" (लॉग-स्पेस - Log-Space)
AI मॉडल घबरा सकते हैं और अपना विचार बदल सकते हैं यदि आप उनसे थोड़ा अलग तरीके से सवाल पूछते हैं।
- समाधान: UGID एक स्थिरता गार्ड जोड़ता है जो AI को शांत रखता है। चाहे आप सवाल औपचारिक रूप से पूछें या अनौपचारिक रूप से, AI का आंतरिक तर्क स्थिर और निष्पक्ष रहता है।
3. परिणाम: एक अधिक निष्पक्ष, स्मार्ट सहायक
पेपर ने कई शक्तिशाली AI मॉडलों (जैसे LLaMA-3 और Qwen) पर इसका परीक्षण किया।
- पहले: AI पक्षपाती था, और इसे ठीक करने से अक्सर इसकी बुद्धिमत्ता कम हो जाती थी या यह कम सुरक्षित हो जाता था।
- बाद में (UGID के साथ): AI काफी कम पक्षपाती (लगभग तटस्थ) हो गया लेकिन इसने अपनी बुद्धिमत्ता बनाए रखी। यह कोड लिखना या चुटकुले सुनाना नहीं भूला, और न ही यह राजा/रानी जैसी बुनियादी परिभाषाओं के बारे में भ्रमित हुआ।
बड़ी तस्वीर (The Big Picture)
सोचिए कि UGID केवल बुरे शब्दों को रोकने वाला "सेंसर" नहीं है, बल्कि एक आर्किटेक्ट है जो AI के आंतरिक शहर का पुनर्निर्माण करता है। उन्होंने सड़कों और गोदामों को फिर से डिज़ाइन किया है ताकि शहर सभी के लिए पूरी तरह से कार्य करे, चाहे वे दरवाजे से अंदर आ रहे हों।
संक्षेप में: UGID पक्षपात को उसके स्रोत (मस्तिष्क की संरचना) पर ठीक करता है, न कि केवल लक्षणों (आउटपुट) पर पैच लगाकर, जिससे यह सुनिश्चित होता है कि AI अपनी बुद्धिमत्ता खोए बिना निष्पक्ष बना रहे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।