← नवीनतम पेपर
🤖 machine learning

Fairness-Aware Mixture-of-Experts via Subgroup Reweighting and Gate Regularization

यह शोध पत्र एक एंड-टू-एंड फेयरनेस-अवेयर मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क प्रस्तावित करता है जो प्रतिस्पर्धी भविष्य कहनेवाला प्रदर्शन बनाए रखते हुए संतुलित विशेषज्ञ उपयोग सुनिश्चित करने के लिए सबग्रुप रीवेटिंग को गेट एंट्रॉपी रेगुलराइजेशन के साथ जोड़कर रूटिंग-प्रेरित पूर्वाग्रह और जनसांख्यिकीय समूहों के बीच प्रदर्शन असमानताओं को कम करता है।

मूल लेखक: Sunhee Hwang

प्रकाशित 2026-08-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sunhee Hwang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, कंप्यूटर मानव दृष्टि के समान स्पष्टता के साथ दुनिया को देखना सीख रहे हैं। वे चेहरों की पहचान कर सकते हैं, मेडिकल स्कैन को वर्गीकृत कर सकते हैं, और पलक झपकते ही वस्तुओं को पहचान सकते हैं। फिर भी, जैसे-जैसे ये सिस्टम शोध प्रयोगशालाओं से निकलकर वास्तविक दुनिया के अनुप्रयोगों में जा रहे हैं, एक शांत दोष उभर कर सामने आया है। क्योंकि उन्हें सिखाने के लिए उपयोग किया जाने वाला डेटा अक्सर मानव समाज की असमानता को दर्शाता है, परिणामस्वरूप बने मॉडल अक्सर कुछ समूहों के लिए अन्य समूहों की तुलना में बेहतर प्रदर्शन करते हैं। एक सिस्टम एक युवा पुरुष के चेहरे को उच्च सटीकता के साथ पहचान सकता है लेकिन एक वृद्ध महिला के मामले में काफी संघर्ष कर सकता है, केवल इसलिए क्योंकि प्रशिक्षण डेटा में पूर्व के अधिक चित्र थे। यह कोड में कोई बग नहीं है, बल्कि डेटा का ही प्रतिबिंब है: जब एक कंप्यूटर सूचना के असंतुलित आहार से सीखता है, तो वह दुनिया की एक पक्षपाती समझ विकसित कर लेता है।

वर्षों से, शोधकर्ताओं ने कंप्यूटर को उम्र या लिंग जैसे संवेदनशील विवरणों को अनदेखा करना सिखाकर, या डेटा को अधिक समान बनाने के लिए उसे मैन्युअल रूप से समायोजित करके इसे ठीक करने का प्रयास किया है। हालांकि, एक नया अध्ययन बताता है कि ये पारंपरिक सुधार एक गहरी समस्या को नजरअंदाज कर देते हैं, विशेष रूप से जब 'मिक्सचर ऑफ एक्सपर्ट्स' (mixture of experts) नामक एक विशिष्ट प्रकार के उन्नत आर्किटेक्चर का उपयोग किया जाता है। यह दृष्टिकोण लचीला होने के लिए डिज़ाइन किया गया है, जो एक मॉडल को विभिन्न इनपुट को विभिन्न विशेषज्ञ उप-नेटवर्कों (sub-networks) को भेजने की अनुमति देता है, ठीक वैसे ही जैसे एक अस्पताल मरीजों को सबसे उपयुक्त विशेषज्ञ के पास निर्देशित करता है। शोधकर्ताओं ने पाया कि जब डेटा असंतुलित होता है, तो यह रूटिंग सिस्टम अनजाने में विशिष्ट समूहों के लोगों को विशिष्ट विशेषज्ञों के पास भेजने लगता है, जिससे मॉडल का आंतरिक तर्क प्रभावी रूप से विभाजित हो जाता है और उसी पूर्वाग्रह को सुदृढ़ करता है जिसे इसे हल करना था।

डोंगयांग मिरे यूनिवर्सिटी की एक शोधकर्ता, सुनही ह्वांग ने इस छिपी हुई विफलता का निदान और सुधार करने का लक्ष्य रखा। यह अध्ययन FAMoE नामक एक ढांचे पर केंद्रित है, जिसका अर्थ है 'फेयरनेस-अवेयर मिक्सचर-ऑफ-एक्सपर्ट्स' (Fairness-Aware Mixture-of-Experts)। समस्या को समझने के लिए, पहले यह समझना आवश्यक है कि ये मॉडल कैसे काम करते हैं। प्रत्येक छवि को एक एकल, कठोर पथ के माध्यम से भेजने के बजाय, एक 'मिक्सचर-ऑफ-एक्सपर्ट्स' मॉडल एक "गेट" का उपयोग करता है यह तय करने के लिए कि कई आंतरिक विशेषज्ञों में से कौन सा विशिष्ट इनपुट को संभालेगा। एक सुचारू रूप से कार्य करने वाले सिस्टम में, गेट को छवियों को उनके दृश्य कंटेंट के आधार पर रूट करना चाहिए। हालांकि, ह्वांग ने पाया कि जब प्रशिक्षण डेटा असंतुलित होता है—उदाहरण के लिए, यदि युवा पुरुषों के चित्र वृद्ध महिलाओं की तुलना में बहुत अधिक हैं—तो गेट एक शॉर्टकट सीख लेता है। यह वास्तव में कार्य के बजाय तस्वीरों में मौजूद लोगों के संवेदनशील गुणों के आधार पर इनपुट को रूट करना शुरू कर देता है। यह घटना, जिसे लेखक "रूटिंग-इंड्यूस्ड बायस" (routing-induced bias) कहते हैं, कुछ विशेषज्ञों को विशिष्ट जनसांख्यिकीय समूहों के साथ ओवरलोड कर देती है जबकि अन्य खाली बैठे रहते हैं, जिससे निष्पक्षता की एक नई परत पैदा होती है जिसे मानक निष्पक्षता विधियाँ देख नहीं पातीं।

इसे हल करने के लिए, टीम ने एक दो-भाग वाली रणनीति प्रस्तावित की जो सीधे प्रशिक्षण प्रक्रिया के भीतर कार्य करती है। सबसे पहले, उन्होंने स्वयं डेटा नमूनों के महत्व को समायोजित किया। विशेषताओं के दुर्लभ संयोजनों—जैसे कि एक विशिष्ट चेहरे की विशेषता वाली वृद्ध महिला—को अधिक महत्व देकर, मॉडल को उन समूहों पर ध्यान केंद्रित करने के लिए मजबूर किया जाता है जिन्हें वह अन्यथा अनदेखा कर देता। यह सुनिश्चित करता है कि सीखने का संकेत सभी के लिए पर्याप्त मजबूत हो, न कि केवल बहुमत के लिए। दूसरा, और शायद अधिक महत्वपूर्ण, उन्होंने गेट में एक नियम जोड़ा जो इसे बहुत अधिक अनुमानित होने से रोकता है। एक मानक सेटअप में, गेट यह सीख सकता है कि हमेशा एक प्रकार के व्यक्ति को एक विशिष्ट विशेषज्ञ के पास कैसे भेजा जाए। नया तरीका एक दंड (penalty) पेश करता है जो गेट को अपने निर्णयों को अधिक समान रूप से फैलाने के लिए प्रोत्साहित करता है, यह सुनिश्चित करता है कि किसी एक विशेषज्ञ पर किसी विशिष्ट जनसांख्यिकीय समूह का एकाधिकार न हो। यह मॉडल के आंतरिक रूटिंग को संतुलित रखता है और महत्वपूर्ण रूप से, व्याख्या योग्य बनाता है।

इस दृष्टिकोण के परिणामों का परीक्षण चेहरे की छवियों के एक बड़े डेटासेट पर किया गया था, जहाँ लक्ष्य लिंग और आयु समूहों में निष्पक्षता सुनिश्चित करते हुए कुछ गुणों की भविष्यवाणी करना था। अध्ययन में पाया गया कि नए तरीके ने सिस्टम की समग्र सटीकता से समझौता किए बिना विभिन्न समूहों के बीच प्रदर्शन के अंतर को काफी कम कर दिया। वास्तव में, मॉडल ने मौजूदा तकनीकों में से कई की तुलना में निष्पक्ष होने और सही होने के बीच एक बेहतर संतुलन हासिल किया, जिसमें जटिल, बहु-चरणीय प्रशिक्षण प्रक्रियाओं पर निर्भर तकनीकें भी शामिल हैं। शायद सबसे उल्लेखनीय निष्कर्ष केवल आंकड़ों में सुधार नहीं था, बल्कि समाधान की पारदर्शिता थी। क्योंकि रूटिंग तंत्र अब संतुलित है, शोधकर्ता वास्तव में गेट के निर्णयों को देखकर यह देख सकते हैं कि मॉडल विभिन्न समूहों के साथ कैसा व्यवहार कर रहा है। पारंपरिक मॉडलों में, निष्पक्षता अक्सर एक 'ब्लैक बॉक्स' होती है; यहाँ, रूटिंग वितरण एक खिड़की के रूप में कार्य करता है, जो दिखाता है कि मॉडल अपने संसाधनों को बिल्कुल कैसे आवंटित करता है।

यह कार्य एक महत्वपूर्ण अंतर्दक्षणा को उजागर करता है: आर्टिफिशियल इंटेलिजेंस में पूर्वाग्रह को ठीक करने के लिए अक्सर यह देखना आवश्यक होता है कि मॉडल निर्णय कैसे लेता है, न कि केवल यह कि वह क्या सीखता है। मॉडल द्वारा सूचना को रूट करने के तरीके को संबोधित करके, शोधकर्ता यह रोकने में सक्षम रहे कि सिस्टम कुछ समूहों के लिए छिपे हुए झुकाव विकसित न करे। यह अध्ययन प्रदर्शित करता है कि जब आप डेटा असंतुलन को ठीक करते हैं और यह सुनिश्चित करते हैं कि आंतरिक मार्ग सभी के लिए खुले रहें, तो मॉडल स्वाभाविक रूप से अधिक निष्पक्ष हो जाता है। यह एक याद दिलाता है कि बुद्धिमान प्रणालियों की खोज में, मशीन के माध्यम से डेटा जिस पथ का अनुसरण करता है, वह डेटा स्वयं जितना महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →