← नवीनतम पेपर
🤖 machine learning

Mitigating Bias in Concept Bottleneck Models for Fair and Interpretable Image Classification

यह शोध पत्र कॉन्सेप्ट बॉटलनेक मॉडल्स (Concept Bottleneck Models) में सूचना रिसाव (information leakage) को संबोधित करने के लिए तीन पूर्वाग्रह शमन तकनीकों—टॉप-के कॉन्सेप्ट फ़िल्टरिंग (top-k concept filtering), पक्षपाती अवधारणाओं को हटाना (removal of biased concepts), और एडवरसेरियल डिबायसिंग (adversarial debiasing)—का प्रस्ताव करता है, जिससे पूर्ववर्ती कार्यों की तुलना में व्याख्या योग्य छवि वर्गीकरण (interpretable image classification) के लिए बेहतर निष्पक्षता-प्रदर्शन संतुलन प्राप्त होता है।

मूल लेखक: Schrasing Tong, Antoine Salaun, Vincent Yuan, Annabel Adeyeri, Lalana Kagal

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Schrasing Tong, Antoine Salaun, Vincent Yuan, Annabel Adeyeri, Lalana Kagal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए कर्मचारी को काम पर रख रहे हैं, लेकिन उनके बायोडाटा (resume) को देखने या उनका सीधे साक्षात्कार करने के बजाय, आप एक बहुत ही बुद्धिमान, लेकिन थोड़े पक्षपाती सहायक से उनके बारे में वर्णन करने के लिए कहते हैं।

यह शोध पत्र एक विशिष्ट प्रकार के AI सिस्टम के बारे में है जिसे कॉन्सेप्ट बॉटलनैक मॉडल (Concept Bottleneck Model - CBM) कहा जाता है। CBM को एक "बिचौलिये" AI के रूप में समझें। एक फोटो को देखकर सीधे अंदाजा लगाने के बजाय, यह पहले फोटो को मानव-पठनीय विचारों (concepts) की एक सूची में अनुवाद करता है, जैसे कि "टाई पहनी हुई है," "स्पैटुला पकड़े हुए है," या "रसोई में खड़ा है।"

इसका लक्ष्य AI को निष्पक्ष और समझने में आसान बनाना है। लेकिन शोधकर्ताओं ने एक समस्या पाई: बिचौलिया राज लीक कर रहा है।

यहाँ सरल उपमाओं का उपयोग करके शोध पत्र का विवरण दिया गया है:

1. समस्या: "ज़्यादा बोलने वाला" अनुवादक

शोधकर्ता CBM का उपयोग AI के पक्षपात (जैसे, यह मान लेना कि केवल पुरुष ही शेफ होते हैं या केवल महिलाएँ ही नर्स होती हैं) को रोकने के लिए करना चाहते थे। विचार यह था: "यदि AI केवल 'स्पैटुला पकड़ने' को देखता है और 'दाढ़ी है' जैसी चीज़ों को अनदेखा करता है, तो यह निष्पक्ष होगा!"

हालाँकि, उन्होंने पाया कि भले ही AI "स्पैटुला पकड़ने" को देख रहा है, लेकिन जिस तरह से वह उस कॉन्सेप्ट की गणना करता है, उसमें गुप्त रूप से लिंग (gender) के बारे में जानकारी शामिल होती है।

  • उपमा: कल्पना कीजिए कि एक अनुवादक एक वाक्य का फ्रेंच से अंग्रेजी में अनुवाद करने के लिए है। लेकिन, अनुवादक गलती से वक्ता के लहजे (accent) और लिंग को अंग्रेजी अनुवाद में फुसफुसा देता है। भले ही अंग्रेजी शब्द सही हों, लेकिन वह "फुसफुसाहट" वक्ता की पहचान प्रकट कर देती है, जिससे सुनने वाले को पक्षपाती धारणाएँ बनाने की अनुमति मिल जाती है।
  • परिणाम: AI अभी भी लिंग को "सुन" रहा था, भले ही उसे केवल कार्यों पर ध्यान देना चाहिए था। इसे सूचना का रिसाव (Information Leakage) कहा जाता है।

2. समाधान: लीक्स को रोकने के तीन तरीके

टीम ने इस गुप्त लिंग जानकारी को लीक करने से रोकने के लिए तीन अलग-अलग तरीके आजमाए।

तकनीक A: "Top-K" फ़िल्टर (स्पॉटलाइट)

AI को उन हर एक सूक्ष्म विवरण को देखने देने के बजाय जो उसे मिलते हैं (जिसमें शोर भरे पक्षपाती फुसफुसाहट शामिल हैं), उन्होंने इसे केवल सबसे महत्वपूर्ण 20 कॉन्सेप्ट्स पर ध्यान केंद्रित करने के लिए कहा।

  • उपमा: कल्पना कीजिए कि आप एक गाना पहचानने की कोशिश कर रहे हैं। आप पूरे 3 घंटे के कॉन्सर्ट की रिकॉर्डिंग सुन सकते हैं (जिसमें भीड़ का शोर, बैंड की ट्यूनिंग, और गायक का खाँसना शामिल है)। या, आप नॉइज़-कैंसलिंग हेडफ़ोन लगा सकते हैं और केवल शीर्ष 20 सबसे तेज़ नोट्स सुन सकते हैं।
  • परिणाम: AI को "बैकग्राउंड नॉइज़" (कमजोर कॉन्सेप्ट्स में छिपे सूक्ष्म लिंग संकेतों) को अनदेखा करने के लिए मजबूर करके, यह बहुत अधिक निष्पक्ष हो गया। इससे इसकी सटीकता में बहुत कम कमी आई, लेकिन इसने लिंग-आधारित अनुमान लगाना बंद कर दिया।

तकनीक B: "बुरे सेब" को हटाना (संपादन)

उन्होंने उन कॉन्सेप्ट्स को खोजने की कोशिश की जो स्पष्ट रूप से पक्षपाती थे (जैसे पुरुषों के लिए "नेक टाई" या महिलाओं के लिए "ब्लाउज") और उन्हें AI की शब्दावली से हटा दिया।

  • उपमा: यह एक पक्षपाती जूरी को उन जूरी सदस्यों को बाहर निकालकर ठीक करने जैसा है जो विशिष्ट टोपियाँ पहनते हैं।
  • परिणाम: यह अच्छी तरह से काम नहीं किया। क्यों? क्योंकि AI चालाक है। यदि आप "नेक टाई" को हटा देते हैं, तो यह लिंग का अनुमान लगाने के लिए "छोटे बाल" या "गहरी आवाज़" जैसे नए तरीकों का उपयोग करना शुरू कर देता है। "लीक" बस दूसरे पाइप में चला गया।

तकनीक C: "एडवर्सरियल" खेल (कोच)

उन्होंने एक दूसरा AI (एक "कोच") जोड़ा, जिसका एकमात्र काम पहले AI के उत्तरों के आधार पर लिंग का अनुमान लगाना था। मुख्य AI फिर अपने काम में बेहतर होने की कोशिश करता है, बिना कोच को लिंग का पता चलने दिए।

  • उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। एक प्रॉक्टर उसके पास खड़ा है और छात्र के लिखने के तरीके के आधार पर उसके लिंग का अनुमान लगाने की कोशिश करता है। छात्र को एहसास होता है, "ओह, अगर मैं बहुत सफाई से लिखता हूँ, तो प्रॉक्टर को पता चल जाएगा कि मैं एक लड़की हूँ।" इसलिए, छात्र इस तरह से लिखना सीखता है जो लिंग के बारे में कोई संकेत न दे, जबकि वह सही उत्तर भी दे रहा हो।
  • परिणाम: यह सबसे प्रभावी तरीका था। इसने AI को लिंग के संकेतों पर निर्भर हुए बिना कार्य (जैसे "अंडा तलना") सीखने के लिए मजबूर किया।

3. बड़ा समझौता: "गोल्डिलॉक्स" ज़ोन (संतुलन)

इस शोध में एक कठिन संतुलन मिला, जैसे कि शॉवर के लिए एकदम सही तापमान ढूँढना:

  • बहुत अधिक कॉन्सेप्ट्स: AI बहुत सटीक है लेकिन बहुत अधिक पक्षपात लीक करता है (बहुत गर्म)।
  • बहुत कम कॉन्सेप्ट्स: AI बहुत निष्पक्ष है लेकिन बहुत अधिक गलतियाँ करता है (बहुत ठंडा)।
  • बिल्कुल सही: Top-K Filter को Adversarial Coach के साथ मिलाकर, उन्होंने एक "स्वीट स्पॉट" पाया। AI बिना सटीकता खोए 28% अधिक निष्पक्ष हो गया।

यह क्यों मायने रखता है

अधिकांश AI मॉडल "ब्लैक बॉक्स" होते हैं—आप एक फोटो डालते हैं, और एक अनुमान आता है, लेकिन आपको नहीं पता कि वह क्यों आया।

  • पुराना तरीका: AI "शेफ" का अनुमान इसलिए लगा क्योंकि उसने एक पुरुष को देखा। आप पक्षपात को देख नहीं सकते।
  • नया तरीका (CBM): AI कहता है, "मैंने शेफ का अनुमान लगाया क्योंकि मैंने एक स्पैटुला और एक चूल्हा देखा।"
  • समाधान: लेखकों ने दिखाया कि इस पारदर्शी प्रणाली के साथ भी, AI अभी भी पक्षपात को चुपके से शामिल कर रहा था। लेकिन उनके नए फिल्टर्स और कोचिंग विधियों का उपयोग करके, उन्होंने इस प्रणाली को पारदर्शी और निष्पक्ष दोनों बना दिया।

संक्षेप में: उन्होंने एक स्मार्ट, अधिक ईमानदार AI बनाया जो अपने तर्क की व्याख्या करता है, और फिर उसे अपने ही स्पष्टीकरणों में छिपे पक्षपात के "फुसफुसाहटों" को सुनना बंद करने के लिए प्रशिक्षित किया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →