← नवीनतम पेपर
💻 computer science

EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation

EquiSteer एक प्रशिक्षण-मुक्त (training-free), प्रति-नमूना अनुमान विधि है जो तटस्थ प्रॉम्प्ट्स में लक्षित गुणों को इंजेक्ट करने के लिए क्रॉस-अटेंशन एक्टिवेशन्स को गतिशील रूप से निर्देशित करके और गुण-विशिष्ट प्रॉम्प्ट्स के मूल इरादे को सुरक्षित रखते हुए टेक्स्ट-टू-इमेज जनरेशन में जनसांख्यिकीय पूर्वाग्रहों को कम करती है।

मूल लेखक: Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई कला मशीन (एक टेक्स्ट-टू-इमेज AI) है जो आपके द्वारा बताए गए किसी भी विवरण को चित्रित कर सकती है। आप इसे कहते हैं, "एक नर्स की फोटो बनाओ," और यह एक महिला का चित्र बनाती है। आप कहते हैं, "एक CEO की फोटो बनाओ," और यह एक पुरुष का चित्र बनाती है।

समस्या यह नहीं है कि मशीन "मूर्ख" है; बल्कि इसने पुराने फोटो के एक विशाल पुस्तकालय से सीखा है जहाँ नर्सें ज्यादातर महिलाएं थीं और CEO ज्यादातर पुरुष थे। मशीन ने इन रूढ़ियों (stereotypes) को याद कर लिया है और उन्हें स्वचालित रूप से दोहराती है, भले ही आपने लिंग (gender) के बारे में कुछ न पूछा हो।

यह पेपर EquiSteer पेश करता है, जो इस कला मशीन के लिए एक नया "रिमोट कंट्रोल" है जो मशीन को शुरू से दोबारा बनाए बिना इन पूर्वाग्रहों (biases) को ठीक करता है।

यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए यहाँ दिया गया है:

1. समस्या: मशीन का "ऑटो-पायलट"

AI के आंतरिक मस्तिष्क को एक विशाल ऑर्केस्ट्रा (orchestra) के रूप में सोचें। जब आप इसे कोई प्रॉम्प्ट देते हैं, तो संगीतकार (AI की परतें) बजना शुरू कर देते हैं। लेकिन अपने प्रशिक्षण के कारण, ऑर्केस्ट्रा का "लिंग" (gender) वाला हिस्सा कुछ विशेष नौकरियों के लिए हमेशा बहुत जोर से बज रहा होता है। यदि आप "नर्स" मांगते हैं, तो "महिला" वाले वाद्य यंत्र इतनी जोर से बजते हैं कि "पुरुष" वाले वाद्य यंत्र सुनाई ही नहीं देते, भले ही आपने लिंग निर्दिष्ट न किया हो।

2. समाधान: EquiSteer (एक स्मार्ट कंडक्टर)

EquiSteer एक स्मार्ट कंडक्टर की तरह है जो संगीत बजने के दौरान (जेनरेशन के समय) हस्तक्षेप करता है। इसे ऑर्केस्ट्रा को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; यह बस वास्तविक समय में विशिष्ट वाद्य यंत्रों की आवाज़ (volume) को समायोजित करता है।

यह तीन चतुर चरणों में ऐसा करता है:

चरण A: "गेटकीपर" (स्क्रिप्ट की जाँच करना)

सबसे पहले, कंडक्टर स्क्रिप्ट (आपका प्रॉम्प्ट) की जाँच करता है।

  • परिदृश्य 1: आपने लिखा, "पुरुष नर्स।"
    • गेटकीपर देखता है कि आपने स्पष्ट रूप से पुरुष के लिए पूछा है। वह कहता है, "ठीक है, उपयोगकर्ता जानता है कि वह क्या चाहता है। ऑर्केस्ट्रा को ठीक वैसे ही बजने दें जैसा लिखा है।" वह कुछ नहीं करता।
  • परिदृश्य 2: आपने लिखा, "एक नर्स।"
    • गेटकीपर देखता है कि आपने लिंग निर्दिष्ट नहीं किया है। वह कहता है, "आह, ऑर्केस्ट्रा 'महिला' स्टीरियोटाइप को बहुत जोर से बजाने वाला है। मुझे हस्तक्षेप करने की आवश्यकता है।"

चरण B: "इरेज़र" (शोर को साफ करना)

यदि गेटकीपर हस्तक्षेप करने का निर्णय लेता है, तो कंडक्टर पहले उन "लिंग" वाद्य यंत्रों को म्यूट (शांत) कर देता है जो पहले से ही बहुत जोर से बज रहे हैं।

  • कल्पना करें कि ऑर्केस्ट्रा अपने प्रशिक्षण के कारण पहले से ही "महिला" की ओर झुका हुआ था। EquiSteert एक विशेष "नॉइज़-कैंसलिंग" तकनीक का उपयोग करके उस पूर्व-मौजूद पूर्वाग्रह को मिटा देता है, जिससे एक साफ स्लेट मिल जाती है। यह रोकता है कि अंतिम छवि एक पुरुष और महिला का भ्रमित करने वाला मिश्रण न बन जाए।

चरण C: "वॉल्यूम नॉब" (संतुलन डालना)

अब, कंडक्टर गायब वाद्य यंत्रों की आवाज़ बढ़ाता है ताकि एक आदर्श संतुलन बनाया जा सके।

  • यदि लक्ष्य 50% पुरुष और 50% महिलाएं हैं, तो EquiSteer गणना करता है कि "महिला" सिग्नल में कितना "पुरुष" सिग्नल जोड़ना है ताकि वे बराबर हो जाएं। यह केवल अनुमान नहीं लगाता; यह एक पूर्व-कैलिब्रेटेड "वॉल्यूम नॉब" का उपयोग करता है जो बताता है कि एक पूरी तरह से संतुलित छवि कैसी सुनाई देनी चाहिए।

3. यह क्यों खास है

पिछले तरीकों ने दो तरीकों से इसे ठीक करने की कोशिश की, जिनमें दोनों की कमियां थीं:

  • पुनः प्रशिक्षण (Retraining): यह पूरे ऑर्केस्ट्रा को निकालने और शून्य से सीखने के लिए नए संगीतकारों को काम पर रखने जैसा है। यह महंगा है, धीमा है, और आप यह तब नहीं कर सकते जब आपके पास मशीन का स्वामित्व न हो।
  • बैच कंट्रोल (Batch Control): यह कंडक्टर को यह बताने जैसा है कि, "अगले 100 गानों के लिए, सुनिश्चित करें कि 50 पुरुष और 50 महिलाएं हों।" यह एक समूह के लिए काम करता है, लेकिन यदि आप केवल एक विशिष्ट गाने के लिए पूछते हैं, तो यह लिंग को गलत कर सकता है।

EquiSteer अलग है क्योंकि:

  • यह ट्रेनिंग-फ्री है: यह बिना इसके वेट्स (weights) बदले मौजूदा मशीन पर काम करता है।
  • यह प्रति-नमूना (Per-Sample) है: यह प्रत्येक छवि को व्यक्तिगत रूप से ठीक करता है। यदि आप "पुरुष नर्स" मांगते हैं, तो यह उसका सम्मान करता है। यदि आप "नर्स" मांगते हैं, तो यह लिंग को संतुलित करता है।
  • यह तेज़ है: यह छवि बनने के एक सेकंड के भीतर होता है।

परिणाम

लेखकों ने चार अलग-अलग प्रकार की AI कला मशीनों (SD-1.5, SD-2.1, SDXL, और SANA) और लिंग, नस्ल, आयु और यहाँ तक कि चश्मा पहनने जैसे विभिन्न विषयों पर इसका परीक्षण किया।

  • निष्पक्षता (Fairness): इसने पूर्वाग्रह के अंतर को 87% तक कम कर दिया। इसका मतलब है कि छवियां बहुत अधिक संतुलित हो गईं (उदाहरण के लिए, नर्सें अब लगभग हमेशा महिलाएं नहीं थीं)।
  • गुणवत्ता (Quality): छवियां अभी भी बेहतरीन दिखती थीं और टेक्स्ट विवरणों से पूरी तरह मेल खाती थीं। "सुधार" ने कला को अजीब या धुंधला नहीं बनाया।
  • सम्मान (Respect): इसने सफलतापूर्वक उन प्रॉम्प्ट्स को अनदेखा किया जहाँ उपयोगकर्ता ने लिंग निर्दिष्ट किया था (जैसे "पुरुष CEO"), यह सुनिश्चित करते हुए कि यह गलती से उपयोगकर्ता द्वारा मांगी गई चीज़ को न बदल दे।

संक्षेप में, EquiSteer एक हल्का, स्मार्ट "ट्यूनर" है जो यह सुनिश्चित करता है कि AI का आंतरिक ऑर्केस्ट्रा एक निष्पक्ष गाना बजाए, चाहे उसने पक्षपाती शीट म्यूजिक से सीखा हो, और इसके लिए संगीत को फिर से लिखने या संगीतकारों को बदलने की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →