← नवीनतम पेपर
💬 NLP

Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models

यह शोध पत्र एक क्रॉस-लिंग्विस्टिक बेंचमार्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि प्रॉम्प्ट भाषाओं में व्याकरणिक लिंग, टेक्स्ट-टू-इमेज मॉडल के आउटपुट को संबंधित दृश्य लिंगों की ओर महत्वपूर्ण रूप से पक्षपाती बनाता है, जो यह प्रकट करता है कि केवल अर्थ संबंधी सामग्री के परे, भाषा की संरचना स्वयं एआई-जनित दृश्य प्रस्तुतियों को आकार देती है।

मूल लेखक: Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata

प्रकाशित 2026-02-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसे शेफ हैं जो किसी भी व्यंजन को केवल रेसिपी पढ़कर बना सकते हैं। लेकिन यहाँ एक ट्विस्ट है: जिस भाषा में आप रेसिपी लिखते हैं उसका व्याकरण (grammar) गुप्त रूप से व्यंजन के स्वाद को बदल देता है, भले ही सामग्री बिल्कुल समान हो।

यह शोधपत्र इस बारे में है कि कैसे शोधकर्ताओं की एक टीम ने खोज निकाला कि टेक्स्ट-टू-इमेज (T2I) AI मॉडल (जो "शेफ" हैं) उन शब्दों के व्याकरणिक लिंग (grammatical gender) से बहुत अधिक प्रभावित होते हैं जिनका उपयोग हम उन्हें वर्णित करने के लिए करते हैं, न कि केवल उन शब्दों के अर्थ से।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

मुख्य विचार: "व्याकरणिक भूत" (The Grammar Ghost)

अंग्रेजी या चीनी जैसी भाषाओं में, "guard" (रक्षक) या "gossip" (गपशप) जैसे शब्दों का कोई अंतर्निहित लिंग नहीं होता। वे तटस्थ होते हैं। लेकिन फ्रेंच, जर्मन या स्पेनिश जैसी भाषाओं में, हर संज्ञा का एक लिंग होता है (पुल्लिंग या स्त्रीलिंग), भले ही वह कोई वस्तु या अवधारणा हो।

  • प्रयोग: शोधकर्ताओं ने उन शब्दों को लिया जहाँ व्याकरणिक लिंग, रूढ़िवादी (stereotypical) लिंग से टकराता है।
    • उदाहरण: फ्रेंच में, "रक्षक" (une sentinelle) के लिए शब्द व्याकरणिक रूप से स्त्रीलिंग है, भले ही रक्षक रूढ़िवादी रूप से पुरुषों के रूप में देखे जाते हैं।
    • उदाहरण: जर्मन में, "गपशप" (der Tratsch) के लिए शब्द व्याकरणिक रूप से पुल्लिंग है, भले ही गपशप को अक्सर महिलाओं से जोड़ा जाता है।

उन्होंने तीन अलग-अलग AI मॉडल (DALL-E 3, Ideogram, और Flux) को तीन प्रकार के प्रॉम्प्ट का उपयोग करके चित्र बनाने के लिए कहा:

  1. जेंडर वाला प्रॉम्प्ट (The Gendered Prompt): फ्रेंच/जर्मन शब्द का उपयोग करना (जैसे, "A photo of a sentinelle")।
  2. तटस्थ प्रॉम्प्ट (अंग्रेजी): अंग्रेजी शब्द का उपयोग करना ("A photo of a guard")।
  3. तटस्थ प्रॉम्प्ट (चीनी): चीनी शब्द का उपयोग करना।

बड़ा खुलासा: व्याकरण एक जादू की छड़ी है

परिणाम आश्चर्यजनक थे। AI ने केवल यह नहीं देखा कि शब्द का अर्थ क्या है; इसने शब्द के लिंग को भी सुना।

  • पुल्लिंग प्रभाव (The Masculine Effect): जब AI को पुल्लिंग व्याकरण वाला शब्द दिया गया (भले ही वह अवधारणा स्त्रीलिंग हो), तो इसने बहुत अधिक बार पुरुषों के चित्र बनाए।

    • उपमा: यह ऐसा है जैसे यदि आपने एक "स्त्रीलिंग" रेसिपी माँगी लेकिन आपने एक "पुल्लिंग" सामग्री लेबल का उपयोग किया, और शेफ ने अचानक सलाद के बजाय स्टेक परोसने का निर्णय लिया।
    • आंकड़े: पुल्लिंग व्याकरण के साथ, AI ने 73% बार पुरुषों को चित्रित किया। तटस्थ अंग्रेजी के साथ, इसने केवल 22% बार पुरुषों को चित्रित किया। केवल एक छोटे से व्याकरणिक चिह्न के कारण यह एक बहुत बड़ी छलांग है।
  • स्त्रीलिंग प्रभाव (The Feminine Effect): जब AI को स्त्रीलिंग व्याकरण वाला शब्द दिया गया, तो इसने महिलाओं को अधिक बार चित्रित किया, लेकिन इसका प्रभाव थोड़ा मिश्रित था।

    • आंकड़े: स्त्रीलिंग व्याकरण ने महिला चित्रों को 38% (अंग्रेजी में 28% की तुलना में) तक बढ़ा दिया।
    • ट्विस्ट: कुछ मामलों में (विशेष रूप से DALL-E 3 मॉडल में), AI ने वास्तव में उसके विपरीत किया जो व्याकरण ने सुझाव दिया था, संभवतः इसलिए क्योंकि यह रूढ़ियों को "ठीक करने" की इतनी कोशिश कर रहा था कि इसने अति-सुधार (overcorrect) कर दिया।

ऐसा क्यों होता है?

शोधकर्ताओं ने पाया कि इसके दो मुख्य कारण हैं:

  1. "हाई-रिसोर्स" पूर्वाग्रह (The "High-Resource" Bias): यह प्रभाव उन भाषाओं में सबसे मजबूत था जिनमें प्रशिक्षण डेटा बहुत अधिक है (जैसे फ्रेंच, स्पेनिश और जर्मन)। ऐसा है जैसे AI ने इन भाषाओं में इतनी सारी किताबें "पढ़ी" हैं कि उसने व्याकरणिक लिंग टैग को विशिष्ट दृश्य शैलियों के साथ जोड़ना सीख लिया है।
  2. "इंग्लिश फ़िल्टर" (The "English Filter"): जब उन्होंने अंग्रेजी के साथ तुलना की, तो प्रभाव कभी-कभी कमजोर था। शोधकर्ताओं को संदेह है कि ऐसा इसलिए है क्योंकि अंग्रेजी AI मॉडल को विशेष रूप से "डीबायसिंग" (पूर्वाग्रह हटाने के लिए प्रशिक्षित) किया गया है। हालांकि, जब उन्होंने चीनी (जिसमें कम पूर्वाग्रह अनुसंधान है) के साथ तुलना की, तो व्याकरणिक लिंग के प्रभाव और भी स्पष्ट और मजबूत थे।

मॉडल अलग तरह से प्रतिक्रिया करते हैं

इन तीन AI मॉडल को तीन अलग-अलग कलाकारों के रूप में सोचें:

  • Flux: सबसे संवेदनशील कलाकार। इसने व्याकरणिक लिंग के नियमों का सख्ती से पालन किया, पुल्लिंग शब्दों के लिए पुरुषों को और स्त्रीलिंग शब्दों के लिए महिलाओं को लगभग हर बार चित्रित किया।
  • Ideogram: एक मध्यम मार्ग वाला कलाकार। इसने नियमों का पालन किया लेकिन उतना चरम नहीं था।
  • DALL-E 3: "विद्रोही" कलाकार। इसने अक्सर व्याकरणिक लिंग को अनदेखा किया या इसके विपरीत भी किया, संभवतः क्योंकि इसके प्रशिक्षण में लिंग संबंधी रूढ़ियों से बचने के लिए कड़े निर्देश शामिल थे।

"अस्पष्टता" का दुष्प्रभाव (The "Ambiguity" Side Effect)

एक दिलचस्प नोट: जब AI को जेंडर वाले भाषाओं के साथ प्रॉम्प्ट दिया गया, तो इसने ऐसे अधिक चित्र बनाए जिन्हें वर्गीकृत करना कठिन था (AI यह नहीं बता सका कि व्यक्ति पुरुष था या महिला)। ऐसा लगता है जैसे शब्द के अर्थ और उसके व्याकरणिक लिंग के बीच का संघर्ष AI को भ्रमित कर देता है, जिससे चित्र लिंग के मामले में "धुंधला" (fuzzy) दिखता है।

निचोड़ (The Bottom Line)

यह शोधपत्र सिद्ध करता है कि भाषा की संरचना स्वयं AI में वास्तविकता को आकार देती है। यह केवल यह नहीं है कि आप क्या कहते हैं (सामग्री), बल्कि आप इसे कैसे कहते हैं (व्याकरण) कि चित्र को बदल देता है।

यदि आप एक "रक्षक" (guard) का चित्र चाहते हैं, तो AI अंग्रेजी में एक पुरुष दिखा सकता है, लेकिन फ्रेंच में एक महिला दिखा सकता है, केवल इसलिए क्योंकि गार्ड के लिए फ्रेंच शब्द व्याकरणिक रूप से स्त्रीलिंग है। शोधकर्ता इसे एक नया आयाम कहते हैं: व्याकरणिक लिंग पूर्वाग्रह (Grammatical Gender Bias)

यह शोधपत्र क्या नहीं कहता:

  • यह यह सुझाव नहीं देता कि हमें जेंडर वाले भाषाओं का उपयोग करना बंद कर देना चाहिए।
  • यह अभी तक इस समस्या का कोई विशिष्ट समाधान नहीं देता है (केवल यह नोट करने के अलावा कि मॉडल प्रशिक्षण को इस बात का ध्यान रखना चाहिए)।
  • यह दावा नहीं करता कि यह सभी AI सिस्टम में होता है, केवल उन्हीं तीन विशिष्ट मॉडलों में जिनका परीक्षण किया गया था।

संक्षेप में, भाषा का व्याकरण AI के लिए एक छिपे हुए निर्देश मैनुअल की तरह है, जो उसे शब्द के अर्थ को देखने से पहले ही यह बताता है कि किसे चित्रित करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →