← नवीनतम पेपर
💬 NLP

Attributing Culture-Conditioned Generations to Pretraining Corpora

यह शोध पत्र MEMOed फ्रेमवर्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल के जनरेशन में सांस्कृतिक पूर्वाग्रह असमान प्रीट्रेनिंग डेटा वितरण से उत्पन्न होते हैं, जहाँ उच्च-आवृत्ति वाली संस्कृतियाँ रटी-रटाई (मेमोराइज्ड) आउटपुट को ट्रिगर करती हैं जबकि निम्न-आवृत्ति वाली संस्कृतियाँ अक्सर प्रासंगिक सामग्री उत्पन्न करने में विफल रहती हैं।

मूल लेखक: Huihan Li, Arnav Goel, Keyu He, Xiang Ren

प्रकाशित 2026-04-21
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huihan Li, Arnav Goel, Keyu He, Xiang Ren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र "Attributing Culture-Conditioned Generations to Pretraining Corpora" की व्याख्या दी गई है।

बड़ी तस्वीर: "सांस्कृतिक पुस्तकालय" की समस्या

कल्पive एक विशाल पुस्तकालय (प्रशिक्षण कॉर्पस/Pretraining Corpus) जहाँ एक रोबोट छात्र (AI मॉडल) अपने पूरे बचपन में उपलब्ध हर किताब, लेख और वेबसाइट को पढ़ने में बिता देता है।

समस्या क्या है? यह पुस्तकालय अत्यधिक पक्षपाती (biased) है। इसमें अमेरिकी पिज्जा, इतालवी फैशन और जापानी सुशी के बारे में हजारों प्रतियां हैं। लेकिन कुछ संस्कृतियों के लिए, जैसे अमेज़न की कुछ जनजातियों या छोटे द्वीप राष्ट्रों के लिए, इस पुस्तकालय में शायद केवल एक या दो पतले पर्चे होंगे, या शायद केवल एक वाक्य होगा जिसमें उनका उल्लेख हो।

जब आप इस रोबोट से पूछते हैं, "[संस्कृति X] का व्यक्ति क्या खाता है?" या "वे क्या पहनते हैं?", तो रोबोट को उत्तर "पता" नहीं होता है जैसा कि इंसान को होता है। इसके बजाय, वह उस आधार पर अनुमान लगाने की कोशिश करता है जो उसने सबसे अधिक बार पढ़ा है।

यह शोध पत्र पूछता है: क्या रोबोट वास्तव में उस संस्कृति के बारे में सच याद कर रहा है, या वह केवल उस चीज़ के आधार पर अनुमान लगा रहा है जिसे उसने सबसे अधिक बार पढ़ा है?


जासूसी उपकरण: MEMOED

शोधकर्ताओं ने MEMOED (pretraining document से MEMOrization) नामक एक जासूसी उपकरण बनाया। MEMOED को एक फॉरेंसिक लाइब्रेरियन (forensic librarian) के रूप में सोचें।

जब रोबोट एक उत्तर देता है (जैसे, "भारत का व्यक्ति बिरयानी खाता है"), तो MEMOED पुस्तकालय में वापस जाकर किताबों की जाँच करता है। वह पूछता है:

  1. क्या रोबोट ने "भारत" और "बिरयानी" को कई बार एक ही वाक्य या पैराग्राफ में एक साथ देखा था?
  2. या उसने केवल इसलिए अनुमान लगाया क्योंकि "बिरयानी" एक लोकप्रिय शब्द है जिसे उसने हर जगह देखा?

यदि उसने उन्हें अक्सर एक साथ देखा, तो यह याद किया हुआ (Memorized) है। यदि उसने केवल अनुमान लगाया, तो यह कुछ और है।


"अनुमानों" के चार प्रकार

शोध पत्र में पाया गया कि जब रोबोट संस्कृति के बारे में बात करता है, तो वह चार में से एक काम करता है। उन्हें समझाने के लिए आइए ट्रैवल गाइड (Travel Guide) की उपमा का उपयोग करें:

1. "सच्चा स्थानीय" (Memorized Association)

  • यह क्या है: रोबोट एक विशिष्ट सांस्कृतिक वस्तु की सही पहचान करता है क्योंकि उसने पुस्तकालय में इसके बारे में कई बार पढ़ा है।
  • उदाहरण: जापान के बारे में पूछने पर "किमोनो" मिलना।
  • क्यों होता है: पुस्तकालय उन किताबों से भरा था जो कहती थीं "जापान = किमोनो।" रोबोट ने इस संबंध को याद कर लिया।
  • अच्छी खबर: यह सटीक है!
  • बुरी खबर: यह केवल लोकप्रिय संस्कृतियों के लिए होता है। यदि आप किसी दुर्लभ संस्कृति के बारे में पूछते हैं, तो पुस्तकालय में इतना नहीं होगा कि रोबोट कुछ भी याद रख सके।

2. "सामान्य पर्यटक" (Diffuse Association)

  • यह क्या है: रोबोट एक उबाऊ, सामान्य उत्तर देता है जो किसी के लिए भी लागू हो सकता है।
  • उदाहरण: किसी भी संस्कृति के बारे में पूछने पर "टी-शर्ट" या "चावल" मिलना।
  • क्यों होता है: ये शब्द पुस्तकालय में लाखों बार आते हैं। रोबोट सोचता है, "मैंने 'टी-शर्ट' को हर जगह देखा है, इसलिए मैं बस यही कह दूँगा।" यह गलत नहीं है, लेकिन यह मददगार या दिलचस्प नहीं है।
  • उपमा: यह एक ट्रैवल गाइड की तरह है जो किसी भी देश के बारे में पूछने पर केवल यह कहता है, "लोग खाना खाते हैं और कपड़े पहनते हैं।"

3. "भ्रमित पर्यटक" (Cross-Culture Generalization)

  • यह क्या है: रोबोट दो संस्कृतियों को मिला देता है। वह आपको संस्कृति A का उत्तर देता है, लेकिन आपने संस्कृति B के बारे में पूछा था।
  • उदाहरण: कोरिया के बारे में पूछने पर "किमोनो" (जो वास्तव में जापानी है) मिलना।
  • क्यों होता है: पुस्तकालय में, जापान और कोरिया अक्सर एक ही लेखों में आते हैं (जैसे, "एशियाई फैशन ट्रेंड्स")। रोबोट भ्रमित हो गया और उसने सोचा, "ओह, अगर यह एशियाई है, तो यह शायद किमोनो ही होगा।"
  • परिणाम: यह आपके द्वारा पूछी गई संस्कृति की अनूठी पहचान को मिटा देता है।

4. "अस्पष्ट निष्कर्ष" (Weak Association Generalization)

  • यह क्या है: रोबोट स्मार्ट बनने की कोशिश करता है लेकिन अंततः अस्पष्ट हो जाता है। वह एक विशिष्ट चीज़ लेता है जिसे वह जानता है और उसे एक सामान्य श्रेणी में बदल देता है।
  • उदाहरण: वह जानता है कि "किमोनो" जापानी है, लेकिन किसी अन्य संस्कृति के बारे में पूछे जाने पर, वह "रोब" (Robe/चोगा) कहता है।
  • क्यों होता है: वह सामान्यीकरण करने की कोशिश कर रहा है। वह जानता है कि "रोब" कपड़ों का एक प्रकार है, इसलिए वह तब एक सुरक्षित विकल्प के रूप में इसका उपयोग करता है जब वह विशिष्ट सांस्कृतिक वस्तु को याद नहीं रख पाता।

बड़ी खोजें (The "Aha!" Moments)

शोधकर्ताओं ने 110 अलग-अलग संस्कृतियों का विश्लेषण किया और कुछ चौंकाने वाले पैटर्न पाए:

1. "अमीर और अमीर होता है" प्रभाव (The "Rich Get Richer" Effect)
यदि किसी संस्कृति का पुस्तकालय में बहुत अधिक उल्लेख किया जाता है (जैसे अमेरिका, भारत या जापान), तो रोबोट के पास विशिष्ट, सटीक उत्तरों की एक लंबी सूची होती है (Memorized)।

  • उपमा: यदि आप न्यूयॉर्क के बारे में 1,000 किताबें पढ़ते हैं, तो आप किसी को बता सकते हैं कि वहाँ क्या पहनना चाहिए।

2. "मौन बहुमत" की समस्या (The "Silent Majority" Problem)
यदि किसी संस्कृति का उल्लेख कम बार किया जाता है ("Long Tail"), तो रोबोट के पास लगभग शून्य विशिष्ट ज्ञान होता है।

  • उपमा: यदि आपने एक दूरस्थ द्वीप के बारे में केवल एक वाक्य पढ़ा है, तो आप किसी को नहीं बता सकते कि वे क्या पहनते हैं। इसके बजाय, रोबोट या तो "टी-शर्ट" (Diffuse) का अनुमान लगाता है या पड़ोसी संस्कृति के साथ भ्रमित (Cross-Culture) हो जाता है।
  • आंकड़ा: अध्ययन की गई संस्कृतियों में से कपड़ों के लिए, 60% संस्कृतियों के पास शून्य याद किए गए प्रतीक थे। रोबोट को उनके बारे में पता ही नहीं था।

3. लोकप्रियता सटीकता पर भारी पड़ती है (Popularity Wins Over Accuracy)
रोबोट उन सबसे लोकप्रिय शब्दों को दोहराना पसंद करता है जिन्हें वह जानता है, भले ही वे सबसे उपयुक्त न हों।

  • उपमा: यदि आप एक छोटे गाँव के विशिष्ट स्थानीय व्यंजन के बारे में रोबोट से पूछते हैं, और वह नहीं जानता, तो वह बस "पिज्जा" कह सकता है क्योंकि "पिज्जा" उसके पूरे डेटाबेस में सबसे आम खाद्य शब्द है। वह प्रासंगिकता के बजाय आवृत्ति (frequency) को प्राथमिकता देता है।

हमें इसकी चिंता क्यों करनी चाहिए?

यह शोध पत्र एक चेतावनी है। यह दिखाता है कि AI मानव के तरीके से संस्कृति को "सीख" नहीं रहा है; यह केवल सांख्यिकीय रूप से उसकी नकल कर रहा है जो उसने सबसे अधिक बार पढ़ा है।

  • लोकप्रिय संस्कृतियों के लिए: AI बहुत अच्छा है, लेकिन यह बहुत अधिक सरलीकरण कर सकता है।
  • अल्पसंख्यक संस्कृतियों के लिए: AI विफल हो रहा है। यह अनिवार्य रूप से सामान्य उत्तरों का "भ्रम" (hallucinating) पैदा कर रहा है या अन्य संस्कृतियों के गुणों को चुरा रहा है क्योंकि इसके पास सच्चाई जानने के लिए पर्याप्त डेटा नहीं है।

समाधान?
हम केवल AI को दोष नहीं दे सकते। समस्या पुस्तकालय (Library) है। रोबोट के पूर्वाग्रह को ठीक करने के लिए, हमें पुस्तकालय को उन संस्कृतियों के बारे में अधिक किताबों से भरने की आवश्यकता है जो वर्तमान में गायब हैं। हमें "लोकप्रिय" आवाजों को "दुर्लभ" आवाजों को दबाने से रोकना होगा।

एक वाक्य में सारांश

AI मॉडल उन छात्रों की तरह हैं जो केवल सबसे लोकप्रिय पाठ्यपुस्तकों का अध्ययन करते हैं; जब उनसे अस्पष्ट संस्कृतियों के बारे में पूछा जाता है, तो वे सच नहीं जानते, इसलिए वे सामान्य उत्तर देते हैं या उन संस्कृतियों को मिला देते हैं जिन्हें वे जानते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →