← नवीनतम पेपर
💬 NLP

Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG

यह शोध पत्र प्रकट करता है कि बहुभाषी रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) मॉडल एक "भाषाई भाई-भतीजावाद" (linguistic nepotism) के पूर्वाग्रह को प्रदर्शित करते हैं जहाँ वे अन्य भाषाओं के अधिक प्रासंगिक दस्तावेज़ों के बजाय अंग्रेजी स्रोतों को प्राथमिकता देते हैं, विशेष रूप से कम-संसाधन वाली भाषाओं और मध्य-संदर्भ स्थितियों के लिए, जिससे वे भाषा की प्राथमिकता के लिए तथ्यात्मक प्रासंगिकता का त्याग करते हैं।

मूल लेखक: Dayeon Ki, Marine Carpuat, Paul McNamee, Daniel Khashabi, Eugene Yang, Dawn Lawrie, Kevin Duh

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dayeon Ki, Marine Carpuat, Paul McNamee, Daniel Khashabi, Eugene Yang, Dawn Lawrie, Kevin Duh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG" का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।

बड़ी तस्वीर: "भाषा संबंधी भाई-भतीजावाद" (The "Language Cousin" Problem)

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन (AI) से किसी विशिष्ट मशीन के काम करने के तरीके पर एक रिपोर्ट लिखने के लिए कहते हैं। आप लाइब्रेरियन को 10 अलग-अलग निर्देशों वाली फाइलों का एक ढेर देते हैं। कुछ अंग्रेजी में हैं, कुछ फ्रेंच में, कुछ स्वाहिली में और कुछ कोरियाई में। वे सभी वास्तव में सही और उपयोगी हैं।

शोध से पता चलता है कि इस लाइब्रेरियन में एक गुप्त पक्षपात है: उन्हें अपने अंग्रेजी रिश्तेदारों (English cousins) से बहुत लगाव है।

भले ही फ्रेंच या कोरियाई मैनुअल उस मशीन को पूरी तरह से समझाता हो, लाइब्रेरियन अंग्रेजी वाले मैनुअल को उद्धृत (quote) करने की अधिक संभावना रखता है। यदि अंग्रेजी मैनुअल वास्तव में गलत या अप्रासंगिक है, लेकिन कोरियाई वाला एकदम सटीक है, तो भी लाइब्रेरियन अक्सर अंग्रेजी वाले को ही चुनने की कोशिश करेगा। वे गुणवत्ता (सही उत्तर) के बदले भाषा प्राथमिकता (परिचित भाषा) का व्यापार कर रहे हैं।

लेखक इसे "भाषाई भाई-भतीजावाद" (Linguistic Nepotism) कहते हैं—एक परिवार के सदस्य (अंग्रेजी) को दूसरे अजनबी (अन्य भाषाओं) के ऊपर प्राथमिकता देना, भले ही वह अजनबी काम के लिए अधिक योग्य हो।


उन्होंने लाइब्रेरियन को रंगे हाथों कैसे पकड़ा?

यह साबित करने के लिए कि यह केवल एक संयोग नहीं था, शोधकर्ताओं ने एक बहुत ही सख्त, नियंत्रित प्रयोग स्थापित किया। इसे एक जादू के खेल की तरह समझें जहाँ जादूगर के ध्यान भटकाने के लिए कार्ड बदल दिए जाते हैं।

  1. सेटअप: उन्होंने एक आदर्श अंग्रेजी रिपोर्ट ली और स्रोत दस्तावेजों को आठ अलग-अलग भाषाओं (जैसे फ्रेंच, अरबी, स्वाहिली, आदि) में अनुवादित किया।
  2. नियंत्रण (Control): उन्होंने बाकी सब कुछ बिल्कुल समान रखा। सामग्री एक ही थी; केवल भाषा बदली थी।
  3. परीक्षण: उन्होंने AI को एक रिपोर्ट लिखने और अपने स्रोतों का हवाला देने के लिए कहा। उन्होंने बारीकी से देखा कि AI किस "भाषा संबंधी रिश्तेदार" को चुनता है।

उन्होंने पाया कि AI की "उद्धरण सटीकता" (citation accuracy - कितनी बार उसने सही स्रोत चुना) गैर-अंग्रेजी भाषा होने पर काफी कम हो गई।

मुख्य निष्कर्ष: पक्षपात कब और बढ़ जाता है

1. "मध्यम संतान" प्रभाव (The "Middle Child" Effect)

शोधकर्ताओं ने पाया कि दस्तावेजों का ढेर में स्थान मायने रखता है।

  • उपमा: कल्पना कीजिए कि आप एक लंबी किताब पढ़ रहे हैं। आपको शुरुआत और अंत स्पष्ट रूप से याद रहते हैं, लेकिन बीच का हिस्सा धुंधला हो जाता है।
  • परिणाम: AI का अंग्रेजी के प्रति झुकाव तब सबसे मजबूत होता है जब दस्तावेज़ संदर्भ के बीच में होता है। यदि स्वाहिली दस्तावेज़ ढेर के बीच में है, तो AI उसे अनदेखा करने और इसके बजाय एक अंग्रेजी दस्तावेज़ लेने की बहुत अधिक संभावना रखता है, भले ही अंग्रेजी वाला दस्तावेज़ दूर हो या कम प्रासंगिक हो।

2. "दबे हुए खिलाड़ी" का दंड (The "Underdog" Penalty)

यह पक्षपात सभी भाषाओं के लिए एक जैसा नहीं है।

  • उपमा: यह एक ऐसे शिक्षक की तरह है जो एक दुर्लभ बोली बोलने वाले छात्रों के प्रति थोड़ा पक्षपाती है, लेकिन एक सामान्य विदेशी भाषा जैसे फ्रेंच बोलने वाले छात्रों के प्रति उसका पक्षपात लगभग न के बराबर है।
  • परिणाम: AI का अंग्रेजी के प्रति झुकाव "कम संसाधन वाली" (lower-resource) भाषाओं (जैसे स्वाहिली या बंगाली) के लिए "उच्च संसाधन वाली" (higher-resource) भाषाओं (जैसे फ्रेंच या स्पेनिश) की तुलना में बहुत अधिक है। AI सबसे अधिक संभावना रखता है कि वह "दबे हुए खिलाड़ियों" (underdog) की भाषाओं को पूरी तरह से अनदेखा कर दे।

3. "प्रश्न की भाषा" का दर्पण (The "Query Language" Mirror)

शोधकर्ताओं ने यह भी परीक्षण किया कि यदि आप किसी अन्य भाषा में प्रश्न पूछते हैं (उदाहरण के लिए, फ्रेंच में) तो क्या होता है।

  • उपमा: यदि आप लाइब्रेरियन से फ्रेंच में बात करते हैं, तो वह अचानक फ्रेंच किताबों के प्रति अधिक मिलनसार हो जाता है।
  • परिणाम: AI उसी भाषा में दस्तावेज़ों को उद्धृत करना पसंद करता है जिसमें प्रश्न पूछा गया है। यदि आप फ्रेंच में पूछते हैं, तो यह फ्रेंच स्रोतों को प्राथमिकता देता है। हालाँकि, यदि प्रश्न अंग्रेजी में है, तो यह अन्य दस्तावेजों की परवाह किए बिना भारी रूप से अंग्रेजी स्रोतों को प्राथमिकता देता है।

सबसे चौंकाने वाला खुलासा: प्रासंगिकता बनाम भाषा (Relevance vs. Language)

यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है। शोधकर्ताओं ने एक जाल बिछाया:

  • दस्तावेज़ A: प्रश्न के लिए पूरी तरह से प्रासंगिक है, लेकिन स्वाहिली में लिखा गया है।
  • दस्तावेज़ B: पूरी तरह से अप्रासंगिक है (यह किसी और चीज़ के बारे में बात करता है), लेकिन अंग्रेजी में लिखा गया है।

परिणाम: AI अक्सर दस्तावेज़ B (अप्रासंगिक अंग्रेजी दस्तावेज़) को चुनने के लिए चुना गया, बजाय दस्तावेज़ A (प्रासंगिक स्वाहिली दस्तावेज़) के।

यह सिद्ध करता है कि इन मॉडलों के लिए, भाषा की प्राथमिकता सत्य से भी अधिक शक्तिशाली हो सकती है। AI एक परिचित भाषा का उपयोग करके सच बोलने के बजाय झूठ बोलना और परिचित भाषा को उद्धृत करना पसंद करता है।

AI निर्णय कैसे लेता है (द "ब्रेन स्कैन")

लेखकों ने AI के "मस्तिष्क" (इसके आंतरिक स्तरों) के भीतर देखा कि यह निर्णय कब होता है।

  • उपमा: कल्पना कीजिए कि जजों की एक समिति विजेता चुनने के लिए निर्णय ले रही है। शुरुआती दौर में, वे भ्रमित होते हैं। लेकिन लगभग 20वें दौर के आसपास, वे अचानक एक विजेता चुन लेते हैं और उसी पर टिके रहते हैं।
  • परिणाम: AI अपने प्रसंस्करण (processing) के बहुत शुरुआती चरण में अपना निर्णय ले लेता है। एक बार जब वह एक अंग्रेजी दस्तावेज़ को उद्धृत करने का निर्णय ले लेता है, तो वह अपना मन बदलने की बहुत कम संभावना रखता है, भले ही वह प्रक्रिया के बाद के चरणों में किसी अन्य भाषा में सही जानकारी देखे। वह जल्दी ही अपने पक्षपात पर "लॉक इन" हो जाता है।

सारांश

यह शोध पत्र निष्कर्ष निकालता है कि बहुभाषी RAG सिस्टम (AI जो कई भाषाओं में पढ़ता और लिखता है) "भाषाई भाई-भतीजावाद" (Linguistic Nepotism) से ग्रस्त हैं। वे व्यवस्थित रूप से अन्य भाषाओं की तुलना में अंग्रेजी (और प्रश्न की भाषा) को प्राथमिकता देते हैं।

  • वे प्रासंगिक गैर-अंग्रेजी दस्तावेजों को अनदेखा करते हैं।
  • वे अप्रासंगिक अंग्रेजी दस्तावेजों को पसंद करते हैं।
  • यह पक्षपात कम सामान्य भाषाओं और लंबे टेक्स्ट के बीच दबे हुए दस्तावेजों के लिए और भी खराब हो जाता है।

लेखक चेतावनी देते हैं कि यदि हम इसे ठीक नहीं करते हैं, तो ये AI सिस्टम गैर-अंग्रेजी भाषियों से जानकारी छिपाते रहेंगे और इस विचार को पुख्ता करेंगे कि अंग्रेजी ही ज्ञान की एकमात्र "महत्वपूर्ण" भाषा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →