← नवीनतम पेपर
🤖 machine learning

Fair Representation in Parliamentary Summaries: Measuring and Mitigating Inclusion Bias

यह शोध पत्र यूरोपीय संसद की बहसों का सारांश निकालने वाले पांच बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) का मूल्यांकन करता है, जो क्रम, भाषा और राजनीतिक संबद्धता के आधार पर वक्ताओं के विरुद्ध व्यवस्थित पूर्वाग्रहों को प्रकट करता है, और एक पदानुक्रमित सारांशीकरण पद्धति प्रस्तावित करता है ताकि उन समावेशी पूर्वाग्रहों को प्रभावी ढंग से कम किया जा सके जहाँ प्रॉम्प्टिंग रणनीतियाँ विफल हो जाती हैं।

मूल लेखक: Eoghan Cunningham, James Cross, Derek Greene

प्रकाशित 2026-04-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eoghan Cunningham, James Cross, Derek Greene

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि यूरोपीय संसद एक विशाल, हलचल भरे टाउन हॉल मीटिंग की तरह है जहाँ विभिन्न देशों के सैकड़ों लोग, अलग-अलग भाषाएँ बोलते हुए और अलग-अलग राजनीतिक विचार रखते हुए महत्वपूर्ण मुद्दों पर बहस करने के लिए एकत्र होते हैं। इन बैठकों का ट्रांसक्रिप्ट (प्रतिलेख) हजारों पन्नों लंबा होता है—इतना लंबा कि कोई भी आम नागरिक इसे पढ़ नहीं सकता।

यहाँ लार्ज लैंग्वेज मॉडल्स (LLMs) आते हैं, जो "AI लेखक" (AI scribes) हैं। उनका काम इन विशाल ट्रांसक्रिप्ट्स को पढ़ना और एक छोटा, आसानी से समझ में आने वाला सारांश लिखना है ताकि जनता समझ सके कि क्या हुआ। इसका लक्ष्य लोकतंत्र को अधिक सुलभ बनाना है।

हालाँकि, यह शोध पत्र एक महत्वपूर्ण प्रश्न पूछता है: क्या AI लेखक निष्पक्ष है? या क्या वह अनजाने में (या जानबूझकर) कुछ लोगों को अनदेखा कर रहा है, उनके शब्दों को तोड़-मरोड़ रहा है, या केवल बैठक की शुरुआत और अंत की ऊँची आवाजों को ही सुन रहा है?

यहाँ सरल उपमाओं (analogies) का उपयोग करके शोध के निष्कर्षों का विवरण दिया गया है।

1. "मिडल कर्स" (बीच का अभिशाप): खोई हुई आवाजें

समस्या:
कल्पना कीजिए कि एक टाउन हॉल में बोलने के लिए लोगों की एक लंबी कतार खड़ी है। AI लेखक शुरुआती कुछ लोगों और आखिरी कुछ लोगों को बहुत ध्यान से सुनता है। लेकिन जो लोग बीच में बोल रहे हैं? AI अक्सर उन्हें अनदेखा कर देता है। यह एक ऐसे रेडियो की तरह है जिसका सिग्नल गाने की शुरुआत और अंत में तो मजबूत होता है, लेकिन बीच का हिस्सा शोर (static) से भरा होता है।

तकनीकी शब्दों में, इसे "लॉस्ट-इन-द-मिडल" (Lost-in-the-Middle) समस्या कहा जाता है। अध्ययन में पाया गया कि बहस के बीच में बोलने वाले वक्ताओं को व्यवस्थित रूप से अनदेखा किया गया या उनका प्रतिनिधित्व खराब तरीके से किया गया, चाहे उनके बिंदु कितने भी महत्वपूर्ण क्यों न हों।

समाधान:
शोधकर्ताओं ने "हाइरार्किकल समराइजेशन" (Hierarchical Summarization) नामक एक नई विधि का परीक्षण किया।

  • पुराना तरीका (फ्लैट): AI एक बार में पूरे 50 पन्नों के दस्तावेज़ को निगलने और फिर सारांश निकालने की कोशिश करता है। वह घबरा जाता है और बीच का हिस्सा भूल जाता है।
  • नया तरीका (हाइरार्किकल): AI एक स्मार्ट संपादक की तरह काम करता है। पहले, वह प्रत्येक व्यक्तिगत भाषण को एक छोटे नोट में सारांशित करता है। फिर, वह उन नोट्स को विषय के आधार पर समूहबद्ध करता है (जैसे, "करों के बारे में सभी बिंदु," "शिक्षा के बारे में सभी बिंदु")। अंत में, वह उन विषय नोट्स को एक अंतिम सारांश में मिला देता है।
  • परिणाम: इस "चरण-दर-चरण" दृष्टिकोण ने समस्या को ठीक कर दिया। कार्य को छोटे हिस्सों में बांटकर, AI ने बीच के वक्ताओं को अनदेखा करना बंद कर दिया। यह एक लेखक को चेकलिस्ट देने जैसा था ताकि वे किसी को भी छोड़ न दें।

2. "भाषा की बाधा": अनुवाद का अंतर

समस्या:
यूरोपीय संसद की 24 आधिकारिक भाषाएँ हैं। अध्ययन में पाया गया कि यदि कोई राजनेता "लो-रिसोर्स" भाषा (ऐसी भाषा जिसके लिए इंटरनेट पर AI के सीखने के लिए कम डेटा उपलब्ध है, जैसे कुछ छोटी यूरोपीय भाषाएँ) में बोलता है, तो AI उन्हें दर्शाने में कम सक्षम होता है।

इससे भी बुरा यह है कि यह पूर्वाग्रह तब भी मौजूद था जब AI उन भाषणों के आधिकारिक अंग्रेजी अनुवादों का सारांश बना रहा था। यह ऐसा है जैसे AI का कुछ लहजों या बोलियों के लिए "कान खराब" हो, और यह पूर्वाग्रह अनुवाद के बाद भी बना रहता है। उन भाषाओं का उपयोग करने वाले वक्ताओं को अंतिम सारांश में सटीक रूप से शामिल किए जाने की संभावना कम थी।

3. "राजनीतिक फिल्टर": वामपंथी पूर्वाग्रह

समस्या:
शोधकर्ताओं ने यह भी जाँच की कि क्या AI किसी विशेष राजनीतिक दल का पक्ष लेता है। उन्होंने एक सूक्ष्म लेकिन स्पष्ट पूर्वाग्रह पाया: वाम-केंद्रित दलों (आम तौर पर अधिक प्रगतिशील या सामाजिक-लोकतांत्रिक समूहों) का प्रतिनिधित्व अधिक पूर्णता से किया गया था, जबकि दक्षिण-केंद्रित (right-of-center) दलों का कम।

AI ने आवश्यक रूप से यह नहीं कहा कि दक्षिणपंथी दलों ने क्या कहा, बल्कि उसने उनके बिंदुओं को अधिक छोड़ दिया (omit किया)। यह एक ऐसे कैमरे की तरह था जो मंच के बाईं ओर के लोगों पर तो पूरी तरह केंद्रित था, लेकिन दाईं ओर के लोगों को थोड़ा फ्रेम से बाहर रखता था।

  • नोट: यह पूर्वाग्रह शुरू में इसलिए छिपा हुआ था क्योंकि "मिडल कर्स" इतना बुरा था कि उसने राजनीतिक पूर्वाग्रह को दबा दिया था। एक बार जब उन्होंने चरण-दर-चरण विधि का उपयोग करके "मिडल कर्स" को ठीक कर दिया, तो राजनीतिक पूर्वाग्रह दृश्यमान हो गया।

4. "मैजिक प्रॉम्प्ट" काम नहीं आया

शोधकर्ताओं ने एक सरल तरकीब आजमाई: उन्होंने AI को कहा, "हे, कृपया सुनिश्चित करें कि आप सभी को समान ध्यान दें!"
परिणाम: यह काम नहीं आया। AI ने निर्देश को अनदेखा कर दिया। यह एक विचलित छात्र को, "कृपया पूरी किताब पर ध्यान दें," कहने जैसा है, बिना वास्तव में उनके पढ़ने के तरीके को बदले। पूर्वाग्रह सूचना को संसाधित करने के तरीके में रचा-बसा है, न कि केवल विनम्रता की कमी है।

मुख्य निष्कर्ष

यह शोध पत्र लोकतंत्र के भविष्य के लिए एक चेतावनी और एक मार्गदर्शिका है।

  • चेतावनी: यदि हम बिना जाँच किए AI को सरकारी प्रणालियों में लगा देते हैं, तो हम अनजाने में बीच की आवाजों को चुप करा सकते हैं, छोटी भाषाओं के बोलने वालों को नुकसान पहुँचा सकते हैं, और राजनीतिक प्रतिनिधित्व को बिगाड़ सकते हैं।
  • मार्गदर्शिका: हम केवल "मैजिक प्रॉम्प्ट्स" पर भरोसा नहीं कर सकते। हमें कैसे काम करता है, इसे बदलने की आवश्यकता है। बड़े कार्यों को छोटे, संरचित चरणों में तोड़कर (जैसे हाइरार्किकल विधि), हम कई सबसे बड़ी निष्पक्षता संबंधी समस्याओं को ठीक कर सकते हैं।

संक्षेप में: AI लोकतंत्र को सुलभ बनाने के लिए एक शक्तिशाली उपकरण है, लेकिन किसी भी अन्य उपकरण की तरह, इसे सावधानीपूर्वक कैलिब्रेट करने की आवश्यकता है। यदि हम ऐसा नहीं करते हैं, तो हमारे लोकतंत्र का "सारांश" केवल पहली, अंतिम, अंग्रेजी बोलने वाली और वामपंथी आवाजों को ही प्रतिबिंबित करेगा, जिससे बाकी सब अंधेरे में रह जाएंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →