Large Language Models Naively Recover Ethnicity from Individual Records
यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल पारंपरिक बेयसियन विधियों की तुलना में उच्च सटीकता और कम आय पूर्वाग्रह के साथ नामों से जातीयता का सहजता से अनुमान लगा सकते हैं, जो विविध वैश्विक संदर्भों में सुदृढ़ प्रदर्शन प्राप्त करते हैं और फाइन-ट्यून किए गए छोटे मॉडलों के माध्यम से लागत प्रभावी स्थानीय परिनियोजन को सक्षम करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो केवल एक नेम टैग को देखकर किसी व्यक्ति की पृष्ठभूमि का पता लगाने की कोशिश कर रहे हैं। लंबे समय तक, शोधकर्ताओं को इस पहेली को सुलझाने के लिए एक बहुत ही कठोर, पुराने ढंग के मानचित्र का उपयोग करना पड़ता था। यह शोध पत्र एक नए, सुपर-स्मार्ट जासूस से परिचित कराता है जो उसी पहेली को बहुत बेहतर तरीके से हल कर सकता है, और यह उन जगहों पर भी ऐसा कर सकता है जहाँ पुराना मानचित्र मौजूद तक नहीं है।
यहाँ सरल शब्दों में शोध पत्र के निष्कर्षों का विवरण दिया गया है:
पुराना जासूस: "BISG" मानचित्र
वर्षों से, अमेरिका में राजनीति और समाज का अध्ययन करने वाले शोधकर्ता BISG (बेयसियन इम्प्रूव्ड सरनेम जियोकोडिंग) नामक एक विधि का उपयोग कर रहे थे।
- यह कैसे काम करता था: यह एक विशाल, पहले से बने चार्ट का उपयोग करने जैसा था। यदि किसी व्यक्ति का एक विशिष्ट उपनाम (सरनेम) था और वह एक विशिष्ट पड़ोस में रहता था, तो चार्ट जनगणना के आंकड़ों के आधार पर उसकी नस्ल का अनुमान लगाता था।
- समस्या: यह मानचित्र केवल अमेरिका के लिए मौजूद था। यह केवल अमेरिकी नस्लीय श्रेणियों (जैसे "श्वेत" या "अश्वेत") के बारे में जानता था। इसने प्रथम नामों (जैसे "जेम्स" या "प्रिया") और मध्य नामों की अनदेखी की। इसकी एक बड़ी कमी भी थी: यदि कोई अश्वेत व्यक्ति एक समृद्ध, मुख्य रूप से श्वेत पड़ोस में रहता था, तो मानचित्र अक्सर गलत अनुमान लगाता था और उसे श्वेत मान लेता था।
नया जासूस: "LLM" मस्तिष्क
लेखक, नूह दासनाइक ने लार्ज लैंग्वेज मॉडल्स (LLMs)—वही तरह का AI जो कहानियाँ लिखता है और सवालों के जवाब देता है—का परीक्षण किया, यह देखने के लिए कि क्या वे नाम से जातीयता (ethnicity) का अनुमान लगा सकते हैं।
- यह कैसे काम करता है: एक स्थिर चार्ट के बजाय, आप AI को एक नाम (और शायद एक स्थान) देते हैं और पूछते हैं, "इस व्यक्ति की जातीयता क्या है?" AI अपनी विशाल स्मृति—किताबों, समाचारों और इंटरनेट टेक्स्ट—का उपयोग करके एक अनुमान लगाता है। इसने विभिन्न संस्कृतियों से जुड़े लाखों नामों को "पढ़ा" है, इसलिए यह उन पैटर्न को समझता है जिन्हें पुराने मानचित्र ने छोड़ दिया था।
- इसकी महाशक्ति: इसे किसी पूर्व-निर्मित चार्ट की आवश्यकता नहीं है। यह भारत, लेबनान या चिली जैसे देशों में जातीयता का अनुमान लगा सकता है, और यह "जाति" (Caste) या "धार्मिक संप्रदाय" (Religious Sect) जैसी विशिष्ट श्रेणियों का अनुमान लगा सकता है, जो पुराना मानचित्र नहीं कर सका।
मुकाबला: किसे सही पता चला?
लेखक ने इस नए AI जासूस का पुराने मानचित्र के विरुद्ध फ्लोरिडा और उत्तरी कैरोलिना की वास्तविक मतदाता सूचियों का उपयोग करके परीक्षण किया।
- स्कोर: AI बहुत अधिक सटीक था। एक संतुलित परीक्षण पर, AI ने लगभग 84.7% सही अनुमान लगाया, जबकि पुराने मानचित्र ने केवल 68.2% सही अनुमान लगाया।
- "प्रथम नाम" का सुराग: पुराना मानचित्र मुख्य रूप से उपनामों को देखता था। AI ने महसूस किया कि प्रथम नाम बहुत बड़े सुराग हैं। जब AI ने पूर्ण नामों (प्रथम + अंतिम) का उपयोग किया, तो वह अश्वेत और हिस्पैनिक मतदाताओं की पहचान करने में पुराने मानचित्र की तुलना में बहुत बेहतर रहा, जिसे अक्सर वे पहचानने में चूक हो जाती थी।
ित - समृद्ध पड़ोस का समाधान: पुराने मानचित्र में एक पूर्वाग्रह था: वह अमीर पड़ोसों में रहने वाले अल्पसंख्यकों को श्वेत मानकर अनुमान लगाता रहता था। AI यह गलती उतनी बार नहीं करता था। यह एक नाम को देख सकता था और कह सकता था, "भले ही वे एक समृद्ध क्षेत्र में रहते हों, यह नाम संकेत देता है कि वे अश्वेत हैं," जबकि पुराना मानचित्र केवल समृद्ध क्षेत्र को देखता था और "श्वेत" होने का अनुमान लगा देता था।
दुनिया भर में परीक्षण
लेखक केवल अमेरिका में ही नहीं रुका। उन्होंने उन स्थानों पर भी परीक्षण किया जहाँ नामकरण के नियम बहुत अलग हैं:
- लेबनान: नामों के आधार पर धार्मिक समूहों (जैसे शिया, सुन्नी या मारोनाइट) का अनुमान लगाना। AI ने लगभग 64% सही अनुमान लगाया।
- भारत: यह अनुमान लगाना कि एक राजनेता किसी विशिष्ट जाति (अनुसूचित जाति या जनजाति) से संबंधित है। AI यहाँ अविश्वसनीय रूप से सटीक था, यहाँ तक कि एक समूह के लिए उसने 99.2% सही अनुमान लगाया।
- अन्य देश: आर्मेनिया और युगांडा जैसे स्थानों में, AI ने केवल नाम पढ़कर देश के ज्ञात जनसंख्या मिश्रण को सफलतापूर्वक पुन: निर्मित किया, जिससे सिद्ध हुआ कि यह वैश्विक स्तर पर काम करता है।
इसे सस्ता और तेज़ बनाना
एक विशाल AI मॉडल का उपयोग करना महंगा और धीमा हो सकता है। लेखक ने एक चतुर तरीका दिखाया:
- बड़े, स्मार्ट AI का उपयोग नामों के एक छोटे बैच को सही ढंग से लेबल करने के लिए करें।
- एक छोटे, सस्ते, ओपन-सोर्स AI मॉडल को उन उत्तरों की नकल करने के लिए प्रशिक्षित करें।
- अब, शोधकर्ता इस छोटे मॉडल को अपने कंप्यूटर पर मुफ्त में चला सकते हैं, और फिर भी यह पुराने मानचित्र को मात दे देता है।
"सोचने" वाला मोड (Thinking Mode)
शोध पत्र में यह भी परीक्षण किया गया कि क्या AI को "अधिक गहराई से सोचने" (जिसे "एक्सटेंडेड रीजनिंग" कहा जाता है) से मदद मिलती है।
- परिणाम: कभी-कभी इसने मदद की, कभी-कभी नहीं। यह एक छात्र को गणित दोबारा चेक करने के लिए कहने जैसा था; कभी-कभी वे गलती ढूंढ लेते थे, कभी-कभी वे खुद ही भ्रमित हो जाते थे। इसने प्रक्रिया को बहुत धीमा भी कर दिया। अधिकांश कार्यों के लिए, "त्वरित अनुमान" ही पर्याप्त था।
निचोड़ (Bottom Line)
यह शोध पत्र सिद्ध करता है कि अब हम महंगे सरकारी प्रशिक्षण डेटा के बिना, नामों से लोगों की जातीय पृष्ठभूमि का उच्च सटीकता के साथ अनुमान लगाने के लिए AI का उपयोग कर सकते हैं।
- यह लचीला है: यह उन देशों में भी काम करता है जहाँ जनगणना डेटा उपलब्ध नहीं है।
- यह अधिक निष्पक्ष है: यह समृद्ध क्षेत्रों में रहने वाले अल्पसंख्यकों के प्रति पूर्वाग्रह को कम करता है।
- यह बहुमुखी है: यह केवल अमेरिकी नस्लीय श्रेणियों के बजाय धर्म, जाति और जातीयता का अनुमान लगा सकता है।
लेखक चेतावनी देते हैं कि हालांकि यह एक शक्तिशाली उपकरण है, शोधकर्ताओं को अभी भी अपने काम की दोबारा जाँच करनी चाहिए, क्योंकि AI कभी-कभी अपने प्रशिक्षण डेटा से पूर्वाग्रह सीख सकता है। लेकिन विभिन्न समूहों के मतदान या समाज में भागीदारी का अध्ययन करने के लिए, यह नया "AI जासूस" एक गेम-चेंजर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।