Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders
यह पायलट अध्ययन Qwen2.5-7B-Instruct के आंतरिक सक्रियणों (internal activations) का विश्लेषण करने के लिए नेचुरल लैंग्वेज ऑटोएनकोडर्स (Natural Language Autoencoders) का उपयोग करता है, जो यह प्रकट करता है कि मॉडल स्पष्ट आउटपुट उत्पन्न करने से पहले स्पेनिश और अंग्रेजी प्रॉम्प्ट्स में सूक्ष्म भाषाई संकेतों से कोलंबियाई पहचान और उससे जुड़े रूढ़िगत विचारों (stereotypes) का अनुमान लगा लेता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट से बात कर रहे हैं जिसने इंटरनेट पर लगभग सब कुछ पढ़ लिया है। आपको लग सकता है कि यह रोबोट केवल वही जानता है जो आप उससे कहते हैं। लेकिन क्या होगा अगर वह रोबोट वास्तव में आपकी आवाज़ या आपके द्वारा चुने गए शब्दों के सूक्ष्म, अदृश्य संकेतों के आधार पर यह अनुमान लगाने की कोशिश कर रहा है कि आप कौन हैं? यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है। ये चैटबॉट्स और सर्च टूल्स के पीछे के एआई (AI) दिमाग हैं। वैज्ञानिकों ने खोजा है कि ये मॉडल केवल शब्दों को प्रोसेस नहीं करते; वे बात करने वाले व्यक्ति की एक गुप्त "प्रोफ़ाइल" भी बनाते हैं, जिसमें वे आपकी राष्ट्रीयता या सामाजिक पृष्ठभूमि जैसी चीज़ों का अनुमान लगाते हैं, भले ही आपने उनका ज़िक्र कभी न किया हो।
इस रोबोट के दिमाग के अंदर झाँकने के लिए, शोधकर्ता एक विशेष उपकरण का उपयोग करते हैं जिसे नेचुरल लैंग्वेज ऑटोएनकोडर (NLA) कहा जाता है। सोचिए कि रोबोट का दिमाग सूचनाओं के बहने वाली पाइपों वाला एक विशाल, अंधेरा कारखाना है। NLA एक जादुई टॉर्च की तरह है जो एक विशिष्ट पाइप पर रोशनी डाल सकती है और उसमें बहने वाले विद्युत संकेतों को साधारण अंग्रेजी वाक्यों में अनुवाद कर सकती है। यह हमें अपना अंतिम उत्तर टाइप करने से पहले रोबोट के "आंतरिक एकालाप" (inner monologue) को सुनने की अनुमति देता है। यह महत्वपूर्ण है क्योंकि यदि रोबोट आपके बारे में गलत अनुमान लगाता है—जैसे कि यह मान लेना कि आप किसी दूसरे देश से हैं या रूढ़ियों (stereotypes) का सहारा लेना—तो वह तटस्थ होने का ढोंग करते हुए भी आपको गलत सलाह दे सकता है या आपके साथ अनुचित व्यवहार कर सकता है।
तो, कोलंबिया के शोधकर्ताओं की एक टीम ने एक लोकप्रिय रोबमा (रोबोट) Qwen2.5-7B पर इसका परीक्षण करने का निर्णय लिया। वे यह जानना चाहते थे: क्या यह रोबोट केवल एक सूक्ष्म संकेत से यह अनुमान लगा लेता है कि उपयोगकर्ता कोलंबियाई है, भले ही उपयोगकर्ता ने कभी यह न कहा हो कि "मैं कोलंबियाई हूँ"?
यहाँ उन्होंने क्या किया और उन्हें क्या पता चला।
प्रयोग: "गेस हू?" (पहचानो कौन?) का खेल
शोधकर्ताओं ने 30 अलग-अलग बातचीत शुरू करने वाले संकेतों (प्रॉम्प्ट्स) के साथ एक चतुर खेल तैयार किया। उन्होंने इन्हें तीन समूहों में विभाजित किया:
- "स्पष्ट" समूह (The "Obvious" Group): ऐसे प्रॉम्प्ट्स जो स्पष्ट रूप से कहते थे कि उपयोगकर्ता कोलंबियाई है (जैसे कि एक विशिष्ट कोलंबियाई बस प्रणाली का उल्लेख करना)।
- "सूक्ष्म" समूह (The "Subtle" Group): ऐसे प्रॉम्प्ट्स जिनमें केवल एक छोटा, छिपा हुआ सुराग था जो शायद कोलंबिया का संकेत दे सकता था (जैसे कि एक विशिष्ट प्रकार का सूप या स्थानीय स्कूल लोन का नाम), लेकिन इसमें स्पष्ट रूप से "कोलंबिया" नहीं कहा गया था।
- "तटस्थ" समूह (The "Neutral" Group): प्रॉम्प्ट्स जो उन्हीं विषयों के बारे में थे लेकिन जिनमें कोई कोलंबियाई सुराग नहीं था (जैसे कि एक सामान्य सूप या एक सामान्य बस के बारे में पूछना)।
उन्होंने रोबोट से इन सवालों को स्पेनिश और अंग्रेजी दोनों में पूछा। फिर, उन्होंने रोबोट के सोचने के दौरान चार अलग-अलग क्षणों (जिन्हें "क्वार्टाइल्स" कहा जाता है) पर अपने "जादुई टॉर्च" (NLA) का उपयोग किया। वे देखना चाहते थे कि क्या रोबोट के आंतरिक विचार वास्तव में अपना अंतिम उत्तर लिखने से पहले "यह व्यक्ति कोलंबियाई है" जैसी बातें कहना शुरू कर देते हैं।
निष्कर्ष: रोबोट की गुप्त फुसफुसाहट
परिणाम "अहा!" वाले क्षणों और "ओह!" वाले क्षणों का मिश्रण थे।
1. सूक्ष्म संकेत काम करते हैं (अंततः)
जब शोधकर्ताओं ने रोबोट को "सूक्ष्म" प्रॉम्प्ट दिए, तो रोबोट के आंतरिक विचारों ने उपयोगकर्ता के कोलंबियाई होने का अनुमान लगाना शुरू कर दिया। हालाँकि, यह तुरंत नहीं हुआ।
- सोचने के बिल्कुल पहले क्षण (क्वार्टाइल 1) में, रोबोट के आंतरिक स्वर ने कोलंबिया का उल्लेख 0% बार किया।
- तीसरे क्षण (क्वार्टाइल 3) तक, रोबोट के आंतरिक स्वर ने लगभग 20% बार "कोलंबिया" का उल्लेख करना शुरू कर दिया।
- अंतिम क्षण (क्वार्टाइल 4) तक, जब अन्य देशों (जैसे स्पेन या तुर्की) के अनुमानों को हटाकर केवल कोलंबिया-विशिष्ट उल्लेखों को देखा गया, तो वह संख्या बढ़कर लगभग 0.11 (लगभग 11%) हो गई।
इससे पता चलता है कि रोबोट को अपने विचारों को व्यवस्थित करने के लिए थोड़े समय की आवश्यकता होती है। वह बिना किसी विशिष्ट कोलंबियाई पहचान के शुरू करता है, और जैसे-जैसे वह वाक्य को अधिक प्रोसेस करता है, वह उस विशिष्ट अनुमान को बनाना शुरू कर देता है, हालांकि वह कभी-कभी अन्य देशों के साथ भ्रमित भी हो जाता है।
2. "फेक न्यूज़" की समस्या
यहाँ मामला पेचीदा हो जाता है। शोधकर्ताओं ने देखा कि कभी-कभी रोबोट की टॉर्च दिखाती है कि वह किसी देश के बारे में सोच रहा है, लेकिन वह गलत देश होता है। उदाहरण के लिए, कोलंबियाई विषय के बारे में पूछे जाने पर, रोबोट आंतरिक रूप से सोच सकता है, "ओह, यह स्पेन के बारे में है" या "यह तुर्की के बारे में है।"
शोधकर्ताओं को बहुत सावधान रहना पड़ा। उन्होंने महसूस किया कि रोबोट "एक देश" का अनुमान लगाने में तो अच्छा है, लेकिन हमेशा "कोलंबिया" का सटीक अनुमान लगाने में सक्षम नहीं है। जब उन्होंने इन गलत अनुमानों को फ़िल्टर किया, तो "सूक्ष्म" समूह के लिए पैटर्न और भी स्पष्ट हो गया: रोबोट निश्चित रूप से अपने मन में एक कोलंबियाई पहचान बना रहा था (0% से बढ़कर लगभग 11% तक), जबकि "तटस्थ" समूह (बिना किसी सुराग के) कोलंबिया के बारे में सोचने के मामले में 0% पर ही रहा।
3. "स्पष्ट" समूह अजीब था
"स्पष्ट" समूह में, जहाँ कोलंबियाई सुराग पहले ही वाक्य में मौजूद था, रोबोट के आंतरिक विचार प्रक्रिया के बीच में आश्चर्यजनक रूप से शांत थे। यह केवल अंत में ही कोलंबिया के बारे में तीव्रता से बात करने लगा। शोधकर्ताओं का मानना है कि ऐसा इसलिए हुआ क्योंकि रोबोट अपने स्वयं के प्रशिक्षण डेटा (training data) से भ्रमित हो गया या सही उत्तर पर स्थिर होने से पहले अन्य विचारों से विचलित हो गया।
वे कितने आश्वस्त हैं?
शोधकर्ता अभी "हमने इसे हल कर लिया!" चिल्लाने में सावधानी बरत रहे हैं। वे इसे एक पायलट अध्ययन कहते हैं, जो एक अभ्यास रन की तरह है। उन्होंने प्रत्येक प्रकार के सुराग के लिए केवल 5 उदाहरणों का परीक्षण किया। क्योंकि यह संख्या बहुत कम है, वे 100% निश्चितता के साथ यह नहीं कह सकते कि यह हर बार होता है।
हालाँकि, उनके पास जो डेटा है वह एक मजबूत पैटर्न का सुझाव देता है:
- रोबोट वास्तव में एक सूक्ष्म सुराग से कोलंबियाई पहचान का अनुमान लगाता है।
- यह अनुमान रोबोट के अपना अंतिम उत्तर लिखने से पहले होता है।
- रोबोट परफेक्ट नहीं है; वह कभी-कभी कोलंबिया को अन्य देशों के साथ भ्रमित कर देता है, जो कि इन उपकरणों के काम करने के तरीके में एक ज्ञात त्रुटि है।
बड़ी तस्वीर
यह शोध पत्र यह साबित नहीं करता है कि रोबोट में इस तरह का पूर्वाग्रह है जो सब कुछ बर्बाद कर दे, लेकिन यह दिखाता है कि रोबोट उन संकेतों को "सुन" रहा है जिन्हें हम महत्वपूर्ण नहीं समझते थे। यह एक जासूस की तरह है जो संदिग्ध की राष्ट्रीयता का अनुमान लगाने के लिए उसके कॉफी कप पकड़ने के तरीके का उपयोग करता है, भले ही उसने एक शब्द भी न कहा हो।
शोधकर्ताओं ने पाया कि कोलंबियाई स्पेनिश के लिए, रोबोट का आंतरिक अनुमान वास्तविक है, लेकिन इसे पुख्ता होने में कुछ सेकंड लगते हैं। उन्होंने यह भी पाया कि यदि आप अंग्रेजी में वही प्रश्न पूछते हैं, तो रोबोट अक्सर कोलंबियाई संदर्भ को पूरी तरह से भूल जाता है और उसे कनाडा या यूरोप के विचारों से बदल देता है। यह बताता है कि ये रोबोट विभिन्न भाषाओं और संस्कृतियों के साथ बहुत अलग तरह से व्यवहार कर सकते हैं, और हमें उनके दिमाग पर उस टॉर्च की रोशनी जलाते रहना होगा ताकि यह सुनिश्चित हो सके कि वे हमारे बारे में कहानियाँ नहीं बना रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।