← नवीनतम पेपर
💬 NLP

How Far Do Auto-Interpretation Labels Generalize: A Controlled Study Across Languages, Scripts, and Rewordings

यह नियंत्रित अध्ययन प्रदर्शित करता है कि जहाँ स्पार्स ऑटोएन्कोडर फीचर्स (sparse autoencoder features) वास्तविक क्रॉस-लिंगुअल अर्थ संबंधी ओवरलैप प्रदर्शित करते हैं, वहीं उनके द्वारा स्वतः-निर्मित प्राकृतिक भाषा लेबल विभिन्न भाषाओं, लिपियों और पुनर्गठित शब्दों (rewordings) के बीच सामान्यीकरण करने में विफल रहते हैं, जो अक्सर उन अंतर्निहित अवधारणाओं के बजाय प्रशिक्षण डेटा प्रतिनिधित्व पूर्वाग्रहों को दर्शाते हैं जिनका उन्हें वर्णन करना चाहिए।

मूल लेखक: Sripad Karne

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sripad Karne

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दर्जनों भाषाओं में लिखी गई किताबों का एक विशाल, सुपर-स्मार्ट पुस्तकालय है। इस पुस्तकालय के भीतर, लाखों छोटे, अदृश्य "स्विच" (जिन्हें विशेषताएं/features कहा जाता है) हैं जो तब जल उठते हैं जब पुस्तकालय किसी विशिष्ट विचार को पढ़ता है, जैसे कि "धोखाधड़ी," "खेल," या "राजनीति।"

क्योंकि इन स्विचों की जांच हाथ से करना बहुत कठिन है, इसलिए पुस्तकालय एक रोबोट सहायक का उपयोग करता है जो उन शीर्ष पुस्तकों को देखता है जिनसे प्रत्येक स्विच जल उठता है और उसके लिए एक छोटा सा स्टिकी नोट लेबल लिख देता है। उदाहरण के लिए, यदि एक स्विच ज्यादातर "ओलंपिक एथलीटों" के बारे में पढ़ने पर जलता है, तो रोबोट एक लेबल लिखेगा: "ओलंपिक एथलीट।"

यह शोध पत्र एक सरल लेकिन महत्वपूर्ण प्रश्न पूछता है: क्या वह स्टिकी नोट लेबल पूरी सच्चाई बताता है?

विशेष रूप से, यदि लेबल कहता है "ओलंपिक एथलीट," तो क्या वह स्विच ओलंपिक एथलीटों के लिए वास्तव में जलता है, चाहे वह कहानी कैसे भी सुनाई गई हो? क्या यह तब भी काम करता है जब कहानी अंग्रेजी में हो? रूसी में हो? लैटिन अक्षरों में लिखी गई सर्बियाई में हो? और सिरिलिक अक्षरों (एक अलग लिपि) में लिखी गई सर्बियाई में हो?

यहाँ शोधकर्ताओं ने सर्बियाई भाषा का उपयोग करते हुए एक चतुर प्रयोग के माध्यम से क्या पाया, इसका विवरण दिया गया है।

द "डबल-स्क्रिप्ट" ट्रिक (दोहरी लिपि की चाल)

सर्बिया अद्वितीय है क्योंकि वहां के लोग बिल्कुल एक ही भाषा को दो अलग-अलग लिपियों में लिखते हैं: लैटिन (अंग्रेजी की तरह: A, B, C) और सिरिलिक (रूसी की तरह: А, Б, В)। आप एक सर्बियाई वाक्य को एक लिपि से दूसरी में बिना अर्थ बदले पूरी तरह से बदल सकते हैं, जैसे कि एक डिजिटल अनुवाद, बिना एक भी शब्द का अर्थ बदले।

शोधकर्ताओं ने इसका उपयोग एक "नियंत्रित परीक्षण" बनाने के लिए किया। उन्होंने 300 वाक्यों को लिया और उन्हें AI को चार तरीकों से दिखाया:

  1. अंग्रेजी (लैटिन लिपि)
  2. रूसी (सिरिलिक लिपि)
  3. सर्बियाई (लैटिन लिपि)
  4. सर्बियाई (सिरिलिक लिपि)

चूंकि सर्बियाई लैटिन और सर्बियाई सिरिलिक केवल अलग तरह से लिखी गई एक ही टेक्स्ट हैं, इसलिए AI को उन्हें बिल्कुल एक जैसा ही मानना चाहिए। यदि "ओलंपिक एथलीट" वाला स्विच वास्तव में एथलीटों की अवधारणा (concept) के बारे में है, तो उसे इन चारों संस्करणों के लिए जलना चाहिए।

अच्छी खबर: स्विच वास्तव में अर्थ को समझते हैं

सबसे पहले, शोधकर्ताओं ने जांचा कि क्या स्विच वास्तव में विभिन्न भाषाओं में विचारों को समझते हैं।

  • परिणाम: हाँ! जब AI ने अंग्रेजी, रूसी और सर्बियाई में एक ही कहानी पढ़ी, तो स्विचों का वही समूह जलने लगा।
  • उपमा: कल्पना कीजिए कि एक कोरस (समूह गान) एक गाना गा रहा है। भले ही वे अंग्रेजी से रूसी में गाना बदल दें, गायक (विशेषताएं/features) का वही समूह अभी भी उसी धुन (अर्थ) पर सामंजस्य बिठा रहा है। स्विच वास्तव में विचार को ट्रैक कर रहे हैं, न कि केवल विशिष्ट शब्दों को।

बुरी खबर: स्टिकी नोट लेबल झूठ बोलते हैं (खामोशी से)

यहीं मामला पेचीदा हो जाता है। शोधकर्ताओं ने फिर रोबोट द्वारा बनाए गए लेबल (स्टिकी नोट्स) को देखा। उन्होंने पूछा: "यदि लेबल कहता है 'ओलंपिक एथलीट,' तो क्या वह स्विच सर्बियाई देखते समय वास्तव में सक्रिय होता है?"

  • परिणाम: नहीं, हमेशा नहीं।
    • लेबल अंग्रेजी के लिए अच्छी तरह काम करते थे।
    • वे रूसी के लिए ठीक-ठाक काम करते थे।
    • लेकिन वे सर्बियाई के लिए, विशेष रूप से सिरिलिक लिपि में लिखे जाने पर, 4 गुना अधिक बार विफल हुए।
  • उपमा: कल्पना कीजिए कि एक सुरक्षा गार्ड है जिसके पास एक बैज है जिस पर लिखा है "आग का पता लगाता है।" वह मुख्य लॉबी (अंग्रेजी) में आग पकड़ने में बहुत अच्छा काम करता है। वह बैक ऑफिस (रूसी) में भी काफी अच्छा है। लेकिन बेसमेंट (सर्बियाई सिरिलिक) में, वह आग को पूरी तरह से अनदेखा कर देता है। समस्या यह नहीं है कि वह आग देख नहीं सकता; समस्या यह है कि जो बैज उसने पहना है, वह आपको यह चेतावनी नहीं देता कि वह बेसमेंट में अंधा है।

यह क्यों होता है?

शोध पत्र सुझाव देता है कि लेबल उस डेटा से पक्षपाती (biased) हैं जिसे AI ने अपने प्रशिक्षण के दौरान सबसे अधिक बार "पढ़ा" है।

  • प्रशिक्षण का आहार: इंटरनेट (जहाँ AI सीखता है) मुख्य रूप से अंग्रेजी है। इसमें रूसी की पर्याप्त मात्रा है। लेकिन इसमें सर्बियाई बहुत कम है, और सिरिलिक में लिखी गई सर्बियाई तो और भी कम है।
  • परिणाम: AI अंग्रेजी में "धाराप्रवाह" है और रूसी में "ठीक-ठाक" है, लेकिन वह सर्बियाई सिरिलिक में थोड़ा "अनजान" है।
  • लेबल का जाल: रोबोट सहायक उस लेबल को लिखता है जो उन उदाहरणों पर आधारित होता है जिन्हें वह सबसे अधिक बार देखता है (अंग्रेजी वाले)। इसलिए, वह अंग्रेजी के लिए एक सटीक लेबल लिखता है। लेकिन क्योंकि AI के पास सर्बियाई सिरिलिक के पर्याप्त उदाहरण नहीं हैं, इसलिए उस कहानी के संस्करण के लिए स्विच वास्तव में सक्रिय नहीं होता है। लेबल स्थानीय रूप से सटीक (अंग्रेजी के लिए सत्य) है लेकिन वैश्विक रूप से भ्रामक (सर्बियाई के लिए असत्य) है।

"गहरा" (Deep) समस्या

शोधकर्ताओं ने यह भी पाया कि यह समस्या AI के मस्तिष्क में आप जितना गहराई में जाते हैं (नेटवर्क की बाद की परतों में), उतनी ही बढ़ती जाती है।

  • उपमा: AI को एक फैक्ट्री असेंबली लाइन के रूप में सोचें। लाइन की शुरुआत में, कार्यकर्ता (विशेषताएं) बहुत सामान्य होते हैं और सभी भाषाओं को अच्छी तरह से संभालते हैं। जैसे-जैसे उत्पाद लाइन में आगे बढ़ता है, कार्यकर्ता विशेषज्ञ बन जाते हैं। अंत तक, विशेषज्ञ "अंग्रेजी संस्करण" के उत्पाद पर इतने केंद्रित हो जाते हैं कि वे उसी वस्तु के "सर्बियाई संस्करण" को पहचानना बंद कर देते हैं। हालाँकि, लेबल वही रहता है, जो आपको सुरक्षा का झूठा अहसास देता है।

मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि स्वचालित रूप से जनरेट किए गए लेबल गारंटी नहीं हैं।

  • वे आपको बताते हैं कि एक विशेषता सबसे सामान्य इनपुट (जैसे अंग्रेजी) पर क्या करती है।
  • वे आपको यह नहीं बताते कि क्या वह विशेषता कम सामान्य भाषाओं या लिपियों के लिए काम करती है।
  • यदि आप AI की सुरक्षा की निगरानी के लिए "हिंसक सामग्री" जैसे लेबल पर भरोसा करते हैं, तो आप सोच सकते हैं कि आप सुरक्षित हैं क्योंकि लेबल ऐसा कहता है। लेकिन यदि AI का सामना कम सामान्य भाषा या लिपि में उसी हिंसक सामग्री से होता है, तो "सुरक्षा स्विच" चालू भी नहीं हो सकता है, और लेबल आपको इस विफलता की कोई चेतावनी नहीं देगा।

संक्षेप में: लेबल अवधारणा (concept) का नाम तो सही बताता है, लेकिन यह इस तथ्य को छिपा देता है कि वह अवधारणा कुछ रूपों में AI के लिए अदृश्य हो सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →