When Informal Text Breaks NLI: Tokenization Failure, Distribution Shift, and Targeted Mitigations
यह शोध पत्र यह प्रदर्शित करता है कि अनौपचारिक टेक्स्ट (informal text) दो विशिष्ट तंत्रों के माध्यम से NLI प्रदर्शन को कम करता है—इमोजी के कारण टोकेनाइजेशन विफलता और शोर वाले टोकन (noise tokens) के कारण वितरण बदलाव (distribution shift)—जिसे प्रीप्रोसेसिंग नॉर्मलाइजेशन को लक्षित प्रशिक्षण संवर्धन (targeted training augmentation) के साथ जोड़कर प्रभावी ढंग से कम किया जा सकता है ताकि ज़ीरो-शॉट GPT-4o-mini प्रदर्शन को भी पीछे छोड़ा जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र है जिसने वर्षों तक केवल पाठ्यपुस्तकों (textbooks) का उपयोग करके एक अंतिम परीक्षा के लिए पढ़ाई की है। वह औपचारिक वाक्यों को पढ़ने में माहिर है जैसे, "The man is walking to the store" (आदमी दुकान की ओर जा रहा है)।
अब, कल्पना कीजिए कि आप उसे एक वास्तविक दुनिया का टेस्ट देते हैं जहाँ लोग एक-दूसरे को टेक्स्ट मैसेज भेज रहे हैं। वाक्य कुछ इस तरह दिखते हैं:
- "The homie is walking to the store 🏪 no cap."
छात्र फेल हो जाता है। इसलिए नहीं कि वह अर्थ नहीं समझता, बल्कि इसलिए क्योंकि उसने पहले कभी इन विशिष्ट "अनौपचारिक" शब्दों या प्रतीकों को नहीं देखा था।
यह शोध पत्र इस बारे में है कि क्यों AI मॉडल (जैसे कि वह छात्र) विफल हो जाते हैं जब लोग स्लैंग (slang), इमोजी, या जेन-ज़ी (Gen-Z) फिलर शब्दों का उपयोग करते हैं, और हम इसे कैसे ठीक कर सकते हैं।
तीन "जाल" (Traps) जो AI के लिए बने हैं
शोधकर्ताओं ने लोगों के लिखने के तीन ऐसे तरीकों का परीक्षण किया है जो AI को भ्रमित करते हैं:
स्लैंग (The "Homie" Trap - "होमी" का जाल):
- क्या होता है: "friend" को "homie" से या "going to" को "gonna" से बदलना।
- परिणाम: AI इसे मुश्किल से नोटिस करता है। यह वैसा ही है जैसे लाल शर्ट को नीली शर्ट से बदलना; AI अभी भी जानता है कि यह एक शर्ट है। AI का शब्दकोश (tokenizer) पहले से ही इन शब्दों को जानता है, इसलिए वह इन्हें ठीक से संभाल लेता है। सटीकता बनी रहती है।
इमोजी (The "Black Box" Trap - "ब्लैक बॉक्स" का जाल):
- क्या होता है: शब्द "man" को 👨 इमोजी से बदलना।
- परिणाम: पूर्ण तबाही। AI के शब्दकोश में इमोजी नहीं होते। जब वह इमोजी देखता है, तो वह कोई चित्र नहीं देखता; वह एक बड़ा प्रश्न चिह्न देखता है (जिसे
[UNK]या "Unknown" कहा जाता है)। - उपमा (Analogy): कल्पना कीजिए कि आप एक किताब पढ़ने की कोशिश कर रहे हैं जहाँ किसी ने सभी संज्ञाओं (nouns) को निकाल दिया है और उनकी जगह खाली वर्ग (blank squares) बना दिए हैं। AI अंधा हो जाता है। वह अनुमान नहीं लगा सकता कि वाक्य का क्या अर्थ है क्योंकि सबसे महत्वपूर्ण हिस्से गायब हैं।
शोर/फिलर शब्द (The "Distraction" Trap - "भटकाव" का जाल):
- क्या होता है: वाक्य के अंत में "no cap," "deadass," या "tbh" जैसे शब्द जोड़ना।
- परिणाम: AI भ्रमित हो जाता है। वह जानता है कि "deadass" का क्या अर्थ है, लेकिन उसने पहले कभी इसे किसी तर्क पहेली (logic puzzle) में उपयोग होते नहीं देखा है। AI सोचता है, "यह शब्द महत्वपूर्ण होना चाहिए क्योंकि यह यहाँ मौजूद है!" और वह पहेली को हल करने के लिए इसका उपयोग करने की कोशिश करता है, जिससे गलत उत्तर मिलते हैं।
- उपमा: यह एक छात्र की तरह है जो गणित का टेस्ट दे रहा है और अचानक कोने में "banana" लिखा हुआ देखता है। छात्र घबरा जाता है और यह समझने की कोशिश करता है कि "banana" के उत्तर को कैसे बदल देता है, जबकि वह सिर्फ एक रैंडम शब्द है।
दो अलग-अलग समाधान
शोध पत्र ने पाया कि आप इन दो समस्याओं को एक ही उपकरण से ठीक नहीं कर सकते। आपको दो अलग-अलग रणनीतियों की आवश्यकता है:
समाधान #1: अनुवादक (Preprocessing - प्रीप्रोसेसिंग)
- इमोजी के लिए: चूंकि AI इमोजी नहीं पढ़ सकता, हमें उन्हें शब्दों में बदलने के लिए एक अनुवादक की आवश्यकता है इससे पहले कि AI उन्हें देखे।
- यह कैसे काम करता है: AI के पढ़ने से पहले, एक कंप्यूटर प्रोग्राम 👨 को वापस "man" में बदल देता है। अब AI इसे सामान्य रूप से पढ़ सकता है।
- यह क्यों विफल होता है: यदि आप केवल "no cap" को हटा देते हैं, तो आप उन नए स्लैंग शब्दों को मिस कर सकते हैं जिनके बारे में आप नहीं जानते थे।
समाधान #2: स्टडी बडी (Augmentation - ऑग्मेंटेशन)
- शोर (Noise) के लिए: हम हर संभव स्लैंग शब्द का अनुवाद नहीं कर सकते, इसलिए इसके बजाय, हम AI को सिखाते हैं कि उनके साथ क्या करना है।
- यह कैसे काम करता है: हम ट्रेनिंग डेटा लेते हैं और अध्ययन चरण के दौरान हजारों वाक्यों में "no cap" और "deadass" जोड़ देते हैं। हम AI को बताते हैं, "हे, इन शब्दों को अनदेखा करो; ये अर्थ नहीं बदलते।"
- यह इमोजी के लिए क्यों विफल होता है: यदि AI अध्ययन के दौरान एक इमोजी देखता है, तो वह अभी भी एक प्रश्न चिह्न
[UNK]में बदल जाता है। AI एक प्रश्न चिह्न को तब तक नहीं समझ सकता जब तक उसे यह नहीं पता होता कि मूल शब्द क्या था।
"हाइब्रिड" सुपर-समाधान
इस शोध पत्र की सबसे बड़ी खोज यह है कि यदि आप दोनों समाधानों को मिला देते हैं, तो AI एक सुपरहीरो बन जाता है।
- इमोजी को वापस शब्दों में अनुवाद (Translate) करें (ताकि AI अंधा न हो)।
- शोर वाले वाक्यों के साथ अध्ययन (Study) करें (ताकि AI फिलर शब्दों को अनदेखा करना सीख सके)।
परिणाम:
- एक छोटा AI मॉडल (14 मिलियन पैरामीटर्स) जो अनौपचारिक टेक्स्ट पर बुरी तरह विफल हो रहा था, अचानक इन अस्त-व्यस्त, वास्तविक दुनिया के टेक्स्ट को समझने में एक विशाल, प्रसिद्ध AI (GPT-4o-mini) से बेहतर हो गया।
- यह एक छोटे छात्र को लेने, उसे इमोजी के लिए एक शब्दकोश देने और फिर उसे स्लैंग के साथ अभ्यास करने देने जैसा है, और अचानक वह एक ऐसे जीनियस से बेहतर प्रदर्शन करता है जिसने केवल पाठ्यपुस्तकों का अध्ययन किया है।
बड़ा सबक
शोध पत्र निष्कर्ष निकालता है कि AI स्लैंग के मामले में "मूर्ख" नहीं है; वह बस तैयार नहीं है।
- यदि इनपुट टूटा हुआ है (इमोजी), तो AI को एक अनुवादक की आवश्यकता है।
- यदि इनपुट शोर भरा है (स्लैंग), तो AI को अभ्यास की आवश्यकता है।
इनपुट को ठीक करके और मॉडल को वास्तविक जीवन की अव्यवस्था पर प्रशिक्षित करके, हम ऐसा AI बना सकते हैं जो वास्तव में यह समझ सके कि इंसान कैसे बात करते हैं, न कि केवल यह कि वे पाठ्यपुस्तकों में कैसे लिखते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।