Entropy of Ukrainian
यह शोध पत्र क्लॉड शैनन के 1951 के वर्ण भविष्यवाणी प्रयोग को 184 स्वयंसेवकों के साथ दोहराकर यूक्रेनी भाषा की एंट्रॉपी (entropy) का अनुमान लगाने वाला पहला अध्ययन प्रस्तुत करता है, जो प्रति वर्ण लगभग 1.201 बिट्स की ऊपरी सीमा प्रदान करता है और इस परिणाम की तुलना वर्तमान लार्ज लैंग्वेज मॉडल्स (Large Language Models) से करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक दोस्त के साथ "अगला अक्षर पहचानो" (Guess the Next Letter) खेल रहे हैं। आप उन्हें एक वाक्य दिखाते हैं जो बीच में ही कट गया है, जैसे: "बिल्ली चटाई पर..."
आपके दोस्त को अगला अक्षर पहचानना है।
- यदि वे "m" (mat - चटाई) पहचानते हैं, तो वे सही हैं। यह बहुत आसान था।
- यदि वे "z" पहचानते हैं, तो वे गलत हैं। उन्हें फिर से अनुमान लगाना होगा।
- यदि वे "p" (pillow - तकिया) पहचानते हैं, तो वे सही हैं।
यह खेल एन्ट्रॉपी (Entropy) नामक चीज़ को मापता है। भाषा की दुनिया में, एन्ट्रॉपी का अर्थ ऊष्मा या अव्यवस्था नहीं है; यह आश्चर्य (surprise) का एक माप है।
- उच्च एन्ट्रॉपी (High Entropy): अगला अक्षर पूरी तरह से आश्चर्यजनक है। सही अक्षर तक पहुँचने के लिए आपको कई बार अनुमान लगाना पड़ता है। भाषा अराजक और अप्रत्याशित महसूस होती है।
- कम एन्ट्रॉपी (Low Entropy): अगला अक्षर स्पष्ट है। आप तुरंत अनुमान लगा लेते हैं। भाषा पूर्वानुमान योग्य और दोहराव वाली लगती है।
प्रयोग: यूक्रेनी भाषा का अनुमान लगाना
दशकों से, वैज्ञानिक अंग्रेजी के साथ इस अनुमान लगाने वाले खेल को खेलते आए हैं। 1951 में, क्लाउड शैनन नामक व्यक्ति ने लोगों से अंग्रेजी वाक्यों में अगले अक्षर का अनुमान लगाने के लिए कहा था। उन्होंने पाया कि अंग्रेजी काफी पूर्वानुमान योग्य है; अगले अक्षर को सही ढंग से पहचानने के लिए आपको औसतन केवल 1.2 अनुमान लगाने पड़ते हैं।
लेकिन अब तक किसी ने भी यूक्रेनी के साथ यह खेल नहीं खेला था।
यूक्रेन के तीन शोधकर्ताओं (एंटोन, मिकिता और मार्कियान) ने पहली बार इस प्रयोग को चलाने का निर्णय लिया। उन्होंने इसे सरल शब्दों में कैसे किया, इसका अनुवाद यहाँ दिया गया है:
1. खिलाड़ी (स्वयंसेवक)
पेशेवर कामगारों को काम पर रखने के बजाय, उन्होंने सोशल मीडिया (मुख्य रूप से टेलीग्राम) पर आम लोगों से खेलने के लिए कहा।
- सेटअप: उन्होंने स्वयंसेवकों को समाचार लेखों से वाक्य दिए।
- ट्विस्ट: लोगों की दिलचस्पी बनाए रखने के लिए, उन्होंने बिल्कुल शुरुआत से शुरू नहीं किया। उन्होंने पहले 70 वर्ण (एक छोटे वाक्य की लंबाई के लगभग बराबर) दिखाए और पूछा, "इसके बाद क्या आता है?"
- खेल: स्वयंसेवक एक अक्षर टाइप करता है। यदि वह गलत है, तो वह लाल हो जाता है, और वे फिर से प्रयास करते हैं। यदि वह सही है, तो वे अगले अक्षर पर बढ़ जाते हैं।
- लक्ष्य: वे देखना चाहते थे कि सही अक्षर प्राप्त करने से पहले कितने "गलत अनुमान" लगाने पड़े।
2. परिणाम: यूक्रेनी कितनी पूर्वानुमान योग्य है?
184 स्वयंसेवकों से डेटा एकत्र करने के बाद, जिन्होंने 17,000 से अधिक अनुमान लगाए, शोधकर्ताओं ने गणना की।
- स्कोर: उन्होंने पाया कि यूक्रेनी का "आश्चर्य स्तर" (एन्ट्रॉपी) लगभग 1.201 बिट्स प्रति वर्ण है।
- इसका क्या अर्थ है? इसका मतलब है कि पूर्वानुमान के मामले में यूक्रेनी अंग्रेजी के समान ही अत्यधिक समान है। अंग्रेजी की तरह ही, यदि आप पिछले अक्षरों को जानते हैं, तो यूक्रेनी में अगला अक्षर आमतौर पर काफी स्पष्ट होता है।
- अतिरेक (Redundancy): क्योंकि भाषा इतनी पूर्वानुमान योग्य है, इसलिए यूक्रेनी वाक्य के लगभग 76% अक्षर "अतिरेक" (redundant) हैं। आप वास्तव में टेक्स्ट का एक बड़ा हिस्सा हटा सकते हैं, और एक मूल वक्ता अभी भी गायब हिस्सों का सटीक अनुमान लगा सकता है।
3. "चीटिंग" की समस्या
शोधकर्ताओं को सावधान रहना पड़ा। चूंकि यह एक ऑनलाइन खेल था, इसलिए कुछ लोगों ने:
- इंटरनेट पर पूरा वाक्य खोज लिया होगा।
- बेतरतीब ढंग से अनुमान लगाया और भाग्य से सही हो गए।
- दिलचस्पी खो दी और खेल के बीच में ही रुक गए।
इसे ठीक करने के लिए, उन्होंने एक सख्त रेफरी की तरह काम किया। उन्होंने उन लोगों के परिणाम हटा दिए जिन्होंने खराब तरीके से खेला (जो शायद कोशिश नहीं कर रहे थे) और उन लोगों के भी जिन्हें बहुत अधिक सटीक रूप से खेला (जो शायद धोखाधड़ी कर रहे थे)। बहुत सख्त होने और बहुत सारा डेटा हटाने के बाद भी, परिणाम लगभग 1.20 के आसपास ही रहा।
4. AI की तुलना: इंसान बनाम रोबोट
शोधकर्ताओं ने आधुनिक AI मॉडल (लार्ज लैंग्वेज मॉडल्स) को भी यही खेल खेलने के लिए कहा।
- AI का लाभ: AI मॉडल इंसानों की तुलना में बहुत बेहतर थे। कुछ बेहतरीन AI मॉडल लगभग 0.7 के स्कोर के साथ अगले अक्षर का अनुमान लगा सकते थे।
- सावधानी: शोधकर्ता चेतावनी देते हैं कि AI अलग तरह से "चीटिंग" कर रहा होगा। चूंकि AI को भारी मात्रा में समाचार डेटा (उन्हीं वाक्यों के समान जिनका उपयोग खेल में किया गया था) पर प्रशिक्षित किया गया था, इसलिए संभव है कि AI ने वास्तविक समझ विकसित करने के बजाय उन विशिष्ट वाक्यों को याद कर लिया हो। यह उस छात्र की तरह है जिसने गणित सीखने के बजाय उत्तर कुंजी (answer key) रट ली है।
- निष्कर्ष: AI बहुत अच्छा है, लेकिन क्योंकि यह "परफेक्ट" स्कोर के बहुत करीब है, इसलिए यह कहना कठिन है कि क्या यह वास्तव में यूक्रेनी को समझ रहा है या केवल उपयोग किए गए विशिष्ट समाचार लेखों के प्रति ओवरफिटिंग (overfitting) कर रहा है।
मुख्य निष्कर्ष
यह शोध पत्र पहली बार है जब हमारे पास एक ठोस संख्या है कि यूक्रेनी कितनी पूर्वानुमान योग्य है।
- यूक्रेनी अराजक नहीं है। यह अत्यधिक संरचित और पूर्वानुमान योग्य है, ठीक अंग्रेजी की तरह।
- इंसान इसमें अच्छे हैं। सामान्य लोग लगभग 1.2 प्रयासों में अगले अक्षर का अनुमान लगा सकते हैं।
- AI बेहतर है, लेकिन शायद बहुत ज्यादा बेहतर है। AI मॉडल और भी तेज़ी से अनुमान लगा सकते हैं, लेकिन हमें "याद करने" और "बुद्धिमत्ता" के बीच भ्रमित होने से बचना चाहिए।
शोधकर्ता स्वीकार करते हैं कि उनका अध्ययन पूर्ण नहीं था (उनके पास पर्याप्त खिलाड़ी नहीं थे, और वाक्य सभी समाचार लेखों से थे), लेकिन यह हमें उस शुरुआती बिंदु से कहीं बेहतर स्थिति में लाता है जो हमारे पास पहले था। उन्होंने अपना कोड और डेटा भी साझा किया है ताकि अन्य लोग भविष्य में इस खेल को बेहतर बनाने का प्रयास कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।