Zero-shot Large Language Models for Automatic Readability Assessment
यह शोध पत्र एक ज़ीरो-शॉट प्रॉम्प्टिंग पद्धति और LAURAE नामक एक हाइब्रिड मॉडल प्रस्तुत करता है जो विविध डेटासेट, भाषाओं और पाठ प्रकारों में अत्याधुनिक, सुदृढ़ अनसुपरवाइज्ड (unsupervised) स्वचालित पठनीयता मूल्यांकन प्राप्त करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जो किताबों के एक विशाल ढेर को छाँटने की कोशिश कर रहे हैं। कुछ किताबें छोटे बच्चों के लिए हैं, कुछ हाई स्कूल के छात्रों के लिए, और कुछ विश्वविद्यालय के प्रोफेसरों के लिए। आपका लक्ष्य यह पता लगाना है कि कौन सी किताबें पढ़ने में आसान हैं और कौन सी कठिन, ताकि आप सही व्यक्ति को सही किताब सुझा सकें।
अतीत में, लाइब्रेरियन इसे मापने के लिए एक साधारण रूलर (पैमाने) का उपयोग करते थे। वे चीजों को गिनते थे जैसे कि "वाक्य कितने लंबे हैं?" या "कितने बड़े शब्दों का उपयोग किया गया है?" यह एक रीडेबिलिटी फॉर्मूला (पठनीयता सूत्र) का उपयोग करने जैसा है। यह तेज़ और सस्ता है, लेकिन थोड़ा अनाड़ी है। यह सोच सकता है कि एक छोटा वाक्य जिसमें एक बहुत बड़ा मेडिकल शब्द है, वह "आसान" है क्योंकि वाक्य छोटा है, या यह इस तथ्य को मिस कर सकता है कि एक लंबा पैराग्राफ वास्तव में बहुत स्पष्ट और सरल है।
बाद में, लाइब्रेरियन ने हर एक किताब को पढ़ने के लिए मानव विशेषज्ञों की एक टीम को काम पर रखने की कोशिश की। यह सटीक था, लेकिन इसमें बहुत समय लगता था और बहुत अधिक खर्च आता था।
फिर, कंप्यूटर स्मार्ट हो गए। शोधकर्ताओं ने लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग करना शुरू किया—सुपर-स्मार्ट AI जिसने इंटरनेट पर लगभग सब कुछ पढ़ लिया है—एक विशेषज्ञ के रूप में। विचार यह था: "आइए AI से पूछें, 'इसे पढ़ना कितना कठिन है?'"
पहली AI कोशिशों के साथ समस्या
इस पेपर के लेखकों ने पाया कि इस काम के लिए AI का उपयोग करने के शुरुआती प्रयास थोड़े ऐसे थे जैसे किसी जीनियस छात्र को बिना निर्देश या ग्रेडिंग रूब्रिक (मूल्यांकन नियम) दिए परीक्षा देने के लिए कहना।
- रूब्रिक संबंधी समस्या: यदि आप AI को 1 से 10 तक का स्कोर देने के लिए कहते हैं, तो वह अनुमान लगा सकता है कि "10" का क्या अर्थ है। लेकिन यदि आप उसे बताते हैं, "1 का अर्थ पहली कक्षा का स्तर है, और 10 का अर्थ पीएचडी स्तर है," और परिभाषाएँ देते हैं, तो वह बहुत बेहतर प्रदर्शन करता है।
- अनुमान लगाने की समस्या: जब AI उत्तर देता है, तो वह केवल एक नंबर नहीं निकालता; वह कई अलग-अलग नंबरों की संभावना (प्रोबेबिलिटी) की गणना करता है। पुराने तरीकों में केवल सबसे संभावित नंबर को ही लिया जाता था। लेखकों ने पाया कि यदि आप उन सभी संभावनाओं को देखते हैं जिन पर AI विचार कर रहा था और उनका औसत निकालते हैं (जैसे कि उसके सभी अनुमानों का भारित औसत लेना), तो आपको एक बहुत अधिक सटीक स्कोर मिलता है।
नया समाधान: "LAURAE"
लेखकों ने LAURAE नामक एक नया सिस्टम बनाया। LAURAE को एक सुपर-लाइब्रेरियन के रूप में सोचें जो एक साथ दो उपकरणों का उपयोग करता है:
- स्मार्ट AI: यह टेक्स्ट को पढ़ता है और संदर्भ, लहजे और अर्थ को समझता है।
- साधारण रूलर: यह वाक्य की लंबाई और शब्दांशों (syllables) को गिनता है (पुराने जमाने का तरीका)।
LAURAE केवल एक या दूसरे को नहीं चुनता है। यह AI से पूछता है: "अपने उत्तर के बारे में आप कितने आश्वस्त हैं?"
- यदि AI बहुत आश्वस्त है (जैसे, "मैं 90% सुनिश्चित हूँ कि यह कॉलेज-स्तर का टेक्स्ट है"), तो LAURAE मुख्य रूप से AI की बात सुनता है।
- यदि AI अनिश्चित है (जैसे, "मैं केवल 50% सुनिश्चित हूँ, शायद यह कठिन है, शायद यह आसान है"), तो LAURAE निर्णय लेने में मदद करने के लिए साधारण रूलर पर अधिक निर्भर करता है।
AI के "स्मार्ट दिमाग" को रूलर के "विश्वसनीय गणित" के साथ मिलाने और AI के आत्मविश्वास को यह तय करने देने कि कितना वजन दिया जाए, LAURAE को धोखा देना बहुत कठिन बना देता है।
उन्होंने क्या टेस्ट किया
इसे सिद्ध करने के लिए, लेखकों ने केवल एक प्रकार के टेक्स्ट पर परीक्षण नहीं किया। उन्होंने 14 अलग-अलग टेक्स्ट सेट्स पर इसका परीक्षण किया, जिनमें शामिल थे:
- मरीजों के लिए चिकित्सा सलाह।
- ग्रीक भाषा में इतिहास की पाठ्यपुस्तकें।
- फ्रेंच, हिंदी, अरबी और रूसी में समाचार लेख।
- छोटे वाक्य और लंबे पैराग्राफ।
उन्होंने अपने नए तरीके की तुलना पुराने "रूलर" फॉर्मूलों और "डम्ब" (कम बुद्धिमान) AI तरीकों से की।
परिणाम
- नया AI तरीका: रूलर की मदद के बिना भी, AI को पूछने का नया तरीका (रूब्रिक देना और उसके अनुमानों का औसत निकालना) लगभग हर टेस्ट में पुराने AI तरीकों को हरा गया।
- LAURAE (कॉम्बो): जब उन्होंने AI को रूलर के साथ जोड़ा, तो परिणाम एक विजेता जैसा था। LAURAE 14 में से 13 डेटासेट्स पर अन्य सभी तरीकों को पछाड़ गया। यह विशेष रूप से अन्य भाषाओं के टेक्स्ट और बहुत तकनीकी या बहुत छोटे टेक्स्ट को संभालने में अच्छा था।
कमी
इस नए सिस्टम का उपयोग करने के दो छोटे नुकसान हैं:
- आपको थोड़ा कोड जानने की आवश्यकता है: आप किसी वेबसाइट पर बस एक बटन क्लिक नहीं कर सकते; आपको खुद कोड चलाना होगा।
- इसे एक शक्तिशाली कंप्यूटर की आवश्यकता है: इस AI को चलाने के लिए एक मजबूत ग्राफिक्स कार्ड (जैसे एक हाई-एंड वीडियो कार्ड) की आवश्यकता होती है, जो साधारण रूलर फॉर्मूलों की तुलना में अधिक बिजली का उपयोग करता है।
निचोड़ (The Bottom Line)
पेपर निष्कर्ष निकालता है कि यदि आपको दस्तावेजों के एक विशाल ढेर की पढ़ने की कठिनाई को स्वचालित रूप से ग्रेड करने की आवश्यकता है, तो LAURAE वर्तमान में उपलब्ध सबसे अच्छा टूल है। यह पुराने फॉर्मूलों की तुलना में अधिक सटीक है और केवल एक साधारण प्रश्न पूछने वाले AI की तुलना में अधिक विश्वसनीय है। यह एक सुरक्षा जाल की तरह काम करता है: जब AI आश्वस्त होता है, तो वह नेतृत्व करता है; जब AI अनिश्चित होता है, तो साधारण गणित मदद के लिए आगे आता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।