Evaluating and Mitigating Hallucinations in Retrieval-Augmented Question Answering over Uzbek School Textbooks
यह अध्ययन UzHistQA डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि जबकि रिट्रीवल-ऑगमेंटेड जनरेशन उज्बेक इतिहास के प्रश्न-उत्तर में मतिभ्रम (hallucinations) को काफी कम कर देता है, निर्मित उत्तरों को पूरी तरह से समाप्त करने के लिए उद्धरण (citation) और त्याग (abstention) तंत्र को लागू करना आवश्यक है, जो कम-संसाधन वाली भाषाओं में रिट्रीवल की गुणवत्ता और जनरेशन की सत्यनिष्ठा का अलग-अलग मूल्यांकन करने की आवश्यकता पर प्रकाश डालता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक कक्षाओं में, छात्र कठिन अवधारणाओं को समझाने, अध्यायों का सारांश निकालने या परीक्षाओं की तैयारी करने के लिए तेजी से आर्टिफिशियल इंटेलिजेंस (एआई) की ओर मुड़ रहे हैं। ये डिजिटल सहायक बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) पर आधारित हैं, जो विशाल मात्रा में टेक्स्ट पर प्रशिक्षित सिस्टम हैं जो धाराप्रवाह, आत्मविश्वासी और अक्सर विश्वसनीय उत्तर उत्पन्न कर सकते हैं। हालांकि, जब एक छात्र ऐसा प्रश्न पूछता है जिसका उत्तर उसे अभी तक ज्ञात नहीं है, तो एक विशिष्ट जोखिम उत्पन्न होता है: उनके पास उत्तर को सत्यापित करने के ज्ञान का अभाव होता है। यदि सिस्टम कोई तथ्य गढ़ देता है, तो वह त्रुटि बिना पता चले रह जाती है, और छात्र कुछ गलत सीख लेता है। इसे ठीक करने के लिए, शोधकर्ताओं ने 'रिट्रीवल-ऑगमेंटेड जनरेशन' (रिट्रीवल-ऑगमेंटेड जनरेशन) नामक एक विधि विकसित की है। केवल मॉडल की आंतरिक स्मृति पर निर्भर रहने के बजाय, सिस्टम उत्तर देने से पहले एक विशिष्ट, विश्वसनीय दस्तावेज़—जैसे कि स्कूल की पाठ्यपुस्तक—में प्रासंगिक अंश खोजने के लिए खोज करता है। यह प्रतिक्रिया को वास्तविकता पर आधारित रखता है, लेकिन यह पूर्णता की गारंटी नहीं देता है। सिस्टम अभी भी सही अंश खोजने में विफल हो सकता है, या यह सही अंश पा सकता है और फिर भी उसे अनदेखा कर सकता है, या यह जो पाया है उसकी गलत व्याख्या कर सकता है।
यह अनिश्चितता उज्बेक भाषा में विशेष रूप से गंभीर है, जो लाखों लोगों द्वारा बोली जाने वाली भाषा है लेकिन आर्टिफिशियल इंटेलिजेंस की दुनिया में इसे "लो-रिसोर्स" (कम संसाधन वाली) माना जाता है। अंग्रेजी के विपरीत, जो इन मॉडलों को प्रशिक्षित करने के लिए उपयोग किए जाने वाले डेटा पर हावी है, उज्बेक के लिए उपलब्ध डिजिटल टेक्स्ट कम हैं। इसके अलावा, उज्बेक एक योगात्मक (अग्लूटिनेटिव) भाषा है, जिसका अर्थ है कि एक एकल मूल शब्द को कई अलग-अलग प्रत्ययों के साथ संशोधित करके रूपों की एक विशाल श्रृंखला बनाई जा सकती है। "स्वतंत्रता" के बारे में पूछने वाला छात्र एक ऐसा शब्द रूप उपयोग कर सकता है जो पाठ्यपुस्तक में उपयोग किए गए शब्द से पूरी तरह से अलग दिखता है, जिससे खोज प्रणाली उत्तर खोजने में विफल हो सकती है। अब तक, इन प्रणालियों के उज्बेक इतिहास के लिए कितनी अच्छी तरह काम करती हैं, इसका परीक्षण करने या वे कितनी बार मनगढ़ंत बातें बनाती हैं, इसे मापने का कोई मानक तरीका नहीं था।
स्वतंत्र शोधकर्ता रुज़िम्बॉय खोल्मुरोटोव द्वारा किया गया एक हालिया अध्ययन 'उज़हिस्टक्यूए' (UzHistQA) नामक एक विशिष्ट टेस्ट सेट बनाकर इस अंतर को संबोधित करता है, जो 1917 से 1991 तक के वर्षों को कवर करने वाली एक आधिकारिक दसवीं कक्षा की इतिहास की पाठ्यपुस्तक पर आधारित है। शोधकर्ता ने पाठ्यपुस्तक का विश्लेषण किया और एक महत्वपूर्ण भाषाई बाधा पाई: पुस्तक के लगभग 31,000 शब्दों में से, आधे से अधिक अद्वितीय शब्द रूप केवल एक बार दिखाई दिए। यह अत्यधिक विविधता का अर्थ है कि सटीक शब्द मिलान के लिए एक साधारण खोज विफल होने की संभावना है। इसे कैसे दूर किया जाए, इसका परीक्षण करने के लिए, अध्ययन ने 56 प्रश्न बनाए, जिनमें कुछ ऐसे भी शामिल थे जिनका उत्तर पाठ्यपुस्तक में बिल्कुल नहीं था, ताकि यह देखा जा सके कि क्या सिस्टम अपनी अज्ञानता स्वीकार करेगा या एक प्रतिक्रिया गढ़ लेगा। शोधकर्ता ने फिर सिस्टम चलाने के चार अलग-अलग तरीकों की तुलना की: एक जो केवल अपनी आंतरिक स्मृति पर निर्भर था, एक जिसने मानक सिमेंटिक सर्च का उपयोग करके पाठ्यपुस्तक को खोजा, एक जिसने इसे कीवर्ड सर्च के साथ जोड़ा, और एक अंतिम संस्करण जिसे सख्ती से अपने स्रोत का उल्लेख करने और साक्ष्य गायब होने पर उत्तर देने से मना करने का निर्देश दिया गया था।
परिणाम चौंकाने वाले थे। जब सिस्टम ने पाठ्यपुस्तक को देखे बिना केवल अपनी आंतरिक स्मृति पर भरोसा किया, तो इसने अपने 91 प्रतिशत उत्तरों में अस ondersteित या मनगढ़ंत दावे किए। इसने उन प्रश्नों के लिए तारीखों, नामों और सूचियों को आत्मविश्वास के साथ गढ़ा जिन्हें पाठ्यपुस्तक कवर नहीं करती थी। जब सिस्टम को पहले पाठ्यपुस्तक देखने के लिए मजबूर किया गया, तो इन अस ondersteित दावों की दर नाटकीय रूप से गिरकर केवल 9 प्रतिशत रह गई। इसने पुष्टि की कि उत्तरों को वास्तविक पाठ में आधारित करना विश्वसनीयता के लिए आवश्यक है। हालांकि, अध्ययन ने एक आश्चर्यजनक जटिलता भी प्रकट की। वह संस्करण जिसने सबसे परिष्कृत खोज पद्धति का उपयोग किया था, जिसने सिमेंटिक समझ को कीवर्ड मिलान के साथ जोड़ा था, उसने सरल खोज की तुलना में सही अंश अधिक बार खोजे। फिर भी, बेहतर साक्ष्य खोजने के बावजूद, इस उन्नत सिस्टम ने सरल वाले की तुलना में अधिक अस ondersteित दावे किए। ऐसा प्रतीत होता है कि जब सिस्टम ने अंशों का एक बड़ा, विविध सेट प्राप्त किया, तो अतिरिक्त जानकारी ने मॉडल को भ्रमित कर दिया, जिससे इसने गलत निष्कर्ष या गणनाएँ कीं, भले ही तथ्य वहीं मौजूद थे।
सुरक्षा के लिए सबसे प्रभावी कॉन्फ़िगरेशन वह था जिसने सख्त नियमों को लागू किया: सिस्टम को प्रत्येक दावे के लिए विशिष्ट पृष्ठ का उल्लेख करना था और उसे निर्देश दिया गया था कि यदि पाठ्यपुस्तक में उत्तर नहीं है तो "मुझे नहीं पता" कहना है। इस दृष्टिकोण ने उन प्रश्नों के लिए सभी मनगढ़ंत उत्तरों को समाप्त कर दिया जिन्हें पाठ्यपुस्तक कवर नहीं करती थी। इसका नुकसान यह था कि सिस्टम ने उन 14 प्रतिशत प्रश्नों को देने से इनकार कर दिया जिन्हें वह उत्तर दे सकता था, यहाँ तक कि तब भी जब उत्तर प्राप्त पाठ में मौजूद था। शोधकर्ता निष्कर्ष निकालते हैं कि शैक्षिक सेटिंग के लिए, यह इनकार एक आवश्यक विशेषता है। एक छात्र जिसे "मुझे नहीं पता" प्राप्त होता है, वह शिक्षक से मदद मांग सकता है, लेकिन एक छात्र जिसे एक आत्मविश्वासपूर्ण, मनगढ़ंत उत्तर प्राप्त होता है, वह एक गलत बात सीखता है और उसके पास यह जानने का कोई तरीका नहीं होता कि वह गलत है। अध्ययन यह स्थापित करता है कि जबकि रिट्रीवल-ऑगमेंटेड जनरेशन इन प्रणालियों को उज्बेक शिक्षा के लिए व्यवहार्य बनाता है, इसके लिए सावधानीपूर्वक डिजाइन की आवश्यकता होती है ताकि सिस्टम को भ्रमित होने से रोका जा सके, और यह रेखांकित करता है कि सही जानकारी खोजना और एक सही उत्तर लिखना दो अलग-अलग चुनौतियाँ हैं जिन्हें स्वतंत्र रूप से मापा जाना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।