Popular but Wrong: Understanding and Mitigating LLM Overconfidence through Knowledge Popularity
यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) उन गलत उत्तरों के प्रति अत्यधिक आत्मविश्वास प्रदर्शित करते हैं जो अत्यधिक लोकप्रिय हैं या क्वेरी के साथ बार-बार सह-घटित होते हैं, और यह प्रदर्शित करता है कि ज्ञान लोकप्रियता संकेतों (knowledge popularity signals) को शामिल करना इस अत्यधिक आत्मविश्वास को प्रभावी ढंग से कम करता है और आत्मविश्वास अनुमान सटीकता में महत्वपूर्ण रूप से सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक सर्वर फार्म की शांत गूँज में, एक नए प्रकार की बुद्धिमत्ता का उदय हुआ है, जो कविता लिख सकती है, समीकरण हल कर सकती है और मानवीय प्रवाह के साथ प्रश्नों के उत्तर दे सकती है। ये बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) टेक्स्ट के विशाल महासागरों पर प्रशिक्षित होते हैं, जो मानव ज्ञान के पैटर्न को पहचानकर वाक्य में अगले शब्द की भविष्यवाणी करना सीखते हैं। लेकिन इसमें एक पेंच है: ये मशीनें वास्तव में तथ्यों को उस तरह से नहीं "जानतीं" जैसे हम जानते हैं। उनके पास दुनिया की कोई स्मृति नहीं है, केवल एक सांख्यिकीय बोध है कि कौन से शब्द आमतौर पर एक साथ आते हैं। जब वे अनिश्चित होती हैं, तो वे अक्सर इसे स्वीकार नहीं करतीं। इसके बजाय, वे अक्सर पूर्ण निश्चितता के साथ गलत उत्तर देती हैं, जिसे शोधकर्ता 'अति-आत्मविश्वास' (ओवरकॉन्फिडेंस) कहते हैं। सुरक्षा, चिकित्सा या वित्त के लिए इन उपकरणों पर भरोसा करने वाले किसी भी व्यक्ति के लिए यह एक गंभीर समस्या है, क्योंकि एक आत्मविश्वासी झूठ, एक हिचकिचाते हुए सच की तुलना में कहीं अधिक खतरनाक होता है। वैज्ञानिकों के लिए मूल प्रश्न यह रहा है कि ये मॉडल अपनी गलतियों पर इतना गहरा विश्वास क्यों करते हैं। क्या यह एक यादृच्छिक त्रुटि है, या उनके सीखने के तरीके में कोई छिपा हुआ पैटर्न है जो उन्हें गलत चीजों के प्रति निश्चित बनाता है?
शोधकर्ताओं की एक टीम ने लोकप्रियता की अवधारणा को देखकर इस रहस्य की जांच करने का निर्णय लिया। उन्होंने सोचा कि क्या मॉडल केवल उन उत्तरों को प्राथमिकता दे रहे थे जो प्रसिद्ध थे या उनके प्रशिक्षण डेटा में बार-बार देखे गए थे, भले ही वे उत्तर पूछे गए विशिष्ट प्रश्न के लिए गलत ही क्यों न हों। इसका परीक्षण करने के लिए, उन्होंने एक विशिष्ट प्रकार के कार्य पर ध्यान केंद्रित किया: वास्तविक दुनिया की संस्थाओं के बारे में तथ्यात्मक प्रश्न, जैसे कि यह पूछना कि एक विशिष्ट फिल्म का निर्देशन किसने किया था या एक बास्केटबॉल खिलाड़ी का जन्म कहाँ हुआ था। उन्होंने हजारों ऐसे प्रश्न एकत्र किए और सही उत्तरों की तुलना मॉडलों द्वारा उत्पन्न गलत उत्तरों से की। उन्होंने इंटरनेट पर कितने लिंक उन लोगों और स्थानों की ओर संकेत करते हैं और लिखित दस्तावेजों में वे कितनी बार एक साथ दिखाई देते हैं, इसकी गणना करके शामिल व्यक्तियों और स्थानों की "लोकप्रियता" को मापा। इस दृष्टिकोण ने उन्हें यह देखने की अनुमति दी कि क्या मॉडल सही नामों के बजाय सबसे परिचित नामों की ओर झुक रहे हैं।
शोधकर्ताओं ने पाया कि जब ये मॉडल गलतियाँ करते हैं, तो उनकी त्रुटियाँ यादृच्छिक नहीं होती हैं। अस्पष्ट या असंary (unlikely) नाम का अनुमान लगाने के बजाय, मॉडल उन उत्तरों को 'हैलुसिनेट' (भ्रमित होकर उत्पन्न करना) करते हैं जो सही तथ्यों की तुलना में अधिक लोकप्रिय होते हैं। उदाहरण के लिए, यदि कोई मॉडल किसी कम प्रसिद्ध फिल्म के निर्देशक के बारे में नहीं जानता है, तो वह किसी यादृच्छिक अज्ञात व्यक्ति के बजाय एक प्रसिद्ध निर्देशक का नाम लेने की अधिक संभावना रखता है जिसे उसने पहले कई बार देखा हो। इसके अलावा, मॉडल अक्सर उन उत्तरों को चुनते हैं जो प्रश्न के साथ अक्सर एक ही वाक्यों में दिखाई देते हैं, भले ही वह संबंध गलत ही क्यों न हो। एक मॉडल किसी फिल्म निर्देशक के बारे में प्रश्न का उत्तर देने के लिए निर्माता (प्रोड्यूसर) का नाम ले सकता है, केवल इसलिए क्योंकि उन दोनों भूमिकाओं का उल्लेख अक्सर लेखों में एक साथ किया जाता है। अध्ययन में पाया गया कि ये लोकप्रिय लेकिन गलत विकल्प न केवल सामान्य हैं; बल्कि वे वे भी हैं जिन पर मॉडल सबसे अधिक भरोसा करता है। भले ही उत्तर गलत हो, मॉडल एक कम प्रसिद्ध, सही उत्तर की तुलना में लोकप्रिय, परिचित लगने वाले उत्तर को उच्च स्तर का आत्मविश्वास प्रदान करता है।
यह पैटर्न विभिन्न प्रकार के प्रश्नों और विभिन्न आकार के मॉडलों में सत्य होता है, जो इन प्रणालियों द्वारा ज्ञान को संसाधित करने के तरीके में एक मौलिक दोष का सुझाव देता है। शोधकर्ताओं ने पाया कि यदि जानकारी का एक टुकड़ा प्रशिक्षण डेटा में अधिक बार दोहराया जाता है, तो मॉडल द्वारा उसे उत्पन्न करने की संभावना और उसका आत्मविश्वास अधिक होता है, चाहे वह विशिष्ट प्रश्न के लिए सही उत्तर ही क्यों न हो। यह एक खतरनाक फीडबैक लूप बनाता है जहाँ सबसे परिचित गलत उत्तर को सबसे संभावित सत्य माना जाता है। अध्ययन इस बात पर प्रकाश डालता है कि पर्याप्त डोमेन ज्ञान अंतराल (domain knowledge gaps) और भी अधिक लोकप्रियता-पक्षपाती पीढ़ी से जुड़े होते हैं, जिसका अर्थ है कि जब मॉडल किसी विशिष्ट विषय के बारे में कम जानते हैं, तो वे परिचित लेकिन गलत जुड़ावों पर अधिक निर्भर होने की संभावना रखते हैं। निष्कर्षों ने लोकप्रियता और अति-आत्मविश्वास के बीच मजबूत व्यवस्थित जुड़ाव को प्रकट किया, हालांकि शोधकर्ताओं ने नोट किया कि ये सहसंबंधी (correlational) हैं न कि कारण संबंधी (causal), जिसका अर्थ है कि वे एक स्पष्ट संबंध दिखाते हैं लेकिन यह सिद्ध नहीं करते कि लोकप्रियता अकेले अति-आत्मविश्वासी भविष्यवाणियों का कारण बनती है।
इसे संबोधित करने के लिए, शोधकर्ताओं ने एक विधि विकसित की जिससे मॉडलों को यह पहचानने में मदद मिल सके कि उनका आत्मविश्वास कब गलत हो सकता है। उन्होंने एक ऐसी प्रणाली बनाई जो मॉडल के आत्मविश्वास स्कोर को स्वीकार करने से पहले उत्तर की लोकप्रियता और प्रश्न तथा उत्तर के बीच के संबंध को देखती है। उत्तर की लोकप्रियता और प्रश्न के साथ उसके जुड़ाव को कारक के रूप में शामिल करके, यह प्रणाली मॉडल के आत्मविश्वास को तब नीचे समायोजित कर सकती है जब वह एक लोकप्रिय लेकिन संभावित रूप से गलत उत्तर के प्रति बहुत आश्वस्त हो। जब उन्होंने छह अलग-अलग मॉडलों पर इस दृष्टिकोण का परीक्षण किया, तो परिणाम आश्चर्यजनक थे। उनके गलत उत्तरों पर मॉडलों द्वारा रखा गया औसत आत्मविश्वास नाटकीय रूप से 0.765 से गिरकर 0.254 हो गया। साथ ही, मॉडल के आत्मविश्वास की समग्र सटीकता में महत्वपूर्ण सुधार हुआ, जिसका अर्थ है कि मॉडल यह जानने में बहुत बेहतर हो गया कि वह कब सही है और कब गलत है।
अध्ययन निष्कर्ष निकालता है कि लोकप्रियता कृत्रिम बुद्धिमत्ता में अति-आत्मविश्वास का एक प्रमुख चालक है। मॉडल केवल अनुमान नहीं लगा रहे हैं; वे सबसे परिचित नामों और जुड़ावों की ओर प्रतिरोध के न्यूनतम पथ का अनुसरण कर रहे हैं। इस पूर्वाग्रह को समझकर, बेहतर सुरक्षा उपाय बनाना संभव है जो इन प्रणालियों को तब अधिकारपूर्ण दिखने से रोक सकें जब वे वास्तव में गलत हों। शोधकर्ताओं ने नोट किया कि हालांकि उनका काम विशिष्ट संस्थाओं के बारे में तथ्यात्मक प्रश्नों पर केंद्रित था, यह सिद्धांत संभवतः अन्य क्षेत्रों में भी लागू होता है जहाँ मॉडल विशिष्ट सत्यों के बजाय सामान्य पैटर्न को प्राथमिकता दे सकते हैं। उन्होंने यह भी स्वीकार किया कि लोकप्रियता के उनके माप सार्वजनिक इंटरनेट डेटा पर आधारित थे, जो उस प्रॉक्सी के रूप में कार्य करता है जो मॉडलों ने अपने प्रशिक्षण के दौरान देखा था, और उनके द्वारा पाया गया संबंध एक मजबूत सहसंबंध है न कि एक सिद्ध कारण-प्रभाव। फिर भी, इन लोकप्रियता संकेतों का उपयोग करके मशीन के अति-आत्मविश्वास को शांत करने की क्षमता इन शक्तिशाली उपकरणों को रोजमर्रा के उपयोग के लिए अधिक विश्वसनीय और भरोसेमंद बनाने की दिशा में एक व्यावहारिक कदम प्रदान करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।