I-CALM: Incentivizing Confidence-Aware Abstention for LLM Hallucination Mitigation
यह शोध पत्र I-CALM को प्रस्तुत करता है, जो एक प्रॉम्प्ट-आधारित ढांचा है जो स्पष्ट पुरस्कार योजनाओं और मानदण्डों के माध्यम से ज्ञानमीमांसीय परित्याग (epistemic abstention) को प्रोत्साहित करके, मॉडल को पुन: प्रशिक्षित किए बिना चयनात्मक उत्तर देने की विश्वसनीयता में सुधार करके, LLM मतिभ्रम (hallucinations) को कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, आत्मविश्वासी मित्र से किसी कठिन विषय पर सलाह मांग रहे हैं, जैसे कि एक लीक होते पाइप को ठीक करना या किसी जटिल गणित की समस्या को हल करना। कभी-कभी, आपका मित्र वास्तव में उत्तर नहीं जानता होता है, लेकिन अपने आत्मविश्वासी व्यक्तित्व के कारण, वह फिर भी एक विश्वसनीय लगने वाला समाधान बना लेता है। वह कह सकता है, "ओह, बस उस वाल्व को कस दो!" जबकि वास्तव में वाल्व खराब है और उसे बदलने की आवश्यकता है। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे हैलुसिनेशन (hallucination) कहा जाता है: AI आत्मविश्वास के साथ गलत होता है।
आपके द्वारा प्रदान किया गया पेपर, जिसका शीर्षक I-CALM है, इस व्यवहार को रोकने का एक चतुर तरीका प्रस्तावित करता है जिसके लिए AI को फिर से प्रशिक्षित करने या उसके मस्तिष्क को बदलने की आवश्यकता नहीं है। इसके बजाय, यह उस "खेल के नियमों" को बदल देता है जो AI खेल रहा है।
यहाँ बताया गया है कि यह कैसे काम करता है, रोजमर्रा के उदाहरणों का उपयोग करते हुए:
1. समस्या: "आत्मविश्वासी अनुमान" का जाल
वर्तमान में, AI मॉडल को हमेशा उत्तर देने के लिए प्रशिक्षित किया जाता है। यदि आप उनसे बहुविकल्पीय प्रश्न पूछते हैं, तो सिस्टम को एक उत्तर चुनने के लिए पुरस्कृत किया जाता है, भले ही वह केवल एक अनुमान हो। यह एक गेम शो की तरह है जहाँ होस्ट कहता है, "आपको अनुमान लगाने के लिए अंक मिलते हैं, लेकिन 'मुझे नहीं पता' कहने पर शून्य अंक मिलते हैं।" स्वाभाविक रूप से, AI अनिश्चितता को स्वीकार करने के बजाय आत्मविश्वास के साथ अनुमान लगाना सीख जाता है।
2. समाधान: I-CALM (Incentivizing Confidence-Aware Abstention)
शोधकर्ताओं ने एक नया निर्देश (एक "प्रॉम्ट") बनाया है जो एक नए नियम पुस्तिका की तरह कार्य करता है। इस नियम पुस्तिका में तीन मुख्य सामग्रियां हैं:
A. "कॉन्फिडेंस चेक" (एक स्कोर मांगना)
उत्तर देने से पहले, प्रॉम्ट AI से पूछता है कि वह 0 से 1 के पैमाने पर कितना आश्वस्त है।
- उदाहरण: कल्पना कीजिए कि आप अपने मित्र से पूछते हैं, "1 से 10 के पैमाने पर, आप कितने आश्वस्त हैं कि उस वाल्व को कसने से लीक ठीक हो जाएगा?"
- यह कैसे मदद करता है: यह AI को बोलने से पहले अपने स्वयं के ज्ञान का मूल्यांकन करने के लिए मजबूर करता है।
B. "रिवॉर्ड सिस्टम" (पुरस्कार प्रणाली)
यह सबसे महत्वपूर्ण हिस्सा है। शोधकर्ता स्कोरिंग के नियमों को बदलते हैं:
- पुराना नियम: आपको सही उत्तर के लिए अंक मिलते हैं। गलत उत्तर के लिए आपको कुछ नहीं मिलता (या छोटा दंड मिलता है)। "मुझे नहीं पता" कहने के लिए आपको शून्य मिलता है।
- नया नियम (I-CALM):
- सही उत्तर: +10 अंक।
- गलत उत्तर: -10 अंक (एक भारी दंड)।
- "मुझे नहीं पता": +4 अंक!
- उदाहरण: अब, आपके मित्र को बताया जाता है: "यदि आप गलत अनुमान लगाते हैं, तो आप अपने लंच के पैसे खो देंगे। लेकिन यदि आप ईमानदारी से कहते हैं कि 'मुझे नहीं पता', तो आपको एक कुकी मिलेगी।"
- परिणाम: AI समझ जाता है कि बेतहाशा अनुमान लगाना जोखिम भरा है। वह अनुमान लगाने के बजाय, "अनिश्चितता" (abstaining) के लिए मिलने वाले पुरस्कार (कुकी) को चुनना पसंद करता है।
C. "मूल्य" (आदर्श मार्गदर्शन)
प्रॉम्ट में विनम्र और सत्यवादी होने के बारे में कुछ संक्षिप्त वाक्य भी जोड़े गए हैं।
- उदाहरण: यह आपके मित्र को बताने जैसा है, "याद रखें, विशेषज्ञ होने का ढोंग करने के बजाय ईमानदार और विनम्र होना बेहतर है।"
- परिणाम: यह AI के व्यक्तित्व को ईमानदारी की ओर मोड़ता है, इस विचार को पुख्ता करता है कि अज्ञानता स्वीकार करना एक गुण है, विफलता नहीं।
3. परिणाम: "अधिक उत्तरों" के बजाय "बेहतर उत्तरों" का व्यापार
जब शोधकर्ताओं ने विभिन्न AI मॉडलों पर इसका परीक्षण किया, तो उन्हें एक दिलचस्प ट्रेड-ऑफ (समझौता) देखने को मिला:
- कम उत्तर: AI ने उतने प्रश्न पूछना बंद कर दिए। उसने "मुझे नहीं पता" बहुत अधिक बार कहा।
- बेहतर उत्तर: जिन प्रश्नों के लिए उसने उत्तर दिया, उनकी सटीकता काफी बढ़ गई। "आत्मविश्वासी लेकिन गलत" उत्तर गायब हो गए।
- द फ्रंटियर (सीमा): उन्होंने एक "फ्रंटियर" (एक मानचित्र की तरह) की खोज की। आप बहुत सख्त हो सकते हैं (AI बहुत अधिक बार "मुझे नहीं पता" कहता है, लेकिन लगभग कभी गलत नहीं होता है) या थोड़ा उदार हो सकते हैं (AI अधिक उत्तर देता है, लेकिन त्रुटि का थोड़ा अधिक जोखिम होता है)। उपयोगकर्ता अपनी जरूरतों के लिए सही संतुलन खोजने हेतु पुरस्कारों को समायोजित कर सकते हैं।
सारांश
I-CALM को AI के लिए एक "ईमानदारी कोच" के रूप में समझें। यह AI को नए तथ्य नहीं सिखाता या उसकी याददाश्त को ठीक नहीं करता है। इसके बजाय, यह उन प्रोत्साहनों को बदल देता है ताकि AI यह सीख सके कि आत्मविश्वास के साथ झूठ बोलने के बजाय चुप रहना बेहतर है।
केवल प्रॉम्ट को बदलकर कि "हम आपको 'मुझे नहीं पता' कहने के लिए पुरस्कृत करेंगे और अनुमान लगाने के लिए दंडित करेंगे," AI अधिक विश्वसनीय, विनम्र और भरोसेमंद सहायक बन जाता है। यह पूरे सिस्टम को फिर से बनाए बिना AI को सुरक्षित बनाने का एक हल्का और कम लागत वाला तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।