LLMs Should Express Uncertainty Explicitly
यह शोध पत्र तर्क देता है कि लार्ज लैंग्वेज मॉडल्स को दो पूरक इंटरफेसों के माध्यम से अनिश्चितता को स्पष्ट रूप से व्यक्त करने के लिए प्रशिक्षित किया जाना चाहिए—अंतिम उत्तरों को कैलिब्रेट करने के लिए वैश्विक मौखिक आत्मविश्वास (global verbalized confidence) और रिट्रीवल एवं वेरिफिकेशन जैसे कार्यों में हस्तक्षेप को ट्रिगर करने के लिए स्थानीय रीजनिंग-टाइम सिग्नलिंग (local reasoning-time signaling)—ताकि निर्णय लेने की प्रक्रिया को अनुकूलित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अति-आत्मविश्वासी शोध सहायक "LLM" को अपने सवालों के जवाब देने के लिए काम पर रख रहे हैं। कभी-कभी, LLM को उत्तर पूरी तरह से पता होता है। अन्य समय में, यह केवल अनुमान लगा रहा होता है, लेकिन इसे यह एहसास नहीं होता कि यह अनुमान लगा रहा है। यह बस पूरे आत्मविश्वास के साथ कहता है, "उत्तर X है!" भले ही वह गलत हो। यह खतरनाक है क्योंकि यदि आप एक आत्मविश्वासी झूठ पर भरोसा करते हैं, तो आप गलत निर्णय ले सकते हैं।
यह शोध पत्र LLMs को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करता है ताकि वे ईमानदारी से स्वीकार कर सकें कि वे अनिश्चित हैं। लेखक तर्क देते हैं कि केवल अनुमान लगाने के बजाय, मॉडल के पास आपको यह बताने के लिए दो अलग-अलग "उपकरण" होने चाहिए, जो इस बात पर निर्भर करते हैं कि समस्या कब होती है।
यहाँ सरल उपमाओं का उपयोग करके विवरण दिया गया है:
दो उपकरण: "कॉन्फिडेंस स्कोर" बनाम "रेड फ्लैग" (चेतावनी का झंडा)
यह शोध पत्र मॉडल द्वारा अनिश्चितता व्यक्त करने के दो तरीकों की तुलना करता है। इन्हें एक कार के दो अलग-अलग सुरक्षा तंत्रों के रूप में सोचें।
1. ग्लोबल इंटरफेस: "स्पीडोमीटर" (मौखिक आत्मविश्वास)
यह कैसे काम करता है: अपना उत्तर पूरा करने के बाद, मॉडल आपको एक संख्या देता है, जैसे "मुझे 90% यकीन है कि यह सही है" या "मुझे केवल 20% यकीन है।"
उपमा: कल्पना कीजिए कि एक मौसम विज्ञानी है। केवल यह कहने के बजाय कि "बारिश होगी," वे कहते हैं, "बारिश की 90% संभावना है।"
शोध पत्र ने क्या पाया:
- समस्या: प्रशिक्षण से पहले, मॉडल एक ऐसे मौसम विज्ञानी की तरह था जो धूप होने पर भी हमेशा कहता था "100% बारिश की संभावना है।" इसे "अति-आत्मविश्वास" (overconfident) कहा जाता है।
- समाधान: लेखकों ने मॉडल को उसके "स्पीडोमीटर" के बारे में ईमानदार होने के लिए प्रशिक्षित किया।
- परिणाम: मॉडल ने अपने आत्मविश्वास के बारे में झूठ बोलना बंद कर दिया। यदि वह गलत था, तो अब वह कहता, "मुझे केवल 30% यकीन है।" इससे मॉडल सही उत्तर खोजने में अधिक स्मार्ट नहीं बना, लेकिन इसने उसे यह बताने में बहुत बेहतर बना दिया कि आपको उस पर कब भरोसा करना चाहिए।
- सर्वश्रेष्ठ उपयोग: इसका उपयोग तब करें जब आपको यह तय करने की आवश्यकता हो, "क्या मुझे इस अंतिम उत्तर पर भरोसा करना चाहिए या नहीं?"
2. लोकल इंटरफेस: "चेक इंजन लाइट" (द <uncertain> टोकन)
यह कैसे काम करता है: उत्तर के अंत तक प्रतीक्षा करने के बजाय, मॉडल को अपनी सोचने की प्रक्रिया के बीच में रुकने और एक विशिष्ट कोड शब्द चिल्लाने के लिए प्रशिक्षित किया जाता है: <uncertain>।
उपमा: कल्पना कीजिए कि एक मैकेनिक आपकी कार पर काम कर रहा है। कार के खराब होने तक इंतजार करने के बजाय कि वह आपको बताए कि कुछ गलत है, वह बीच में ही रुक जाता है, एक लाल झंडा उठाता है, और कहता है, "ओह, मैं यहाँ फंस गया हूँ। मुझे नहीं पता कि इस हिस्से को कैसे ठीक किया जाए। मुझे मदद के लिए एक सीनियर मैकेनिक को बुलाने की जरूरत है।"
शोध पत्र ने क्या पाया:
- समस्या: प्रशिक्षण से पहले, जब मॉडल किसी कठिन तथ्य पर अटक जाता था, तो वह चुपचाप अनुमान लगाता रहता था जब तक कि वह गलत उत्तर न दे दे।
- समाधान: मॉडल ने सीखा कि जैसे ही वह तर्क (reasoning) के दौरान किसी बाधा से टकराता है, वह तुरंत "रेड फ्लैग" (चेतावनी का झंडा) उठा दे।
- परिणाम: यह एक प्रारंभिक चेतावनी प्रणाली के रूप में कार्य करता है। यह गलतियों को पकड़ लेता है जब वे हो रही होती हैं। यह एक कंप्यूटर सिस्टम को मॉडल को रोकने, डेटाबेस में उत्तर खोजने (रिट्रीवल) की अनुमति देता है, और फिर मॉडल को अपना वाक्य पूरा करने देता है।
- सर्वश्रेष्ठ उपयोग: इसका उपयोग तब करें जब आप गलतियों को जल्दी पकड़ना चाहते हैं ताकि मॉडल के वाक्य पूरा करने से पहले ही उन्हें ठीक किया जा सके।
यह क्यों मायने रखता है: "साइलेंट फेलियर" बनाम "ईमानदार गलती"
लेखकों ने इन दोनों तरीकों के बीच एक महत्वपूर्ण अंतर की खोज की:
- प्रशिक्षण से पहले: मॉडल "साइलेंट फेलियर" (मौन विफलता) करता था। वह आत्मविश्वास के साथ गलत बात कहता था। आपको तब तक पता नहीं चलता कि वह गलत था जब तक कि बहुत देर न हो जाए।
- प्रशिक्षण के बाद:
- स्पीडोमीटर विधि ने "साइलेंट फेलियर" को "ईमानदार गलतियों" में बदल दिया। मॉडल अभी भी गलत उत्तर दे सकता था, लेकिन उसने कहा, "मुझे यकीन नहीं है," इसलिए आप जान गए कि उस पर भरोसा न करें।
- रेड फ्लैग विधि ने "साइलेंट फेलियर" को "इंटरवेंशन पॉइंट्स" (हस्तक्षेप के बिंदुओं) में बदल दिया। मॉडल ने खुद को रोक लिया और मदद मांगी, जिससे गलती अंतिम उत्तर बनने से पहले ही रुक गई।
गुप्त सूत्र: मॉडल ने कैसे सीखा
शोध पत्र ने यह देखने के लिए भी गहराई से जांच की कि मॉडल ने यह कैसे सीखा।
- स्पीडोमीटर (ग्लोबल): मॉडल को अपने मस्तिष्क में बहुत अधिक बदलाव करने की आवश्यकता नहीं थी। इसने बस अपने आंतरिक "अनिश्चितता मीटर" को अधिक सटीक रूप से पढ़ने और ईमानदारी से रिपोर्ट करने का सीखा। यह एक व्यक्ति को अपनी पल्स (नाड़ी) को सही ढंग से पढ़ना सिखाने जैसा है।
- रेड फ्लैग (लोकल): इसके लिए गहरे बदलाव की आवश्यकता थी। मॉडल को अपनी सोचने की प्रक्रिया को पुनर्गठित करना पड़ा। इसने सीखा कि अपनी तर्क प्रक्रिया में एक विशिष्ट "पैनिक बटन" कैसे बनाया जाए। यह एक व्यक्ति को यह सिखाने जैसा है कि जब वह खोया हुआ महसूस करे, तो केवल आंतरिक रूप से खोया हुआ महसूस करने के बजाय, शारीरिक रूप से रुकना और हाथ उठाना।
मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि अनिश्चितता केवल एक चीज़ नहीं है। AI को वास्तव में उपयोगी और सुरक्षित बनाने के लिए, हमें इसे दो अलग-अलग कौशल सिखाने की आवश्यकता है:
- ग्लोबल कॉन्फिडेंस: हमें यह बताने के लिए, "हे, मुझे इस अंतिम उत्तर के बारे में यकीन नहीं है, इसलिए इस पर अंधाधुंध भरोसा न करें।"
- लोकल सिग्नलिंग: हमें यह बताने के लिए, "मैं अपनी सोच की प्रक्रिया के बीच में यहीं फंस गया हूँ; कृपया मेरे लिए और जानकारी लेकर आएं।"
AI को "मुझे नहीं पता" कहने के इन दो तरीकों को देकर, हम इसे आत्मविश्वास के साथ भ्रमित (hallucinate) करने से रोक सकते हैं और इसे एक ऐसे उपकरण के रूप में उपयोग कर सकते हैं जो अपनी सीमाओं को जानता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।