Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers
यह शोध पत्र यह पहचान करता है कि मौजूदा कॉन्फिडेंस कैलिब्रेशन विधियाँ बड़े भाषा मॉडल (LLMs) के लिए तब विफल हो जाती हैं जब प्रश्नों के कई सही उत्तर होते हैं क्योंकि वे व्यवस्थित रूप से कम आकलन (underestimation) करते हैं, और एक नया बेंचमार्क (MACE) तथा एक सिमेंटिक कॉन्फिडेंस एग्रीगेशन (SCA) विधि प्रस्तावित करता है ताकि एकल और बहु-उत्तर परिदृश्यों दोनों में सुदृढ़ कैलिब्रेशन प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर की व्याख्या दी गई है।
बड़ी समस्या: जब "सही होना" "भ्रमित होने" जैसा दिखने लगता है
कल्पना कीजिए कि आप एक ट्रिविया क्विज़ (सामान्य ज्ञान प्रतियोगिता) दे रहे हैं।
- परिदृश्य A: प्रश्न है, "हैमलेट किसने लिखा था?" इसका केवल एक सही उत्तर है: शेक्सपियर। यदि आप "शेक्सपियर" कहते हैं, तो आप सही हैं, और आप बहुत आत्मविश्वास महसूस करते हैं।
- परिदृश्य B: प्रश्न है, "एक फल का नाम बताइए जो लाल है।" इसके कई सही उत्तर हो सकते हैं: सेब, स्ट्रॉबेरी, चेरी, रास्पबेरी।
यह पेपर तर्क देता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स (LLMs) परिदृश्य B में भ्रमित हो जाते हैं।
जब एक मॉडल जानता है कि कई सही उत्तर हैं (जैसे सेब, स्ट्रॉबेरी और चेरी), तो वह अपना "वोट विभाजित" करने लगता है। वह 20 प्रयासों में से "सेब" को 6 बार, "स्ट्रॉबेरी" को 6 बार और "चेरी" को 6 बार कह सकता है। क्योंकि उसने हर बार केवल एक ही उत्तर नहीं चुना, मॉडल का आंतरिक "कॉन्फिडेंस मीटर" (आत्मविश्वास मापने वाला यंत्र) गिर जाता है। वह सोचता है, "ओह नहीं, मैं पक्का नहीं हूँ कि किसे चुनूँ, इसलिए मुझे लगता है कि मैं अनिश्चित हूँ।"
विडंबना: मॉडल वास्तव में परिदृश्य B में अधिक सही होने की संभावना रखता है (क्योंकि सही होने के कई तरीके हैं), लेकिन उसका कॉन्फिडेंस मीटर कम दिखाता है। यह उस व्यक्ति की तरह है जो दुकान तक पहुँचने के तीन अलग-अलग रास्ते जानता है, लेकिन क्योंकि वह केवल एक ही रास्ते को चुनने का निर्णय नहीं ले पा रहा है, वह खुद को खोया हुआ मानने लगता है।
नया टूल: MACE (द "मल्टी-आंसर" टेस्ट)
इस समस्या को साबित करने के लिए, शोधकर्ताओं ने MACE नामक एक नया टेस्ट बनाया। MACE को उन सवालों के लिए एक विशेष जिम की तरह समझें जो यह परखता है कि मॉडल कई सही उत्तरों वाले सवालों को कितनी अच्छी तरह संभालते हैं।
- सेटअप: उन्होंने छह विषयों (जैसे पुरस्कार, राजनीतिक पद और नदियाँ) में 12,000 प्रश्न बनाए।
- ट्विस्ट: प्रत्येक विषय के लिए, उन्होंने ऐसे प्रश्न बनाए जिनमें ठीक 1, 2, 4, या 6 सही उत्तर थे।
- लक्ष्य: यह देखना कि क्या सही उत्तरों की संख्या बदलने पर मॉडल्स के कॉन्फिडेंस स्कोर सटीक रहते हैं या नहीं।
उन्होंने क्या पाया: "बिग ब्रेन" विरोधाभास
उन्होंने चार अलग-अलग परिवारों के AI मॉडल्स (छोटे से लेकर विशाल तक) पर कॉन्फिडेंस मापने के 15 अलग-अलग तरीकों का परीक्षण किया। यहाँ क्या हुआ:
- सटीकता बढ़ती है, कॉन्फिडेंस घटता है: जैसे-जैसे सही उत्तरों की संख्या बढ़ी (1 से 6 तक), मॉडल उन सवालों के जवाब अधिक बार सही देते गए। हालाँकि, उनका अनुमानित कॉन्फिडेंस (आत्मविश्वास) काफी गिर गया।
- बड़े मॉडल्स अधिक पीड़ित होते हैं: सबसे बड़े, सबसे स्मार्ट मॉडल्स (जैसे 70-बिलियन पैरामीटर वाले) सबसे अधिक भ्रमित थे। क्योंकि वे बहुत कुछ जानते हैं, वे सही उत्तरों की एक विस्तृत विविधता उत्पन्न कर सकते हैं। यह विविधता उन्हें कॉन्फिडेंस चेकर्स की नज़र में "अनिर्णय की स्थिति" में दिखाती है, जिससे उनके कॉन्फिडेंस स्कोर क्रैश हो जाते हैं।
- "ट्रस्ट क्राइसिस" (विश्वास का संकट): वास्तविक दुनिया के मिश्रित सवालों में (कुछ जिनमें 1 उत्तर है, कुछ जिनमें 6 उत्तर हैं), मौजूदा सर्वोत्तम तरीके भी विफल रहे। वे एक सही उत्तर को "अविश्वसनीय" के रूप में चिह्नित कर देते थे, सिर्फ इसलिए क्योंकि मॉडल ने उसके कुछ अलग-अलग सही रूपांतर प्रस्तुत किए थे।
समाधान: SCA (द "टीम वोट" मेथड)
शोधकर्ताओं ने सेमेंटिक कॉन्फिडेंस एग्रीगेशन (SCA) नामक एक नई विधि प्रस्तावित की।
पुराना तरीका (द "टॉप डॉग" अप्रोच):
अधिकांश तरीके मॉडल द्वारा दिए गए एकल सबसे लोकप्रिय उत्तर को देखते हैं। यदि मॉडल ने 20 उत्तर दिए और 10 "सेब" और 10 "स्ट्रॉबेरी" दिए, तो पुराना तरीका कहता है, "आप केवल 50% समय सहमत थे। आप आश्वस्त नहीं हैं।"
नया तरीका (SCA - द "टीम वोट"):
SCA सभी सही उत्तरों के कुल संभाव्यता (total probability) को देखता है।
- यह उत्तरों को अर्थ के आधार पर समूहित करता है (जैसे, सभी "सेब" वाले उत्तर एक समूह हैं, "स्ट्रॉबेरी" वाले दूसरे)।
- यह सभी सही समूहों के कॉन्फिडेंस स्कोर को जोड़ता है।
- परिणाम: भले ही मॉडल ने अपने वोट सेब और स्ट्रॉबेरी के बीच विभाजित किए हों, SCA देखता है कि "लाल फलों" के लिए कुल वोट 100% है। यह समझ जाता है, "आह, मॉडल आश्वस्त है, बस उसके पास कुछ वैध विकल्प हैं।"
मुख्य निष्कर्ष (The Takeaway)
- समस्या: वर्तमान AI कॉन्फिडेंस टूल्स सोचते हैं कि कई सही उत्तर होने का मतलब है कि AI अनिश्चित है।
- समाधान: नया SCA मेथड इस समस्या को ठीक करता है क्योंकि यह केवल सबसे लोकप्रिय उत्तर के बजाय सभी वैध उत्तरों के कॉन्फिडेंस को जोड़ता है।
- परिणाम: SCA उन सवालों पर बहुत अच्छा काम करता है जिनमें कई उत्तर होते हैं और यह उन सवालों को खराब नहीं करता जिनमें केवल एक उत्तर होता है। यह AI को तब आत्मविश्वासी दिखने में मदद करता है जब वह वास्तव में आत्मविश्वासी होता है, भले ही वह एक से अधिक तरीकों से सही हो।
संक्षेप में: यह पेपर हमें सिखाता है कि AI के लिए, कई तरीकों से सही होने का मतलब अनिश्चित दिखना नहीं होना चाहिए। हमें बस वोटों को गिनने का एक बेहतर तरीका चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।