← नवीनतम पेपर
💬 NLP

Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers

यह शोध पत्र यह पहचान करता है कि मौजूदा कॉन्फिडेंस कैलिब्रेशन विधियाँ बड़े भाषा मॉडल (LLMs) के लिए तब विफल हो जाती हैं जब प्रश्नों के कई सही उत्तर होते हैं क्योंकि वे व्यवस्थित रूप से कम आकलन (underestimation) करते हैं, और एक नया बेंचमार्क (MACE) तथा एक सिमेंटिक कॉन्फिडेंस एग्रीगेशन (SCA) विधि प्रस्तावित करता है ताकि एकल और बहु-उत्तर परिदृश्यों दोनों में सुदृढ़ कैलिब्रेशन प्राप्त किया जा सके।

मूल लेखक: Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर की व्याख्या दी गई है।

बड़ी समस्या: जब "सही होना" "भ्रमित होने" जैसा दिखने लगता है

कल्पना कीजिए कि आप एक ट्रिविया क्विज़ (सामान्य ज्ञान प्रतियोगिता) दे रहे हैं।

  • परिदृश्य A: प्रश्न है, "हैमलेट किसने लिखा था?" इसका केवल एक सही उत्तर है: शेक्सपियर। यदि आप "शेक्सपियर" कहते हैं, तो आप सही हैं, और आप बहुत आत्मविश्वास महसूस करते हैं।
  • परिदृश्य B: प्रश्न है, "एक फल का नाम बताइए जो लाल है।" इसके कई सही उत्तर हो सकते हैं: सेब, स्ट्रॉबेरी, चेरी, रास्पबेरी।

यह पेपर तर्क देता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स (LLMs) परिदृश्य B में भ्रमित हो जाते हैं।

जब एक मॉडल जानता है कि कई सही उत्तर हैं (जैसे सेब, स्ट्रॉबेरी और चेरी), तो वह अपना "वोट विभाजित" करने लगता है। वह 20 प्रयासों में से "सेब" को 6 बार, "स्ट्रॉबेरी" को 6 बार और "चेरी" को 6 बार कह सकता है। क्योंकि उसने हर बार केवल एक ही उत्तर नहीं चुना, मॉडल का आंतरिक "कॉन्फिडेंस मीटर" (आत्मविश्वास मापने वाला यंत्र) गिर जाता है। वह सोचता है, "ओह नहीं, मैं पक्का नहीं हूँ कि किसे चुनूँ, इसलिए मुझे लगता है कि मैं अनिश्चित हूँ।"

विडंबना: मॉडल वास्तव में परिदृश्य B में अधिक सही होने की संभावना रखता है (क्योंकि सही होने के कई तरीके हैं), लेकिन उसका कॉन्फिडेंस मीटर कम दिखाता है। यह उस व्यक्ति की तरह है जो दुकान तक पहुँचने के तीन अलग-अलग रास्ते जानता है, लेकिन क्योंकि वह केवल एक ही रास्ते को चुनने का निर्णय नहीं ले पा रहा है, वह खुद को खोया हुआ मानने लगता है।

नया टूल: MACE (द "मल्टी-आंसर" टेस्ट)

इस समस्या को साबित करने के लिए, शोधकर्ताओं ने MACE नामक एक नया टेस्ट बनाया। MACE को उन सवालों के लिए एक विशेष जिम की तरह समझें जो यह परखता है कि मॉडल कई सही उत्तरों वाले सवालों को कितनी अच्छी तरह संभालते हैं।

  • सेटअप: उन्होंने छह विषयों (जैसे पुरस्कार, राजनीतिक पद और नदियाँ) में 12,000 प्रश्न बनाए।
  • ट्विस्ट: प्रत्येक विषय के लिए, उन्होंने ऐसे प्रश्न बनाए जिनमें ठीक 1, 2, 4, या 6 सही उत्तर थे।
  • लक्ष्य: यह देखना कि क्या सही उत्तरों की संख्या बदलने पर मॉडल्स के कॉन्फिडेंस स्कोर सटीक रहते हैं या नहीं।

उन्होंने क्या पाया: "बिग ब्रेन" विरोधाभास

उन्होंने चार अलग-अलग परिवारों के AI मॉडल्स (छोटे से लेकर विशाल तक) पर कॉन्फिडेंस मापने के 15 अलग-अलग तरीकों का परीक्षण किया। यहाँ क्या हुआ:

  1. सटीकता बढ़ती है, कॉन्फिडेंस घटता है: जैसे-जैसे सही उत्तरों की संख्या बढ़ी (1 से 6 तक), मॉडल उन सवालों के जवाब अधिक बार सही देते गए। हालाँकि, उनका अनुमानित कॉन्फिडेंस (आत्मविश्वास) काफी गिर गया।
  2. बड़े मॉडल्स अधिक पीड़ित होते हैं: सबसे बड़े, सबसे स्मार्ट मॉडल्स (जैसे 70-बिलियन पैरामीटर वाले) सबसे अधिक भ्रमित थे। क्योंकि वे बहुत कुछ जानते हैं, वे सही उत्तरों की एक विस्तृत विविधता उत्पन्न कर सकते हैं। यह विविधता उन्हें कॉन्फिडेंस चेकर्स की नज़र में "अनिर्णय की स्थिति" में दिखाती है, जिससे उनके कॉन्फिडेंस स्कोर क्रैश हो जाते हैं।
  3. "ट्रस्ट क्राइसिस" (विश्वास का संकट): वास्तविक दुनिया के मिश्रित सवालों में (कुछ जिनमें 1 उत्तर है, कुछ जिनमें 6 उत्तर हैं), मौजूदा सर्वोत्तम तरीके भी विफल रहे। वे एक सही उत्तर को "अविश्वसनीय" के रूप में चिह्नित कर देते थे, सिर्फ इसलिए क्योंकि मॉडल ने उसके कुछ अलग-अलग सही रूपांतर प्रस्तुत किए थे।

समाधान: SCA (द "टीम वोट" मेथड)

शोधकर्ताओं ने सेमेंटिक कॉन्फिडेंस एग्रीगेशन (SCA) नामक एक नई विधि प्रस्तावित की।

पुराना तरीका (द "टॉप डॉग" अप्रोच):
अधिकांश तरीके मॉडल द्वारा दिए गए एकल सबसे लोकप्रिय उत्तर को देखते हैं। यदि मॉडल ने 20 उत्तर दिए और 10 "सेब" और 10 "स्ट्रॉबेरी" दिए, तो पुराना तरीका कहता है, "आप केवल 50% समय सहमत थे। आप आश्वस्त नहीं हैं।"

नया तरीका (SCA - द "टीम वोट"):
SCA सभी सही उत्तरों के कुल संभाव्यता (total probability) को देखता है।

  • यह उत्तरों को अर्थ के आधार पर समूहित करता है (जैसे, सभी "सेब" वाले उत्तर एक समूह हैं, "स्ट्रॉबेरी" वाले दूसरे)।
  • यह सभी सही समूहों के कॉन्फिडेंस स्कोर को जोड़ता है।
  • परिणाम: भले ही मॉडल ने अपने वोट सेब और स्ट्रॉबेरी के बीच विभाजित किए हों, SCA देखता है कि "लाल फलों" के लिए कुल वोट 100% है। यह समझ जाता है, "आह, मॉडल आश्वस्त है, बस उसके पास कुछ वैध विकल्प हैं।"

मुख्य निष्कर्ष (The Takeaway)

  • समस्या: वर्तमान AI कॉन्फिडेंस टूल्स सोचते हैं कि कई सही उत्तर होने का मतलब है कि AI अनिश्चित है।
  • समाधान: नया SCA मेथड इस समस्या को ठीक करता है क्योंकि यह केवल सबसे लोकप्रिय उत्तर के बजाय सभी वैध उत्तरों के कॉन्फिडेंस को जोड़ता है।
  • परिणाम: SCA उन सवालों पर बहुत अच्छा काम करता है जिनमें कई उत्तर होते हैं और यह उन सवालों को खराब नहीं करता जिनमें केवल एक उत्तर होता है। यह AI को तब आत्मविश्वासी दिखने में मदद करता है जब वह वास्तव में आत्मविश्वासी होता है, भले ही वह एक से अधिक तरीकों से सही हो।

संक्षेप में: यह पेपर हमें सिखाता है कि AI के लिए, कई तरीकों से सही होने का मतलब अनिश्चित दिखना नहीं होना चाहिए। हमें बस वोटों को गिनने का एक बेहतर तरीका चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →