← नवीनतम पेपर
💬 NLP

Why Don't You Know? Evaluating the Impact of Uncertainty Sources on Uncertainty Quantification in LLMs

यह शोधपत्र एक नए डेटासेट को प्रस्तुत करता है जो व्यवस्थित रूप से यह मूल्यांकन करता है कि अनिश्चितता के विभिन्न स्रोत—जैसे कि ज्ञान अंतराल, आउटपुट परिवर्तनशीलता और इनपुट अस्पष्टता—लार्ज लैंग्वेज मॉडल्स में मौजूदा अनिश्चितता मात्रा निर्धारण (अनसर्टेन्टी क्वांटिफिकेशन) विधियों के प्रदर्शन को कैसे प्रभावित करते हैं, जिससे यह पता चलता है कि कई विधियाँ तब विफल हो जाती हैं या भ्रामक हो जाती हैं जब अनिश्चितता केवल ज्ञान की सीमाओं से परे के कारकों से उत्पन्न होती है।

मूल लेखक: Maiya Goloburda, Roman Vashurin, Fedor Chernogorsky, Nurkhan Laiyk, Daniil Orel, Preslav Nakov, Maxim Panov

प्रकाशित 2026-04-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maiya Goloburda, Roman Vashurin, Fedor Chernogorsky, Nurkhan Laiyk, Daniil Orel, Preslav Nakov, Maxim Panov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, अच्छी तरह से पढ़ा-लिखा लेकिन थोड़ा अति-आत्मविश्वासी रोबोट सहायक काम पर रख रहे हैं जो महत्वपूर्ण कार्यों में आपकी मदद करने के लिए है। आप उससे सवाल पूछते हैं, और वह तुरंत जवाब देता है। लेकिन कभी-कभी, रोबोट गलत भी होता है। डेवलपर्स के लिए बड़ा सवाल यह है: हमें कैसे पता चलेगा कि रोबोट अंदाज़ा लगा रहा है या वह वास्तव में आश्वस्त है?

यह पेपर एक जासूसी कहानी की तरह है जो यह जांच रहा है कि हम रोबोट के अलग-अलग प्रकार के "संदेह" के बीच अंतर कितनी अच्छी तरह कर सकते हैं।

समस्या: एक आकार सबके लिए उपयुक्त नहीं है

वर्तमान में, अधिकांश सिस्टम रोबोट को एक एकल "कॉन्फिडेंस स्कोर" (जैसे 0% से 100% तक का प्रतिशत) देने की कोशिश करते हैं ताकि यह बताया जा सके कि वह कितना आश्वस्त है। यह पेपर तर्क देता है कि यह एक तूफान, एक ट्रैफिक जाम और एक फटे टायर को एक ही शब्द से वर्णित करने जैसा है: "समस्या।"

लेखकों ने महसूस किया कि एक रोबोट का अनिश्चितता (uncertainty) तीन बहुत अलग स्रोतों से आती है, और उन्हें एक समान मानना भ्रम पैदा करता है:

  1. "मुझे नहीं पता" का अंतर (मॉडल ज्ञान - Model Knowledge):

    • उपमा: आप रोबोट से पूछते हैं, "अमेरिका के 45वें राष्ट्रपति कौन थे?" लेकिन रोबोट को जिस डेटा पर प्रशिक्षित किया गया था, वह उस घटना से पहले का है। वह वास्तव में उत्तर नहीं जानता।
    • सही कदम: रोबोट को कहना चाहिए, "मुझे नहीं पता," या आपसे किसी किताब को देखने के लिए कहना चाहिए।
  2. "अपना पसंदीदा चुनें" वाली स्थिति (आउटपुट परिवर्तनशीलता - Output Variability):

    • उपमा: आप पूछते हैं, "किसी लाल रंग के फल का नाम बताएं।" रोबोट "सेब," "स्ट्रॉबेरी," या "चेरी" कह सकता है। सभी सही हैं। यदि रोबोट 100% आत्मविश्वास के साथ "सेब" कहता है, तो वह झूठ नहीं बोल रहा है; उसने बस विकल्पों की सूची में से एक वैध विकल्प चुना है।
    • सही कदम: रोबोट को आश्वस्त महसूस करना चाहिए, भले ही कई सही उत्तर हों। उसे घबराना नहीं चाहिए क्योंकि कई विकल्प मौजूद हैं।
  3. "अस्पष्ट प्रश्न" का जाल (इनपुट अस्पष्टता - Input Ambiguity):

    • उपमा: आप पूछते हैं, "खेल किसने जीता?" लेकिन आपने रोबोट को कभी नहीं बताया कि कौन सा खेल। रोबोट को यह अंदाज़ा लगाना होगा कि आपका मतलब सॉकर, शतरंज या वीडियो गेम से है।
    • सही कदम: रोबोट को रुकना चाहिए और पूछना चाहिए, "आपका मतलब किस खेल से है?" बजाय इसके कि वह आत्मविश्वास से "लेकर्स" कह दे और गलत साबित हो।

प्रयोग: एक विशेष परीक्षण बनाना

यह पता लगाने के लिए कि कौन सा "कॉन्फिडेंस मीटर" किस स्थिति के लिए सबसे अच्छा काम करता है, लेखकों ने एक विशेष टेस्ट डेटासेट बनाया। इसे तीन विशिष्ट ट्रैक वाले ड्राइविंग टेस्ट की तरह समझें:

  • ट्रैक A: एक टूटा हुआ पुल वाला रास्ता (ज्ञान का अंतर/Knowledge Gap)।
  • ट्रैक B: तीन वैध निकास वाले एक सड़क वाला रास्ता (आउटपुट परिवर्तनशीलता/Output Variability)।
  • ट्रैक C: बिना संकेतों वाले एक सड़क वाला रास्ता (अस्पष्टता/Ambiguity)।

उन्होंने यह देखने के लिए कई अलग-अलग "कॉन्फिडेंस मीटर" (गणितीय विधियों) का परीक्षण किया कि कौन सा सही समस्या की पहचान कर सकता है।

बड़ी खोज

परिणाम आश्चर्यजनक और थोड़े चिंताजनक थे:

  • "नॉलेज गैप" मीटर बहुत अच्छा काम करता है: जब रोबोट वास्तव में कुछ नहीं जानता, तो अधिकांश कॉन्फिडेंस मीटर सही ढंग से कहते हैं, "हे, मैं यहाँ अनिश्चित हूँ।"
  • "अस्पष्ट प्रश्न" मीटर विफल हो जाता है: जब प्रश्न अस्पष्ट होता है, तो रोबलेट अक्सर आत्मविश्वास के साथ उत्तर का अनुमान लगा लेता है। कॉन्फिडेंस मीटर सोचते हैं कि रोबोट आश्वस्त है, भले ही वह वास्तव में अंधेरे में अंदाज़ा लगा रहा हो।
  • "अपना पसंदीदा चुनें" मीटर भ्रमित हो जाता है: जब कई सही उत्तर होते हैं, तो कुछ मीटर सोचते हैं कि रोबोट "अनिश्चित" है क्योंकि उसने हर बार बिल्कुल वही शब्द नहीं चुना, भले ही उत्तर सही था।

रूपक (Metaphor): यह एक ऐसे स्मोक डिटेक्टर की तरह है जो आग लगने पर तो पूरी तरह काम करता है, लेकिन जब आप खिड़की खोलते हैं (परिवर्तनशीलता) या जब आप एक धुंधले कमरे में चलते हैं (अस्पष्टता), तो वह चिल्लाने लगता है। आप अलार्म को अनदेखा करने लगते हैं क्योंकि वह हमेशा गलत कारणों से बज रहा होता है।

यह क्यों मायने रखता है

यदि हम वास्तविक जीवन में इन त्रुटिपूर्ण कॉन्फिडेंस मीटरों का उपयोग करते हैं, तो बुरी चीजें हो सकती हैं:

  • चिकित्सा में: एक रोबोट आत्मविश्वास के साथ गलत निदान दे सकता है क्योंकि मरीज के लक्षण अस्पष्ट थे, और रोबोट ने स्पष्टीकरण मांगने के बजाय अनुमान लगाया।
  • कानून में: एक रोबोट एक सरल प्रश्न का उत्तर देने से मना कर सकता है क्योंकि उसे लगता है कि "बहुत सारे संभावित उत्तर हैं," जिससे काम की गति धीमी हो जाती है।

निष्कर्ष

पेपर निष्कर्ष निकालता है कि हमें एक एकल "कॉन्फिडेंस स्कोर" का उपयोग करना बंद कर देना चाहिए। इसके बजाय, हमें स्मार्ट, मल्टी-टूल सिस्टम की आवश्यकता है जो पूछ सकें:

  • "क्या आप उत्तर नहीं जानते?" (ज्ञान की जाँच करें)
  • "क्या प्रश्न अस्पष्ट है?" (अस्पष्टता की जाँच करें)
  • "क्या कई सही उत्तर हैं?" (परिवर्तनशीलता की जाँच करें)

केवल यह समझकर कि रोबोट अनिश्चित क्यों है, हम इसे सुरक्षित रूप से व्यवहार करना सिखा सकते है: अज्ञानता स्वीकार करना जब वह नहीं जानता, स्पष्टता मांगना जब प्रश्न अस्पष्ट हो, और आश्वस्त रहना जब वह केवल सही विकल्पों की सूची में से एक चुन रहा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →