← नवीनतम पेपर
🤖 machine learning

"very likely" Means "uncertain"? How LLMs Diverge from Humans in Linguistic Uncertainty Quantification

यह शोध पत्र एक अनुकूलन-आधारित एल्गोरिदम, METHODNAME को पेश करते हुए मौखिक अनिश्चितता मात्रा निर्धारण (verbal uncertainty quantification) में मनुष्यों और बड़े भाषा मॉडलों के बीच के विचलन की जांच करता है, जो बार-बार नमूनाकरण (repeated sampling) पर निर्भर रहने के बजाय मॉडल आउटपुट से सीधे मौखिक संकेतकों के लिए इष्टतम संभाव्यता मैपिंग सीखने के लिए है ताकि व्यवस्थित आत्मविश्वास असमानताओं को प्रकट किया जा सके।

मूल लेखक: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

प्रकाशित 2026-10-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

जब हम बोलते हैं, तो हम अक्सर अपनी बातों में सावधानी बरतते हैं। हम कुछ कहना "संभावित" (likely), "संभव" (possible), या "लगभग निश्चित" (almost certain) कहते हैं, इन शब्दों का उपयोग यह संकेत देने के लिए करते हैं कि हम वास्तव में कितना जानते हैं। संदेह व्यक्त करने की यह क्षमता मेटाकॉग्निशन (metacognition) का एक रूप है, जो एक मानसिक जांच है जहाँ हम अपने स्वयं के ज्ञान की सीमाओं को स्वीकार करते हैं। यह मानव संचार का एक महत्वपूर्ण हिस्सा है, जो हमें उन उत्तरों का ढोंग किए बिना अनिश्चितता से निपटने में सक्षम बनाता है जिन्हें हम नहीं जानते। आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से लार्ज लैंग्वेज मॉडल्स (LLMs) के साथ, यही क्षमता एक महत्वपूर्ण सुरक्षा विशेषता बनती जा रही है। ये मॉडल कभी-कभी आत्मविश्वास से भरी लेकिन तथ्यात्मक रूप से गलत जानकारी उत्पन्न कर सकते हैं, जिसे 'hallucination' (भ्रम) के रूप में जाना जाता है। इन प्रणालियों पर भरोसा करने के लिए, विशेष रूप से चिकित्सा या कानून जैसे संवेदनशील क्षेत्रों में, हमें यह जानने की आवश्यकता है कि वे कब अनिश्चित हैं। चुनौती यह पता लगाने में है कि संदेह व्यक्त करने के लिए AI द्वारा उपयोग किए जाने वाले शब्दों का अर्थ एक मानव श्रोता के लिए वही है या नहीं जो मशीन के लिए है।

शोधकर्ताओं की एक टीम ने यह जांचने के लिए काम शुरू किया कि क्या लार्ज लैंग्वेज मॉडल्स द्वारा व्यक्त की गई मौखिक अनिश्चितता मानव समझ के अनुरूप है। उन्होंने सबसे पहले लोगों द्वारा "बहुत संभावित" (very likely) या "अनिश्चित" (uncertain) जैसे वाक्यांशों की व्याख्या कैसे की जाती है, इसका एक विशाल संग्रह एकत्र किया। दशकों के मनोवैज्ञानिक और निर्णय-विज्ञान अनुसंधान से प्राप्त जानकारी का उपयोग करते हुए, उन्होंने एक संदर्भ मार्गदर्शिका तैयार की जो इन सामान्य वाक्यांशों को विशिष्ट संख्यात्मक संभावनाओं (numerical probabilities) से जोड़ती है। उदाहरण के लिए, मानव मस्तिष्क में, "बहुत संभावित" वाक्यांश उच्च स्तर के विश्वास को दर्शाता है, जबकि "संभव" बीच में कहीं स्थित है। इसके बाद शोधकर्ताओं ने कई उन्नत भाषा मॉडलों का परीक्षण किया, उनसे प्रश्न पूछकर और उन्हीं प्राकृतिक भाषा वाक्यांशों का उपयोग करके उनके विश्वास स्तर को समझाने के लिए कहा। उन्होंने मॉडलों के उत्तरों की तुलना मानव संदर्भ मार्गदर्शिका से की ताकि यह देखा जा सके कि क्या मशीनें अपने उपयोगकर्ताओं की भाषा बोल रही हैं।

परिणामों ने एक महत्वपूर्ण विसंगति को उजागर किया। हालांकि मॉडल इन शब्दों का उपयोग कर सकते थे, लेकिन उन्होंने मनुष्यों की तुलना में उन्हें अलग स्तर की निश्चितता प्रदान की। उदाहरण के लिए, जब कोई मनुष्य "बहुत संभावित" सुनता है, तो वह इसे एक मजबूत संभावना के रूप में व्याख्या करता है, लेकिन अध्ययन में शामिल मॉडलों ने अक्सर इस वाक्यांश का उपयोग उन स्थितियों के लिए किया जहाँ वे वास्तव में काफी अनिश्चित थे। इसके विपरीत, मॉडल उन वाक्यांशों के लिए उच्च स्तर का विश्वास व्यक्त कर सकते हैं जिन्हें मनुष्य केवल अनुमान मानते हैं। इस बेमेल होने का अर्थ है कि केवल एक मॉडल के आउटपुट को पढ़कर और यह मान लेना कि उसके मौखिक संकेत उसके आंतरिक स्तर को दर्शाते हैं, भ्रामक हो सकता है। अध्ययन ने दिखाया कि मशीन के विश्वास को सटीक रूप से मापने के लिए अनिश्चितता के शब्दों के मानव-निर्मित शब्दकोश पर भरोसा करना पर्याप्त नहीं था; मॉडलों के पास उन शब्दों के अर्थ के लिए अपना स्वयं का, विशिष्ट आंतरिक तर्क था।

इस अंतर को पाटने के लिए, शोधकर्ताओं ने VOCAL नामक एक नई विधि विकसित की। मॉडलों को मानवीय परिभाषाओं के अनुरूप बनाने के बजाय, यह दृष्टिकोण मॉडल के अपने व्यवहार से अनिश्चितता के शब्दों के विशिष्ट अर्थ को सीखता है। यह प्रणाली मॉडल के हजारों प्रतिक्रियाओं का विश्लेषण करती है, यह नोट करती है कि वह कब सही होता है और कब गलत होता है, तब वह किन वाक्यांशों का उपयोग करता है। फिर यह एक कस्टम मानचित्र बनाता है जो मॉडल की विशिष्ट मौखिक आदतों को सटीक संभाव्यता स्कोर में अनुवादित करता है। इस प्रक्रिया में एक गणितीय अनुकूलन (mathematical optimization) शामिल है जो डेटा को सुचारू बनाता है, यह सुनिश्चित करता है कि समान ध्वनि वाले वाक्यांशों को समान स्कोर मिले, भले ही मॉडल उनका दुर्लभ उपयोग करता हो। मशीन के विशिष्ट स्वरूप के अनुसार व्याख्या को अनुकूलित करके, यह विधि यह पता लगाने का एक बहुत अधिक विश्वसनीय तरीका बनाती है कि मॉडल कब अनिश्चित है।

प्रयोगों ने प्रदर्शित किया कि यह अनुकूलित दृष्टिकोण मशीन पर मानवीय मानक थोपने की तुलना में काफी बेहतर काम करता है। विभिन्न डेटासेट्स पर परीक्षणों में, जिसमें जटिल गणितीय समस्याएं और चिकित्सा संबंधी प्रश्न शामिल थे, यह नई विधि मानव संदर्भ मार्गदर्शिका के अकेले उपयोग की तुलना में मॉडल के उत्तर के सही या गलत होने की भविष्यवाणी करने में बहुत अधिक सटीक थी। कुछ मामलों में, सुधार काफी बड़ा था, जिसने एक ऐसी विधि को जो केवल रैंडम गेसिंग (random guessing) से थोड़ा बेहतर प्रदर्शन कर रही थी, उसे त्रुटियों को विश्वसनीय रूप से पहचानने योग्य बना दिया। शोधकर्ताओं ने पाया कि यह तकनीक उन बहुत अधिक महंगी विधियों के प्रदर्शन स्तर प्राप्त कर सकती है जिनमें मॉडल को कई उत्तर उत्पन्न करने और उनकी तुलना करने की आवश्यकता होती है, लेकिन बिना अतिरिक्त समय या कंप्यूटिंग शक्ति के।

अध्ययन यह निष्कर्ष निकालता है कि हालांकि लार्ज लैंग्वेज मॉडल्स मानव भाषण पैटर्न की नकल कर सकते हैं, लेकिन उनकी अनिश्चितता की आंतरिक समझ हमसे मौलिक रूप से भिन्न है। "बहुत संभावित" जैसा वाक्यांश मशीन के लिए उतना वजन नहीं रखता जितना कि एक व्यक्ति के लिए। इन प्रणालियों को वास्तव में भरोसेमंद बनाने के लिए, हम केवल उनसे मनुष्यों की तरह बोलने की अपेक्षा नहीं कर सकते और यह उम्मीद नहीं कर सकते कि उनका अर्थ भी वही होगा। इसके बजाय, हमें उनकी अनिश्चितता के विशिष्ट लहजे (dialect) को समझना होगा। मॉडल के अद्वितीय मौखिक संकेतों को विश्वास के स्पष्ट संकेतों में अनुवादित करने वाले कस्टम मानचित्र बनाकर, हम एक सही उत्तर और एक आत्मविश्वासी भ्रम (hallucination) के बीच बेहतर अंतर कर सकते हैं, जिससे वास्तविक दुनिया के उपयोग के लिए यह तकनीक अधिक सुरक्षित और विश्वसनीय बन जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →