← नवीनतम पेपर
💬 NLP

Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language

यह अध्ययन संभाव्य जोखिम संचार के लिए पोस्ट-हॉक व्याख्याकार के रूप में नौ लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है और पाता है कि हालांकि वे आम तौर पर सुसंगत हैं, वे विशेष रूप से अनिश्चितता के संबंध में काफी गलत अंशांकित (miscalibrated) बने हुए हैं, जो यह संकेत देता है कि वे संख्यात्मक भविष्यवाणियों को प्राकृतिक भाषा में अनुवादित करने के लिए अभी तक विश्वसनीय ज़ीरो-शॉट उपकरण नहीं हैं।

मूल लेखक: Diego Cerda-Mardini, Sarath Chandar, Sreenath Madathil

प्रकाशित 2026-07-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Diego Cerda-Mardini, Sarath Chandar, Sreenath Madathil

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक क्रिस्टल बॉल है जो भविष्य की भविष्यवाणी कर सकती है, लेकिन वह आपको स्पष्ट "हाँ" या "नहीं" देने के बजाय "73% संभावना" या "बहुत अनिश्चित भविष्यवाणी" जैसे अंक फुसफुसाती है। अब, कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) से उन अंकों को एक आम व्यक्ति के लिए सरल अंग्रेजी में अनुवाद करने के लिए कहते हैं। आप चाहते हैं कि रोबोट कहे, "बारिश होने की बहुत अधिक संभावना है," जब संख्या अधिक हो, और "यह बहुत अनिश्चित है," जब संख्या अस्थिर हो।

बड़ा सवाल जो यह शोध पत्र पूछता है, वह यह है: क्या ये रोबोट बिना गलती किए यह काम वास्तव में कर सकते हैं?

शोधकर्ताओं ने "अनुवाद" का एक विशाल खेल आयोजित किया ताकि यह पता लगाया जा सके। उन्होंने केवल रोबोटों से अनुमान लगाने के लिए नहीं कहा; उन्होंने उन्हें एक "क्रिस्टल बॉल" (जिसे बीटा डिस्ट्रीब्यूशन नामक चीज़ का उपयोग करके गणितीय रूप से मॉडल किया गया था) से प्राप्त सिम्युलेटेड भविष्यवाणियां दीं, जिनमें विशिष्ट, ज्ञात स्तर की संभावना और अनिश्चितता थी। फिर उन्होंने नौ अलग-अलग AI मॉडलों को एक सख्त मेनू विकल्पों (जैसे "बहुत संभावित" या "अत्यधिक अनिश्चित") में से सटीक वाक्यांश चुनने के लिए कहा। उन्होंने यह बार-बार किया, उनकी "टेम्परेचर" (कितना रचनात्मक या रैंडम होने की अनुमति है) को बदला और छह अलग-अलग वास्तविक दुनिया के परिदृश्यों में परीक्षण किया, जैसे बाढ़ की भविष्यवाणी करना या यह अनुमान लगाना कि एक जुआरी जीतेगा या नहीं।

प्रयोगशाला से सीधा निष्कर्ष यहाँ दिया गया है: रोबोट सुसंगत (consistent) हैं, लेकिन वे कैलिब्रेशन (calibration) में बहुत खराब हैं।

इसे एक मौसम विज्ञानी की तरह समझें जो बहुत विश्वसनीय है कि वह हर बार आपसे पूछने पर एक ही बात कहता है, लेकिन वह इस बारे में पूरी तरह गलत है कि उस बात का अर्थ क्या है।

  • निरंतरता (The "Reliable Robot"): Consistency: यदि आप एक ही रोबोट से एक ही प्रश्न दस बार पूछते हैं, तो वह लगभग हमेशा एक ही उत्तर देगा। यह एक ऐसे तोते की तरह है जो कभी अपना स्क्रिप्ट नहीं भूलता। अधिकांश मॉडलों ने यहाँ बहुत उच्च स्कोर किया, जिसमें एक शीर्ष-स्तरीय मॉडल (GPT-5.4) को 1.0 का पूर्ण स्कोर मिला। वह कभी नहीं डगमगाया।
  • कैलिब्रेशन (The "Truth-Teller"): Calibration: यहीं पर रोबट लड़खड़ाते हैं। कैलिब्रेशन का अर्थ है शब्दों को वास्तविक गणित से मिलाना। यदि गणित कहता है "95% संभावना," तो रोबोट को "लगभग निश्चित" कहना चाहिए। यदि यह "10% संभावना" कहता है, तो उसे "बहुत अनिश्चित" कहना चाहिए। अध्ययन में पाया गया कि अधिकांश रोबोट मिसकैलिब्रेटेड (miscalibrated) हैं। वे अक्सर वही बीच के रास्ते वाले वाक्यांश चुनते हैं (जैसे "कुछ हद तक निश्चित") चाहे गणित चिल्लाकर "लगभग असंभव" कह रहा हो या "गारंटीकृत"। वे उस व्यक्ति की तरह हैं जो पासे के नंबर चाहे जो भी हों, हमेशा "शायद" कहता है।

यह शोध पत्र स्पष्ट रूप से किसे खारिज करता है:
आप सोच सकते हैं, "हो सकता है कि रोबोट गणित नहीं कर पा रहे हों! शायद अगर हम उन्हें कच्चे डेटा के बजाय सीधे अंतिम नंबर दें, तो वे इसे सही कर लेंगे।" शोधकर्ताओं ने इसी विचार का परीक्षण किया। उन्होंने रोबोट को प्रॉम्प्ट में ही पहले से गणना किया गया "मोड" (सबसे संभावित संख्या) और "सैंपल साइज" (गणित कितना निश्चित है) दिया। परिणाम क्या रहा? इससे कोई मदद नहीं मिली। रोबोट अभी भी संख्याओं को सही शब्दों से जोड़ने में विफल रहे। यह सुझाव देता है कि समस्या यह नहीं है कि वे गणित नहीं कर सकते; समस्या स्वयं अनुवाद के चरण में है। उनके पास एक ठोस आंतरिक शब्दकोश नहीं है जो संख्याओं को शब्दों से जोड़ता हो।

"टेम्परेचर" (Temperature) का ट्रेड-ऑफ:
शोधकर्ताओं ने "टेम्परेचर" सेटिंग के साथ भी प्रयोग किया, जो नियंत्रित करता है कि रोबोट के विकल्प कितने रैंडम हैं।

  • लो टेम्परेचर (Low Temperature): रोबोट एक उबाऊ रोबोट है। वह हर बार एक ही सुरक्षित शब्द चुनता है। उच्च निरंतरता, लेकिन वह एक ढर्रे में फंस जाता है और संख्याओं से मेल नहीं खाता।
  • हाई टेम्परेचर (High Temperature): रोबोट थोड़ा जंगली हो जाता है। वह अलग-अलग शब्द चुनना शुरू कर देता है, जो वास्तव में संख्याओं से मेल खाने में मदद करता है (कैलिब्रेशन में सुधार करता है), लेकिन यह एक अस्थिर रोबोट बन जाता है जो आपको एक ही प्रश्न के लिए अलग-अलग उत्तर देता है (निरंतरता को नष्ट कर देता है)।

एक स्टार परफॉर्मर:
एक अपवाद था: GPT-5.4। यह मॉडल संभावना (likelihood) का वर्णन करने में एक दैत्य था। इसने लगभग पूर्ण 0.96 का कैलिब्रेशन स्कोर और 1.0 का पूर्ण निरंतरता स्कोर प्राप्त किया। ऐसा लगा कि इसने एक पूर्ण, कठोर नियम पुस्तिका सीख ली है: "यदि संख्या X है, तो मैं Y कहूँगा।" हालांकि, भले ही यह सुपर-रोबोट था, यह अनिश्चितता (uncertainty) के मामले में विफल रहा। इसने अनिश्चितता कार्यों पर केवल 0.37 का स्कोर प्राप्त किया, और अस्पष्ट, मध्यम-स्तर के वाक्यांशों पर ही वापस आ गया। ऐसा प्रतीत होता है कि सबसे स्मार्ट रोबोट को भी यह नहीं पता कि गणित से मेल खाने वाले तरीके से "मैं वास्तव में अनिश्चित हूँ" कैसे कहा जाए।

मुख्य बात (The Bottom Line):
शोध पत्र निष्कर्ष निकालता है कि वर्तमान में, ये AI मॉडल जोखिम को समझाने के लिए स्टैंडअलोन टूल के रूप में तैयार नहीं हैं। वे एक बहुत ही सुसंगत अनुवादक की तरह हैं जो ऐसी भाषा बोलता है जहाँ शब्द वास्तव में अर्थ से मेल नहीं खाते। यदि आप उनसे किसी चिकित्सा जोखिम या बाढ़ की चेतावनी को समझाने के लिए कहते हैं, तो वे एक आत्मविश्वास से भरा उत्तर दे सकते हैं जो वास्तव में भ्रामक हो सकता है।

लेखक सुझाव देते हैं कि जबकि ये मॉडल प्रवाहपूर्ण, आसानी से पढ़े जाने वाले वाक्य बनाने में माहिर हैं, हम बस एक रिस्क कैलकुलेटर में इन्हें प्लग नहीं कर सकते और सटीक होने की उम्मीद नहीं कर सकते। "बोतलनेक" (bottleneck) गणित नहीं है; यह रोबot की एक संख्या को भरोसेमंद शब्द में बदलने की अक्षमता है। जब तक हम इसे ठीक नहीं कर लेते, हमें जीवन-मृत्यु की स्थितियों की संभावनाओं को समझाने के लिए AI का उपयोग करने में बहुत सावधान रहने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →