Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language
यह अध्ययन संभाव्य जोखिम संचार के लिए पोस्ट-हॉक व्याख्याकार के रूप में नौ लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है और पाता है कि हालांकि वे आम तौर पर सुसंगत हैं, वे विशेष रूप से अनिश्चितता के संबंध में काफी गलत अंशांकित (miscalibrated) बने हुए हैं, जो यह संकेत देता है कि वे संख्यात्मक भविष्यवाणियों को प्राकृतिक भाषा में अनुवादित करने के लिए अभी तक विश्वसनीय ज़ीरो-शॉट उपकरण नहीं हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक क्रिस्टल बॉल है जो भविष्य की भविष्यवाणी कर सकती है, लेकिन वह आपको स्पष्ट "हाँ" या "नहीं" देने के बजाय "73% संभावना" या "बहुत अनिश्चित भविष्यवाणी" जैसे अंक फुसफुसाती है। अब, कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) से उन अंकों को एक आम व्यक्ति के लिए सरल अंग्रेजी में अनुवाद करने के लिए कहते हैं। आप चाहते हैं कि रोबोट कहे, "बारिश होने की बहुत अधिक संभावना है," जब संख्या अधिक हो, और "यह बहुत अनिश्चित है," जब संख्या अस्थिर हो।
बड़ा सवाल जो यह शोध पत्र पूछता है, वह यह है: क्या ये रोबोट बिना गलती किए यह काम वास्तव में कर सकते हैं?
शोधकर्ताओं ने "अनुवाद" का एक विशाल खेल आयोजित किया ताकि यह पता लगाया जा सके। उन्होंने केवल रोबोटों से अनुमान लगाने के लिए नहीं कहा; उन्होंने उन्हें एक "क्रिस्टल बॉल" (जिसे बीटा डिस्ट्रीब्यूशन नामक चीज़ का उपयोग करके गणितीय रूप से मॉडल किया गया था) से प्राप्त सिम्युलेटेड भविष्यवाणियां दीं, जिनमें विशिष्ट, ज्ञात स्तर की संभावना और अनिश्चितता थी। फिर उन्होंने नौ अलग-अलग AI मॉडलों को एक सख्त मेनू विकल्पों (जैसे "बहुत संभावित" या "अत्यधिक अनिश्चित") में से सटीक वाक्यांश चुनने के लिए कहा। उन्होंने यह बार-बार किया, उनकी "टेम्परेचर" (कितना रचनात्मक या रैंडम होने की अनुमति है) को बदला और छह अलग-अलग वास्तविक दुनिया के परिदृश्यों में परीक्षण किया, जैसे बाढ़ की भविष्यवाणी करना या यह अनुमान लगाना कि एक जुआरी जीतेगा या नहीं।
प्रयोगशाला से सीधा निष्कर्ष यहाँ दिया गया है: रोबोट सुसंगत (consistent) हैं, लेकिन वे कैलिब्रेशन (calibration) में बहुत खराब हैं।
इसे एक मौसम विज्ञानी की तरह समझें जो बहुत विश्वसनीय है कि वह हर बार आपसे पूछने पर एक ही बात कहता है, लेकिन वह इस बारे में पूरी तरह गलत है कि उस बात का अर्थ क्या है।
- निरंतरता (The "Reliable Robot"): Consistency: यदि आप एक ही रोबोट से एक ही प्रश्न दस बार पूछते हैं, तो वह लगभग हमेशा एक ही उत्तर देगा। यह एक ऐसे तोते की तरह है जो कभी अपना स्क्रिप्ट नहीं भूलता। अधिकांश मॉडलों ने यहाँ बहुत उच्च स्कोर किया, जिसमें एक शीर्ष-स्तरीय मॉडल (GPT-5.4) को 1.0 का पूर्ण स्कोर मिला। वह कभी नहीं डगमगाया।
- कैलिब्रेशन (The "Truth-Teller"): Calibration: यहीं पर रोबट लड़खड़ाते हैं। कैलिब्रेशन का अर्थ है शब्दों को वास्तविक गणित से मिलाना। यदि गणित कहता है "95% संभावना," तो रोबोट को "लगभग निश्चित" कहना चाहिए। यदि यह "10% संभावना" कहता है, तो उसे "बहुत अनिश्चित" कहना चाहिए। अध्ययन में पाया गया कि अधिकांश रोबोट मिसकैलिब्रेटेड (miscalibrated) हैं। वे अक्सर वही बीच के रास्ते वाले वाक्यांश चुनते हैं (जैसे "कुछ हद तक निश्चित") चाहे गणित चिल्लाकर "लगभग असंभव" कह रहा हो या "गारंटीकृत"। वे उस व्यक्ति की तरह हैं जो पासे के नंबर चाहे जो भी हों, हमेशा "शायद" कहता है।
यह शोध पत्र स्पष्ट रूप से किसे खारिज करता है:
आप सोच सकते हैं, "हो सकता है कि रोबोट गणित नहीं कर पा रहे हों! शायद अगर हम उन्हें कच्चे डेटा के बजाय सीधे अंतिम नंबर दें, तो वे इसे सही कर लेंगे।" शोधकर्ताओं ने इसी विचार का परीक्षण किया। उन्होंने रोबोट को प्रॉम्प्ट में ही पहले से गणना किया गया "मोड" (सबसे संभावित संख्या) और "सैंपल साइज" (गणित कितना निश्चित है) दिया। परिणाम क्या रहा? इससे कोई मदद नहीं मिली। रोबोट अभी भी संख्याओं को सही शब्दों से जोड़ने में विफल रहे। यह सुझाव देता है कि समस्या यह नहीं है कि वे गणित नहीं कर सकते; समस्या स्वयं अनुवाद के चरण में है। उनके पास एक ठोस आंतरिक शब्दकोश नहीं है जो संख्याओं को शब्दों से जोड़ता हो।
"टेम्परेचर" (Temperature) का ट्रेड-ऑफ:
शोधकर्ताओं ने "टेम्परेचर" सेटिंग के साथ भी प्रयोग किया, जो नियंत्रित करता है कि रोबोट के विकल्प कितने रैंडम हैं।
- लो टेम्परेचर (Low Temperature): रोबोट एक उबाऊ रोबोट है। वह हर बार एक ही सुरक्षित शब्द चुनता है। उच्च निरंतरता, लेकिन वह एक ढर्रे में फंस जाता है और संख्याओं से मेल नहीं खाता।
- हाई टेम्परेचर (High Temperature): रोबोट थोड़ा जंगली हो जाता है। वह अलग-अलग शब्द चुनना शुरू कर देता है, जो वास्तव में संख्याओं से मेल खाने में मदद करता है (कैलिब्रेशन में सुधार करता है), लेकिन यह एक अस्थिर रोबोट बन जाता है जो आपको एक ही प्रश्न के लिए अलग-अलग उत्तर देता है (निरंतरता को नष्ट कर देता है)।
एक स्टार परफॉर्मर:
एक अपवाद था: GPT-5.4। यह मॉडल संभावना (likelihood) का वर्णन करने में एक दैत्य था। इसने लगभग पूर्ण 0.96 का कैलिब्रेशन स्कोर और 1.0 का पूर्ण निरंतरता स्कोर प्राप्त किया। ऐसा लगा कि इसने एक पूर्ण, कठोर नियम पुस्तिका सीख ली है: "यदि संख्या X है, तो मैं Y कहूँगा।" हालांकि, भले ही यह सुपर-रोबोट था, यह अनिश्चितता (uncertainty) के मामले में विफल रहा। इसने अनिश्चितता कार्यों पर केवल 0.37 का स्कोर प्राप्त किया, और अस्पष्ट, मध्यम-स्तर के वाक्यांशों पर ही वापस आ गया। ऐसा प्रतीत होता है कि सबसे स्मार्ट रोबोट को भी यह नहीं पता कि गणित से मेल खाने वाले तरीके से "मैं वास्तव में अनिश्चित हूँ" कैसे कहा जाए।
मुख्य बात (The Bottom Line):
शोध पत्र निष्कर्ष निकालता है कि वर्तमान में, ये AI मॉडल जोखिम को समझाने के लिए स्टैंडअलोन टूल के रूप में तैयार नहीं हैं। वे एक बहुत ही सुसंगत अनुवादक की तरह हैं जो ऐसी भाषा बोलता है जहाँ शब्द वास्तव में अर्थ से मेल नहीं खाते। यदि आप उनसे किसी चिकित्सा जोखिम या बाढ़ की चेतावनी को समझाने के लिए कहते हैं, तो वे एक आत्मविश्वास से भरा उत्तर दे सकते हैं जो वास्तव में भ्रामक हो सकता है।
लेखक सुझाव देते हैं कि जबकि ये मॉडल प्रवाहपूर्ण, आसानी से पढ़े जाने वाले वाक्य बनाने में माहिर हैं, हम बस एक रिस्क कैलकुलेटर में इन्हें प्लग नहीं कर सकते और सटीक होने की उम्मीद नहीं कर सकते। "बोतलनेक" (bottleneck) गणित नहीं है; यह रोबot की एक संख्या को भरोसेमंद शब्द में बदलने की अक्षमता है। जब तक हम इसे ठीक नहीं कर लेते, हमें जीवन-मृत्यु की स्थितियों की संभावनाओं को समझाने के लिए AI का उपयोग करने में बहुत सावधान रहने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।