Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal
यह शोध पत्र UniCR को प्रस्तुत करता है, जो एक एकीकृत ढांचा (unified framework) है जो विषम अनिश्चितता साक्ष्यों (heterogeneous uncertainty evidence) को कैलिब्रेटेड शुद्धता संभावनाओं (calibrated correctness probabilities) में संलयित करता है ताकि सिद्धांतपूर्ण इनकार (principled refusal) के माध्यम से उपयोगकर्ता-निर्दिष्ट त्रुटि बजट को लागू किया जा सके, जिससे बेस मॉडल फाइन-ट्यूनिंग की आवश्यकता के बिना बड़े भाषा मॉडलों (large language models) की विश्वसनीयता में सुधार होता है और मतिभ्रम (hallucinations) को कम किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, तेज़ बोलने वाला सहायक है जो लगभग हर चीज़ के बारे में थोड़ा-बहुत जानता है। समस्या यह है कि यह सहायक कभी-कभी उन चीज़ों के बारे में भी पूरे आत्मविश्वास के साथ बात करता है जिन्हें वह वास्तव में नहीं जानता, या वह ऐसे तथ्य बना सकता है जो वास्तविक लगते हैं लेकिन गलत होते हैं। यह कुछ वैसा ही है जैसे कोई छात्र परीक्षा में उत्तर का अनुमान लगाता है और कहता है, "मैं 100% निश्चित हूँ!" भले ही वह केवल अनुमान लगा रहा हो।
आपके द्वारा साझा किया गया पेपर UniCR नामक एक नई प्रणाली पेश करता है। UniCR को एक स्मार्ट "क्वालिटी कंट्रोल मैनेजर" के रूप में समझें जो सहायक और प्रश्न पूछने वाले व्यक्ति के बीच बैठता है। इसका मुख्य काम सहायक को यह सिखाना है कि कब बोलना है और, इससे भी महत्वपूर्ण बात, कब चुप रहना है।
यहाँ बताया गया है कि रोज़मर्रा के उदाहरणों का उपयोग करते हुए UniCR कैसे काम करता है:
1. सुराग जुटाना (जासूसी का काम)
आमतौर पर, एक AI यह तय करने के लिए कि वह सही है या नहीं, केवल अपने आंतरिक विचारों को देखता है। UniCR अलग है; यह निर्णय लेने से पहले कई अलग-अलग स्रोतों से सुराग जुटाने वाले एक जासूस की तरह काम करता है। यह जाँचता है:
- AI कितना आश्वस्त महसूस करता है: क्या AI की अपनी "अंतरात्मा की आवाज़" (संभावना) उत्तर से मेल खाती है?
- निरंतरता (Consistency): यदि आप AI से एक ही सवाल पाँच अलग-अलग तरीकों से पूछते हैं, तो क्या वह हर बार एक ही उत्तर देता है? यदि उत्तर इधर-उधर हैं, तो यह एक चेतावनी का संकेत है।
- बाहरी मदद: क्या AI ने अपने उत्तर की पुष्टि करने के लिए किसी विश्वसनीय दस्तावेज़ को ढूँढा या कैलकुलेटर (टूल्स) का उपयोग किया?
- "सत्य की जाँच": क्या उत्तर उस चीज़ के साथ फिट बैठता है जिसे हम पहले से सच जानते हैं?
2. "कॉन्फिडेंस मीटर" (कैलिब्रेशन)
एक बार जब जासूस सभी सुराग जुटा लेता है, तो UniCR केवल अनुमान नहीं लगाता; यह एक कैलिब्रेटेड प्रोबेबिलिटी (परिकलित संभावना) की गणना करता है। कल्पना कीजिए कि एक मौसम पूर्वानुमान जो पहले कहता था कि "बारिश हो सकती है" 50% बार, लेकिन वास्तव में 90% बार बारिश हुई। वह पूर्वानुमान अविश्वसनीय था। UniCR इसे ठीक करता है। यह AI के कॉन्फिडेंस मीटर को एडजस्ट करता है ताकि जब AI कहे, "मैं 90% सुनिश्चित हूँ," तो इसका वास्तव में मतलब यह हो कि सही होने की 90% संभावना है। यह एक साधारण "ट्यूनिंग नॉब" (टेम्परेचर स्केलिंग) का उपयोग करता है ताकि AI का आत्मविश्वास वास्तविकता से मेल खा सके।
3. सुरक्षा बजट (रिस्क-कंट्रोल्ड रिफ्यूज़ल)
यह सबसे महत्वपूर्ण हिस्सा है। कल्पना कीजिए कि आप एक कार चला रहे हैं और आपके पास एक सख्त नियम है: "मैं केवल हर 1,000 मील में एक बार टायर पंचर होने का जोखिम उठा सकता हूँ।"
UniCR AI के लिए एक समान एरर बजट निर्धारित करता है। यदि AI का कॉन्फिडेंस स्कोर उस रेखा से नीचे गिर जाता है जहाँ वह उस बजट को तोड़ सकता है, तो UniCR AI को उत्तर देने से मना करने के लिए मजबूर करता है। गलत उत्तर देने के बजाय, यह कहता है, "मेरे पास इस पर सुरक्षित रूप से उत्तर देने के लिए पर्याप्त जानकारी नहीं है।"
महत्वपूर्ण बात यह है कि यह सिस्टम तब भी काम करता है जब AI एक "ब्लैक बॉक्स" (आप देख नहीं सकते कि वह अंदर से कैसे सोचता है) हो। आपको AI को फिर से प्रशिक्षित करने या उसके मस्तिष्क को बदलने की आवश्यकता नहीं है; आप बस इसके ऊपर एक सुरक्षा प्रबंधक जोड़ देते हैं।
4. लंबी कहानियों को संभालना (तथ्य-जाँच)
जब AI को लंबी कहानियाँ या रिपोर्ट लिखनी होती है, तो गलती से तथ्य गढ़ना आसान होता है। UniCR कहानी की वास्तविक साक्ष्यों (जैसे लाइब्रेरी में तथ्यों को खोजना) के विरुद्ध जाँच करता है। यदि AI एक ऐसा वाक्य लिखता है जो साक्ष्य के विपरीत है, तो UniCR उस विशिष्ट भाग पर उसका कॉन्फिडेंस कम कर देता है। यह AI को आत्मविश्वास के साथ मनगढ़ंत कहानियाँ सुनाने से रोकता है।
परिणाम
इस पेपर ने तीन प्रकार के कार्यों पर इस सिस्टम का परीक्षण किया:
- छोटे प्रश्न (जैसे सामान्य ज्ञान)।
- कोड लिखना (जहाँ कोड वास्तव में यह देखने के लिए चलाया जाता है कि वह काम करता है या नहीं)।
- लंबे शोध उत्तर (बाहरी दस्तावेज़ों का उपयोग करके)।
इन सभी परीक्षणों में, UniCR पुराने तरीकों से बेहतर प्रदर्शन करता है। यह इस मामले में बेहतर था कि वह कब अनिश्चित था, जब उसने वास्तव में उत्तर दिया तो उसने कम गलतियाँ कीं, और इसने अपने सुरक्षा नियमों को तोड़े बिना अधिक प्रश्नों को सही ढंग से हल किया।
संक्षेप में: UniCR एक सार्वभौमिक सुरक्षा जाल है जो AI को आत्मविश्वास के साथ अनुमान लगाने के बजाय "मुझे नहीं पता" कहना सिखाता है। यह यह तय करने के लिए कि कब बोलना है और कब चुप रहना है, कई अलग-अलग सुरागों को जोड़ता है, जिससे यह सुनिश्चित होता है कि AI त्रुटियों की एक सुरक्षित सीमा के भीतर रहे, और यह सब बिना AI को शुरू से बनाए बिना किया जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।