The Score Granularity Gap in Black-Box LLM Classification: A Comparative Study of Confidence Constructions
यह शोध पत्र "स्कोर ग्रैनुलैरिटी गैप" (score granularity gap) को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि जहाँ ब्लैक-बॉक्स LLMs में सिंगल-शॉट मौखिकित आत्मविश्वास स्कोर (verbalized confidence scores) मामलों को अच्छी तरह से रैंक करते हैं, वहीं वे परिनियोजन के लिए केवल कुछ ही मोटे थ्रेशोल्ड प्रदान करते हैं, जबकि मल्टी-क्वेरी एकत्रीकरण कमजोर मॉडलों में सुधार करता है लेकिन मजबूत मॉडलों को खराब कर सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त फैक्ट्री के मैनेजर हैं। आपके पास एक नया, सुपर-स्मार्ट रोबोट (एक AI) है जो पैकेज छाँटता है। कभी-कभी रोबोट 100% निश्चित होता है कि पैकेज "अच्छा" (Good) है, और कभी-कभी वह 100% निश्चित होता है कि वह "खराब" (Bad) है। लेकिन उन पैकेजों के बारे में क्या जो उसे लेकर अनिश्चित है?
वास्तविक दुनिया में, आप रोबोट को हर निर्णय लेने की अनुमति नहीं दे सकते। आपको एक सुरक्षा नियम चाहिए: "यदि रोबोट 90% सुनिश्चित है, तो इसे स्वचालित रूप से भेज दें। यदि वह कम सुनिश्चित है, तो इसे जांच के लिए इंसान के पास भेजें।"
यह पेपर एक छिपी हुई समस्या के बारे में है कि हम इन रोबोटों से यह बताने के लिए कैसे पूछते हैं कि वे कितने आश्वस्त हैं। लेखक इसे "स्कोर ग्रैनुलैरिटी गैप" (Score Granularity Gap) कहते हैं।
यहाँ सरल शब्दों में इसका विवरण दिया गया है:
1. समस्या: "टूटा हुआ डायल" (The Broken Dial)
कल्पना कीजिए कि रोबोट आपको एक कॉन्फिडेंस स्कोर देता है ताकि आप निर्णय ले सकें।
- आदर्श (The Ideal): एक स्मूथ डायल जो 0% से 100% तक जाता है जिसमें अनंत सूक्ष्म चरण (steps) हैं। आप किसी भी बिंदु पर अपना नियम सेट कर सकते हैं (जैसे, "केवल तभी ऑटो-शिप करें जब यह 73.4% सुनिश्चित हो")।
- वास्तविकता (The Reality): रोबोट का "डायल" टूटा हुआ है। इसमें 100 स्टेप्स नहीं हैं। इसके पास केवल चार या पांच अलग-अलग नंबर हैं जिन्हें वह बोल सकता है, जैसे "कम," "मध्यम," "उच्च," और "बहुत उच्च।"
भले ही रोबोट अविश्वसनीय रूप से स्मार्ट हो और "अच्छे" पैकेजों को "बुरे" पैकेजों से ऊपर सही ढंग से रैंक कर सके (वह जानता है कि कौन सा बेहतर है), फिर भी वह आपकी फैक्ट्री को बारीकी से नियंत्रित करने में आपकी मदद नहीं कर सकता। यदि आप ठीक शीर्ष 70% पैकेज स्वीकार करना चाहते हैं, लेकिन रोबोट केवल 50% और 90% के स्कोर देता है, तो आप फंस जाते हैं। या तो आप 50% स्वीकार करेंगे या 90%, लेकिन कभी भी 70% नहीं।
उपमा (The Analogy): यह एक रेडियो ट्यून करने जैसा है जिसमें केवल चार स्टेशन हैं: समाचार, संगीत, खेल और मौसम। भले ही संगीत स्टेशन एकदम सही हो, लेकिन आप "जैज़" या "रॉक" नहीं सुन सकते क्योंकि रेडियो में वे चैनल ही नहीं हैं। आप एक "स्मूथ रैंप" के बजाय एक "खुरदरी सीढ़ी" (coarse staircase) के साथ फंसे हुए हैं।
2. प्रयोग: रोबोट से पूछने के सात तरीके
शोधकर्ताओं ने यह देखने के लिए सात अलग-अलग तरीकों का परीक्षण किया कि कौन सा तरीका डायल पर सबसे अधिक "स्टेप्स" प्रदान करता है।
- तरीका A: बस पूछ लें (The "Verbalized" Score)। आप AI से पूछते हैं: "क्या आप सुनिश्चित हैं?" और वह कहता है: "मैं 85% सुनिश्चित हूँ।"
- परिणाम: AI वास्तव में चीजों को रैंक करने में बहुत अच्छा है (वह जानता है कि क्या सही है), लेकिन यह केवल कुछ ही नंबरों का उपयोग करता है (जैसे 0.5, 0.8, 0.9, 1.0)। यह एक कोर्स डायल (coarse dial) है।
- तरीका B: "टोकन" स्कोर (The "Token" Score)। यदि AI को अपने आंतरिक गणित (log-probabilities) दिखाने की अनुमति है, तो वह अधिक नंबर दे सकता है।
- परिणाम: यह एक स्मूथ डायल देता है, लेकिन कई कमर्शियल रोबोट आपको अपना गणित नहीं दिखाएंगे।
- तरीका C: "भीड़" (Multi-Query)। आप एक ही सवाल को 10 बार पूछते हैं, शायद थोड़े अलग तरीके से, और जवाबों का औसत निकालते हैं।
- परिणाम: यह सैकड़ों स्टेप्स के साथ एक बहुत ही स्मूथ डायल बनाता है। हालाँकि, एक पेच है।
- यदि रोबोट कमजोर (weak) है (बहुत स्मार्ट नहीं है), तो उसे 10 बार पूछने से वह बहुत स्मार्ट हो जाता है और आपको एक बेहतरीन डायल मिलता है।
- यदि रोबोट मजबूत (strong) है (पहले से ही बहुत स्मार्ट है), तो उसे 10 बार पूछने से वह उलझ (confuse) सकता है और इसकी रैंकिंग खराब कर सकता है। यह एक जीनियस से 10 अलग-अलग लोगों द्वारा सलाह लेने जैसा है; वे शायद पानी में कीचड़ घोल देंगे।
- परिणाम: यह सैकड़ों स्टेप्स के साथ एक बहुत ही स्मूथ डायल बनाता है। हालाँकि, एक पेच है।
3. "व्याख्यात्मकता" का मोड़ (The "Interpretability" Twist)
शोधकर्ताओं ने एक ऐसा तरीका भी आजमाया जहाँ उन्होंने प्रश्न को 10 छोटे, विशिष्ट प्रश्नों में तोड़ दिया (जैसे, "क्या इस वाक्य में विरोधाभास है?" "क्या व्याकरण सही है?")।
- ऐसा क्यों किया? यह इसलिए नहीं है कि यह बेहतर रैंक करता है। यह इसलिए है क्योंकि यह व्याख्या योग्य (explainable) है।
- लाभ: यदि रोबोट गलती करता है, तो आप 10 छोटे जवाबों को देखकर कह सकते हैं, "आह, यह व्याकरण न समझ पाने के कारण विफल हुआ।" यह एक रसीद होने जैसा है जो दिखाता है कि आपने क्या खरीदा है, बजाय केवल कुल बिल के। यह विनियमित उद्योगों (जैसे चिकित्सा या कानून) के लिए बहुत महत्वपूर्ण है जहाँ आपको यह जानने की आवश्यकता होती है कि निर्णय क्यों लिया गया था।
4. निष्कर्ष: आपको क्या करना चाहिए?
यह पेपर उन लोगों के लिए एक सरल मार्गदर्शिका देता है जो इन AI सिस्टम को तैनात (deploy) कर रहे हैं:
- हमेशा उत्तर को बदलें (Convert): यदि AI कहता है "मैं 90% सुनिश्चित हूँ कि यह 'नहीं' है," तो आपको इसे उपयोग करने से पहले "मैं 10% सुनिश्चित हूँ कि यह 'हाँ' है" में बदलना होगा। अन्यथा, आपकी छंटनी उलटी हो जाएगी।
- यदि आपके पास कमजोर AI है: "भीड़" (Crowd) पद्धति का उपयोग करें (इसे 10 बार पूछें)। यह AI को स्मार्ट बनाएगा और आपको काम करने के लिए एक स्मूथ डायल देगा।
- यदि आपके पास मजबूत AI है: सरल "बस पूछें" (Just Ask) पद्धति पर टिके रहें। यह तेज़ है और अच्छी तरह से रैंक करता है। इसे 10 बार न पूछें, अन्यथा आप इसे बदतर बना सकते हैं।
- यदि आपको अपने निर्णयों को समझाने की आवश्यकता है: "छोटे प्रश्नों" (Small Questions) वाले तरीके का उपयोग करें। यह आपको एक स्मूथ डायल और हर निर्णय के लिए एक स्पष्ट कारण देता है, भले ही इसमें अधिक कंप्यूटर पावर खर्च हो।
सारांश
यह पेपर तर्क देता है कि हमें केवल यह नहीं पूछना चाहिए कि, "क्या AI आश्वस्त है?" हमें यह पूछना चाहिए, "हम उस आत्मविश्वास को कितनी बारीकी से ट्यून कर सकते हैं?"
एक परफेक्ट रैंकिंग सिस्टम बेकार है यदि वह आपको केवल तीन बटन दबाने का विकल्प देता है। एक विश्वसनीय स्वचालित प्रणाली बनाने के लिए, आपको एक ऐसे स्कोर की आवश्यकता है जो आपको जोखिम को सटीक रूप से नियंत्रित करने के लिए पर्याप्त "स्टेप्स" प्रदान करे, चाहे वह रूपांतरण (conversion) का उपयोग करना हो, प्रश्नों के स्मार्ट "भीड़" का उपयोग करना हो, या तर्क के पारदर्शी विवरण का उपयोग करना हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।