Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation
यह शोध पत्र मशीन अनुवाद में लार्ज लैंग्वेज मॉडल्स से प्रति-टोकन (per-token) आत्मविश्वास निकालने के लिए पांच मौखिक विधियों (verbalized methods) को प्रस्तुत और मूल्यांकित करता है, जिसमें यह पाया गया है कि वे आंतरिक संकेतों (internal signals) के साथ कम सहसंबंध दिखाने के बावजूद त्रुटि पहचान और अंशांकन (calibration) में उनके तुलनीय प्रदर्शन करती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुभाषी रोबोट अनुवादक है। आप उसे एक वाक्य का अनुवाद करने के लिए कहते हैं, और वह इसे तुरंत कर देता है। लेकिन आप कैसे जानेंगे कि उसने इसे सही किया है या नहीं? क्या रोबोट को पता चलता है कि उसने कोई गलती की है?
यह शोध एक विशिष्ट प्रश्न की जांच करता है: क्या हम रोबोट से पूछ सकते हैं, "आप इस विशिष्ट शब्द के बारे में कितने आश्वस्त हैं?" और क्या उसके उत्तर पर भरोसा किया जा सकता है?
शोधकर्ताओं ने रोबोट के "आत्मविश्वास के स्तर" (confidence level) को जानने के दो तरीकों की तुलना की:
- "आंतरिक" तरीका (The "Internal" Way): रोबोट के गुप्त गणित (इसके आंतरिक संभाव्यता/probabilities) को देखना। यह रोबोट के मस्तिष्क में झांकने जैसा है यह देखने के लिए कि एक शब्द चुनने से पहले वह कितने विकल्पों पर विचार कर रहा था।
- "मौखिक" तरीका (The "Verbalized" Way): बस रोबोट से पूछना, "0 से 1 के पैमाने पर, आप इस शब्द के प्रति कितने आश्वस्त हैं?" और उसे उत्तर टाइप करने देना।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. "मस्तिष्क में झांकने" के साथ समस्या
आमतौर पर, जब हम जानना चाहते हैं कि अनुवाद अच्छा है या नहीं, तो हम रोबोट के आंतरिक गणित को देखते हैं। यदि रोबोट सही शब्द चुनने के बारे में 99% सुनिश्चित था, तो हम मान लेते हैं कि वह सही है।
हालाँकि, शोध पत्र इस विधि में एक दोष बताता है जिसे "सरफेस फॉर्म कॉम्पिटिशन" (Surface Form Competition) कहा जाता है।
- उपमा: कल्पना कीजिए कि आप "The cat sat on the mat" का अनुवाद कर रहे हैं। आप "The feline sat on the rug" भी कह सकते हैं। दोनों ही सटीक अनुवाद हैं।
- समस्या: यदि रोबोट "cat" और "feline" के बीच उलझा हुआ है, तो उसका आंतरिक गणित दिखा सकता है कि वह "cat" के बारे में केवल 50% सुनिश्चित है क्योंकि वह "feline" के बारे में भी सोच रहा है। लेकिन "cat" वास्तव में एक सही अनुवाद है!
- परिणाम: रोबोट का आंतरिक गणित कहता है, "मैं अनिश्चित हूँ," लेकिन आउटपुट वास्तव में सटीक है। आंतरिक संकेत भ्रामक है क्योंकि यह विकल्पों के बीच भ्रम को मापता है, न कि सटीकता को।
2. नया विचार: बस उससे पूछें
चूंकि रोबोट बात कर सकता है, इसलिए शोधकर्ताओं ने एक अलग दृष्टिकोण आजमाया: मौखिक आत्मविश्वास (Verbalized Confidence)। गणित में झांकने के बजाय, उन्होंने रोबोट को यह कहने के लिए प्रेरित किया, "मुझे 90% यकीन है कि यह शब्द सही है।"
उन्होंने पूछने के पाँच तरीके आजमाए:
- सूची (The List): "बताएं कि वाक्य के कौन से हिस्से गलत हैं।"
- शब्द संख्या (Word Numbers): "प्रत्येक शब्द को 0 से 1 के बीच एक स्कोर दें।"
- शब्द शब्द (Word Words): "प्रत्येक शब्द को 'बहुत निश्चित' या 'निश्चित नहीं' जैसा लेबल दें।"
- टोकन संख्या/शब्द (Token Numbers/Words): पूरे शब्दों के बजाय शब्दों के छोटे टुकड़ों (tokens) के लिए ऐसा ही करना।
3. बड़ा आश्चर्य: वे सहमत नहीं हैं
शोधकर्ता उम्मीद कर रहे थे कि यदि रोबोट का आंतरिक गणित कहता है "मैं अनिश्चित हूँ," और हम रोबोट से पूछते हैं "क्या आप अनिश्चित हैं?", तो रोबोट कहेगा "हाँ।"
वे गलत थे।
- उपमा: यह एक मौसम पूर्वानुमानकर्ता की तरह है जो अपने जटिल रडार डेटा (आंतरिक) को देखता है और कहता है, "बारिश की 50% संभावना है," लेकिन जब आप उससे सीधे पूछते हैं, "क्या आपको लगता है कि बारिश होगी?", तो वह कहता है, "मुझे 90% यकीन है कि बारिश नहीं होगी।"
- निष्कर्ष: रोबोट के आंतरिक गणित और उसके द्वारा बोले गए शब्दों के बीच लगभग कोई सहसंबंध (correlation) नहीं था। वे अनिवार्य रूप से दो अलग-अलग रणनीतियाँ थीं जो वास्तव में एक-दूसरे से बात नहीं करती थीं।
4. क्या पूछने से मदद मिली?
तो, यदि वे सहमत नहीं हैं, तो कौन सा बेहतर है: वास्तविक अनुवाद त्रुटियों को पकड़ना?
- परिणाम: आश्चर्यजनक रूप से, रोबोट से पूछना (मौखिक) गणित में झांकने (आंतरिक) जितना ही अच्छा था, और कभी-कभी उससे भी बेहतर था।
- शर्त: यह इस पर निर्भर करता है कि आप किस रोबोट का उपयोग कर रहे हैं।
- एक मॉडल (Llama3) के लिए, रोबोट को "लिकर्ट" (Likert) स्कोर देने के लिए कहना (जैसे, 'बहुत निश्चित') सबसे अच्छा काम करता है।
- दूसरे मॉडल (Aya23) के लिए, रोबोट के आंतरिक गणित (Entropy) को देखना सबसे अच्छा काम करता है।
- वास्तविकता की जाँच: सबसे अच्छा तरीका भी पूर्ण नहीं था। रोबोट अपनी गलतियों को पहचानने में अभी भी केवल मध्यम रूप से अच्छे थे। यह एक छात्र की तरह है जो परीक्षा दे रहा है और यह जानने में काफी अच्छा है कि कौन से उत्तर गलत हैं, लेकिन फिर भी वह कुछ ऐसी गलतियाँ करता है जिन्हें वह समझ नहीं पाता।
5. यह क्यों महत्वपूर्ण है (शोध पत्र के अनुसार)
शोध पत्र निष्कर्ष निकालता है कि हमें रोबोट के कोड के अंदर देखने के लिए "हैकर्स" होने की आवश्यकता नहीं है। हम बस उससे पूछ सकते हैं।
- पहुंच (Accessibility): आपको रोबोट के आंतरिक "मस्तिष्क" (जो अक्सर बंद-स्रोत/closed-source मॉडल में छिपा होता है) तक पहुँचने की आवश्यकता नहीं है। आपको बस उससे चैट करने की आवश्यकता है।
- विशिष्टता (Granularity): शोधकर्ताओं ने पाया कि भले ही उन्होंने एक सटीक संख्या (जैसे 0.83) के लिए पूछा, रोबोट अपने उत्तरों को सरल चरणों (जैसे 0.8 या 0.9) में बदलने की प्रवृत्ति रखते थे, जिससे पता चलता है कि वे एक उच्च-परिशुद्धता कैलकुलेटर के बजाय एक साधारण चेकलिस्ट का उपयोग कर रहे थे।
सारांश
यह शोध पत्र इस बात का परीक्षण है कि क्या हम अपने आत्मविश्वास के बारे में एक लार्ज लैंग्वेज मॉडल (LLM) के अपने शब्दों पर भरोसा कर सकते हैं।
- पुराना तरीका: गणित देखें (आंतरिक)।
- नया तरीका: मॉडल से पूछें (मौखिक)।
- निर्णय: वे पूरी तरह से अलग चीजें हैं, लेकिन अनुवाद त्रुटियों को खोजने के लिए मॉडल से पूछना गणित देखने जितना ही प्रभावी है। यह अनुवाद की जांच करने का एक सरल, अधिक सुलभ तरीका है कि वह खराब होने की संभावना है या नहीं, बिना मॉडल के गुप्त कोड को देखे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।