← नवीनतम पेपर
💬 NLP

Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

यह शोध पत्र छह विश्वास अनुमान विधियों का मूल्यांकन करके एक्टिवेशन ओरेकल के लिए अनिश्चितता मात्रा निर्धारण (uncertainty quantification) की जांच करता है, जिसमें यह पाया गया कि बूटस्ट्रैप मोड फ्रीक्वेंसी सर्वोत्तम अंशांकन (calibration) प्रदान करती है जबकि लॉग-प्रोबेबिलिटी एक लागत प्रभावी ट्राइएज सिग्नल के रूप में कार्य करती है।

मूल लेखक: Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है (आइए उसे "टारगेट" कहें) जिसके पास एक रहस्य है। शायद इसे अपने दिमाग के अंदर एक विशिष्ट शब्द, जैसे कि "पेड़" (tree), छिपा कर रखने के लिए प्रोग्राम किया गया है। आप उस शब्द को सीधे नहीं देख सकते; आप केवल उसके सोचने के दौरान उसके विद्युत संकेतों (उसके "एक्टिवेशन्स") को देख सकते हैं।

अब, कल्पना कीजिए कि आपके पास एक दूसरा रोबोट है, "ओरेकल" (Oracle), जिसका एकमात्र काम उन विद्युत संकेतों को देखना और उन्हें सरल अंग्रेजी में अनुवाद करना है। वह कहता है, "गुप्त शब्द पेड़ है!"

समस्या:
ओरेकल शब्द का अनुमान लगाने में तो बहुत अच्छा है, लेकिन इसमें एक बड़ी व्यक्तित्व संबंधी खामी है: इसे कभी पता नहीं चलता कि यह गलत है। यह इस बात पर समान आत्मविश्वास के साथ कहता है कि "गुप्त शब्द पेड़ है" चाहे वह सही हो या पूरी तरह से भ्रमित (hallucinating) हो। यदि आप इस ओरेकल का उपयोग महत्वपूर्ण निर्णय लेने के लिए कर रहे हैं (जैसे कि "क्या इस AI को रिलीज़ करना सुरक्षित है?"), तो आपको यह जानने की आवश्यकता है कि: ओरेकल वास्तव में कितना आश्वस्त है?

प्रयोग:
इस शोध पत्र के लेखकों ने ओरेकल को यह सिखाने की कोशिश की कि वह कैसे कह सके, "मुझे काफी यकीन है," या "मैं बस अंदाज़ा लगा रहा हूँ।" उन्होंने ओरेकल के आत्मविश्वास को मापने के लिए छह अलग-अलग तरीकों का परीक्षण किया, जो कुछ इस तरह है जैसे मौसम के पूर्वानुमान की विश्वसनीयता की जाँच करने के छह अलग-अलग तरीके हों।

उन्होंने इसे सरल उपमाओं का उपयोग करके कैसे परखा, यहाँ दिया गया है:

छह आत्मविश्वास विधियाँ (Six Confidence Methods)

  1. "अंतर्ज्ञान" (Log-Probability):

    • यह कैसे काम करता है: ओरेकल उस शब्द को देखता है जो उसने अभी कहा और पूछता है, "इस विशिष्ट शब्द को चुनने की कितनी संभावना थी?"
    • परिणाम: यह एक ठीक-ठाक अनुमान है, लेकिन अक्सर ओरेकल ज़रूरत से ज़्यादा आत्मविश्वासी होता है। वह सोचता है कि वह 90% आश्वस्त है जबकि वास्तव में वह केवल 60% बार सही होता है।
  2. "भीड़ का वोट" (Bootstrap Mode Frequency):

    • कैसे काम करता है: ओरेकल से केवल एक बार पूछने के बजाय, आप उससे एक बार में 20 बार पूछते हैं, उसे थोड़ा रैंडम होने देते हैं (जैसे पासा फेंकना)। यदि वह 18 बार "पेड़" कहता है और 2 बार "कार" कहता है, तो आप जानते हैं कि वह बहुत आश्वस्त है। यदि वह "पेड़," "कार," "बादल," "चट्टान" और "पेड़" बेतरतीब ढंग से कहता है, तो आप जानते हैं कि वह भ्रमित है।
    • परिणाम: यही विजेता था। यह ओरेकल के सही या गलत होने को बताने में सबसे सटीक था। यह एक भीड़ से पूछने जैसा है; यदि वे सभी सहमत हैं, तो आप उत्तर पर भरोसा कर सकते हैं।
  3. "ईमानदार साक्षात्कार" (Direct Self-Report):

    • कैसे काम करता है: आप सीधे ओरेकल से पूछते हैं: "0 से 100 के पैमाने पर, आप कितने आश्वस्त हैं?"
    • परिणाम: यह सबसे खराब तरीका था। ओरेकल आत्मनिरीक्षण (introspection) करने में बहुत बुरा है। बड़े मॉडल पर, यह गलत होने पर सही होने की तुलना में अधिक आत्मविश्वासी था। यह उस छात्र की तरह है जो 100% सुनिश्चित है कि उसने गणित का सवाल सही हल किया है, भले ही उसने उसे पूरी तरह से गलत किया हो।
  4. "MCMC चेन" (Power Sampling):

    • कैसे काम करता है: यह एक जटिल गणितीय ट्रिक है जहाँ ओरेकल विभिन्न संभावित उत्तरों के बीच "कूदने" (jump) की कोशिश करता है ताकि यह देख सके कि क्या वह एक ही उत्तर पर अटक गया है।
    • परिणाम: यह अच्छा काम नहीं कर पाया। क्योंकि ओरेकल का दिमाग एक ही उत्तर पर इतना केंद्रित है, वह वास्तव में अन्य संभावनाओं पर "कूद" नहीं पाता है, इसलिए यह तरीका यह नहीं बता सका कि वह आत्मविश्वासी है या बस जिद्दी है।
  5. "रस्साकशी" (Steering Sensitivity):

    • कैसे काम करता है: आप धीरे से ओरेकल के दिमाग को अलग-अलग दिशाओं में धकेलते हैं ताकि यह देख सकें कि क्या इससे उसका उत्तर बदल जाता है। यदि वह वैसा ही रहता है, तो वह आश्वस्त है।
    • परिणाम: यह बहुत ही मोटा (coarse) तरीका था। यह तापमान को मापने के लिए ऐसे थर्मामीटर जैसा था जिसमें केवल "गर्म" और "ठंडा" सेटिंग्स हैं।
  6. "मल्टी-चेन वोट" (Multi-Chain Vote):

    • कैसे काम करता है: यह "भीड़ के वोट" के समान है, लेकिन 20 उत्तर उत्पन्न करने के लिए एक अधिक जटिल और महंगी गणितीय विधि का उपयोग करता है।
    • परिणाम: इसने ठीक-ठाक काम किया, लेकिन यह बहुत धीमा था और इसने साधारण "भीड़ के वोट" से बेहतर परिणाम नहीं दिए।

मुख्य निष्कर्ष (The Big Takeaways)

  • सबसे अच्छा उपकरण: "भीड़ का वोट" (मॉडल को 20 बार पूछना और यह देखना कि वह खुद के साथ कितनी बार सहमत होता है) सबसे अच्छा तरीका है यह जानने का कि ओरेकल सच बोल रहा है या नहीं।
  • जाल (The Trap): ओरेकल पर तब तक भरोसा न करें जब वह केवल कहता है "मैं आश्वस्त हूँ।" शोध पत्र में पाया गया कि जब ओरेकल से उसके आत्मविश्वास को रेट करने के लिए कहा जाता है, तो वह अक्सर उतना ही झूठ बोलता है (या कहें कि भ्रमित होता है) जितना कि वह उत्तर के बारे में झूठ बोलता है।
  • लागत (The Cost): "भीड़ के वोट" के लिए अधिक कंप्यूटर पावर की आवश्यकता होती है क्योंकि आपको मॉडल को 20 बार चलाना पड़ता है। "अंतर्ज्ञान" विधि तेज़ है लेकिन कम सटीक है। लेखक सुझाव देते हैं कि तेज़ विधि का उपयोग केवल एक त्वरित फ़िल्टर के रूप में करें, लेकिन अंतिम निर्णय के लिए "भीड़ के वोट" पर भरोसा करें।

यह क्यों महत्वपूर्ण है

यदि आप AI मॉडल की जाँच करने के लिए सुरक्षा प्रणाली बना रहे हैं, तो आप केवल ओरेकल की बातों को सुनकर काम नहीं चला सकते। आपको यह जानने की आवश्यकता है कि आप उसकी बातों पर कितना भरोसा कर सकते हैं। यह शोध पत्र हमें विश्वास बनाने का एक मैनुअल देता है, यह दिखाते हुए कि ओरेकल को "दो बार सोचने" के लिए कहना (भीड़ के वोट के माध्यम से) उसे पकड़ने का सबसे विश्वसनीय तरीका है जब वह मनगढ़ंत बातें बना रहा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →