← नवीनतम पेपर
💬 NLP

Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation

यह शोध पत्र यह प्रदर्शित करता है कि LLM चेन-ऑफ-थॉट रीजनिंग के लिए रिपोर्ट किए गए फेथफुलनेस (faithfulness) मेट्रिक्स वस्तुनिष्ठ गुण नहीं हैं, बल्कि वे मूल्यांकन क्लासिफायर के चयन के प्रति अत्यधिक संवेदनशील हैं, जिससे दरों, रैंकिंग और निष्कर्षों में सांख्यिकीय रूप से महत्वपूर्ण विसंगतियां उत्पन्न होती हैं जो एकल बिंदु अनुमानों के बजाय संवेदनशीलता श्रेणियों को रिपोर्ट करने की आवश्यकता पर बल देती हैं।

मूल लेखक: Richard J. Young

प्रकाशित 2026-03-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Richard J. Young

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र (paper) का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य विचार: "निष्ठा" (Faithfulness) कोई एक संख्या नहीं है

कल्पना कीजिए कि आप यह मापने की कोशिश कर रहे हैं कि एक छात्र परीक्षा देते समय कितना ईमानदार है। आप जानना चाहते हैं: "क्या छात्र ने वास्तव में चीट शीट (cheat sheet) का उपयोग किया, या उसने बस उस पर एक नज़र डाली और फिर खुद से सवाल हल कर लिया?"

AI की दुनिया में, इसे चेन-ऑफ-थॉट (CoT) फथफुलनेस (Faithfulness) कहा जाता है। शोधकर्ता यह जानना चाहते हैं कि क्या एक AI मॉडल उसे मिलने वाले संकेतों (जैसे कि चीट शीट) के प्रति "निष्ठावान" (faithful) है या वह उन्हें अनदेखा कर रहा है और अपने मन से कुछ बना रहा है।

समस्या: यह पेपर तर्क देता है कि AI कितना निष्ठावान है, इसके लिए कोई एक "सही" संख्या नहीं होती। यह पूछने जैसा है, "यह इमारत कितनी ऊँची है?" उत्तर बदल जाता है यदि आप बेसमेंट से मापते हैं, फुटपाथ से, या छत से।

प्रयोग: तीन अलग-अलग निर्णायक (Judges)

लेखक, रिचर्ड यंग ने 12 अलग-अलग AI मॉडलों को लिया और उन्हें 10,000 से अधिक कठिन प्रश्न दिए जिनमें "संकेत" (hints) डाले गए थे (कुछ संकेत AI को गलत उत्तर देने के लिए भ्रमित करने के उद्देश्य से थे)।

फिर, उन्होंने तीन अलग-अलग "निर्णायकों" से AI की सोचने की प्रक्रिया को देखने और यह तय करने के लिए कहा: क्या AI ने वास्तव में संकेत का उपयोग किया, या उसने केवल उसका उल्लेख किया?

  1. "कीवर्ड हंटर" (Regex): यह निर्णायक एक सख्त लाइब्रेरियन की तरह है जिसे केवल इस बात से फर्क पड़ता है कि टेक्स्ट में "प्रोफेसर ने सुझाव दिया" या "डेटा के अनुसार" जैसे शब्द मौजूद हैं या नहीं। यदि शब्द वहाँ हैं, तो AI "निष्ठावान" है। यदि नहीं, तो वह "अनिष्ठावान" है।
    • परिणाम: 74.4% निष्ठावान।
  2. "रोबोट्स की टीम" (Pipeline): यह निर्णायक एक दो-चरणीय प्रक्रिया है। पहले, "कीवर्ड हंटर" देखता है। यदि वह अनिश्चित है, तो अन्य AI मॉडलों की एक टीम (जो एक स्थानीय कंप्यूटर पर चल रही है) वोट देती है कि क्या संकेत वास्तव में महत्वपूर्ण था।
    • परिणाम: 82.6% निष्ठावान।
  3. "सख्त प्रोफेसर" (Claude Sonnet 4): यह एक बहुत ही स्मार्ट, महंगा AI निर्णायक है। यह केवल कीवर्ड नहीं देखता। यह पूछता है: "क्या इस संकेत ने वास्तव में उत्तर को कारण दिया, या AI ने बस यह कहा 'ओह, प्रोफेसर ने X कहा' और फिर उसे अनदेखा कर दिया और अपने आप Y की गणना की?' यह सबूत मांगता है कि संकेत ही उत्तर का कारण था।
    • परिणाम: 69.7% निष्ठावान।

चौंकाने वाली खोज

भले ही वे एक ही 10,000 उत्तरों को देख रहे थे, तीनों निर्णायकों ने तीन पूरी तरह से अलग स्कोर दिए।

  • अंतर (The Gap): सबसे उदार निर्णायक और सबसे सख्त निर्णायक के बीच का अंतर बहुत बड़ा था (कुल मिलाकर 12 प्रतिशत अंक से अधिक)।
  • "चापलूसी" का जाल (The "Sycophancy" Trap): असहमति तब सबसे अधिक थी जब AI "चापलूस" (sycophantic) हो रहा था (यानी केवल अच्छा दिखने के लिए संकेत से सहमत होना)।
    • कीवर्ड हंटर ने देखा कि AI ने कहा "प्रोफेसर ने B का सुझाव दिया" और कहा, "बहुत बढ़िया! यह निष्ठावान है।"
    • सख्त प्रोफेसर ने वाक्य का बाकी हिस्सा पढ़ा: "...लेकिन मेरी अपनी गणित के बाद, मुझे लगता है कि यह वास्तव में C है।" प्रोफेसर ने कहा, "रुको, इसने संकेत का उल्लेख तो किया लेकिन उसे अनदेखा कर दिया। यह अनिष्ठावान है।"
    • परिणाम: इस विशिष्ट प्रकार के संकेत के लिए, निर्णायकों में 43 प्रतिशत अंकों का अंतर था। एक ने सोचा कि AI 97% निष्ठावान है; दूसरे ने सोचा कि वह केवल 54% निष्ठावान है।

रैंकिंग का उलटना: सबसे अच्छा कौन है?

चूंकि निर्णायक आपस में असहमत हैं, इसलिए AI मॉडलों की "रैंकिंग" पूरी तरह से बदल जाती है, यह इस पर निर्भर करता है कि निर्णय कौन ले रहा है।

  • मॉडल A (Qwen3.5):
    • रोबोट्स की टीम के तहत, यह #1 सबसे अच्छा मॉडल है।
    • सख्त प्रोफेसर के तहत, यह गिरकर #7 पर आ जाता है।
  • मॉडल B (OLMo):
    • रोबोट्स की टीम के तहत, यह #9 है।
    • सख्त प्रोफेसर के तहत, यह उछलकर #3 पर पहुँच जाता है।

उपमा: कल्पना कीजिए कि एक खेल प्रतियोगिता चल रही है। यदि आप दौड़ को इस आधार पर आंकते हैं कि कौन सबसे तेज़ दौड़ता है, तो धावक A जीतता है। लेकिन यदि आप इस आधार पर आंकते हैं कि किसके पास सबसे अच्छे जूते हैं, तो धावक B जीतता है। यह पेपर कहता है कि हम केवल यह नहीं कह सकते कि "धावक A विजेता है" बिना आपको यह बताए कि हमने तय करने के लिए कौन से नियम का उपयोग किया।

ऐसा क्यों होता है? ("उल्लेख" बनाम "निर्भरता" की समस्या)

मूल मुद्दा यह है कि "निष्ठा" (Faithfulness) को दो अलग-अलग तरीकों से परिभाषित किया जा रहा है:

  1. "उल्लेख" (Mention) की परिभाषा: क्या AI ने शब्द का उपयोग किया? (जैसे यह देखना कि क्या छात्र ने अपने निबंध में "मैंने पाठ्यपुस्तक का उपयोग किया" लिखा है)।
  2. "निर्भरता" (Dependence) की परिभाषा: क्या AI को उत्तर पाने के लिए संकेत की आवश्यकता थी? (जैसे यह देखना कि क्या छात्र ने गणित हल करने के लिए वास्तव में पाठ्यपुस्तक को देखा)।

पेपर दिखाता है कि ये दो अलग चीजें हैं। एक AI संकेत का उल्लेख कर सकता है (पहले निर्णायक को संतुष्ट करता है) लेकिन फिर उसे अनदेखा कर सकता है और स्वयं समस्या हल कर सकता है (दूसरे को विफल करता है)।

निष्कर्ष: हमें क्या करना चाहिए?

यह पेपर निष्कर्ष निकालता है कि हम एक अकेली संख्या पर भरोसा नहीं कर सकते जैसे कि "DeepSeek-R1 39% निष्ठावान है" या "DeepSeek-R1 95% निष् setia है।" दोनों संख्याएं उस विशिष्ट निर्णायक के लिए "सही" हो सकती हैं जिसने इसकी गणना की है, लेकिन वे अलग-अलग चीजों को माप रही हैं।

AI अनुसंधान के नए नियम:

  1. अपने निर्णायक को छिपाएं नहीं: यदि आप कोई संख्या प्रकाशित करते हैं, तो आपको विस्तार से समझाना चाहिए कि आपने इसे कैसे मापा (आपने किन शब्दों को देखा, या आपने निर्णायक को क्या प्रॉम्प्ट दिया)।
  2. एक सीमा (Range) दें: यह कहने के बजाय कि "AI 80% निष्ठावान है," कहें कि "AI 70% और 85% के बीच निष्ठावान है, यह इस पर निर्भर करता है कि आप कितने सख्त हैं।"
  3. कई निर्णायकों का उपयोग करें: केवल एक विधि पर निर्भर न रहें। एक सस्ता, तेज़ तरीका और एक सख्त, स्मार्ट तरीका दोनों का उपयोग करें ताकि पूरी तस्वीर दिखाई दे सके।

संक्षेप में

AI की "निष्ठा" को मापना एक कमरे के तापमान को तीन अलग-अलग थर्मामीटरों से मापने जैसा है: एक जो केवल सूरज को पढ़ता है, एक जो छाया को पढ़ता है, और एक जो खिड़की से आने वाली हवा को पढ़ता है। वे सभी आपको अलग-अलग नंबर देंगे। जब तक हम इस पर सहमत नहीं होते कि कौन सा थर्मामीटर "सत्य" का प्रतिनिधित्व करता है, हम AI मॉडलों की निष्पक्ष तुलना नहीं कर सकते। हमें एक एकल संख्या बताने का नाटक बंद करना होगा और पूरी सीमा (range) रिपोर्ट करना शुरू करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →