← नवीनतम पेपर
🤖 AI

C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning

यह शोध पत्र C2-Faith प्रस्तुत करता है, जो PR800K से व्युत्पन्न एक बेंचमार्क है जो चेन-ऑफ-थॉट रीजनिंग में कॉज़ल (causal) और कवरेज फेथफुलनेस (coverage faithfulness) का आकलन करने की LLM जजों की क्षमता का मूल्यांकन करता है, जो यह प्रकट करता है कि उनका प्रदर्शन कार्य के अनुसार काफी भिन्न होता है और उन्हें त्रुटियों को स्थानीयकृत करने या अपूर्ण तर्क को सटीक रूप से स्कोर करने में कठिनाई होती है।

मूल लेखक: Avni Mittal, Rauno Arike

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Avni Mittal, Rauno Arike

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो एक छात्र के गणित के होमवर्क को ग्रेड दे रहे हैं। छात्र ने एक समस्या का लंबा, चरण-दर-चरण समाधान लिखा है।

अतीत में, शिक्षक (और AI मॉडल) मुख्य रूप से एक ही चीज़ की परवाह करते थे: क्या उन्हें सही उत्तर मिला? यदि अंतिम संख्या सही थी, तो छात्र को 'A' ग्रेड मिल जाता था।

लेकिन हाल ही में, हमें एहसास हुआ कि यह पर्याप्त नहीं है। एक छात्र अनुमान लगाकर, उत्तर कुंजी (answer key) की नकल करके, या बहुत सारी ऐसी बातें लिखकर सही उत्तर प्राप्त कर सकता है जो सुनने में तो समझदारी भरी लगती हैं लेकिन वास्तव में उनका कोई अर्थ नहीं होता। इसे unfaithful (अविश्वसनीय) होना कहा जाता है। उनके पास सही मंजिल तो है, लेकिन उन्होंने जो नक्शा बनाया है वह टूटा हुआ है।

यह शोध पत्र एक नया टूल पेश करता है जिसे C2-Faith कहा जाता है, ताकि यह परीक्षण किया जा सके कि "AI शिक्षक" (Judges) इन टूटे हुए नक्शों को पकड़ने में कितने अच्छे हैं।

टूटे हुए नक्शे के दो तरीके

लेखकों ने महसूस किया कि छात्र की तर्क प्रक्रिया के "unfaithful" होने के दो मुख्य तरीके हैं, और उन्होंने इन्हें Causality (कार्य-कारण संबंध) और Coverage (व्याप्ति) नाम दिया।

  1. Causality (डोमिनो प्रभाव टेस्ट):
    डोमिनो की एक कतार की कल्पना करें। यदि आप पहले डोमिनो को गिराते हैं, तो दूसरा केवल इसलिए गिरता है क्योंकि पहला गिरा है।

    • टेस्ट: क्या चरण B तार्किक रूप से चरण A के कारण ही हुआ है?
    • विफलता: यदि छात्र लिखता है, "मैंने 5 से गुणा किया," और अगला चरण कहता है, "इसलिए, मैंने 2 जोड़ा," तो यह एक टूटा हुआ डोमिनो है। दूसरा चरण पहले से मेल नहीं खाता। यह एक Causal त्रुटि है।
  2. Coverage (लुप्त पहेली के टुकड़ों का टेस्ट):
    एक पहेली (puzzle) की कल्पना करें जहाँ छात्र डिब्बे पर बने चित्र से सीधे तैयार चित्र पर कूद जाता है, बीच के 50 टुकड़ों को छोड़ देता है।

    • टेस्ट: क्या छात्र ने वहां तक पहुँचने के लिए सभी आवश्यक चरण दिखाए हैं?
    • विफलता: यदि छात्र कहता है, "उत्तर 42 है," लेकिन उसने वह हिस्सा छोड़ दिया जहाँ उसने वास्तव में गणित किया था, तो उसका Coverage कम है। तर्क अधूरा है, भले ही अंतिम संख्या सही हो।

प्रयोग: AI शिक्षकों को चकमा देना

यह परीक्षण करने के लिए कि क्या AI जज त्रुटियों को पकड़ने में सक्षम हैं, शोधकर्ताओं ने एक "नकली परीक्षा" बनाई।

  • सेटअप: उन्होंने एक विशाल डेटाबेस से सटीक, सही गणितीय समाधान लिए।
  • चाल: उन्होंने गुप्त रूप से एक चरण को एक नकली, निरर्थक चरण से बदल दिया (Causality को तोड़ना) या उन्होंने बीच के कई चरणों को हटा दिया (Coverage को तोड़ना)।
  • चुनौती: उन्होंने तीन शीर्ष-स्तरीय AI मॉडलों (GPT-4.1, DeepSeek-V3.1, और o4-mini) को जज के रूप में कार्य करने और त्रुटियों को खोजने के लिए कहा।

आश्चर्यजनक परिणाम

परिणाम "रॉक, पेपर, सिज़र्स" के खेल की तरह थे। कोई भी एक AI हर चीज़ में सर्वश्रेष्ठ नहीं था।

  • "द स्पॉटर" (DeepSeek-V3.1):
    यह AI दो विशिष्ट चरणों को देखने और यह कहने में अद्भुत था कि, "हे, ये आपस में मेल नहीं खाते!" यह Causal त्रुटियों को पकड़ने में सबसे अच्छा था।

    • उपमा: यह एक मैकेनिक की तरह है जो यह जांचने में माहिर है कि क्या दो विशिष्ट गियर आपस में फिट बैठते हैं, लेकिन शायद पूरे इंजन को देखने में उतना अच्छा नहीं है।
  • "द डिटेक्टिव" (o4-mini):
    यह AI तर्क की पूरी लंबी श्रृंखला को देखने और ठीक से पहचानने में सबसे अच्छा था कि गलती कहाँ हुई। यह समग्र रूप से सबसे संतुलित भी था।

    • उपमा: यह एक जासूस की तरह है जो एक पूरा उपन्यास पढ़ सकता है और कहानी के छेद (plot hole) वाली सटीक पन्ने की ओर इशारा कर सकता है।
  • "द ऑप्टिमिस्ट" (वे सभी):
    जब बात Coverage (छूटे हुए चरणों) की आई, तो सभी AI जज बहुत उदार थे। यहाँ तक कि जब छात्र ने 70% गणितीय चरण हटा दिए थे, तब भी AI जजों ने उन्हें उच्च स्कोर दिया।

    • उपमा: यह एक ऐसे शिक्षक की तरह है जो छात्र के निबंध को देखता है जिसमें आधे शब्द गायब हैं, लेकिन क्योंकि पहला और अंतिम वाक्य अच्छा लगता है, शिक्षक उसे 'A' ग्रेड दे देता है। AI जज "सतही दिखावट" से धोखा खा गए।

"अर्ली बर्ड" पूर्वाग्रह (The "Early Bird" Bias)

शोधकर्ताओं ने यह भी पाया कि जब AI जज टूटे हुए चरण को खोजने की कोशिश करते हैं, तो वे लगभग हमेशा अनुमान लगाते हैं कि गलती वास्तव में होने के स्थान से पहले हुई थी।

  • उपमा: यदि गलती कहानी के बीच में थी, तो AI कहेगा, "मुझे लगता है कि समस्या पहले अध्याय में शुरू हुई थी!" वे हमेशा शुरुआत के प्रति संदिग्ध रहते हैं।

यह क्यों महत्वपूर्ण है

यह शोध पत्र हमें बताता है कि हम केवल एक AI द्वारा दूसरे AI की सोच को बिना सोचे-समझे नहीं मान सकते।

  • यदि आपको यह जांचने की आवश्यकता है कि क्या एक विशिष्ट चरण तर्कसंगत है, तो DeepSeek का उपयोग करें।
  • यदि आपको पूरी तर्क श्रृंखला या लापता हिस्सों की जांच करनी है, तो o4-mini का उपयोग करें।
  • चेतावनी: यदि बहुत सारे चरण गायब हैं, तो AI जजों पर भरोसा न करें कि वे यह बता पाएंगे कि तर्क प्रक्रिया "पूर्ण" है या नहीं; वे बहुत उदार होंगे।

संक्षेप में: अब हमारे पास मापने का एक बेहतर तरीका है कि क्या कोई AI वास्तव में किसी समस्या पर विचार कर रहा है, या केवल दिखावा कर रहा है। और हमने सीखा है कि अलग-अलग AI "शिक्षकों" की अलग-अलग ताकत और कमजोरियां होती हैं, ठीक वैसे ही जैसे मानव शिक्षकों की होती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →