← नवीनतम पेपर
💻 computer science

Explaining Sources of Uncertainty in Automated Fact-Checking

यह शोध पत्र CLUE को पेश करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो टेक्स्ट स्पैन के बीच संघर्षों और सहमतियों की पहचान करके और उन्हें मौखिक रूप से व्यक्त करके स्वचालित तथ्य-जांच अनिश्चितता के लिए प्राकृतिक भाषा स्पष्टीकरण उत्पन्न करता है, जिससे मौजूदा बेसलाइनों की तुलना में अधिक निष्ठावान, सूचनात्मक और तार्किक रूप से सुसंगत आउटपुट प्राप्त होता है।

मूल लेखक: Jingyi Sun, Greta Warren, Irina Shklovski, Isabelle Augenstein

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jingyi Sun, Greta Warren, Irina Shklovski, Isabelle Augenstein

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Explaining Sources of Uncertainty in Automated Fact-Checking" (CLUE) शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

समस्या: "ब्लैक बॉक्स" जासूस

कल्पना कीजिए कि आपने किसी समाचार की सत्यता जाँचने के लिए एक अत्यंत बुद्धिमान AI जासूस को काम पर रखा है। वह जासूस एक दावे (जैसे, "बिल्लियाँ वायरस फैला सकती हैं") को पढ़ता है और दो अलग-अलग समाचार लेखों (साक्ष्य 1 और साक्ष्य 2) को देखता है ताकि निर्णय ले सके।

जासूस आपको एक उत्तर देता है: "यह संभवतः सच है।" लेकिन फिर, वह एक अजीब, गैर-जरूरी नोट जोड़ता है: "मुझे 73% यकीन है।"

यह एक मानव तथ्य-जाँचर (fact-checker) के लिए निराशाजनक है। आप केवल 73% ही क्यों सुनिश्चित हैं?

  • क्या ऐसा इसलिए है क्योंकि दोनों लेख एक-दूसरे का खंडन कर रहे हैं?
  • क्या ऐसा इसलिए है क्योंकि एक लेख अस्पष्ट है?
  • क्या ऐसा इसलिए है क्योंकि जासूस केवल अनुमान लगा रहा है?

वर्तमान AI सिस्टम उन जासूसों की तरह हैं जो आपको एक आत्मविश्वास स्कोर (confidence score) तो देते हैं, लेकिन अपना काम दिखाने से इनकार कर देते हैं। वे आपको यह नहीं बताते कि किस हिस्से ने उन्हें संशय में डाला। यदि दो लेख असहमत हैं, तो AI यह नहीं बताता कि लेख 1 का कौन सा विशिष्ट वाक्य लेख 2 से टकरा रहा है। वह बस कहता है, "मैं 100% सुनिश्चित नहीं हूँ," जिससे आपको कारण का अनुमान लगाने के लिए छोड़ दिया जाता है।

समाधान: CLUE ("अपना काम दिखाओ" फ्रेमवर्क)

लेखकों ने CLUE (Conflict-&Agreement-aware Language-model Uncertainty Explanations) नामक एक नया टूल बनाया है।

CLUE को AI जासूस और मानव के बीच एक अनुवादक (translator) के रूप में समझें। केवल एक संख्या देने के बजाय, CLUE AI को एक साधारण अंग्रेजी स्पष्टीकरण लिखने के लिए मजबूर करता है जो ठीक उसी स्थान को उजागर करता है जहाँ भ्रम पैदा हो रहा है।

यहाँ बताया गया है कि CLपणे (CLUE) कैसे काम करता है, चरण-दर-चरण:

1. "अंतर पहचानो" खेल (स्पैन इंटरेक्शन)

सबसे पहले, CLUE दावे (Claim) और दो साक्ष्य लेखों को देखता है। यह एक हाइलाइटर पेन की तरह कार्य करता है, जो विशिष्ट "स्पैन इंटरेक्शन" (span interactions) को स्कैन करता है।

  • मिलान (The Match): यह पाता है कि दावा और साक्ष्य 1 कहाँ सहमत हैं (जैसे, दोनों "बिल्लियों" का उल्लेख करते हैं)।
  • टकराव (The Clash): यह पाता है कि साक्ष्य 1 और साक्ष्य 2 कहाँ असहमत हैं (जैसे, साक्ष्य 1 कहता है "बिल्लियाँ इसे फैला सकती हैं," लेकिन साक्ष्य 2 कहता है "कोई संक्रमण नहीं पाया गया")।

CLUE केवल पूरे दस्तावेज़ को नहीं देखता; यह उन विशिष्ट वाक्यों पर ज़ूम करता है जो एक-दूसरे से बात कर रहे हैं (या लड़ रहे हैं)।

2. "कॉन्फिडेंस मीटर" (अनिश्चितता स्कोरिंग)

AI एक "चिंता स्कोर" (गणितीय रूप से जिसे एन्ट्रॉपी कहा जाता है) की गणना करता है। यदि AI विरोधाभासी साक्ष्यों से भ्रमित है, तो यह स्कोर बढ़ जाता है। यदि साक्ष्य स्पष्ट हैं और सहमत हैं, तो स्कोर कम हो जाता है।

3. "कहानीकार" (स्पष्टीकरण पीढ़ी)

यही असली जादू है। CLUE "चिंता स्कोर" और "हाइलाइट किए गए टकरावों" को लेता है और AI से एक कहानी लिखने के लिए कहता है।

  • पुराना तरीका: "मुझे 73% विश्वास है।"
  • CLUE का तरीका: "मैं कुछ हद तक अनिश्चित हूँ क्योंकि जहाँ साक्ष्य 1 इस बात से सहमत है कि बिल्लियाँ वायरस प्राप्त कर सकती हैं, वहीं साक्ष्य 2 इस बात का खंडन करता है कि वे इसे दूसरों तक फैला सकती हैं। यह विशिष्ट असहमति ही कारण है कि मैं 100% सुनिश्चित नहीं हूँ।"

उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने इसका परीक्षण तीन अलग-अलग AI मॉडलों और दो वास्तविक दुनिया के तथ्य-जाँच डेटासेट्स (एक स्वास्थ्य के बारे में, एक सामान्य समाचार के बारे में) पर किया।

उन्होंने CLUE की तुलना एक "मानक" AI से की जिसे बिना किसी मदद के खुद को समझाने के लिए प्रॉम्प्ट दिया जाता है।

  • परिणाम: मानक AI अक्सर मनगढ़ंत कारण बनाता था या अस्पष्ट स्पष्टीकरण देता था जो उसके वास्तविक भ्रम से मेल नहीं खाते थे।
  • CLUE का परिणाम: CLUE के स्पष्टीकरण बहुत अधिक ईमानदार थे। उन्होंने सटीक रूप से उन वाक्यों की ओर इशारा किया जो संदेह पैदा कर रहे थे।

मानव परीक्षकों (वास्तविक लोगों) ने CLUE को पसंद किया। उन्होंने कहा कि स्पष्टीकरण:

  • अधिक सहायक थे: उन्होंने वास्तव में उन्हें समस्या समझने में मदद की।
  • कम दोहराव वाले थे: वे टेक्स्ट को बार-बार दोहराते नहीं थे।
  • अधिक तार्किक थे: उनका तर्क समझ में आता था।

ट्रेड-ऑफ (द "सख्त" बनाम "बातूनी" जासूस)

शोध में पाया गया कि CLUE को चलाने के दो तरीके हैं, और उनके बीच थोड़ा व्यक्तित्व का टकराव है:

  1. सख्त जासूस (CLUE-Span+Steering): यह संस्करण AI को हाइलाइट किए गए वाक्यों के बहुत करीब रहने के लिए मजबूर करता है। यह गणित के प्रति अत्यंत सटीक (faithful) है, लेकिन कभी-कभी स्पष्टीकरण थोड़ा रोबोटिक या कटा-कटा सा लगता है क्योंकि यह विशिष्ट शब्दों पर बहुत अधिक केंद्रित है।
  2. बातूनी जासूस (CLUE-Span): यह संस्करण थोड़ा अधिक लचीला है। यह बेहतर ढंग से बहता है और मनुष्यों को स्वाभाविक लगता है, लेकिन यह कभी-कभी एक सूक्ष्म विवरण को छोड़ सकता है या थोड़ा अतिरिक्त विवरण जोड़ सकता है।

निष्कर्ष

यह शोध पत्र तर्क देता है कि तथ्य-जाँच जैसे उच्च-जोखिम वाले कार्यों के लिए AI के उपयोगी होने के लिए, यह केवल एक निर्णय और एक संख्या देकर काम नहीं चला सकता। इसे अपना काम दिखाना होगा।

CLUE पहला ऐसा टूल है जो विरोधाभासी दस्तावेजों के ढेर को देख सकता है, उन सटीक वाक्यों को खोज सकता है जो आपस में लड़ रहे हैं, और मानव को समझा सकता है: "मैं अनिश्चित हूँ क्योंकि ये दो विशिष्ट वाक्य आपस में असहमत हैं।" यह AI को एक रहस्यमय भविष्यवक्ता से बदलकर एक पारदर्शी भागीदार बना देता है जो सत्य को सत्यापित करने में मनुष्यों की मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →