← नवीनतम पेपर
💬 NLP

Uncertainty-Aware Web-Conditioned Scientific Fact-Checking

यह शोध पत्र वैज्ञानिक तथ्य-जांच के लिए एक अनिश्चितता-जागरूक, वेब-सशर्त ढांचे को प्रस्तुत करता है जो दावों को परमाणु तथ्यों में विभाजित करता है, स्थानीय संदर्भ के विरुद्ध उनका सत्यापन करता है, और विशिष्ट डोमेन में व्याख्या योग्य, लागत-कुशल और उच्च-सटीक सत्यापन प्राप्त करने के लिए केवल अनिश्चित मामलों के लिए ही वेब खोजों का चयनत्मक रूप से आह्वान करता है।

मूल लेखक: Ashwin Vinod, Katrin Erk

प्रकाशित 2026-04-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ashwin Vinod, Katrin Erk

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन किसी अपराध स्थल के बजाय, आप एक वैज्ञानिक दावे की जांच कर रहे हैं जैसे, "यह नई दवा 10 मिनट में सिरदर्द ठीक कर देती है।"

अतीत में, AI जासूस (लार्ज लैंग्वेज मॉडल्स) अक्सर उस उत्तर का अनुमान लगाते थे जो उन्हें अपने "याद रखे हुए" प्रशिक्षण से मिलता था। वे कभी-कभी सही होते थे, लेकिन अक्सर वे हैलुसिनेट (hallucinate) करते थे—यानी ऐसी बातें बना लेते थे जो सुनने में तो तर्कसंगत लगती थीं लेकिन पूरी तरह से गलत थीं। वे एक ऐसे जासूस की तरह थे जो आत्मविश्वास के साथ आपसे कहता है कि बटलर ने ही यह किया है, भले ही उसने वास्तव में सबूतों को देखा तक न हो।

यह पेपर एक नए, अधिक स्मार्ट जासूस सिस्टम Atomic+Search को पेश करता है। इसे सावधान, ईमानदार और कुशल होने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ इसके सरल चरणों में विवरण दिया गया है:

1. "लेगो ब्लॉक" रणनीति (एटॉमिक डीकंपोजिशन)

कल्पना कीजिए कि वैज्ञानिक दावा एक विशाल, जटिल लेगो महल (Lego castle) है। यदि आप एक साथ पूरे महल की जांच करने की कोशिश करते हैं कि वह असली है या नहीं, तो यह बहुत भारी काम हो जाता है। आप बीच में छिपे एक नकली ईंट को भी मिस कर सकते हैं।

इसके बजाय, यह सिस्टम दावे को छोटे, व्यक्तिगत लेगो ब्लॉक्स (जिन्हें "एटॉमिक फैक्ट्स" कहा जाता है) में तोड़ देता है।

  • पुराना तरीका: पूरे वाक्य की जांच करें।
  • नया तरीका: इसे टुकड़ों में तोड़ें।
    • दावा: "यह दवा 10 मिनट में सिरदर्द ठीक करती है।"
    • ब्लॉक 1: "दवा मौजूद है।"
    • ब्लॉक 2: "दवा सिरदर्द का इलाज करती है।"
    • ब्लॉक 3: "यह 10 मिनट में काम करती है।"

इन छोटे ब्लॉकों की एक-एक करके जांच करके, सिस्टम सटीक रूप से पहचान सकता है कि दावे का कौन सा हिस्सा सच है और कौन सा हिस्सा फर्जी है।

2. "लोकल लाइब्रेरियन" (कॉन्टेक्स्ट-ओनली चेक)

सबसे पहले, सिस्टम आपके द्वारा दिए गए दस्तावेज़ (साक्ष्य का अंश) को देखता है। इसे एक लोकल लाइब्रेरियन के रूप में सोचें जिसके पास केवल वही किताब उपलब्ध है जो आपने उन्हें सौंपी है।

  • सिस्टम लाइब्रेरियन से पूछता है: "क्या यह किताब कहती है कि ब्लॉक 1 सच है?"
  • यदि किताब स्पष्ट रूप से कहती है "हाँ," तो लाइब्रेरियन उस पर Supported (समर्थित) की मुहर लगा देता है।
  • यदि किताब स्पष्ट रूप से कहती है "नहीं," तो वह उस पर Refuted (खंडित) की मुहर लगा देता है।
  • महत्वपूर्ण चरण: यदि किताब मौन है या भ्रमित करने वाली है, तो लाइब्रेरियन अनुमान नहीं लगाता। वे आपको उत्तर देने के लिए झूठ बोलने से इनकार करते हैं। वे इसे "Uncertain" (अनिश्चित) या NEI (पर्याप्त जानकारी नहीं) के रूप में चिह्नित करते हैं।

3. "अनसर्टेन्टी गेट" (कब इंटरनेट को बुलाएं)

यह सबसे महत्वपूर्ण नवाचार है। कई AI सिस्टम में, यदि AI सुनिश्चित नहीं होता है, तो वह बस अनुमान लगा सकता है या पूरे इंटरनेट को अंधाधुंध खोज सकता है, जो धीमा और महंगा है।

इस सिस्टम में एक गेटकीपर है।

  • यदि लोकल लाइब्रेरियन 100% आश्वस्त है (High Confidence), तो गेटकीपर बंद रहता है। इंटरनेट सर्च की आवश्यकता नहीं है।
  • यदि लाइब्रेरियन "अनिश्चित" (Uncertain) है (मध्यम स्थिति), तो गेटकीपर खुल जाता है।
  • नियम: सिस्टम केवल उन विशिष्ट ब्लॉकों के लिए "इंटरनेट" (एक विशेष खोज इंजन) को कॉल करता है जिनके बारे में वह अनिश्चित है। यह उन चीजों को खोजने में समय बर्बाद नहीं करता जिन्हें वह पहले से जानता है।

4. "ट्रस्टेड सोर्स" सर्च (डोमेन-प्रतिबंधित)

जब गेट खुलता है, तो सिस्टम केवल गूगल (जो ब्लॉग, विज्ञापनों और फर्जी खबरों से भरा है) को नहीं खोजता। यह एक VIP क्लब को खोजता है जो NIH, WHO, CDC और PubMed जैसे विश्वसनीय वैज्ञानिक स्रोतों का है।

  • यह पूछता है: "हे, क्या ये विश्वसनीय चिकित्सा स्रोत ब्लॉक 3 की पुष्टि करते हैं?"
  • यदि नया साक्ष्य सहमत होता है, तो बहुत अच्छा!
  • सेफ्टी नेट: यदि इंटरनेट से प्राप्त नया साक्ष्य आपके द्वारा दिए गए मूल दस्तावेज़ का खंडन करता है, तो सिस्टम abstain (परहेज) करता है। वह कहता है, "मैं निर्णय नहीं ले सकता क्योंकि स्रोत असहमत हैं," बजाय इसके कि वह एक गलत उत्तर देने के लिए मजबूर हो। वह गलत झूठ बोलने के बजाय "मुझे नहीं पता" कहना चुनता है।

5. "चीफ डिटेक्टिव" (अंतिम फैसला)

अंत में, एक "चीफ डिटेक्टिव" (जज AI) सभी मुहर लगे हुए लेगो ब्लॉक्स को देखता है।

  • यदि अधिकांश ब्लॉक "Supported" हैं, तो पूरा दावा Supported है।
  • यदि मुख्य ब्लॉक "Refuted" हैं, तो दावा Refuted है।
  • यदि सिस्टम को एक महत्वपूर्ण ब्लॉक पर "मुझे नहीं पता" कहना पड़ा, तो पूरे दावे को NEI (पर्याप्त जानकारी नहीं) का लेबल मिलता है।

यह एक बड़ी बात क्यों है?

  • यह सस्ता है: क्योंकि यह केवल तभी इंटरनेट खोजता है जब यह वास्तव में भ्रमित होता है, यह पैसा और समय बचाता है।
  • यह ईमानदार है: यह स्वीकार करता है कि उसे नहीं पता, बजाय इसके कि वह मनगढ़ंत बातें बनाए।
  • यह व्याख्या योग्य (Explainable) है: आप देख सकते हैं कि ठीक किस लेगो ब्लॉक ने विफल किया। केवल "यह फर्जी है" कहने के बजाय, यह कह सकता है, "दवा मौजूद है, लेकिन यह 10 मिनट में काम नहीं करती है।"
  • यह सुरक्षित है: यह चिकित्सा जैसे उच्च-जोखिम वाले क्षेत्रों के लिए उपयुक्त है, जहाँ एक गलत अनुमान खतरनाक हो सकता है।

संक्षेप में: यह पेपर AI को अनुमान लगाना छोड़ने, बड़ी समस्याओं को छोटे टुकड़ों में तोड़ने, केवल तभी उत्तर खोजने के लिए पूछने जब वह अटक जाए, और हमेशा यह स्वीकार करने के लिए सिखाता है कि उसके पास पर्याप्त सबूत नहीं हैं। यह एक आत्मविश्वासी लेकिन अविश्वसनीय अनुमान लगाने वाले से एक सूक्ष्म, साक्ष्य-आधारित वैज्ञानिक में अपग्रेड होने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →