← नवीनतम पेपर
💻 computer science

Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models

यह शोध पत्र DAVinCI को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो दावों के आंतरिक और बाहरी स्रोतों के दोहरे एट्रिब्यूशन को एंटेलमेंट-आधारित सत्यापन के साथ जोड़कर लार्ज लैंग्वेज मॉडल्स की तथ्यात्मक विश्वसनीयता और व्याख्यात्मकता को बढ़ाता है, जिसके परिणामस्वरूप उच्च-जोखिम वाले डोमेन में सटीकता और जवाबदेही में महत्वपूर्ण सुधार होता है।

मूल लेखक: Vipula Rawte, Ryan Rossi, Franck Dernoncourt, Nedim Lipka

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vipula Rawte, Ryan Rossi, Franck Dernoncourt, Nedim Lipka

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही प्रतिभाशाली, तेज़ बोलने वाला दोस्त है जो लगभग हर चीज़ के बारे में थोड़ा-बहुत जानता है। वह आपको कहानियाँ सुना सकता है, कविताएँ लिख सकता है, और अविश्वसनीय प्रवाह के साथ जटिल विषयों को समझा सकता है। हालाँकि, इस दोस्त की एक बुरी आदत है: कभी-कभी, जब उसे उत्तर नहीं पता होता, तो वह खुद को आत्मविश्वासी दिखाने के लिए कुछ भी बना देता है। AI की दुनिया में, हम इसे "हैलुसिनेशन" (hallucination) कहते हैं।

यदि यह दोस्त डॉक्टर, वकील या वैज्ञानिक होता, तो उसके मनगढ़ंत तथ्य खतरनाक हो सकते थे। वहीं पर DAVinCI काम आता है।

समस्या: "आत्मविश्वासी झूठा" (The Confident Liar)

लार्ज लैंग्वेज मॉडल्स (LLMs) उस तेज़ बोलने वाले दोस्त की तरह हैं। वे टेक्स्ट जेनरेट करने में बहुत अच्छे हैं, लेकिन अक्सर उनमें "सत्य की जाँच" (truth check) करने की क्षमता की कमी होती है। वे पूरे आत्मविश्वास के साथ कह सकते हैं, "कैरोलिन कैनेडी एक अंतरिक्ष यात्री हैं," जबकि वास्तव में वह एक राजनयिक हैं। पारंपरिक सिस्टम तथ्य की जाँच बाद में करने की कोशिश करते हैं, लेकिन वे अक्सर इस बारीकी को पकड़ने में चूक जाते हैं कि जानकारी कहाँ से आई या मॉडल कितना सुनिश्चित है।

समाधान: DAVinCI (डबल-चेक डिटेक्टिव)

लेखकों ने एक फ्रेमवर्क बनाया है जिसे DAVinCI (Dual Attribution and Verification) कहा जाता है। इसे एक डिटेक्टिव (जासूस) और एक जज (न्यायाधीश) को काम करने के लिए नियुक्त करने के रूप में समझें, जो अंतिम निर्णय दिए जाने से पहले मिलकर काम करते हैं।

यह कैसे काम करता है, इसे दो सरल चरणों में विभाजित किया गया है:

1. डिटेक्टिव (एट्रिब्यूशन/स्रोत का निर्धारण)

AI आपको उत्तर देने से पहले, "डिटेक्टिव" पूछता है: "तुम्हें यह विचार कहाँ से मिला?"

  • पुराना तरीका: AI बस कहता है, "मुझे यह पता है!"
  • DAVinCI का तरीका: AI को यह बताना होगा कि उसकी बात का समर्थन करने के लिए किताब का कौन सा विशिष्ट पृष्ठ (या इंटरनेट का विशिष्ट वाक्य) मौजूद है।
    • उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। उत्तर लिखने के बजाय, उसे अपनी पाठ्यपुस्तक का वह सटीक वाक्य हाइलाइट करना होगा जो साबित करता है कि वह सही है। यदि वह वाक्य नहीं ढूँढ पाता, तो सिस्टम जान जाता है कि वह केवल अनुमान लगा रहा है।

शोधकर्ताओं ने परीक्षण किया कि डिटेक्टिव के दो तरीके कैसे काम करते हैं:

  • "फुल पैसेज" (Full Passage) डिटेक्टिव: यह पूरे पैराग्राफ को देखता है। (सबसे सटीक, जैसे पूरा अध्याय पढ़ना)।
  • "स्निपेट" (Snippet) डिटेक्टिव: यह केवल कुछ शब्दों को देखता है। (तेज़, लेकिन संदर्भ चूक सकता है, जैसे लेख पढ़े बिना केवल हेडलाइन देखना)।

2. जज (वेरिफिकेशन/सत्यापन)

एक बार जब डिटेक्टिव सबूत ढूँढ लेता है, तो "जज" हस्तक्षेप करता है। जज केवल उत्तर को नहीं देखता; वह AI के दावे की तुलना डिटेक्टिव द्वारा खोजे गए साक्ष्यों से करता है।

  • फैसला (The Verdict): जज तय करता है कि दावा समर्थित (सत्य) है, खंडित (असत्य) है, या पर्याप्त जानकारी नहीं है (हमें अभी नहीं पता)।
  • कॉन्फिडेंस चेक (Confidence Check): यही असली जादू है। यदि जज केवल 50% सुनिश्चित है, तो DAVinCI कहता है, "ठहरिए, हम इसे 'सत्य' कहने के लिए पर्याप्त आश्वस्त नहीं हैं।" यह AI को आत्मविश्वास के साथ झूठ बोलने से रोकने के लिए उत्तर को "पर्याप्त जानकारी नहीं है" में डाउनग्रेड कर देता है।

यह बेहतर क्यों है? (परिणाम)

शोधकर्ताओं ने DAVinCI का परीक्षण दो बड़े डेटासेट्स (FEVER और CLIMATE-FEVER) पर किया, जो सामान्य ज्ञान और जलवायु परिवर्तन के बारे में सत्य और असत्य कथनों के विशाल पुस्तकालयों की तरह हैं।

  • स्कोरकार्ड: जब उन्होंने मानक AI फैक्ट-चेकिंग की तुलना में DAVinCI की तुलना की, तो पाया कि DAVinCI ने सटीकता में 5% से 20% तक सुधार किया।
  • "फुल पैसेज" का लाभ: उन्होंने पाया कि साक्ष्य के पूरे पैराग्राफ ( "Full Passage" डिटेक्टिव) का उपयोग करना केवल स्निपेट्स के उपयोग से कहीं बेहतर था। यह किसी रहस्य को सुलझाने के लिए केवल हेडलाइन पढ़ने के बजाय पूरी पुलिस रिपोर्ट पढ़ने जैसा है।
  • सुरक्षा जाल (Safety Net): "कॉन्फिडेंस थ्रेशोल्ड" (कि जज को कितना आश्वस्त होना चाहिए) को समायोजित करके, वे हर त्रुटि को पकड़ने (हाई रिकॉल) और यह सुनिश्चित करने के बीच संतुलन बना सकते थे कि वे गलती से किसी झूठ को "सत्य" न कह दें (हाई प्रिसिजन)।

बड़ी तस्वीर (The Big Picture)

DAVinCI को AI के लिए एक क्वालिटी कंट्रोल फ़िल्टर के रूप में समझें।

  • DAVinCI के बिना: आपको एक सहज, आत्मविश्वासी, लेकिन संभावित रूप से फर्जी कहानी मिलती है।
  • DAVinCI के साथ: आपको एक ऐसी कहानी मिलती है जो एक "रसीद" (साक्ष्य) और एक "वारंटी" (सत्यापन) के साथ आती है। यदि AI सुनिश्चित नहीं है, तो वह इसे स्वीकार कर लेता है, बजाय इसके कि वह मनगढ़ंत बातें बनाए।

आपको इसकी परवाह क्यों करनी चाहिए?

हम एक ऐसी दुनिया में प्रवेश कर रहे हैं जहाँ AI हमारी खबरें लिख रहा है, हमारी बीमारियों का निदान कर रहा है, और हमारे कानूनी मामलों में तर्क दे रहा है। हम केवल इस बात पर भरोसा नहीं कर सकते कि AI सच बोल रहा है। DAVinCI हमें AI को जवाबदेह बनाने का एक तरीका प्रदान करता है। यह AI को मजबूर करता है कि वह कहे, "यहाँ मेरा उत्तर है, यहाँ मेरा प्रमाण है, और मैं कितना आश्वस्त हूँ, यह भी यहाँ है।"

यह AI को स्मार्ट बनाने के बारे में नहीं है; यह AI को ईमानदार और ऑडिट योग्य बनाने के बारे में है। ठीक वैसे ही जैसे आप उस वित्तीय सलाहकार पर भरोसा नहीं करेंगे जो आपको अपना गणित (हिसाब-किताब) नहीं दिखा सकता, हमें उस AI पर भी भरोसा नहीं करना चाहिए जो हमें अपने स्रोत नहीं दिखा सकता। DAVinCI वह उपकरण है जो AI को अपना काम दिखाना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →