DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA
यह शोध पत्र DS@GT ARC के CLEF 2026 LongEval सबमिशन को प्रस्तुत करता है, जो यह तर्क देता है कि जबकि फ्रंटियर मॉडल प्रवाह में उत्कृष्ट हैं, वैज्ञानिक QA में उद्धरण निष्ठा (citation faithfulness) और उत्तर ग्राउंडिंग (answer grounding) में सुधार करने के लिए प्री-जनरेशन फ़िल्टरिंग और पोस्ट-जनरेशन एंटेलमेंट चेक को संयोजित करने वाला एक सुधारात्मक पाइपलाइन आवश्यक है, जो पारंपरिक प्रासंगिकता स्कोर के बजाय सख्त ग्राउंडिंग को प्राथमिकता देने वाले मूल्यांकन मेट्रिक्स की आवश्यकता पर प्रकाश डालता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: LongEval में DS@GT ARC
समस्या विवरण
वैज्ञानिक ज्ञान गतिशील है, जो निरंतर अनुसंधान और प्रकाशन के माध्यम से विकसित होता रहता है। यह टेम्पोरल ड्रिफ्ट (temporal drift) रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम के लिए महत्वपूर्ण चुनौतियां पेश करता है, जिसमें पुराने या अप्रासंगिक सूचनाओं को खोजने, साक्ष्य छूट जाने, या प्रदान किए गए स्रोत दस्तावेजों के आधार पर तथ्यात्मक रूप से पुष्ट उत्तर न दे पाने का जोखिम रहता है। हालांकि RAG वैज्ञानिक प्रश्नोत्तर (QA) के लिए बाहरी दस्तावेजों का लाभ उठाने के मामले में सैद्धांतिक रूप से आदर्श है, वर्तमान सिस्टम अक्सर "रिट्रीवल-संबंधित गलतियों" से ग्रस्त होते हैं, जिनमें विचलित करने वाले (distractor) दस्तावेजों का समावेश और बिना आधार वाले दावे उत्पन्न करना शामिल है। पारंपरिक प्राकृतिक भाषा मूल्यांकन मेट्रिक्स (जो प्रवाह और लेक्सिकल ओवरलैप को प्राथमिकता देते हैं) और वैज्ञानिक डोमेन में सख्त साइटेशन अखंडता (citation integrity) एवं तथ्यात्मक ग्राउंडिंग की आवश्यकता के बीच एक महत्वपूर्ण अंतर मौजूद है।
कार्यप्रणाली
DS@GT ARC टीम ने CLEF 2026 LongEval टास्क 4 में भाग लिया, जिसमें CORE वैज्ञानिक साहित्य संग्रह का उपयोग किया गया था। कार्य में एक क्वेरी और दस पूर्व-प्राप्त दस्तावेजों का एक निश्चित सेट प्रदान किया गया, जिसमें प्रतिभागियों को उस सेट के विशिष्ट साइटेशन के साथ समर्थित प्राकृतिक भाषा उत्तर उत्पन्न करने की आवश्यकता थी। टीम ने तीन अलग-अलग आर्किटेक्चरल दृष्टिकोणों का मूल्यांकन किया:
- DS@GT हाइब्रिड बेसलाइन: ओवरलैपिंग सिमेंटिक चंक्स (semantic chunks) को रैंक करने के लिए एक हाइब्रिड रिट्रीवर (BM25 + BGE डेंस एम्बेडिंग्स) का उपयोग करने वाला एक मानक RAG कार्यान्वयन। शीर्ष- चंक्स को उत्तर संश्लेषण के लिए सीधे Gemma-4-31B इंस्ट्रक्शन-ट्यून्ड मॉडल में भेजा गया।
- करेक्टिव RAG (CRAG) + CiteFix पाइपलाइन: ग्राउंडिंग को लागू करने के लिए डिज़ाइन किया गया एक दो-चरणीय सुधारात्मक आर्किटेक्चर:
- प्री-जनरेशन (Pre-Generation): एक लाइटवेट क्रॉस-एनकोडर (CRAG) क्वेरी के विरुद्ध प्राप्त चंक्स का मूल्यांकन करता है, और उन चंक्स को हटा देता है जो एंटेलमेंट थ्रेशोल्ड (entailment threshold) को पूरा नहीं करते हैं, ताकि जनरेशन से पहले विचलित करने वाले तत्वों को फ़िल्टर किया जा सके।
- पोस्ट-जनरेशन (Post-Generation): CiteFix उत्पन्न दावों का उनके उद्धृत दस्तावेज़ चंक्स के विरुद्ध विश्लेषण करता है। वे साइटेशन जिन्हें विशिष्ट दावों का समर्थन करने के लिए एंटेलमेंट की कमी है, उन्हें हटा दिया जाता है, जिससे सख्त एट्रिब्यूशन सुनिश्चित होता है।
- फ्रंटियर मॉडल बेंचमार्क: GPT-5.5 Thinking और Claude Opus 4.7 Thinking जैसे अत्याधुनिक मॉडलों का उपयोग करते हुए दो मैन्युअल रूप से क्यूरेट किए गए रन, जिन्होंने चंकिंग और स्कोरिंग को बायपास करते हुए, दस उम्मीदवार दस्तावेजों के कच्चे टेक्स्ट (raw text) से सीधे उत्तरों का संश्लेषण किया।
मूल्यांकन रणनीति
टीम ने एक दोहरी-मूल्यांकन रूपरेखा का उपयोग किया:
- आधिकारिक टास्क मेट्रिक्स: एक हिडन गोल्ड सेट के विरुद्ध लेक्सिकल/सिमेंटिक समानता के लिए ROUGE और BERT सहित मानक मेट्रिक्स, साइटेशन प्रिसिजन (Citation Precision), और नगेट कवरेज (Nugget Coverage)।
- रेफरेंस-फ्री RAGAs डायग्नोस्टिक्स: संपूर्ण 10-दस्तावेज़ संदर्भ के विरुद्ध दावों की ग्राउंडिंग (ग्लोबल फेथफुलनेस), उद्धृत दस्तावेजों के विरुद्ध दावों की सख्त ग्राउंडिंग (साइटेशन फेथफुलनेस), और आंसर रिलेवेंसी को मापने के लिए एक LLM-एज़-जज सेटअप (Claude Sonnet 4.6 का उपयोग करके)।
प्रमुख परिणाम
मूल्यांकन ने पारंपरिक प्रदर्शन मेट्रिक्स और तथ्यात्मक ग्राउंडिंग के बीच एक महत्वपूर्ण विचलन प्रकट किया:
- फ्रंटियर मॉडल्स: GPT-5.5 और Claude Opus 4.7 ने आधिकारिक मेट्रिक्स (ROUGE, BERT, Answer Relevancy) और साइटेशन प्रिसिजन पर उच्चतम स्कोर प्राप्त किया। हालांकि, RAGAs डायग्नोस्टिक्स ने एक महत्वपूर्ण विफलता मोड उजागर किया: ये मॉडल अक्सर अपने पैरामीट्रिक मेमोरी पर भरोसा करके अत्यधिक प्रासंगिक उत्तर उत्पन्न करते हैं, न कि प्रदान किए गए संदर्भ पर। परिणामस्वरूप, उनमें कम साइटेशन फेथफुलनेस (जैसे, GPT-5.5 का स्कोर 0.417) देखी गई, जो इंगित करती है कि वे अक्सर साइटेशन का भ्रम (hallucinate) पैदा करते हैं या विशिष्ट विवरणों को प्राप्त दस्तावेजों में ग्राउंड करने में विफल रहते हैं।
- करेक्टिव पाइपलाइन: CRAG+CiteFix पाइपलाइन ने सभी सबमिशन में उच्चतम ग्लोबल फेथफुलनेस (0.784) और साइटेशन फेथफुलनेस (0.758) प्राप्त की। हालांकि, ग्राउंडिंग के प्रति इस सख्त पालन के कारण हाइब्रिड बेसलाइन की तुलना में कम ROUGE और BERT स्कोर प्राप्त हुए। यह गिरावट पाइपलाइन के "एब्स्टेंशन व्यवहार" (abstention behavior) के कारण थी, जहाँ सिस्टम उत्तर उत्पन्न करने से इनकार कर देता है जब प्राप्त संदर्भ में पर्याप्त साक्ष्य की कमी होती है, बजाय इसके कि पैरामीट्रिक मेमोरी से भ्रम उत्पन्न करे।
- सांख्यिकीय सार्थकता: 47 टेस्ट क्वेरीज पर RAGAs स्कोर पर एक Wilcoxon साइन-रैंक टेस्ट ने संकेत दिया कि सुधारात्मक हस्तक्षेपों द्वारा प्रदान की गई फेथफुलनेस में सुधार सांख्यिकीय रूप से महत्वपूर्ण नहीं था, जो सत्यापन के लिए उपयोग किए गए NLI मॉडल्स की संभावित सीमाओं या हस्तक्षेपों की विशिष्ट ट्यूनिंग का सुझाव देता है।
महत्व और निष्कर्ष
यह शोध पत्र तर्क देता है कि विश्वसनीय RAG QA सिस्टम के मूल्यांकन के लिए मेट्रिक डिज़ाइन में बदलाव की आवश्यकता है। परिणाम दर्शाते हैं कि फ्रंटियर मॉडल प्रदान किए गए संदर्भ का उपयोग करने में विफल रहते हुए भी अत्यधिक प्रासंगिक और प्रवाहपूर्ण उत्तरों को अधिकतम कर सकते हैं, एक ऐसा विफलता मोड जिसे पारंपरिक मेट्रिक्स (ROUGE/BERT) दंडित करने में विफल रहते हैं। इसके विपरीत, जो पाइपलाइन सख्त ग्राउंडिंग लागू करती है, वे पैरामीट्रिक मेमोरी पर आधारित संवादात्मक प्रवाह के बजाय सुरक्षित एब्स्टेंशन व्यवहार के कारण लेक्सिकल ओवरलैप मेट्रिक्स पर कम प्रदर्शन करती हुई प्रतीत हो सकती हैं।
लेखक निष्कर्ष निकालते हैं कि वैज्ञानिक डोमेन में सुरक्षित RAG QA पाइपलाइनों को सुरक्षित करने के लिए ऐसे मूल्यांकन मेट्रिक्स की आवश्यकता है जो संवादात्मक प्रवाह के बजाय स्ट्रक्चरल सेफ्टी (structural safety) और उचित विफलता मोड (जैसे एब्स्टेंशन) को पुरस्कृत करें। वे प्रस्तावित करते हैं कि भविष्य के बेंचमार्क को ऐसे मेट्रिक्स को प्राथमिकता देनी चाहिए जो सख्त उत्तर ग्राउंडिंग को लागू करते हों ताकि यह सुनिश्चित किया जा सके कि वैज्ञानिक दावे वास्तव में उद्धृत शोध दस्तावेजों द्वारा समर्थित हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।