← नवीनतम पेपर
🤖 AI

Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

यह शोध पत्र Q-CARE को प्रस्तुत करता है, जो एक क्वेरी-अज्ञेय (query-agnostic) और संदर्भ-मुक्त (reference-free) ढांचा है जो रिट्रीवर कवरेज और जनरेटर क्लेम वेरिफिएबिलिटी (generator claim verifiability) के लिए एकीकृत मेट्रिक्स स्थापित करने हेतु क्वेरी और उत्तरों को परमाणु इकाइयों (atomic units) में विभाजित करता है, जो मौजूदा RAG मूल्यांकन विधियों की तुलना में मानव निर्णयों के साथ बेहतर सहसंबंध प्रदर्शित करता है।

मूल लेखक: Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

प्रकाशित 2026-08-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने वाले जासूस हैं। आपके पास एक सुपर-स्मार्ट सहायक (एक लार्ज लैंग्वेज मॉडल) है जो कहानियाँ लिख सकता है, सवालों के जवाब दे सकता है और जटिल विषयों को समझा सकता है। लेकिन इस सहायक के साथ एक समस्या है: कभी-कभी यह अपनी ओर से बातें बना लेता है, या यह अपने नोट्स देखना भूल जाता है। इसे ठीक करने के लिए, हम सहायक को संदर्भ पुस्तकों का एक ढेर (प्राप्त साक्ष्य) देते हैं और कहते हैं, "केवल उन्हीं किताबों का उपयोग करके उत्तर दें जो आपको इनमें मिलें।" इसे रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) कहा जाता है। यह ऐसा है जैसे अपने जासूस को एक लाइब्रेरी कार्ड देना ताकि उसे अंदाज़ा न लगाना पड़े।

लेकिन पेचीदा हिस्सा यह है: हमें कैसे पता चलेगा कि जासूस ने अच्छा काम किया है या नहीं? यदि सवाल सरल है, जैसे "राष्ट्रपति कौन है?", तो उत्तर की जाँच करना आसान है। लेकिन क्या होगा यदि सवाल जटिल है, जैसे "कॉफी के इतिहास और अर्थव्यवस्था पर इसके प्रभाव की व्याख्या करें"? उत्तर लंबा हो सकता है, इसमें कई अलग-अलग विचार हो सकते हैं, और इसकी ग्रेडिंग करना कठिन हो सकता है। पुराने तरीके उत्तरों की जाँच करने के लिए एक सख्त शिक्षक की तरह थे जो केवल तभी अंक देते थे जब छात्र का उत्तर शब्द-दर-शब्द एक विशिष्ट "गोल्ड स्टैंडर्ड" से मेल खाता हो। यह सरल तथ्यों के लिए तो काम करता था लेकिन जटिल कहानियों के लिए पूरी तरह विफल रहा। यह नहीं बता पाता था कि छात्र ने कोई मुख्य बिंदु छोड़ दिया है या उसने कोई ऐसा तथ्य बना लिया है जो सुनने में तो अच्छा लगता है लेकिन किताबों में नहीं है। हमें ग्रेडिंग करने के एक नए तरीके की आवश्यकता थी जो किसी भी प्रकार के प्रश्न के लिए काम कर सके, चाहे वह एक सरल तथ्य हो या गहरा विवरण, और जिसके लिए किसी पूर्ण 'उत्तर कुंजी' (answer key) से तुलना करने की आवश्यकता न हो।

यहाँ Q-CARE आता है, जो शोधकर्ता जियोंगहवान चोई और उनकी टीम (KAIST) द्वारा प्रस्तावित एक नया मूल्यांकन ढांचा (evaluation framework) है। Q-CARE को एक अत्यंत व्यवस्थित, अति-सतर्क शिक्षण सहायक के रूप में समझें जो न केवल अंतिम निबंध को देखता है, बल्कि यह देखने के लिए कि जासूस कहाँ सफल हुआ या कहाँ विफल हुआ, पूरी प्रक्रिया को छोटे, प्रबंधनीय टुकड़ों में तोड़ देता है।

पूरे उत्तर को एक साथ देखने के बजाय, Q-CARE एक मास्टर शेफ की तरह व्यवहार करता है जो एक जटिल व्यंजन को अलग-अलग हिस्सों में तोड़ देता है। सबसे पहले, यह मूल प्रश्न को छोटे, खाने योग्य "उप-प्रश्नों" (sub-questions) में काट देता है। यदि प्रश्न है "मैं केक कैसे बनाऊं?", तो यह इसे "मुझे किन सामग्रियों की आवश्यकता है?", "मुझे कितनी देर तक बेक करना चाहिए?" और "तापमान क्या होना चाहिए?" में तोड़ देता है। यह उत्तर के साथ भी ऐसा ही करता है, लंबे पैराग्राफ को व्यक्तिगत "दावों" (claims) या तथ्यों में तोड़ देता है, जैसे "केक को मैदा चाहिए" या "350 डिग्री पर बेक करें।"

फिर, असली जादू होता है। Q-CARE केवल उन संदर्भ पुस्तकों का उपयोग करके "डॉट्स जोड़ने" (connect the dots) का खेल खेलता है जिनका उपयोग करने की अनुमति जासूस को दी गई थी। यह तीन महत्वपूर्ण प्रश्न पूछता है:

  1. क्या किताबों में उप-प्रश्नों का विवरण मौजूद था? (क्या लाइब्रेरी में सामग्रियों की जानकारी थी?)
  2. क्या उत्तर में उप-प्रश्नों को शामिल किया गया था? (क्या छात्र ने वास्तव में सामग्रियों के बारे में लिखा?)
  3. क्या उत्तर के दावों को किताबों द्वारा सिद्ध किया जा सकता है? (क्या दावा "350 डिग्री पर बेक करें" वास्तव में किताब में लिखा है, या छात्र ने अंदाज़ा लगाया है?)

यह दृष्टिकोण Q-CARE को दो मुख्य चीजें मापने की अनुमति देता है: कवरेज (क्या उत्तर ने वह सब कुछ संबोधित किया जो प्रश्न ने पूछा था?) और सत्यापनीयता (क्या प्रत्येक वाक्य साक्ष्यों द्वारा समर्थित है?)।

शोधकर्ताओं ने आठ अलग-अलग प्रकार के डेटासेट्स वाले एक विशाल बेंचमार्क पर इस नई पद्धति का परीक्षण किया, जिसमें सरल समाचार प्रश्नों से लेकर जटिल वैज्ञानिक स्पष्टीकरण तक शामिल थे। उन्होंने Q-CARE की तुलना चार अन्य लोकप्रिय मूल्यांकन उपकरणों से की। परिणाम स्पष्ट थे: Q-CARE मानव न्यायाधीशों के साथ अन्य तरीकों की तुलना में बहुत अधिक सहमति रखता था। वास्तव में, इसने क्लोज-एंडेड प्रश्नों के रिट्रीवल के लिए मानव निर्णयों के साथ 0.55 का सहसंबंध (correlation) प्राप्त किया और ओपन-एंडेड प्रश्नों के लिए सत्यापन क्षमता (verifiability) पर 0.69 प्राप्त किया, जो RAGEval और RAGChecker जैसे प्रतिद्वंद्वियों से काफी बेहतर प्रदर्शन करता है, जो अक्सर जटिल या ओपन-एंडेड होने पर संघर्ष करते थे।

Q-CARE की सबसे शानदार बातों में से एक यह है कि इसे काम करने के लिए "गोल्ड स्टैंडर्ड" उत्तर की आवश्यकता नहीं होती है। यह "रेफरेंस-फ्री" है, जिसका अर्थ है कि यह छात्र के निबंध को ग्रेड कर सकता है भले ही शिक्षक के पास उत्तर कुंजी न हो, जब तक कि छात्र ने सही पाठ्यपुस्तकों का उपयोग किया हो। टीम ने पाया कि यह विधि "राष्ट्रपति कौन है?" जैसे सरल प्रश्नों के लिए उतनी ही अच्छी तरह काम करती है जितनी कि "सापेक्षता के सिद्धांत की व्याख्या करें" जैसे निबंधों के लिए।

हालाँकि, शोध पत्र यह भी सुझाव देता है कि ग्रेडिंग करने वाले "दिमाग" (AI मॉडल) का आकार मायने रखता है। जब उन्होंने Q-CARE चलाने के लिए एक छोटे AI मॉडल का उपयोग किया, तो स्कोर उतने विश्वसनीय नहीं थे, विशेष रूप से कठिन ओपन-एंडेड प्रश्नों के लिए। लेकिन जब उन्होंने एक बड़े, स्मार्ट मॉडल (जैसे Qwen3-30B) का उपयोग किया, तो मूल्यांकन बहुत अधिक सटीक हो गया, जिससे पता चलता है कि इस नए ग्रेडिंग सिस्टम का प्रभावी ढंग से उपयोग करने के लिए एक मजबूत "शिक्षक" की आवश्यकता होती है।

संक्षेप में, Q-CARE यह सुझाव देता है कि प्रश्नों और उत्तरों को छोटे, सत्यापन योग्य टुकड़ों में तोड़कर, हम अंततः एक ऐसा ग्रेडिंग सिस्टम बना सकते हैं जो निष्पक्ष, सुसंगत और मानव जिज्ञासा की पूरी सीमा—सरल तथ्यों से लेकर गहरे, ओपन-एंडेड अन्वेषण तक—को संभालने में सक्षम हो। यह सुनिश्चित करने की दिशा में एक कदम है कि हमारे AI सहायक न केवल बुद्धिमान लगें, बल्कि वास्तव में सहायक और सत्यवादी भी हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →