← नवीनतम पेपर
💬 NLP

Evaluating RAG Metrics in Applied Contexts: An Experiment, Its Findings and Its Limitations

यह शोध पत्र एक व्यावसायिक प्रश्न-उत्तर डेटासेट पर मानव मूल्यांकन और मानक मेट्रिक्स के विरुद्ध अपने स्कोर की तुलना करके चार लाइब्रेरीज़ के विभिन्न RAG मेट्रिक्स की प्रासंगिकता का मूल्यांकन करने वाले एक अनुभवजन्य अध्ययन को प्रस्तुत करता है, जबकि साथ ही पद्धतिगत सीमाओं और भविष्य के अनुसंधान दिशाओं पर भी चर्चा करता है।

मूल लेखक: Quentin Brabant

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Quentin Brabant

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "RAG" नामक एक बहुत ही बुद्धिमान, लेकिन कभी-कभी भ्रमित होने वाले लाइब्रेरियन के मैनेजर हैं। इस लाइब्रेरियन का काम आपकी बातों का जवाब देना है, जिसके लिए वह पहले सही किताब के पन्ने खोजने के लिए शेल्फ की ओर दौड़ता है (रिट्रीवल/retrieval) और फिर उन पन्नों के आधार पर एक सारांश उत्तर लिखता है (जनरेशन/generation)।

समस्या क्या है? आपको कैसे पता चलेगा कि आपका लाइब्रेरियन वास्तव में अच्छा काम कर रहा है? आप उनसे सीधे यह नहीं पूछ सकते, "क्या मैंने अच्छा किया?" क्योंकि वे झूठ बोल सकते हैं या ज़रूरत से ज़्यादा आत्मविश्वासी हो सकते हैं। आपको उनके काम को ग्रेड देने के लिए एक तरीके की आवश्यकता है।

यह पेपर वास्तव में उन ग्रेडिंग टूल्स (मेट्रिक्स) के लिए एक रिपोर्ट कार्ड है जिनका उपयोग हम इस लाइब्रेरियन का मूल्यांकन करने के लिए करते हैं। लेखक, ऑरेंज रिसर्च के क्वेंटिन ब्राबेंट ने यह देखने के लिए एक छोटा प्रयोग किया कि कौन से ग्रेडिंग टूल्स वास्तव में मानव विशेषज्ञों के विचारों से मेल खाते हैं।

यहाँ प्रयोग, निष्कर्ष और सावधानियों का सरल विवरण दिया गया है:

1. सेटअप: "मॉक परीक्षा"

टीम ने वास्तविक व्यावसायिक दस्तावेजों (जैसे टेलीकॉम ऑफर और ग्राहक नियम) पर आधारित 96 विशिष्ट प्रश्न के साथ एक अभ्यास परीक्षण तैयार किया।

  • मानव ग्रेडर (Human Graders): दो विशेषज्ञों ने प्रश्नों और लाइब्रेरियन के उत्तरों को पढ़ा और उन्हें 1 से 5 तक का स्कोर दिया।
    • 5: सटीक उत्तर, सही तथ्य, और विवरण की बिल्कुल सही मात्रा।
    • 1: लाइब्रेरियन ने किसी पूरी तरह से असंबंधित विषय के बारे में बात की।
  • स्वचालित ग्रेडर (Automated Graders): उन्होंने चार लोकप्रिय "AI ग्रेडिंग सॉफ्टवेयर" लाइब्रेरीज़ (Ragas, DeepEval, RAGChecker, और Opik) का परीक्षण किया। ये उपकरण बिना हर उत्तर को देखे, स्वचालित रूप से स्कोर देने की कोशिश करते हैं।

2. लक्ष्य: सबसे अच्छा "रूलर" (मापक) खोजना

लक्षक केवल एक सॉफ्टवेयर लाइब्रेरी को हमेशा के लिए "विजेता" घोषित करना नहीं था। इसके बजाय, वे यह देखना चाहते थे: "क्या ये स्वचालित रूलर वास्तव में वही माप रहे हैं जो मानव विशेषज्ञ माप रहे हैं?"

यदि कोई कंप्यूटर प्रोग्राम कहता है कि एक उत्तर "बहुत अच्छा" (5/5) है, लेकिन एक इंसान कहता है कि यह "बहुत खराब" (1/5) है, तो वह कंप्यूटर प्रोग्राम एक टूटा हुआ रूलर है। टीम ने कोरिलेशन (correlation) की तलाश की—यानी कंप्यूटर के स्कोर और मानव के स्कोर के बीच एक सांख्यिकीय तालमेल।

3. निष्कर्ष: किसने सही ग्रेड दिया?

परिणाम आश्चर्यजनक और निराशाजनक दोनों थे:

  • पुराने स्कूल के टूल्स: आश्चर्यजनक रूप से, कुछ पुराने, सरल टूल्स (जैसे METEOR) वास्तव में इंसानों के साथ काफी अच्छी तरह मेल खाए।
  • "नो-रेफरेंस" टूल्स: कुछ टूल्स "सही" उत्तर कुंजी को देखे बिना ही उत्तरों को ग्रेड देने की कोशिश करते हैं। ये आमतौर पर खराब प्रदर्शन करते हैं। यह गणित के टेस्ट को बिना सही उत्तर जाने ग्रेड देने जैसा है; कंप्यूटर बस अंदाज़ा लगाता है।
  • बड़ा सरप्राइज (RAGChecker): एक टूल, RAGChecker, ने मानव स्कोर के साथ बहुत मजबूत कोरिलेशन दिखाया। वास्तव में, यह इतना अच्छा मेल खा गया कि लेखकों को संदेह हुआ।
  • "हैलुसिनेशन" (Hallucination) चेक: जो टूल्स यह जांचने के लिए बनाए गए हैं कि लाइब्रेरियन ने मनगढ़ंत बातें तो नहीं कीं (faithfulness), वे समग्र गुणवत्ता स्कोर के साथ अच्छा कोरिलेशन नहीं दिखा पाए। यह समझ में आता है क्योंकि एक लाइब्रेरियन सच तो बोल सकता है लेकिन फिर भी बोरिंग या अप्रासंगिक उत्तर दे सकता है।

4. पकड़: "टूटा हुआ रूलर" की समस्या

यह इस पेपर का सबसे महत्वपूर्ण हिस्सा है। लेखक अपने स्वयं के प्रयोग में एक बड़ी खामी की ओर इशारा करते हैं।

उपमा (Analogy): कल्पना कीजिए कि आप एक थर्मामीटर का परीक्षण कर रहे हैं। आपके पास केवल अपने घर का एक कमरा है और उस कमरे का तापमान हमेशा 70°F रहता है।

  • आपने थर्मामीटर कमरे में रखा। इसने 70°F दिखाया।
  • आपने दूसरा थर्मामीटर रखा। इसने भी 70°F दिखाया।
  • आप निष्कर्ष निकालते हैं: "ये थर्मामीटर एकदम सही हैं!"

वास्तविकता: आप यह नहीं बता सकते कि थर्मामीटर वास्तव में तापमान माप रहे हैं, या वे केवल ऐसे टूल्स हैं जो हमेशा "70" ही बताते हैं। क्योंकि आपने केवल एक ही लाइब्रेरियन सिस्टम (एक कमरा) का परीक्षण किया, आप यह नहीं बता सकते कि स्वचालित ग्रेडर वास्तव में उत्तर की गुणवत्ता को माप रहा है, या वह कुछ और माप रहा है, जैसे कि प्रश्न पूछने की आसानी

  • उदाहरण: यदि कोई प्रश्न बहुत सरल है, तो लाइब्रेरियन को उच्च स्कोर मिलता है। यदि स्वचालित ग्रेडर केवल यह अनुमान लगाने में "स्मार्ट" है कि सरल प्रश्नों के लिए उच्च स्कोर मिलता है, तो यह इंसानों के साथ पूरी तरह से कोरिलेट करेगा। लेकिन यदि आप उसे एक कठिन प्रश्न देते हैं, तो वह पूरी तरह से विफल हो सकता है। लेखकों को संदेह है कि RAGChecker शायद यही कर रहा है—यह अनजाने में "प्रश्न की कठिनाई" को माप रहा है, न कि "उत्तर की गुणवत्ता" को।

5. निष्कर्ष: आगे क्या है?

पेपर इस निष्कर्ष पर पहुँचता है कि हालांकि ये स्वचालित टूल्स खराब विकल्पों को फ़िल्टर करने के लिए उपयोगी हैं, लेकिन हम अभी तक इस प्रकार के परीक्षण के आधार पर उन पर 100% भरोसा नहीं कर सकते।

एक वास्तविक, विश्वसनीय ग्रेड प्राप्त करने के लिए, लेखक सुझाव देते हैं कि हमें ग्रेडर का परीक्षण कई अलग-अलग लाइब्रेरियन (अलग-अलग AI सिस्टम) और कई अलग-अलग प्रकार के प्रश्नों के विरुद्ध करना होगा। यदि कोई टूल पूरे क्षेत्र में एक अच्छे लाइब्रेरियन और एक बुरे लाइब्रेरियन के बीच अंतर बताने में लगातार सक्षम है, तभी हमें पता चलेगा कि वह एक अच्छा रूलर है।

संक्षेप में: इस पेपर ने AI लाइब्रेरियन को ग्रेड देने वाले रूलर्स का परीक्षण किया। कुछ रूलर अच्छे दिखे, लेकिन क्योंकि इस परीक्षण में केवल एक ही लाइब्रेरियन का उपयोग किया गया था, लेखक चेतावनी देते हैं कि वे रूलर्स केवल प्रश्नों की आसानी के आधार पर अंदाज़ा लगा रहे होंगे, न कि उत्तरों की वास्तविक गुणवत्ता के आधार पर। इसे ठीक करने के लिए, अगली बार हमें इन रूलर्स का परीक्षण कई अलग-अलग लाइब्रेरियन के एक पूरे क्लासरूम पर करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →