Evaluating RAG Metrics in Applied Contexts: An Experiment, Its Findings and Its Limitations
यह शोध पत्र एक व्यावसायिक प्रश्न-उत्तर डेटासेट पर मानव मूल्यांकन और मानक मेट्रिक्स के विरुद्ध अपने स्कोर की तुलना करके चार लाइब्रेरीज़ के विभिन्न RAG मेट्रिक्स की प्रासंगिकता का मूल्यांकन करने वाले एक अनुभवजन्य अध्ययन को प्रस्तुत करता है, जबकि साथ ही पद्धतिगत सीमाओं और भविष्य के अनुसंधान दिशाओं पर भी चर्चा करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप "RAG" नामक एक बहुत ही बुद्धिमान, लेकिन कभी-कभी भ्रमित होने वाले लाइब्रेरियन के मैनेजर हैं। इस लाइब्रेरियन का काम आपकी बातों का जवाब देना है, जिसके लिए वह पहले सही किताब के पन्ने खोजने के लिए शेल्फ की ओर दौड़ता है (रिट्रीवल/retrieval) और फिर उन पन्नों के आधार पर एक सारांश उत्तर लिखता है (जनरेशन/generation)।
समस्या क्या है? आपको कैसे पता चलेगा कि आपका लाइब्रेरियन वास्तव में अच्छा काम कर रहा है? आप उनसे सीधे यह नहीं पूछ सकते, "क्या मैंने अच्छा किया?" क्योंकि वे झूठ बोल सकते हैं या ज़रूरत से ज़्यादा आत्मविश्वासी हो सकते हैं। आपको उनके काम को ग्रेड देने के लिए एक तरीके की आवश्यकता है।
यह पेपर वास्तव में उन ग्रेडिंग टूल्स (मेट्रिक्स) के लिए एक रिपोर्ट कार्ड है जिनका उपयोग हम इस लाइब्रेरियन का मूल्यांकन करने के लिए करते हैं। लेखक, ऑरेंज रिसर्च के क्वेंटिन ब्राबेंट ने यह देखने के लिए एक छोटा प्रयोग किया कि कौन से ग्रेडिंग टूल्स वास्तव में मानव विशेषज्ञों के विचारों से मेल खाते हैं।
यहाँ प्रयोग, निष्कर्ष और सावधानियों का सरल विवरण दिया गया है:
1. सेटअप: "मॉक परीक्षा"
टीम ने वास्तविक व्यावसायिक दस्तावेजों (जैसे टेलीकॉम ऑफर और ग्राहक नियम) पर आधारित 96 विशिष्ट प्रश्न के साथ एक अभ्यास परीक्षण तैयार किया।
- मानव ग्रेडर (Human Graders): दो विशेषज्ञों ने प्रश्नों और लाइब्रेरियन के उत्तरों को पढ़ा और उन्हें 1 से 5 तक का स्कोर दिया।
- 5: सटीक उत्तर, सही तथ्य, और विवरण की बिल्कुल सही मात्रा।
- 1: लाइब्रेरियन ने किसी पूरी तरह से असंबंधित विषय के बारे में बात की।
- स्वचालित ग्रेडर (Automated Graders): उन्होंने चार लोकप्रिय "AI ग्रेडिंग सॉफ्टवेयर" लाइब्रेरीज़ (Ragas, DeepEval, RAGChecker, और Opik) का परीक्षण किया। ये उपकरण बिना हर उत्तर को देखे, स्वचालित रूप से स्कोर देने की कोशिश करते हैं।
2. लक्ष्य: सबसे अच्छा "रूलर" (मापक) खोजना
लक्षक केवल एक सॉफ्टवेयर लाइब्रेरी को हमेशा के लिए "विजेता" घोषित करना नहीं था। इसके बजाय, वे यह देखना चाहते थे: "क्या ये स्वचालित रूलर वास्तव में वही माप रहे हैं जो मानव विशेषज्ञ माप रहे हैं?"
यदि कोई कंप्यूटर प्रोग्राम कहता है कि एक उत्तर "बहुत अच्छा" (5/5) है, लेकिन एक इंसान कहता है कि यह "बहुत खराब" (1/5) है, तो वह कंप्यूटर प्रोग्राम एक टूटा हुआ रूलर है। टीम ने कोरिलेशन (correlation) की तलाश की—यानी कंप्यूटर के स्कोर और मानव के स्कोर के बीच एक सांख्यिकीय तालमेल।
3. निष्कर्ष: किसने सही ग्रेड दिया?
परिणाम आश्चर्यजनक और निराशाजनक दोनों थे:
- पुराने स्कूल के टूल्स: आश्चर्यजनक रूप से, कुछ पुराने, सरल टूल्स (जैसे METEOR) वास्तव में इंसानों के साथ काफी अच्छी तरह मेल खाए।
- "नो-रेफरेंस" टूल्स: कुछ टूल्स "सही" उत्तर कुंजी को देखे बिना ही उत्तरों को ग्रेड देने की कोशिश करते हैं। ये आमतौर पर खराब प्रदर्शन करते हैं। यह गणित के टेस्ट को बिना सही उत्तर जाने ग्रेड देने जैसा है; कंप्यूटर बस अंदाज़ा लगाता है।
- बड़ा सरप्राइज (RAGChecker): एक टूल, RAGChecker, ने मानव स्कोर के साथ बहुत मजबूत कोरिलेशन दिखाया। वास्तव में, यह इतना अच्छा मेल खा गया कि लेखकों को संदेह हुआ।
- "हैलुसिनेशन" (Hallucination) चेक: जो टूल्स यह जांचने के लिए बनाए गए हैं कि लाइब्रेरियन ने मनगढ़ंत बातें तो नहीं कीं (faithfulness), वे समग्र गुणवत्ता स्कोर के साथ अच्छा कोरिलेशन नहीं दिखा पाए। यह समझ में आता है क्योंकि एक लाइब्रेरियन सच तो बोल सकता है लेकिन फिर भी बोरिंग या अप्रासंगिक उत्तर दे सकता है।
4. पकड़: "टूटा हुआ रूलर" की समस्या
यह इस पेपर का सबसे महत्वपूर्ण हिस्सा है। लेखक अपने स्वयं के प्रयोग में एक बड़ी खामी की ओर इशारा करते हैं।
उपमा (Analogy): कल्पना कीजिए कि आप एक थर्मामीटर का परीक्षण कर रहे हैं। आपके पास केवल अपने घर का एक कमरा है और उस कमरे का तापमान हमेशा 70°F रहता है।
- आपने थर्मामीटर कमरे में रखा। इसने 70°F दिखाया।
- आपने दूसरा थर्मामीटर रखा। इसने भी 70°F दिखाया।
- आप निष्कर्ष निकालते हैं: "ये थर्मामीटर एकदम सही हैं!"
वास्तविकता: आप यह नहीं बता सकते कि थर्मामीटर वास्तव में तापमान माप रहे हैं, या वे केवल ऐसे टूल्स हैं जो हमेशा "70" ही बताते हैं। क्योंकि आपने केवल एक ही लाइब्रेरियन सिस्टम (एक कमरा) का परीक्षण किया, आप यह नहीं बता सकते कि स्वचालित ग्रेडर वास्तव में उत्तर की गुणवत्ता को माप रहा है, या वह कुछ और माप रहा है, जैसे कि प्रश्न पूछने की आसानी।
- उदाहरण: यदि कोई प्रश्न बहुत सरल है, तो लाइब्रेरियन को उच्च स्कोर मिलता है। यदि स्वचालित ग्रेडर केवल यह अनुमान लगाने में "स्मार्ट" है कि सरल प्रश्नों के लिए उच्च स्कोर मिलता है, तो यह इंसानों के साथ पूरी तरह से कोरिलेट करेगा। लेकिन यदि आप उसे एक कठिन प्रश्न देते हैं, तो वह पूरी तरह से विफल हो सकता है। लेखकों को संदेह है कि RAGChecker शायद यही कर रहा है—यह अनजाने में "प्रश्न की कठिनाई" को माप रहा है, न कि "उत्तर की गुणवत्ता" को।
5. निष्कर्ष: आगे क्या है?
पेपर इस निष्कर्ष पर पहुँचता है कि हालांकि ये स्वचालित टूल्स खराब विकल्पों को फ़िल्टर करने के लिए उपयोगी हैं, लेकिन हम अभी तक इस प्रकार के परीक्षण के आधार पर उन पर 100% भरोसा नहीं कर सकते।
एक वास्तविक, विश्वसनीय ग्रेड प्राप्त करने के लिए, लेखक सुझाव देते हैं कि हमें ग्रेडर का परीक्षण कई अलग-अलग लाइब्रेरियन (अलग-अलग AI सिस्टम) और कई अलग-अलग प्रकार के प्रश्नों के विरुद्ध करना होगा। यदि कोई टूल पूरे क्षेत्र में एक अच्छे लाइब्रेरियन और एक बुरे लाइब्रेरियन के बीच अंतर बताने में लगातार सक्षम है, तभी हमें पता चलेगा कि वह एक अच्छा रूलर है।
संक्षेप में: इस पेपर ने AI लाइब्रेरियन को ग्रेड देने वाले रूलर्स का परीक्षण किया। कुछ रूलर अच्छे दिखे, लेकिन क्योंकि इस परीक्षण में केवल एक ही लाइब्रेरियन का उपयोग किया गया था, लेखक चेतावनी देते हैं कि वे रूलर्स केवल प्रश्नों की आसानी के आधार पर अंदाज़ा लगा रहे होंगे, न कि उत्तरों की वास्तविक गुणवत्ता के आधार पर। इसे ठीक करने के लिए, अगली बार हमें इन रूलर्स का परीक्षण कई अलग-अलग लाइब्रेरियन के एक पूरे क्लासरूम पर करना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।