← नवीनतम पेपर
🤖 AI

RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models

यह शोध पत्र RagTester को प्रस्तुत करता है, जो एक स्वचालित एंड-टू-एंड परीक्षण ढांचा है जो रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) प्रणालियों का मूल्यांकन करने के लिए विविध परीक्षण मामले उत्पन्न करता है, और विभिन्न मॉडल कॉन्फ़िगरेशन में बेसलाइन विधियों की तुलना में काफी अधिक विफलताओं का पता लगाने की अपनी क्षमता प्रदर्शित करता है।

मूल लेखक: Ange Maiztegi, Jon Ayerdi, Miren Illarramendi, Aitor Arrieta

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ange Maiztegi, Jon Ayerdi, Miren Illarramendi, Aitor Arrieta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक सुपर-स्मार्ट रोबोट दोस्त है जो कहानियाँ लिख सकता है, गणित की समस्याएँ हल कर सकता है और किसी भी विषय पर आपसे बात कर सकता है। यह रोबोट अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन इसका एक रहस्य है: यह केवल वही जानता है जो इसने सालों पहले स्कूल में सीखा था। यदि आप इससे कल की किसी समाचार कहानी के बारे में या आपकी कंपनी की हैंडबुक के किसी विशिष्ट नियम के बारे में पूछते हैं, तो यह अनुमान लगा सकता है, मनगढ़ंत बातें बना सकता है, या बस कह सकता है कि उसे नहीं पता। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है—शक्तिशाली AI दिमाग जो बात करने में तो बहुत अच्छे हैं लेकिन नवीनतम तथ्यों को जानने में कभी-कभी खराब होते हैं।

इसे ठीक करने के लिए, इंजीनियरों ने RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) नामक एक तरकीब निकाली। RAG को उस रोबोट को एक विशाल, जादुई पुस्तकालय और एक सुपर-फास्ट लाइब्रेरियन देने के रूप में सोचें। आपके प्रश्न का उत्तर देने से पहले, लाइब्रेरियन उन सटीक पन्नों को खोजने के लिए दौड़ता है जिनमें उत्तर मौजूद है। फिर रोबोट उन पन्नों को पढ़ता है और केवल उसी के आधार पर अपना उत्तर लिखता है जो उसने पाया है। यह सुनने में एकदम सही लगता है, है ना? लेकिन यहाँ एक पेंच है: लाइब्रेरियन गलत किताब उठा सकता है, रोबोट सही पन्ने को अनदेखा कर सकता है, या वह एक उलझे हुए पैराग्राफ से भ्रमित हो सकता है। यदि इस टीम का कोई भी हिस्सा गड़बबड़ करता है, तो रोबोट गलत उत्तर देता है। क्योंकि इस टीम के विफल होने के कई तरीके हैं, हमें उन्हें वास्तविक लोगों से बात कराने से पहले उन सभी का परीक्षण करने की आवश्यकता है।

यहीं पर RAG-TESTER नामक एक नया टूल आता है। इस टूल के पीछे के शोधकर्ताओं ने यह देखना चाहा कि क्या वे एक स्वचालित "बग हंटर" (खामियां खोजने वाला) बना सकते हैं जो एक नए वीडियो गेम का परीक्षण करने वाले एक सख्त, जिज्ञासु किशोर की तरह व्यवहार करता है। केवल रोबोट से कुछ यादृच्छिक प्रश्न पूछने के बजाय, RAG-TESTER एक पूरा परीक्षण अरीना (testing arena) बनाता है। सबसे पहले, यह स्वचालित रूप से रिट्रीवल डॉक्यूमेंट्स (PDFs) तैयार करता है जिनमें पेचीदा, जटिल और यहाँ तक कि उबाऊ खंड भी शामिल होते हैं। फिर यह हजारों ऐसे प्रश्न लिखता है जिन्हें रोबोट को फँसाने के लिए डिज़ाइन किया गया है: कुछ प्रश्न उन चीजों के बारे में होते हैं जो किताबों में नहीं हैं (यह देखने के लिए कि क्या रोबोट झूठ बोलता है), कुछ बहुत कठिन-से-पढ़ने वाले पैराग्राफ के बारे में होते हैं, और कुछ के लिए आवश्यक है कि रोबोट टेक्स्ट के विभिन्न हिस्सों से सुरागों को जोड़कर देखे।

एक बार जब प्रश्न तैयार हो जाते हैं, तो RAG-TESTER उन्हें रोबोटों और लाइब्रेरियन के 24 अलग-अलग संयोजनों (विभिन्न AI मॉडल्स और सर्च टूल्स का उपयोग करके) के माध्यम से चलाता है। इसके बाद, यह उत्तरों को ग्रेड देने के लिए एक विशेष "जज" AI का उपयोग करता है, जो यह जाँचता है कि क्या रोबोट ईमानदार था, क्या उसने सही प्रश्न का उत्तर दिया, और क्या उसने कोई महत्वपूर्ण विवरण छोड़ दिया। परिणाम आँखें खोल देने वाले थे। 72,000 टेस्ट रन के दौरान, RAG-TESTER ने 21,633 विफलताएं पाईं। यह बहुत सारी गलतियाँ हैं! इसने पाया कि यहाँ तक कि "सबसे स्मार्ट" रोबोट भी तब कल्पना (hallucinate) करने लगते थे यानी मनगढ़ंत बातें बनाने लगते थे जब उनसे उन चीजों के बारे में पूछा जाता था जो उनकी किताबों में नहीं थीं, या वे जटिल टेक्स्ट से भ्रमित हो जाते थे।

इस अध्ययन ने RAG-TESTER की तुलना एक सरल, "कम बुद्धिमान" परीक्षण पद्धति से भी की। स्मार्ट, स्वचालित टेस्टर ने साधारण टेस्टर की तुलना में 6.6% अधिक विफलताएं पाईं। यह सुनने में बहुत बड़ी संख्या नहीं लग सकती है, लेकिन AI की दुनिया में, उन अतिरिक्त गलतियों को पकड़ना एक बड़ी बात है। इसका मतलब है कि स्मार्ट टेस्टर उन छिपे हुए जाल को खोजने में बहुत बेहतर है जो रोबलों को झूठ बोलने या भ्रमित होने का कारण बनते हैं। दिलचस्प बात यह है कि शोधकर्ताओं ने पाया कि वास्तविक दुनिया के दस्तावेजों (जैसे इंटरनेट से वास्तविक PDF) का उपयोग करना, उन दस्तावेजों की तुलना में बहुत कठिन था जो इस टूल द्वारा बनाए गए थे। वास्तविक दस्तावेजों में खराब फॉर्मेटिंग और अजीब संरचनाएं थीं जिनसे रोबोट संघर्ष करते थे, जो यह साबित करता है कि भले ही हम परीक्षण सामग्री बना सकते हैं, वास्तविक जीवन अभी भी अंतिम 'बॉस लेवल' है।

संक्षेप में, RAG-TESTER हमें दिखाता है कि एक विश्वसनीय AI सिस्टम बनाना केवल सबसे स्मार्ट रोबोट चुनने के बारे में नहीं है; यह इस बारे में है कि वह अपने पुस्तकालय के साथ कैसे काम करता है, उसका कड़ाई से परीक्षण करना। यह टूल सुझाव देता है कि हम इन सिस्टमों पर बिना जांचे भरोसा नहीं कर सकते। हमें स्वचालित, व्यवस्थित परीक्षण की आवश्यकता है ताकि उन सूक्ष्म तरीकों को पकड़ा जा सके जिनसे वे विफल होते हैं—चाहे वह रोबोट द्वारा तथ्य गढ़ना हो, सही किताब को अनदेखा करना हो, या एक जटिल वाक्य में खो जाना हो। इस प्रकार के परीक्षण का उपयोग करके, डेवलपर्स इन समस्याओं को ठीक कर सकते हैं इससे पहले कि AI डॉक्टरों, वकीलों या किसी भी ऐसे व्यक्ति को सलाह देना शुरू करे जिसे सच्चाई की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →