← नवीनतम पेपर
🤖 AI

Generating Leakage-Free Benchmarks for Robust RAG Evaluation

यह शोध पत्र SeedRG को प्रस्तुत करता है, जो एक अर्ध-सिंथेटिक (semi-synthetic) बेंचमार्क जनरेशन पाइपलाइन है जो सीड डेटा से रीजनिंग ग्राफ्स निकालकर और नवीन, संरचनात्मक रूप से समान उदाहरण उत्पन्न करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) मूल्यांकन में नॉलेज लीकेज और बेंचमार्क एजिंग की समस्या को कम करता है, जिन्हें किसी LLM की पैरामीट्रिक मेमोरी से हल नहीं किया जा सकता।

मूल लेखक: Jiayi Liu, Jiaxing Zhang, Bowen Jin, Jennifer Neville

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayi Liu, Jiaxing Zhang, Bowen Jin, Jennifer Neville

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो किसी छात्र की लाइब्रेरी (पुस्तकालय) का उपयोग करने की क्षमता का मूल्यांकन कर रहे हैं। आप उन्हें एक प्रश्न और किताबों का एक ढेर देते हैं, और आप देखना चाहते हैं कि क्या वे उन किताबों में उत्तर ढूँढ सकते हैं।

लेकिन यहाँ एक समस्या है: छात्र ने वर्षों पहले किताबें पढ़कर अधिकांश प्रश्नों के उत्तर पहले ही याद कर लिए हैं। जब आप उनसे पूछते हैं, "प्राइड एंड प्रेजुडिस किसने लिखी थी?", तो उन्हें आपके द्वारा दी गई किताबों में देखने की आवश्यकता नहीं होती; उन्हें यह याद रहता है।

यह बिल्कुल वही है जिसके बारे में शोध पत्र "Generating Leakage-Free Benchmarks for Robust RAG Evaluation" है। यह तर्क देता है कि हम वर्तमान में AI सिस्टम (विशेष रूप से वे जो बाहरी डेटा के "लाइब्रेरी" या RAG का उपयोग करते हैं) का परीक्षण बहुत आसान प्रश्नों के साथ कर रहे हैं क्योंकि AI पहले से ही अपनी आंतरिक स्मृति से उत्तर जानता है।

यहाँ इस शोध पत्र की कहानी का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "चीटिंग" वाला टेस्ट

लेखकों ने पाया कि AI को परखने के लिए उपयोग किए जाने वाले लोकप्रिय परीक्षण जानकारी "लीक" (leak) कर रहे हैं।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को गणित का टेस्ट दे रहे हैं जहाँ उत्तर उनके हाथ के पीछे लिखे हुए हैं। भले ही आप उनसे कहें, "आपको इसे हल करने के लिए कैलकुलेटर का उपयोग करना चाहिए," वे बस अपने हाथ को देख लेते हैं। आप यह नहीं बता सकते कि उनका कैलकुलेटर अच्छा है या बुरा क्योंकि वे वास्तव में उसका उपयोग नहीं कर रहे हैं।
  • वास्तविकता: AI की दुनिया में, "हाथ" AI की आंतरिक स्मृति (पैरामीट्रिक ज्ञान) है। "कैलकुलेटर" रिट्रीवल सिस्टम (RAG) है। चूंकि AI पहले से ही टेस्ट के तथ्यों को जानता है, इसलिए रिट्रीवल सिस्टम अनावश्यक हो जाता है। इससे यह बताना असंभव हो जाता है कि कौन सा AI सिस्टम वास्तव में बेहतर है।
  • "एजिंग" (पुराना होने) का मुद्दा: शोध पत्र नोट करता है कि समय के साथ यह स्थिति और खराब होती जाती है। जैसे-जैसे AI मॉडल पुराने टेस्ट प्रश्नों पर फिर से प्रशिक्षित (retrain) किए जाते हैं, वे टेस्ट को "याद" कर लेते हैं। टेस्ट बेकार हो जाते हैं, जैसे कि एक सुरक्षा गार्ड जिसने चोर का चेहरा याद कर लिया है लेकिन फिर भी उसे अंदर आने दे रहा है क्योंकि वह चोर का नाम जानता है।

2. समाधान: SeedRG (एक "मैड लिब्स" मशीन)

इसे ठीक करने के लिए, लेखकों ने SeedRG नामक एक नया टूल बनाया। केवल AI को "नए प्रश्न बनाने" के लिए कहने के बजाय (जिससे अक्सर AI अनजाने में उन तथ्यों का उपयोग कर लेता है जिन्हें वह पहले से जानता है), SeedRG एक चतुर और संरचित दृष्टिकोण का उपयोग करता है।

  • उपमा: "मैड लिब्स" (Mad Libs) खेल के बारे में सोचें। आपके पास एक कहानी है जिसमें संज्ञा (nouns), क्रिया (verbs) और स्थानों के लिए खाली स्थान हैं।
    • पुराना तरीका: बस शुरू से एक नई कहानी लिखें। (AI अनजाने में "न्यूयॉर्क" या "आइंस्टीन" के बारे में लिख सकता है क्योंकि वह इन शब्दों को अच्छी तरह जानता है)।
    • SeedRG का तरीका: एक मौजूदा कहानी लें। उन "स्लॉट्स" (जैसे, एक विशिष्ट शहर, एक विशिष्ट वैज्ञानिक) की पहचान करें। फिर, उन स्लॉट्स को बिल्कुल नए, अज्ञात नामों से बदल दें जिन्हें AI ने पहले कभी नहीं सुना है (जैसे, "न्यूयॉर्क" को "ज़ोग-42" से और "आइंस्टीन" को "डॉ. ग्लॉरप" से बदलना)।
  • यह कैसे काम करता है:
    1. तर्क को मैप करना: यह एक मानचित्र (रीज़निंग ग्राफ) बनाता है कि मूल प्रश्न तथ्यों को कैसे जोड़ता है।
    2. हिस्सों को बदलना: यह विशिष्ट नामों को नए नामों से बदल देता है, लेकिन लॉजिक मैप को बिल्कुल वैसा ही रखता है।
    3. दोबारा जाँच करना: यह सुनिश्चित करने के लिए एक परीक्षण चलाया जाता है कि AI दिए गए टेक्स्ट के बिना उस नए प्रश्न का उत्तर नहीं दे सके। यदि AI उत्तर का अनुमान लगा लेता है, तो उस प्रश्न को हटा दिया जाता है और फिर से बनाया जाता है।

3. परिणाम: अंततः अंतर दिखाई देता है

जब लेखकों ने अपने नए "SeedRG" बेंचमार्क का पुराने बेंचमार्क के मुकाबले परीक्षण किया, तो परिणाम नाटकीय थे।

  • पुराने टेस्ट: सभी अलग-अलग AI सिस्टम एक जैसे दिखे। वे सभी उच्च स्कोर प्राप्त कर रहे थे क्योंकि वे केवल वही दोहरा रहे थे जो वे जानते थे। यह एक ऐसी दौड़ की तरह था जहाँ सभी स्थिर खड़े हैं, लेकिन फिनिश लाइन को वहीं खिसका दिया गया है जहाँ वे खड़े हैं।
  • SeedRG टेस्ट: क्योंकि प्रश्नों में नए, अज्ञात तथ्यों का उपयोग किया गया था, AI को रिट्रीवल सिस्टम (उसकी "लाइब्रेरी") का उपयोग करना ही पड़ा। अचानक, अंतर दिखाई देने लगे। कुछ सिस्टम सही किताब खोजने में बेहतरीन थे; अन्य बहुत खराब थे।
    • रूपक (Metaphor): यह उस विषय पर छात्रों को टेस्ट देने जैसा है जिसे उन्होंने अभी तक नहीं पढ़ा है। अब आप वास्तव में देख सकते हैं कि कौन जानकारी खोजने में अच्छा है और कौन केवल अनुमान लगा रहा है।

4. "मैप" क्यों महत्वपूर्ण है?

शोध पत्र ने यह भी खोजा कि एक प्रश्न कितना कठिन होता है।

  • खोज: प्रश्न की कठिनाई केवल शब्दों के बारे में नहीं है; यह तथ्यों के बीच के संबंधों के ढांचे (रीज़निंग ग्राफ) के बारे में है।
  • उपमा: यदि आपके पास 3 स्टॉप वाला एक मैप है, तो यह आसान है। यदि आपके पास 10 स्टॉप वाला मैप है, तो यह कठिन है। SeedRG यह सुनिश्चित करता है कि जब वे नामों को बदलते हैं, तो वे मैप के आकार को बिल्कुल वैसा ही रखते हैं। यह साबित करता है कि कठिनाई रास्ते पर चलने के तरीके में आती है, न कि साइनबोर्ड पर लिखे नामों में।

सारांश

शोध पत्र कहता है: "वर्तमान टेस्ट टूटे हुए हैं क्योंकि AI सिस्टम अपनी मेमोरी का उपयोग करके चीटिंग कर रहे हैं। हमने एक नया टूल, SeedRG, बनाया है, जो नामों को बदलकर और लॉजिक को समान रखते हुए ताज़ा, असंभव-से-याद-करने-योग्य प्रश्न बनाता है। यह AI को वास्तव में अपने सर्च टूल्स का उपयोग करने के लिए मजबूर करता है, जिससे हमें अंततः यह देखने में मदद मिलती है कि कौन से सिस्टम वास्तव में जानकारी खोजने में अच्छे हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →