← नवीनतम पेपर
💬 NLP

LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation

यह शोध पत्र LayerRAG-Bench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है यह प्रदर्शित करते हुए कि जबकि स्कीमा नॉर्मलाइजेशन (schema normalization) एजेंटिक RAG सिस्टम में स्कीमा ड्रिफ्ट (schema drift) को प्रभावी ढंग से संबोधित करता है, यह पुराने साक्ष्य (stale evidence) या अनुमति त्रुटियों (permission errors) जैसी अन्य महत्वपूर्ण विश्वसनीयता संबंधी समस्याओं को हल करने में विफल रहता है, जिससे यह सार्वभौमिक समाधानों या केवल ग्राउंडेडनेस-आधारित मेट्रिक्स पर निर्भर रहने के बजाय लक्षित, परत-विशिष्ट मूल्यांकन की वकालत करता है।

मूल लेखक: Musa Shams (Independent Researcher)

प्रकाशित 2026-07-31
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Musa Shams (Independent Researcher)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट असिस्टेंट बना रहे हैं जो एक विशाल पुस्तकालय को पढ़ सकता है, आपके व्यक्तिगत रहस्यों को याद रख सकता है, और आपकी समस्याओं को हल करने के लिए गैजेट्स के टूलबॉक्स का उपयोग कर सकता है। यह एजेंटिक रिट्रीवल-ऑगमेंटेड जनरेशन (Agentic RAG) की दुनिया है। "रिट्रीवल" (Retrieval) को रोबोट की पुस्तकालय की अलमारियों तक दौड़ने और सही किताब उठाने की क्षमता के रूप में सोचें। "जनरेशन" (Generation) का अर्थ है रोबोट द्वारा उस किताब को पढ़ना और आपके लिए एक कहानी लिखना। लेकिन "एजेंटिक" (Agentic) इसमें एक नया मोड़ जोड़ता है: रोबोट केवल पढ़ ही नहीं रहा है; वह टूल्स (जैसे कैलकुलेटर या कैलेंडर) का उपयोग करने की भी कोशिश कर रहा है, यह जाँच रहा है कि क्या उसके पास किसी कमरे में प्रवेश करने की अनुमति है, और यह भी याद रख रहा है कि पाँच मिनट पहले आपकी बातचीत में क्या हुआ था।

बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है: हमें कैसे पता चलेगा कि यह रोबलेट वास्तव में विश्वसनीय है? रोबोट को आत्मविश्वास से भरा हुआ दिखने के लिए बेवकूफ बनाना आसान है। यह एक पुरानी, एक्सपायर्ड किताब उठा सकता है, ऐसे टूल का उपयोग कर सकता है जिसके लिए उसके पास लाइसेंस नहीं है, या आपकी बातचीत को आपके पड़ोसी की बातचीत के साथ मिला सकता है। यदि रोबोट गलत किताब या गलत अनुमति के आधार पर एक आदर्श वाक्य लिखता है, तो यह एक सफलता की तरह दिखता है, लेकिन वास्तव में यह एक आपदा है जो होने वाली है। हमें यह परीक्षण करने के लिए एक तरीके की आवश्यकता है कि क्या रोबोट ने केवल अच्छा उत्तर दिया या उसने सही किताब उठाई, सही टूल का उपयोग किया, और नियमों का सम्मान किया।

यही वह चीज़ है जिसे नया पेपर, LayerRAG-Bench, संबोधित करता है। शोधकर्ताओं ने इन AI रोबोटों के लिए एक विशाल, नियंत्रित बाधा दौड़ (obstacle course) बनाई। उन्होंने 8 अलग-अलग व्यावसायिक दुनियाओं (जैसे कानूनी या वित्त) में 240 अलग-अलग कार्य बनाए और शीर्ष कंपनियों के 9 अलग-अलग AI मॉडलों का परीक्षण किया। उन्होंने रोबलों से केवल प्रश्न पूछने के लिए नहीं कहा; उन्होंने जानबूझकर चीजों को विशिष्ट तरीकों से बिगाड़ा ताकि यह देखा जा सके कि रोबोट कैसे प्रतिक्रिया देते हैं। उन्होंने "दोष" (faults) पेश किए जैसे कि रोबोट को एक टूटे हुए निर्देश मैनुअल (schema drift) वाला टूल देना, आवश्यक पुस्तक को छिपा देना (missing evidence), जिस कमरे में उसे प्रवेश करना है उसका दरवाजा बंद कर देना (permission denied), या उसे पिछले साल के पुस्तकालय की किताब दिखाना (stale index)।

मुख्य खोज एक वास्तविकता की जाँच है: एक टूटे हुए हिस्से को ठीक करने से सब कुछ ठीक नहीं हो जाता। शोधकर्ताओं ने पाया कि यदि उन्होंने टूटे हुए निर्देश मैनुअल को "मरम्मत" किया (एक सुधार जिसे स्कीमा नॉर्मलाइजेशन (schema normalization) कहा जाता है), तो रोबोट की सफलता दर 0% से बढ़कर 91.3% हो गई। यह एक बड़ी जीत है! लेकिन यहाँ पेंच यह है: उसी सुधार ने अन्य समस्याओं के लिए बिल्कुल भी काम नहीं किया। यदि किताब गायब थी, अनुमति नहीं मिली थी, या रोबोट पिछले सत्र के नोट्स देख रहा था, तो "मरम्मत" ने कोई मदद नहीं की। सफलता दर 0% पर ही रही।

यह पेपर हमें एक सामान्य जाल के बारे में भी चेतावनी देता है: सिर्फ इसलिए कि एक उत्तर "ग्राउंडेड" (मतलब, वह उस टेक्स्ट को उद्धृत करता है जो उसे मिला है) लगता है, इसका मतलब यह नहीं है कि वह सही है। शोधकर्ताओं ने पाया कि जिन मामलों में रोबोट ने गलत सत्र या पुराने इंडेक्स को देखा था, वहां वह अभी भी गलत टेक्स्ट में पूरी तरह से 'ग्राउंडेड' उत्तर उत्पन्न कर सकता था, जिससे भारी संख्या में गलत अलार्म (false alarms) पैदा हुए।

संक्षेप में, यह पेपर तर्क देता है कि हमें AI विश्वसनीयता को एक एकल स्कोर के रूप में मानना बंद कर देना चाहिए। इसके बजाय, हमें रोबोट के मस्तिष्क के प्रत्येक "लेयर" (परत) की अलग से जाँच करनी चाहिए। एक टूटे हुए टूल कॉन्ट्रैक्ट के लिए सुधार, गायब डेटा या सुरक्षा उल्लंघनों के लिए जादुई छड़ी नहीं है। वास्तव में विश्वसनीय AI असिस्टेंट बनाने के लिए, हमें यह जानने की आवश्यकता है कि कौन सी लेयर टूटी हुई है और उस विशिष्ट लेयर के लिए सही सुधार लागू करना होगा, बजाय इसके कि हम उम्मीद करें कि एक सामान्य समाधान सभी समस्याओं को हल कर देगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →