← नवीनतम पेपर
💬 NLP

LIT-RAGBench: Benchmarking Generator Capabilities of Large Language Models in Retrieval-Augmented Generation

यह शोध पत्र LIT-RAGBench को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क डेटासेट और मूल्यांकन ढांचा है जिसे पांच महत्वपूर्ण श्रेणियों—इंटीग्रेशन (Integration), रीजनिंग (Reasoning), लॉजिक (Logic), टेबल (Table), और एब्स्टेंशन (Abstention)—में रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) में लार्ज लैंग्वेज मॉडल्स की क्षमताओं का व्यवस्थित रूप से आकलन करने के लिए डिज़ाइन किया गया है, जिसमें व्यावहारिक RAG परिनियोजन के लिए मॉडल चयन और विकास को निर्देशित करने हेतु मानव-निर्मित जापानी प्रश्नों और क्यूरेटेड अंग्रेजी अनुवादों के मिश्रण का उपयोग किया गया है।

मूल लेखक: Koki Itai, Shunichi Hasegawa, Yuta Yamamoto, Gouki Minegishi, Masaki Otsuki

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Koki Itai, Shunichi Hasegawa, Yuta Yamamoto, Gouki Minegishi, Masaki Otsuki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपनी कंपनी के लिए सवालों के जवाब देने के लिए एक सुपर-स्मार्ट रिसर्च असिस्टेंट (एक लार्ज लैंग्वेज मॉडल, या LLM) को काम पर रख रहे हैं। आप उन्हें कहते हैं, "सिर्फ अंदाज़ा मत लगाओ; पहले हमारी कंपनी की फाइलों में तथ्य खोजो।" इस सेटअप को RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है।

समस्या क्या है? यहाँ तक कि सबसे स्मार्ट असिस्टेंट भी कभी-कभी गलतियाँ कर सकते हैं। वे:

  • हैलुसिनेट (Hallucinate) कर सकते हैं: आत्मविश्वास के साथ गलत तथ्य बना लेते हैं क्योंकि वे गलत होने के बावजूद आश्वस्त दिखते हैं।
  • विषय से भटक सकते हैं: सही फाइल तो ढूंढ लेते हैं लेकिन दो अलग-अलग दस्तावेजों के बीच संबंध जोड़ने में विफल रहते हैं।
  • चार्ट्स से भ्रमित हो सकते हैं: एक स्प्रेडशीट देखते हैं और नंबरों को पूरी तरह से गलत पढ़ लेते हैं।
  • जवाब देने से मना कर देते हैं: या इससे भी बुरा, वे जवाब देने से मना कर देते हैं जब वे उत्तर ढूंढ सकते थे।

अब तक, यह देखने के लिए कि ये असिस्टेंट इन सभी विशिष्ट कौशलों में से कितने अच्छे हैं, कोई अच्छा "ड्राइवर का टेस्ट" नहीं था।

पेश है: LIT-RAGBench

इस शोध पत्र के लेखकों ने एक नई, कठोर परीक्षा बनाई है जिसे LIT-RAGBench कहा जाता है। इसे एक मल्टी-स्किल बाधा दौड़ (obstacle course) के रूप में समझें, जिसे एक रिसर्च असिस्टेंट की वास्तविक दुनिया की तैयारी को परखने के लिए डिज़ाइन किया गया है।

इसका नाम Logic (तर्क), Integration (एकीकरण), Table (तालिका), Reasoning (तर्कशक्ति), और Abstention (परहेज/अस्वीकार) से मिलकर बना है। यहाँ प्रत्येक भाग का सरल रूपकों (metaphors) का उपयोग करके विवरण दिया गया है:

1. Integration (एकीकरण - "पज़ल मास्टर")

  • टेस्ट: असिस्टेंट को तीन अलग-अलग दस्तावेज़ दिए जाते हैं। उत्तर केवल एक में नहीं है; यह एक पहेली है जहाँ हिस्सा A दस्तावेज़ 1 में है, और हिस्सा B दस्तावेज़ 2 में है।
  • रूपक: कल्पना करें कि आपसे पूछा जाता है, "पुरस्कार किसने जीता?" असिस्टेंट को एक न्यूज़लेटर (दस्तावेज़ 1) पढ़ना होगा जो कहता है "एलिस ने जीता," और एक अलग ईमेल (दस्तावेज़ 2) पढ़ना होगा जो कहता है "एलिस मार्केटिंग टीम से है।" इसे यह कहने के लिए दोनों को जोड़ना होगा कि "मार्केटिंग टीम से एलिस ने जीता।" यदि इसने केवल एक को पढ़ा, तो यह विफल हो जाएगा।

2. Reasoning (तर्कशक्ति - "डिटेक्टिव")

  • टेस्ट: उत्तर सीधे तौर पर नहीं दिया गया है। असिस्टेंट को "मल्टी-हॉप" निष्कर्ष निकालना होगा।
  • रूपक: दस्तावेज़ कहता है, "मीटिंग मंगलवार को स्थानांतरित कर दी गई है।" दूसरा कहता है, "मंगलवार को छुट्टी है।" असिस्टेंट को यह निष्कर्ष निकालना चाहिए कि, "इसलिए, मीटिंग प्रभावी रूप से रद्द या फिर से स्थगित कर दी गई है," भले ही किसी ने स्पष्ट रूप से "रद्द" नहीं लिखा हो। यह गणित कौशल का भी परीक्षण करता है, जैसे बिक्री की सूची से कुल लाभ की गणना करना, जिसमें कई AI मॉडल आश्चर्यजनक रूप से संघर्ष करते हैं।

3. Logic (तर्क - "अनुवादक")

  • टेस्ट: प्रश्न दस्तावेज़ से अलग शब्दों का उपयोग करता है।
  • रूपक: आप पूछते हैं, "क्या $10,000 का बजट स्वीकृत है?" दस्तावेज़ कहता है, "दस हजार डॉलर का फंड ग्रीनलिट है।" एक इंसान जानता है कि ये दोनों एक ही हैं। एक AI भ्रमित हो सकता है और कह सकता है, "मुझे $10,000 नहीं दिख रहा," जिससे वह समानार्थी शब्द को पहचानने में चूक जाता है। यह यह भी परीक्षण करता है कि क्या AI सीमाओं को समझता है (जैसे, "क्या 39 वर्षीय व्यक्ति '40 से कम' की श्रेणी में पात्र है?")।

4. Table (तालिका - "चार्ट रीडर")

  • टेस्ट: जानकारी अव्यवस्थित स्प्रेडशीट, HTML टेबल, या CSV फाइलों के अंदर छिपी होती है।
  • रूपक: एक टेबल की कल्पना करें जहाँ पंक्तियाँ (rows) और कॉलम (columns) आपस में जुड़े हुए हैं (जैसे एक जटिल एक्सेल शीट)। AI को एक मर्ज किए गए ब्लॉक का हिस्सा होने वाले सेल में एक विशिष्ट नंबर ढूंढना होगा। यह एक थिएटर में विशिष्ट सीट खोजने जैसा है जहाँ गलियारे के संकेत गायब हैं और पंक्तियाँ आपस में मिली हुई हैं। कई AI यहाँ खो जाते हैं।

5. Abstention (परहेज - "ईमानदारी की जाँच")

  • टेस्ट: असिस्टेंट से ऐसा सवाल पूछा जाता है जहाँ दस्तावेज़ों में उत्तर नहीं होता, या दस्तावेज़ आपस में विरोधाभासी होते हैं।
  • रूपक: आप पूछते हैं, "CEO का पसंदीदा रंग क्या है?" दस्तावेज़ केवल CEO की व्यावसायिक रणनीति के बारे में बात करते हैं। एक अच्छा असिस्टेंट कहेगा, "मुझे नहीं पता, फाइलों में यह नहीं दिया गया है।" एक बुरा असिस्टेंट मदद करने के चक्कर में कोई रंग (जैसे "नीला") बना देगा। यह सेक्शन परीक्षण करता है कि क्या AI को पता है कि कब चुप रहना है और अज्ञानता स्वीकार करनी है।

परिणाम: टेस्ट में कौन पास हुआ?

शोधकर्ताओं ने दुनिया के कई सबसे स्मार्ट AI मॉडल्स (जैसे GPT-5, Claude, Llama, और Qwen) पर यह टेस्ट चलाया।

  • बड़ा आश्चर्य: किसी भी मॉडल ने पूर्ण स्कोर प्राप्त नहीं किया। वास्तव में, किसी भी मॉडल ने 90% सटीकता तक भी नहीं पहुँच पाई। यहाँ तक कि "सबसे स्मार्ट" मॉडल भी विशिष्ट प्रकार की पहेलियों में फंस गए।
  • कमजोरियाँ:
    • गणित और तर्क: कई मॉडल्स साधारण गणना करने या यह समझने में संघर्ष करते कि "10k" का अर्थ "10,000" है।
    • टेबल: अव्यवस्थित स्प्रेडशीट पढ़ना लगभग सभी के लिए एक दुःस्वप्न था।
    • ईमानदारी: कुछ मॉडल्स उत्तर देने के लिए बहुत उत्सुक थे (हैलुसिनेशन), जबकि अन्य बहुत डरपोक थे (तथ्यों के होने के बावजूद उत्तर देने से मना कर देना)। इसे "ओवर-एब्स्टेंशन" (Over-Abstention) समस्या कहा जाता है।

यह क्यों मायने रखता है?

LIT-RAGBench को व्यवसायों के लिए एक क्वालिटी कंट्रोल चेकलिस्ट के रूप में सोचें।

यदि आप अपने कर्मचारियों के लिए चैटबॉट बनाने की कोशिश कर रहे एक कंपनी हैं, तो आप केवल "सबसे लोकप्रिय" AI नहीं चुन सकते। आपको जानना होगा:

  • "क्या यह मॉडल हमारे वित्तीय स्प्रेडशीट से भ्रमित हो जाता है?" (टेबल स्किल)
  • "यदि डेटा गायब है तो क्या यह तथ्य बना लेगा?" (एब्स्टेंशन स्किल)
  • "क्या यह विभिन्न रिपोर्टों के बीच संबंधों को जोड़ सकता है?" (इंटिग्रेशन स्किल)

निष्कर्ष:
AI अविश्वसनीय रूप से स्मार्ट हो रहा है, लेकिन यह अभी भी पूर्ण नहीं है। यह नया बेंचमार्क हमें दिखाता है कि यह कहाँ विफल होता है। यह हमें बताता है कि अपने व्यवसायों को चलाने के लिए AI पर भरोसा करने से पहले, हमें चार्ट पढ़ने, गणित करने और यह जानने की उसकी क्षमता को ठीक करने की आवश्यकता है कि "मुझे नहीं पता" कब कहना है।

लेखकों ने इस टेस्ट को ओपन-सोर्स कर दिया है, ताकि कोई भी बेहतर, अधिक विश्वसनीय AI असिस्टेंट को प्रशिक्षित करने के लिए इसका उपयोग कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →