MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation
यह शोध पत्र MKG-RAG-Bench प्रस्तुत करता है, जो एक नया क्रॉस-डोमेन बेंचमार्क है जिसे सामान्य और चिकित्सा डोमेन से क्यूरेटेड डेटासेट का लाभ उठाकर मल्टीमॉडल नॉलेज ग्राफ-ऑगमेंटेड जनरेशन में रिट्रीवल चुनौतियों का मूल्यांकन और निदान करने के लिए डिज़ाइन किया गया है, ताकि यह प्रदर्शित किया जा सके कि रिट्रीवल की गुणवत्ता समग्र सिस्टम प्रदर्शन का एक महत्वपूर्ण निर्धारक है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं। आपके पास एक प्रतिभाशाली जासूस (एक लार्ज लैंग्वेज मॉडल) है जो बहुत सारे सामान्य तथ्यों को जानता है, लेकिन कभी-कभी उन्हें मामला सुलझाने के लिए विशिष्ट, अद्यतित सुरागों की आवश्यकता होती है।
अतीत में, यदि जासूस को किसी सुराग की आवश्यकता होती थी, तो वे कागजों, तस्वीरों और नोट्स के एक विशाल, अव्यवस्थित ढेर (अनस्ट्रक्चर्ड कॉर्पस) में खोज करते थे। कभी-कभी उन्हें सही सुराग मिल जाता था, लेकिन अक्सर वे अप्रासंगिक कचरे से विचलित हो जाते थे या किसी तस्वीर को उसके टेक्स्ट विवरण से जोड़ने में असमर्थ होते थे।
इसे ठीक करने के लिए, शोधकर्ताओं ने नॉलेज ग्राफ (Knowledge Graphs) बनाना शुरू किया। इसे एक विशाल, व्यवस्थित फाइलिंग कैबिनेट के रूप में समझें जहाँ सूचना का हर हिस्सा स्पष्ट, तार्किक धागों द्वारा एक दूसरे से जुड़ा होता है। यदि आप एक धागे को खींचते हैं, तो आपको संबंधित तथ्य मिल जाते हैं। यह एक बिखरे हुए ढेर की तुलना में बहुत बेहतर है।
लेकिन समस्या यह है: वास्तविक जीवन केवल टेक्स्ट नहीं है। यह तस्वीरें, चार्ट, मेडिकल स्कैन और आरेख (diagrams) भी हैं। मौजूदा "फाइलिंग कैबिनेट" ज्यादातर केवल टेक्स्ट ही रख पाते हैं। जब आप पुराने सिस्टम में टेक्स्ट विवरण का उपयोग करके किसी तस्वीर को खोजने की कोशिश करते हैं (या इसके विपरीत), तो सर्च इंजन भ्रमित हो जाता है। यह एक लाइब्रेरी में "एक लाल फल" के लिए पूछने जैसा है, लेकिन लाइब्रेरियन केवल शब्द "सेब" को समझता है और रंग या इस तथ्य को अनदेखा कर देता है कि वह एक तस्वीर है।
पेश है: MKG-RAG-Bench
इस पेपर के लेखक कहते हैं, "हमें एक बेहतर तरीका चाहिए जिससे हम यह परीक्षण कर सकें कि क्या हमारे सर्च इंजन इन मिश्रित-मीडिया फाइलिंग कैबिनेट में वास्तव में सही सुराग ढूंढ सकते हैं।"
उन्होंने एक नया टेस्ट ट्रैक बनाया जिसे MKG-RAG-Bench कहा जाता है।
1. दो टेस्ट ट्रैक
उन्होंने अपने सर्च इंजन का परीक्षण करने के लिए दो विशिष्ट "प्रशिक्षण मैदान" बनाए:
- जनरल ट्रैक (MarKG): एक सामान्य विश्वकोश की तरह जिसमें एफिल टॉवर से लेकर बल्ब कैसे काम करता है, तक सब कुछ शामिल है, जिसमें टेक्स्ट और चित्र मिश्रित हैं।
- मेडिकल ट्रैक (MedMKG): एक विशेष अस्पताल फाइलिंग सिस्टम जिसमें रोगी के रिकॉर्ड, मेडिकल डायग्राम और बीमारियों के टेक्स्ट विवरण शामिल हैं।
2. "जाल" (हमें एक नए परीक्षण की आवश्यकता क्यों है)
लेखकों ने देखा कि यदि आप बस एक मौजूदा फाइलिंग कैबिनेट लेते हैं और एक जासूस को उसका उपयोग करके रहस्य सुलझाने के लिए कहते हैं, तो जासूस अक्सर विफल हो जाता है। क्यों?
- सुरागों की कमी: रहस्य सुलझाने के लिए आवश्यक विशिष्ट तथ्य कैबिनेट में मौजूद ही नहीं हो सकता है।
- शोर (Noise): कैबिनेट बेकार तथ्यों से भरा हो सकता है जो जासूस को विचलित करते हैं।
इसे ठीक करने के लिए, उन्होंने केवल मौजूदा डेटा का उपयोग नहीं किया। उन्होंने पूर्ण प्रश्न बनाने के लिए एक विशेष निर्माण पाइपलाइन (एक फैक्ट्री की तरह) बनाई:
- चरण 1 (फ़िल्टरिंग): उन्होंने एक AI का उपयोग करके "बोरिंग" तथ्यों (जैसे "सूर्य एक तारा है") को हटा दिया जिन्हें खोजने के लिए सर्च इंजन की आवश्यकता नहीं है। उन्होंने केवल उन "उच्च-उपयोगिता" वाले तथ्यों को रखा जिन्हें खोजना अनिवार्य है।
- चरण 2 (मास्क): उन्होंने एक पूर्ण तथ्य लिया (जैसे, "पेनिसिलिन बैक्टीरिया के संक्रमण का इलाज करती है") और उसके एक हिस्से को ढक दिया (जैसे, "पेनिसिलिन [MASK] का इलाज करती है")।
- चरण 3 (प्रश्न): उन्होंने उस मास्क किए गए तथ्य को एक स्वाभाविक प्रश्न में बदल दिया।
- टेक्स्ट संस्करण: "पेनिसिलिन किसका इलाज करती है?"
- इमेज संस्करण: उन्होंने एफिल टॉवर की एक तस्वीर दिखाई और पूछा, "इस तस्वीर में स्थित लैंडमार्क कहाँ स्थित है?"
यह सुनिश्चित करता है कि प्रत्येक प्रश्न के लिए, फाइलिंग कैबिनेट में एक विशिष्ट, सही उत्तर छिपा हुआ है, और इसे पाने का एकमात्र तरीका ग्राफ में सही "धागे" को खोजना है।
3. दौड़ (प्रयोग)
उन्होंने यह देखने के लिए कि कौन सा "सर्च इंजन" (रिट्रीवर) छिपे हुए सुराग को सबसे तेज़ी से और सबसे सटीक रूप से ढूंढ सकता है, अलग-अलग प्रकार के "खोजकर्ताओं" को इस ट्रैक पर उतारा। उन्होंने चार प्रकार के खोजकर्ताओं का परीक्षण किया:
- टेक्स्ट-ओनली सर्चर: तस्वीरों को अनदेखा करता है, केवल शब्दों को पढ़ता है।
- कैप्शनर: एक तस्वीर लेता है, उसका विवरण लिखता है, और फिर उस विवरण का उपयोग करके खोज करता है।
- फ्यूजन सर्चर: चित्र और टेक्स्ट को एक साथ समझने की कोशिश करता है, उन्हें आपस में मिला देता है।
- रीरैंकर (Reranker): पहले एक त्वरित, मोटा सर्च करता है, फिर सबसे अच्छे परिणाम को चुनने के लिए एक धीमा, सावधानीपूर्वक दूसरा लुक देता है।
4. परिणाम
पेपर में कुछ आश्चर्यजनक बातें सामने आईं:
- यह कठिन है: यहाँ तक कि सर्वश्रेष्ठ सर्च इंजन भी "मिश्रित-मीडिया" सुराग ढूंढने में संघर्ष करते हैं। यह केवल टेक्स्ट खोजने की तुलना में बहुत अधिक कठिन है।
- "फ्यूजन" सर्चर जीतता है (ज्यादातर): वे खोजकर्ता जो टेक्स्ट और इमेज दोनों को एक साथ समझ सकते हैं, वे उन लोगों की तुलना में बेहतर प्रदर्शन करते हैं जो केवल चित्रों को टेक्स्ट में बदलते हैं।
- कचरा अंदर, कचरा बाहर (Garbage In, Garbage Out): यदि सर्च इंजन गलत सुराग चुनता है (भले ही वह एक तस्वीर हो), तो जासूस (AI) गलत उत्तर देता है। खोज की गुणवत्ता सीधे तौर पर अंतिम उत्तर की गुणवत्ता को निर्धारित करती है।
- "नो सर्च" सरप्राइज: उनके मेडिकल परीक्षणों में, उन्होंने पाया कि कभी-कभी, बिखरे हुए मेडिकल कैबिनेट को खोजने के बजाय केवल जासूस को अनुमान लगाने देना वास्तव में बेहतर था। इससे यह साबित हुआ कि पुराने कैबिनेट शोर से भरे थे जिसने जासूस को भ्रमित कर दिया था।
मुख्य निष्कर्ष
यह पेपर कोई नया चिकित्सा उपचार या पुल बनाने का नया तरीका खोजने के बारे में नहीं है। यह एक बेहतर रूलर (मापने का पैमाना) बनाने के बारे में है।
उन्होंने महसूस किया कि किसी के पास यह मापने का कोई अच्छा तरीका नहीं था कि AI सिस्टम एक संगठित डेटाबेस में टेक्स्ट और छवियों के मिश्रण को प्रभावी ढंग से खोज सकते हैं या नहीं। उन्होंने MKG-RAG-Bench को वह रूलर बनाने के लिए बनाया। अब, शोधकर्ता इस रूलर का उपयोग यह देखने के लिए कर सकते हैं कि उनके सर्च इंजन कहाँ विफल हो रहे हैं और उन्हें कैसे ठीक किया जाए, जिससे यह सुनिश्चित हो सके कि भविष्य के AI सिस्टम चित्रों और शब्दों की दुनिया में सही सुराग वास्तव में ढूंढ सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।