MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation
MiRAGE एक मल्टी-एजेंट फ्रेमवर्क है जो उच्च-जोखिम वाले एंटरप्राइज अनुप्रयोगों में रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम के मूल्यांकन के लिए विशिष्ट बेंचमार्क की कमी को दूर करने हेतु सत्यापित, डोमेन-विशिष्ट, मल्टीमॉडल और मल्टी-हॉप प्रश्न-उत्तर डेटासेट उत्पन्न करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े नादान रोबोट को एक परमाणु ऊर्जा संयंत्र (न्यूक्लियर पावर प्लांट) के जटिल मैनुअल को पढ़ना सिखाने की कोशिश कर रहे हैं। वह मैनुअल केवल शब्दों से नहीं बना है; वह चार्ट्स, 3D आरेख (डायग्राम्स) और तालिकाओं (टेबल्स) से भी भरा है। यदि आप रोबोट से केवल सरल प्रश्न पूछते हैं जैसे "दबाव (प्रेशर) क्या है?", तो वह अनुमान लगा सकता है या मनगढ़ंत बातें बना सकता है क्योंकि उसने पेज 10 के एक चित्र को पेज 50 के एक वाक्य से जोड़ना नहीं सीखा है।
यही वह समस्या है जिसे MiRAGE हल करता है।
समस्या: "एक-चरणीय" (One-Step) रोबोट
वर्तमान AI सिस्टम (जिन्हें RAG या रिट्रीवल-ऑगमेंटेड जनरेशन कहा जाता है) उन छात्रों की तरह हैं जो किसी सवाल का जवाब देने के लिए किताब में से एक अकेला वाक्य खोजने में माहिर होते हैं। लेकिन वास्तविक दुनिया में—जैसे वित्त (फाइनेंस), चिकित्सा या इंजीनियरिंग में—उत्तर शायद ही कभी एक ही स्थान पर मिलते हैं। आपको सही उत्तर पाने के लिए एक ग्राफ को देखना, एक नियम को पढ़ना और एक तालिका की जांच करना पड़ सकता है।
इन AI सिस्टमों के लिए मौजूदा परीक्षण बहुत आसान हैं। वे सामान्य समाचार या विकिपीडिया से सरल प्रश्नों का उपयोग करते हैं। वे यह परीक्षण नहीं करते कि क्या AI वास्तविक कॉर्पोरेट दस्तावेजों में पाए जाने वाले जटिल, बहु-चित्र, बहु-चरणीय पहेलियों को संभाल सकता है।
समाधान: विशेषज्ञ विशेषज्ञों की एक टीम (MiRAGE)
लेखकों ने MiRAGE बनाया है, जिसका अर्थ है Multiagent framework for RAG Evaluation। एक अकेले AI से सब कुछ करने के बजाय, MiRAGE एक निर्माण दल (कंस्ट्रक्शन क्रू) या एक न्यूज़रूम की तरह काम करता है जहाँ विभिन्न विशेषज्ञ मिलकर एक सटीक परीक्षण तैयार करते हैं।
यहाँ उनके "स्वार्म" (झुंड) के AI एजेंट कैसे काम करते हैं, इसे एक सरल उपमा (एनालॉजी) से समझें:
लाइब्रेरियन (डेटा इनजेशन):
कल्पना कीजिए कि एक अव्यवस्थित पुस्तकालय है जहाँ किताबें ब्लूप्रिंट और चार्ट्स के साथ मिली हुई हैं। लाइब्रेरियन एजेंट केवल टेक्स्ट को स्कैन नहीं करता; वह चित्रों और तालिकाओं को देखता है, उन्हें शब्दों में वर्णित करता है, और सब कुछ व्यवस्थित और तार्किक ढेरों में व्यवस्थित करता है। वह यह सुनिश्चित करता है कि एक चार्ट और उसके कैप्शन के बीच का संबंध कहीं खो न जाए।डिटेक्टिव (कॉन्टेक्स्ट बिल्डिंग):
यह एजेंट "मल्टी-हॉप" मास्टर है। यदि आप कोई प्रश्न पूछते हैं, तो डिटेक्टिव केवल वह पहला पेज नहीं उठाता जो प्रासंगिक दिखता है। वह एक सुराग से शुरू करता है, महसूस करता है कि जानकारी अधूरी है, और अधिक सुरागों की तलाश में निकल पड़ता है। वह तब तक खुदाई करता रहता है जब तक कि वह पहेली को सुलझाने के लिए आवश्यक सभी बिखरे हुए सबूत एकत्र नहीं कर लेता। वह एक "सिमेंटिक कॉन्टेक्स्ट विंडो" बनाता है, जो बस एक फैंसी तरीका है यह कहने का कि वह उत्तर देने से पहले पूरी कहानी को संकलित करता है।एक्सपर्ट (पर्सोना इंजेक्शन):
सिस्टम जानता है कि वह वित्त या जीव विज्ञान जैसे किसी विशिष्ट क्षेत्र से निपट रहा है। वह उस क्षेत्र के एक वरिष्ठ विशेषज्ञ की "टोपी" (पर्सोना) पहन लेता है। यह सुनिश्चित करता है कि इसके द्वारा उत्पन्न किए गए प्रश्न ऐसे लगें जैसे वे किसी वास्तविक पेशेवर द्वारा पूछे गए हों, न कि किसी सामान्य रोबोट द्वारा। यह गहरे, निगमनात्मक (डिडक्टिव) प्रश्न पूछता है जिनके लिए वास्तविक समझ की आवश्यकता होती है।फैक्ट-चेकर (एडवर्सरियल वेरीफायर):
यह सबसे महत्वपूर्ण हिस्सा है। एक बार जब टीम एक प्रश्न और एक उत्तर तैयार कर लेती है, तो फैक्ट-चेकर हस्तक्षेप करता है। यह एक संदेही संपादक की तरह कार्य करता है। यह उत्तर को देखता है और कहता है, "रुको, क्या दस्तावेज़ वास्तव में यह कहता है?" यदि AI ने कोई संख्या बना ली या दो असंबंधित तथ्यों को जोड़ दिया, तो फैक्ट-चेकर उस उत्तर को कचरे में डाल देता है। यह "हैलुसिनेशन" (मनगढ़ंत बातें बनाना) को रोकता है।एडिटर (रिफाइनमेंट):
अंत में, एक एडिटर एजेंट सभी उत्पन्न प्रश्नों को देखता है ताकि वे सभी एक जैसे न हों। वह डुप्लिकेट को हटाता है और यह सुनिश्चित करता है कि अंतिम परीक्षण विषयों की एक विस्तृत श्रृंखला को कवर करता है, ठीक वैसे ही जैसे एक वास्तविक परीक्षा करती है।
उन्होंने क्या पाया
टीम ने इस फ्रेमवर्क का परीक्षण चार बहुत अलग प्रकार के दस्तावेजों पर किया:
- वित्त (Finance): जटिल तालिकाओं से भरी वार्षिक रिपोर्ट।
- नियम (Regulations): भारी तर्क के साथ सख्त सरकारी नियम।
- विज्ञान (Science): 3D आणविक मॉडल वाले जीव विज्ञान के शोध पत्र।
- पत्रकारिता (Journalism): समाचार पत्रों के ओपिनियन पीस।
परिणाम:
- कठिन प्रश्न: MiRAGE द्वारा बनाए गए प्रश्न काफी कठिन थे। औसतन, उन्हें हल करने के लिए जानकारी के 2.3 से अधिक अलग-अलग हिस्सों (हॉप्स) को जोड़ने की आवश्यकता थी, जबकि मानक परीक्षणों में आमतौर पर केवल 1 की आवश्यकता होती है।
- सत्यनिष्ठ उत्तर: फैक्ट-चेकर के कारण, उत्तर अत्यधिक सटीक और वास्तविक दस्तावेजों पर आधारित थे।
- विजुअल गैप (दृश्य अंतराल): सिस्टम टेक्स्ट के लिए बहुत अच्छा है, लेकिन यह शुद्ध दृश्य तर्क (विजुअल रीजनिंग) के साथ थोड़ा संघर्ष करता है। लेखकों ने पाया कि यदि वे AI को किसी छवि का टेक्स्ट विवरण देते हैं, तो यह अच्छी तरह से काम करता है। लेकिन यदि AI को बिना विवरण के सीधे छवि को "देखना" पड़ता है, तो वह कभी-कभी भ्रमित हो जाता है। वे इसे एक "फ्रंटियर" कहते हैं जिस पर अभी भी काम करने की आवश्यकता है।
निचोड़ (The Bottom Line)
MiRAGE AI सिस्टम के लिए "गोल्ड स्टैंडर्ड" परीक्षा स्वचालित रूप से बनाने का एक उपकरण है। आसान, सामान्य प्रश्नों के बजाय, यह कंपनी के अपने अस्त-व्यस्त दस्तावेजों के आधार पर कठिन, यथार्थवादी परीक्षण बनाता है। यह कंपनियों को यह जानने में मदद करता है कि क्या उनका AI वास्तव में उच्च-दांव वाले कार्यों को संभालने के लिए पर्याप्त स्मार्ट है, या वह केवल अनुमान लगा रहा है।
संक्षेप में: MiRAGE AI विशेषज्ञों की एक टीम है जो एक कठिन, बहु-चरणीय पहेली बनाती है, उसे हल करती है, काम की जाँच करती है, और फिर उस पहेली का उपयोग यह परीक्षण करने के लिए करती है कि क्या अन्य AI वास्तव में वास्तविक दुनिया के लिए तैयार हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।