← नवीनतम पेपर
💬 NLP

MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation

MiRAGE एक मल्टी-एजेंट फ्रेमवर्क है जो उच्च-जोखिम वाले एंटरप्राइज अनुप्रयोगों में रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम के मूल्यांकन के लिए विशिष्ट बेंचमार्क की कमी को दूर करने हेतु सत्यापित, डोमेन-विशिष्ट, मल्टीमॉडल और मल्टी-हॉप प्रश्न-उत्तर डेटासेट उत्पन्न करता है।

मूल लेखक: Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

प्रकाशित 2026-01-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े नादान रोबोट को एक परमाणु ऊर्जा संयंत्र (न्यूक्लियर पावर प्लांट) के जटिल मैनुअल को पढ़ना सिखाने की कोशिश कर रहे हैं। वह मैनुअल केवल शब्दों से नहीं बना है; वह चार्ट्स, 3D आरेख (डायग्राम्स) और तालिकाओं (टेबल्स) से भी भरा है। यदि आप रोबोट से केवल सरल प्रश्न पूछते हैं जैसे "दबाव (प्रेशर) क्या है?", तो वह अनुमान लगा सकता है या मनगढ़ंत बातें बना सकता है क्योंकि उसने पेज 10 के एक चित्र को पेज 50 के एक वाक्य से जोड़ना नहीं सीखा है।

यही वह समस्या है जिसे MiRAGE हल करता है।

समस्या: "एक-चरणीय" (One-Step) रोबोट

वर्तमान AI सिस्टम (जिन्हें RAG या रिट्रीवल-ऑगमेंटेड जनरेशन कहा जाता है) उन छात्रों की तरह हैं जो किसी सवाल का जवाब देने के लिए किताब में से एक अकेला वाक्य खोजने में माहिर होते हैं। लेकिन वास्तविक दुनिया में—जैसे वित्त (फाइनेंस), चिकित्सा या इंजीनियरिंग में—उत्तर शायद ही कभी एक ही स्थान पर मिलते हैं। आपको सही उत्तर पाने के लिए एक ग्राफ को देखना, एक नियम को पढ़ना और एक तालिका की जांच करना पड़ सकता है।

इन AI सिस्टमों के लिए मौजूदा परीक्षण बहुत आसान हैं। वे सामान्य समाचार या विकिपीडिया से सरल प्रश्नों का उपयोग करते हैं। वे यह परीक्षण नहीं करते कि क्या AI वास्तविक कॉर्पोरेट दस्तावेजों में पाए जाने वाले जटिल, बहु-चित्र, बहु-चरणीय पहेलियों को संभाल सकता है।

समाधान: विशेषज्ञ विशेषज्ञों की एक टीम (MiRAGE)

लेखकों ने MiRAGE बनाया है, जिसका अर्थ है Multiagent framework for RAG Evaluation। एक अकेले AI से सब कुछ करने के बजाय, MiRAGE एक निर्माण दल (कंस्ट्रक्शन क्रू) या एक न्यूज़रूम की तरह काम करता है जहाँ विभिन्न विशेषज्ञ मिलकर एक सटीक परीक्षण तैयार करते हैं।

यहाँ उनके "स्वार्म" (झुंड) के AI एजेंट कैसे काम करते हैं, इसे एक सरल उपमा (एनालॉजी) से समझें:

  1. लाइब्रेरियन (डेटा इनजेशन):
    कल्पना कीजिए कि एक अव्यवस्थित पुस्तकालय है जहाँ किताबें ब्लूप्रिंट और चार्ट्स के साथ मिली हुई हैं। लाइब्रेरियन एजेंट केवल टेक्स्ट को स्कैन नहीं करता; वह चित्रों और तालिकाओं को देखता है, उन्हें शब्दों में वर्णित करता है, और सब कुछ व्यवस्थित और तार्किक ढेरों में व्यवस्थित करता है। वह यह सुनिश्चित करता है कि एक चार्ट और उसके कैप्शन के बीच का संबंध कहीं खो न जाए।

  2. डिटेक्टिव (कॉन्टेक्स्ट बिल्डिंग):
    यह एजेंट "मल्टी-हॉप" मास्टर है। यदि आप कोई प्रश्न पूछते हैं, तो डिटेक्टिव केवल वह पहला पेज नहीं उठाता जो प्रासंगिक दिखता है। वह एक सुराग से शुरू करता है, महसूस करता है कि जानकारी अधूरी है, और अधिक सुरागों की तलाश में निकल पड़ता है। वह तब तक खुदाई करता रहता है जब तक कि वह पहेली को सुलझाने के लिए आवश्यक सभी बिखरे हुए सबूत एकत्र नहीं कर लेता। वह एक "सिमेंटिक कॉन्टेक्स्ट विंडो" बनाता है, जो बस एक फैंसी तरीका है यह कहने का कि वह उत्तर देने से पहले पूरी कहानी को संकलित करता है।

  3. एक्सपर्ट (पर्सोना इंजेक्शन):
    सिस्टम जानता है कि वह वित्त या जीव विज्ञान जैसे किसी विशिष्ट क्षेत्र से निपट रहा है। वह उस क्षेत्र के एक वरिष्ठ विशेषज्ञ की "टोपी" (पर्सोना) पहन लेता है। यह सुनिश्चित करता है कि इसके द्वारा उत्पन्न किए गए प्रश्न ऐसे लगें जैसे वे किसी वास्तविक पेशेवर द्वारा पूछे गए हों, न कि किसी सामान्य रोबोट द्वारा। यह गहरे, निगमनात्मक (डिडक्टिव) प्रश्न पूछता है जिनके लिए वास्तविक समझ की आवश्यकता होती है।

  4. फैक्ट-चेकर (एडवर्सरियल वेरीफायर):
    यह सबसे महत्वपूर्ण हिस्सा है। एक बार जब टीम एक प्रश्न और एक उत्तर तैयार कर लेती है, तो फैक्ट-चेकर हस्तक्षेप करता है। यह एक संदेही संपादक की तरह कार्य करता है। यह उत्तर को देखता है और कहता है, "रुको, क्या दस्तावेज़ वास्तव में यह कहता है?" यदि AI ने कोई संख्या बना ली या दो असंबंधित तथ्यों को जोड़ दिया, तो फैक्ट-चेकर उस उत्तर को कचरे में डाल देता है। यह "हैलुसिनेशन" (मनगढ़ंत बातें बनाना) को रोकता है।

  5. एडिटर (रिफाइनमेंट):
    अंत में, एक एडिटर एजेंट सभी उत्पन्न प्रश्नों को देखता है ताकि वे सभी एक जैसे न हों। वह डुप्लिकेट को हटाता है और यह सुनिश्चित करता है कि अंतिम परीक्षण विषयों की एक विस्तृत श्रृंखला को कवर करता है, ठीक वैसे ही जैसे एक वास्तविक परीक्षा करती है।

उन्होंने क्या पाया

टीम ने इस फ्रेमवर्क का परीक्षण चार बहुत अलग प्रकार के दस्तावेजों पर किया:

  • वित्त (Finance): जटिल तालिकाओं से भरी वार्षिक रिपोर्ट।
  • नियम (Regulations): भारी तर्क के साथ सख्त सरकारी नियम।
  • विज्ञान (Science): 3D आणविक मॉडल वाले जीव विज्ञान के शोध पत्र।
  • पत्रकारिता (Journalism): समाचार पत्रों के ओपिनियन पीस।

परिणाम:

  • कठिन प्रश्न: MiRAGE द्वारा बनाए गए प्रश्न काफी कठिन थे। औसतन, उन्हें हल करने के लिए जानकारी के 2.3 से अधिक अलग-अलग हिस्सों (हॉप्स) को जोड़ने की आवश्यकता थी, जबकि मानक परीक्षणों में आमतौर पर केवल 1 की आवश्यकता होती है।
  • सत्यनिष्ठ उत्तर: फैक्ट-चेकर के कारण, उत्तर अत्यधिक सटीक और वास्तविक दस्तावेजों पर आधारित थे।
  • विजुअल गैप (दृश्य अंतराल): सिस्टम टेक्स्ट के लिए बहुत अच्छा है, लेकिन यह शुद्ध दृश्य तर्क (विजुअल रीजनिंग) के साथ थोड़ा संघर्ष करता है। लेखकों ने पाया कि यदि वे AI को किसी छवि का टेक्स्ट विवरण देते हैं, तो यह अच्छी तरह से काम करता है। लेकिन यदि AI को बिना विवरण के सीधे छवि को "देखना" पड़ता है, तो वह कभी-कभी भ्रमित हो जाता है। वे इसे एक "फ्रंटियर" कहते हैं जिस पर अभी भी काम करने की आवश्यकता है।

निचोड़ (The Bottom Line)

MiRAGE AI सिस्टम के लिए "गोल्ड स्टैंडर्ड" परीक्षा स्वचालित रूप से बनाने का एक उपकरण है। आसान, सामान्य प्रश्नों के बजाय, यह कंपनी के अपने अस्त-व्यस्त दस्तावेजों के आधार पर कठिन, यथार्थवादी परीक्षण बनाता है। यह कंपनियों को यह जानने में मदद करता है कि क्या उनका AI वास्तव में उच्च-दांव वाले कार्यों को संभालने के लिए पर्याप्त स्मार्ट है, या वह केवल अनुमान लगा रहा है।

संक्षेप में: MiRAGE AI विशेषज्ञों की एक टीम है जो एक कठिन, बहु-चरणीय पहेली बनाती है, उसे हल करती है, काम की जाँच करती है, और फिर उस पहेली का उपयोग यह परीक्षण करने के लिए करती है कि क्या अन्य AI वास्तव में वास्तविक दुनिया के लिए तैयार हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →