← नवीनतम पेपर
💬 NLP

MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval

यह शोध पत्र MCERF को प्रस्तुत करता है, जो एक मल्टीमॉडल रिट्रीवल और रीजनिंग फ्रेमवर्क है जो जटिल टेक्स्ट, तालिकाओं और छवियों वाली इंजीनियरिंग दस्तावेज़ों पर प्रश्न-उत्तर की सटीकता में महत्वपूर्ण सुधार करने के लिए ColPali मॉडल और एडेप्टिव रूटिंग रणनीतियों का लाभ उठाता है, जिससे बेसलाइन RAG सिस्टम की तुलना में 41.1% की सापेक्ष वृद्धि प्राप्त होती है।

मूल लेखक: Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

प्रकाशित 2026-04-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मैकेनिक हैं जो एक बहुत ही जटिल, कस्टम-निर्मित रेस कार को ठीक करने की कोशिश कर रहे हैं। आपके पास एक विशाल, 140 पन्नों की नियम पुस्तिका (rulebook) है जो आपको बताती है कि कार को बिल्कुल कैसे बनाया जाना चाहिए। यह नियम पुस्तिका केवल टेक्स्ट नहीं है; यह आरेख (diagrams), चार्ट, टेबल और तस्वीरों से भरी हुई है।

समस्या क्या है? आप इस नियम पुस्तिका में नियमों को खोजने और यह जांचने के लिए एक सुपर-स्मार्ट AI असिस्टेंट का उपयोग करने की कोशिश कर रहे हैं कि क्या आपकी कार कानूनी रूप से सही (legal) है। लेकिन AI संघर्ष कर रहा है। यह ऐसा है जैसे आंखों पर पट्टी बांधकर घास के ढेर में एक विशिष्ट सुई को खोजने की कोशिश करना, जो केवल टेक्स्ट तो पढ़ सकती है लेकिन चित्रों को अनदेखा कर देती है।

यह पेपर इस समस्या को हल करने के लिए MCERF (Multimodal ColPali Enhanced Retrieval and Reasoning Framework) नामक एक नया, अधिक स्मार्ट सिस्टम पेश करता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. पुराना तरीका: "अंधा खोज" (The "Blind Search")

पहले, जब इंजीनियर AI से कोई सवाल पूछते थे, तो सिस्टम टेक्स्ट पढ़कर उत्तर खोजने की कोशिश करता था।

  • उपमा (Analogy): कल्पना कीजिए कि आप "पहियों" (wheels) के बारे में एक नियम ढूंढ रहे हैं। पुराना सिस्टम "wheel" शब्द को टेक्स्ट में खोजेगा। लेकिन क्या होगा यदि वह नियम वास्तव में एक पहिये को दिखाने वाले डायग्राम के अंदर हो, या पहियों के आकार को सूचीबद्ध करने वाली एक टेबल में हो? पुराना सिस्टम इसे पूरी तरह से मिस कर देगा क्योंकि वह चित्रों के प्रति "अंधा" था।
  • परिणाम: AI अक्सर गलत अनुमान लगाता था या कहता था, "मुझे नहीं पता," क्योंकि वह पूरी तस्वीर नहीं देख पाता था।

2. नया तरीका: MCERF (द "सुपर-स्लीथ")

लेखकों ने एक नया सिस्टम बनाया है जो एक ऐसे जासूस की तरह काम करता है जो पढ़ भी सकता है और देख भी सकता है। वे इसे MCERF कहते हैं।

A. "पैचवर्क" आंखें (ColPali)

केवल टेक्स्ट पढ़ने के बजाय, MCERF नियम पुस्तिका के हर पन्ने को एक विशाल पहेली की तरह मानता है। यह पन्ने को छोटे-छोटे चौकोर टुकड़ों (patches) में तोड़ देता है।

  • उपमा: कल्पना कीजिए कि नियम पुस्तिका एक विशाल भित्ति चित्र (mural) है। पुराने AI ने उस भित्ति चित्र को दूर से पढ़ने की कोशिश की। MCERF ज़ूम इन करता है और हर एक ईंट और टाइल को देखता है। यह समझता है कि "tighten" शब्द के बगल में एक बोल्ट की तस्वीर उतनी ही महत्वपूर्ण है जितना कि स्वयं "tighten" शब्द।
  • यह कैसे मदद करता है: यह उन नियमों को ढूंढ सकता है जो चार्ट, डायग्राम और फोटो के अंदर छिपे होते हैं जिन्हें केवल टेक्स्ट-आधारित सर्च इंजन मिस कर देते हैं।

B. "विशेषज्ञ टीम" (Routing)

MCERF हर सवाल का जवाब देने के लिए केवल एक दिमाग का उपयोग नहीं करता है। इसमें एक Router (एक ट्रैफिक पुलिस की तरह) है जो सवाल को देखता है और उसे सबसे उपयुक्त विशेषज्ञ के पास भेज देता है।

  • उपमा: कल्पना कीजिए कि एक अस्पताल का इमरजेंसी रूम है।
    • यदि आपकी हड्डी टूट गई है, तो Router आपको ऑर्थोपेडिक स्पेशलिस्ट (High Reasoning mode) के पास भेजता है।
    • यदि आपके पास एक साधारण टेक्स्ट वाला सवाल है, तो वह आपको लाइब्रेरियन (Hybrid Lookup mode) के पास भेजता है।
    • यदि आपके पास एक जटिल चार्ट है, तो वह आपको डेटा एनालिस्ट (Vision-to-Text mode) के पास भेजता है।
  • परिणाम: सिस्टम एक अखरोट तोड़ने के लिए हथौड़े का उपयोग करके समय बर्बाद नहीं करता है। यह काम के लिए सही उपकरण चुनता है।

C. "दोबारा जांचना" (Self-Consistency)

बहुत कठिन सवालों के लिए, सिस्टम केवल एक बार AI से नहीं पूछता। यह एक ही सवाल पांच बार पूछता है, पांच अलग-अलग उत्तर प्राप्त करता है, और फिर एक "जज" से सबसे अच्छा उत्तर चुनने के लिए कहता है।

  • उपमा: यह सलाह के लिए पांच अलग-अलग विशेषज्ञों से पूछने जैसा है, और फिर एक सीनियर मैनेजर द्वारा सभी पांचों मतों की समीक्षा करने जैसा है ताकि यह सुनिश्चित किया जा सके कि अंतिम उत्तर ठोस है। यह AI को "हैलुसिनेट" करने (मनगढ़ंत बातें बनाने) से रोकता है।

3. परिणाम: एक बड़ी जीत

जब उन्होंने इस नए सिस्टम का परीक्षण "Formula SAE" (एक छात्र रेस कार प्रतियोगिता) की नियम पुस्तिका पर किया:

  • पुराना सिस्टम: लगभग 56% उत्तर सही दे पाया।
  • नया सिस्टम (MCERF): लगभग 79% उत्तर सही दे पाया।
  • बड़ी बात: नया सिस्टम उस स्थिति से भी बेहतर था जब AI को एक साथ पूरी 140 पन्नों की किताब पढ़ने के लिए दिया जाता है (जो आमतौर पर "गोल्ड स्टैंडर्ड" माना जाता है)। इसने साबित कर दिया कि आपको AI को पूरी लाइब्रेरी खिलाने की आवश्यकता नहीं है यदि आप उसे सही पन्ने और सही चित्र दे दें।

सारांश

MCERF को एक ऐसे लाइब्रेरियन से अपग्रेड के रूप में देखें जो केवल टेक्स्ट पढ़ सकता है, एक ऐसे मल्टीमीडिया विशेषज्ञ के रूप में जो टेक्स्ट पढ़ सकता है, डायग्राम की व्याख्या कर सकता है, चार्ट का विश्लेषण कर सकता है और यह जानता है कि मदद के लिए सही विशेषज्ञ को कैसे बुलाया जाए।

यह इंजीनियरिंग को सुरक्षित और तेज़ बनाता है क्योंकि इंजीनियर अंततः अपने AI असिस्टेंट से पूछ सकते हैं, "क्या यह डिज़ाइन नियमों का पालन करता है?" और एक विश्वसनीय उत्तर प्राप्त कर सकते हैं जो वास्तव में केवल शब्दों को नहीं, बल्कि चित्रों को भी देखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →