← नवीनतम पेपर
💻 computer science

ManuRAG: Multi-modal Retrieval Augmented Generation for Manufacturing Question Answering (Early Version)

यह शोधपत्र ManuRAG को प्रस्तुत करता है, जो एक अभिनव मल्टी-मोडल रिट्रीवल ऑगमेंटेड जनरेशन (Retrieval Augmented Generation) फ्रेमवर्क है जिसे विशेष रूप से विनिर्माण प्रश्न-उत्तर (manufacturing question answering) के लिए डिज़ाइन किया गया है, जो कई बेंचमार्क डेटासेट में सटीकता, विश्वसनीयता और व्याख्यात्मकता में मौजूदा विधियों से बेहतर प्रदर्शन करने के लिए विविध प्रकार के डेटा को एकीकृत करता है।

मूल लेखक: Yunqing Li, Zihan Dong, Farhad Ameri, Jianbang Zhang

प्रकाशित 2026-01-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunqing Li, Zihan Dong, Farhad Ameri, Jianbang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ManuRAG पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं के माध्यम से समझाया गया है।

बड़ी समस्या: "स्विस आर्मी नाइफ" बनाम "विशेषज्ञ टूलबॉक्स"

कल्पना कीजिए कि आप एक जटिल मशीन को ठीक करने की कोशिश कर रहे हैं एक मास्टर मैकेनिक हैं। अपना काम करने के लिए, आपको मैनुअल्स (निर्देश पुस्तिकाओं) के एक विशाल पुस्तकालय की मदद लेनी पड़ती है। लेकिन यहाँ एक पेंच है: ये मैनुअल्स केवल साधारण टेक्स्ट नहीं हैं। वे एक अराजक मिश्रण हैं:

  • पैराग्राफ जो समझाते हैं कि इंजन कैसे काम करता है।
  • ब्लूप्रिंट्स और टूटे हुए हिस्सों की तस्वीरें
  • दबाव (pressure) की गणना करने के लिए गणितीय सूत्र (math formulas)
  • पार्ट नंबरों की सूची देने वाली तालिकाएं (tables)

पुराना तरीका (पारंपरिक RAG):
पारंपरिक AI सहायकों (रिट्रीवल-ऑगमेंटेड जनरेशन, या RAG) को एक ऐसे लाइब्रेरियन के रूप में सोचें जो केवल टेक्स्ट पढ़ सकता है। यदि आप पूछते हैं, "कौन सा हिस्सा टूटा हुआ है?" और उत्तर किसी आरेख (diagram) या गणितीय समीकरण के अंदर छिपा है, तो लाइब्रेरियन उसे अनदेखा कर देता है। वे आपको उस टेक्स्ट के आधार पर एक अस्पष्ट उत्तर दे सकते हैं जिसे वे पढ़ सकते हैं, लेकिन वे महत्वपूर्ण दृश्य संकेतों (visual clues) को छोड़ देते हैं। यह केवल लिखित निर्देशों का उपयोग करके IKEA फर्नीचर जोड़ने की कोशिश करने जैसा है, जबकि चित्रों को पूरी तरह से अनदेखा कर दिया गया हो।

नया तरीका (ManuRally):
इस पेपर के लेखकों ने ManuRAG बनाया है। इसे एक सुपर-इंटेलिजेंट, मल्टी-सेंसरी मैकेनिक के रूप में सोचें। यह सिस्टम केवल टेक्स्ट नहीं पढ़ता; यह आरेखों को "देख" सकता है, गणितीय सूत्रों को "हल" कर सकता है, और तालिकाओं को "पढ़" सकता है। यह इन सभी अलग-अलग प्रारूपों को एक बड़े, जुड़े हुए पहेली (puzzle) की तरह मानता है।


ManuRAG कैसे काम करता है: चार-चरणीय असेंबली लाइन

पेपर में जटिल विनिर्माण दस्तावेजों (manufacturing documents) को स्पष्ट उत्तरों में बदलने के लिए ManuRAG को एक चार-चरणीय प्रक्रिया के रूप में वर्णित किया गया है:

  1. स्कैनर (डेटा एक्सट्रैक्शन):
    एक हाई-टेक स्कैनर की कल्पना करें जो केवल एक पेज की कॉपी नहीं करता। यह एक PDF को देखता है और कहता है, "ठीक है, यह हिस्सा एक गियर की तस्वीर है, यह टॉर्क के लिए एक गणितीय सूत्र है, और यह सामग्रियों की एक सूची है।" यह टेक्स्ट, इमेज और फॉर्मूला को सावधानीपूर्वक अलग करता है ताकि कुछ भी खो न जाए या आपस में न मिल जाए।

  2. फाइलिंग सिस्टम (इंडेक्सिंग):
    एक बार जब स्कैनर टुकड़ों को छाँट लेता है, तो ManuRAG उन्हें एक स्मार्ट फाइलिंग कैबिनेट में रख देता है।

    • यह हर टेक्स्ट पैराग्राफ के लिए एक "डिस्क्रिप्शन कार्ड" लिखता है।
    • यह हर इमेज और फॉर्मूला के लिए एक "डिस्क्रिप्शन कार्ड" लिखता है।
    • महत्वपूर्ण रूप से, यह उन्हें आपस में जोड़ता है। यदि कोई पैराग्राफ "Figure 3" का उल्लेख करता है, तो सिस्टम जानता है कि वह वास्तव में कौन सी इमेज फ़ाइल है, ताकि वे जुड़े रहें।
  3. डिटेक्टिव (रिट्रीवल):
    जब आप कोई प्रश्न पूछते हैं (जैसे, "मैं मॉडल X का सस्पेंशन कैसे ठीक करूँ?"), तो ManuRAG एक जासूस की तरह काम करता है। यह केवल "सस्पेंशन" शब्दों को नहीं खोजता। यह अवधारणा (concept) को खोजता है।

    • यदि उत्तर एक पैराग्राफ में है, तो यह वह टेक्स्ट लेता है।
    • यदि उत्तर एक डायग्राम में है, तो यह इमेज लेता है।
    • यह सबसे प्रासंगिक "साक्ष्य" (टेक्स्ट और इमेज) को मेज पर लाता है।
  4. एक्सपर्ट (आंसर जनरेशन):
    अंत में, सिस्टम इस सभी साक्ष्यों को एक शक्तिशाली AI मस्तिष्क (Large Language Model) को सौंप देता है। AI टेक्स्ट और तस्वीरों दोनों को एक साथ देखता है और एक सटीक, सटीक उत्तर लिखता है।

गुप्त नुस्खा (Secret Sauce): चार अलग-अलग रणनीतियाँ

शोधकर्ताओं ने केवल एक संस्करण नहीं बनाया; उन्होंने यह देखने के लिए कि कौन सी विधि सबसे अच्छा काम करती है, चार संस्करण बनाए। इन्हें अपने टूलबॉक्स को व्यवस्थित करने के चार अलग-अलग तरीकों के रूप में सोचें:

  • ManuRAG1 और 3 (डुअल-ड्रॉअर सिस्टम): ये टेक्स्ट और इमेज को अलग-अलग दराजों में रखते हैं लेकिन उत्तर देते समय दोनों से जानकारी निकालने की कोशिश करते हैं।
  • ManuRAG2 (केवल टेक्स्ट सिस्टम): यह इमेज को पूरी तरह से अनदेखा कर देता है, केवल टेक्स्ट पर निर्भर रहता है। (पेपर में पाया गया कि जटिल विनिर्माण प्रश्नों के लिए यह बहुत अच्छा नहीं था)।
  • ManuRAG4 (द ट्रांसलेटर): यह विजेता है। यह इमेज और फॉर्मूला को लेता है, उन्हें विस्तृत टेक्स्ट विवरण में "अनुवाद" करने के लिए AI का उपयोग करता है, और फिर उन सभी को एक बड़ी टेक्स्ट फ़ाइल में मिला देता है।
    • उपमा: कल्पना कीजिए कि आपके पास एक टूटे हुए इंजन की फोटो है। AI को फोटो दिखाने के बजाय, ManuRAG4 पहले एक स्मार्ट असिस्टेंट से फोटो का अत्यधिक विस्तार से वर्णन करने के लिए कहता है ("पिस्टन ऊपर से फटा हुआ है...")। फिर, यह उस विवरण को मैनुअल टेक्स्ट के साथ मिलाकर AI को फीड करता है। यह सुनिश्चित करता कि AI इमेज की सीमाओं से भ्रमित हुए बिना विजुअल डेटा को पूरी तरह समझ सके।

परिणाम: क्या यह काम कर गया?

टीम ने विनिर्माण (manufacturing) से संबंधित 1,515 प्रश्नों पर अपने सिस्टम का परीक्षण किया, जिसमें गणितीय समस्याओं से लेकर बहुविकल्पीय प्रश्न और निबंध शामिल थे।

  • विजेता: ManuRAG4 ("ट्रांसलेटर" संस्करण) ने बाकी सब को पीछे छोड़ दिया।
  • क्यों? यह गणितीय समस्याओं को हल करने और सही बहुविकल्पीय उत्तर चुनने में सबसे सटीक था।
  • सबक: केवल इमेज होना ही काफी नहीं है। आपको यह सुनिश्चित करना होगा कि AI यह समझ सके कि टेक्स्ट के संदर्भ में उन इमेज का अर्थ क्या है। इमेज को खोजने से पहले उन्हें टेक्स्ट विवरण में बदलकर, ManuRAG4 ने उपलब्ध जानकारी का अधिकतम लाभ उठाया।

इसका क्या अर्थ है (पेपर के अनुसार)

पेपर का दावा है कि ManuRAG विशेष रूप से विनिर्माण (manufacturing) के लिए एक शक्तिशाली नया उपकरण है। यह इंजीनियरों और ऑपरेटरों को टेक्स्ट, चित्रों और गणित को सहजता से जोड़कर सटीक उत्तर प्राप्त करने में मदद करता है।

लेखक यह भी उल्लेख करते हैं कि चूंकि यह सिस्टम जटिल, विशिष्ट डेटा को संभालने में बहुत अच्छा है, इसलिए इसका उपयोग कानून, स्वास्थ्य सेवा और वित्त जैसे अन्य क्षेत्रों में भी किया जा सकता है, जहाँ दस्तावेजों में टेक्स्ट, चार्ट और जटिल डेटा का मिश्रण होता है। हालाँकि, यह पेपर मुख्य रूप से यह सिद्ध करने पर केंद्रित है कि यह विनिर्माण प्रश्नों के लिए काम करता है।

संक्षेप में: ManuRAG आपके AI सहायक को एक चश्मे देने जैसा है जो उसे केवल शब्द पढ़ने के बजाय डायग्राम पढ़ने और गणित की समस्याओं को हल करने की अनुमति देता है, जिससे वह जटिल उद्योगों के लिए एक बहुत अधिक स्मार्ट सहायक बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →