← नवीनतम पेपर
💻 computer science

HVM-GraphRAG: Holistic-View Multimodal Graph Retrieval-Augmented Generation on Complex Document

HVM-GraphRAG एक नवीन समग्र-दृष्टिकोण वाला मल्टीमॉडल GraphRAG फ्रेमवर्क है जो विश्वसनीय अवधारणा-स्तरीय ग्राफ सूचकांकों का निर्माण करके जटिल दस्तावेजों पर प्रश्न-उत्तर क्षमता को बढ़ाता है ताकि विषम साक्ष्यों की कुशल पुनर्प्राप्ति और मोडैलिटी-विशिष्ट पुनर्गठन को सक्षम किया जा सके, जिससे यह सटीकता और दक्षता दोनों में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

मूल लेखक: Xin He, Yili Wang, Wenqi Fan, Qing Li, Qinggang Zhang, Yi Chang, Xin Wang

प्रकाशित 2026-07-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xin He, Yili Wang, Wenqi Fan, Qing Li, Qinggang Zhang, Yi Chang, Xin Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, बहु-स्तरीय रहस्य को सुलझाने की कोशिश कर रहे हैं, जहाँ आपके सुराग एक ऐसी लाइब्रेरी में बिखरे हुए हैं जिसमें न केवल किताबें हैं, बल्कि आरेख (diagrams) वाले विशाल व्हाइटबोर्ड, नंबरों से भरी स्प्रेडशीट्स और सबूतों की तस्वीरें भी हैं। यह "कॉम्प्लेक्स डॉक्यूमेंट क्वेश्चन अनस्विंग" (जटिल दस्तावेज़ प्रश्न उत्तर) की दुनिया है। कंप्यूटर विज्ञान के इस कोने में, शोधकर्ता आर्टिफिशियल इंटेलिजेंस (AI) को एक सुपर-स्मार्ट जासूस की तरह काम करना सिखा रहे हैं। केवल एक छोटा पैराग्राफ पढ़ने के बजाय, AI को टेक्स्ट, टेबल और इमेज के मिश्रण वाले लंबे, अव्यवस्थित दस्तावेज़ों के भीतर छिपे जवाबों की तलाश करनी होगी। लक्ष्य सरल है: सही सुराग ढूँढना और उन्हें सच बताने के लिए आपस में जोड़ना। लेकिन यहाँ एक पेंच है: जब आपके पास हजारों पन्ने और सैकड़ों अलग-अलग प्रकार के सुराग होते हैं, तो AI के लिए खो जाना, गलत सबूत पकड़ लेना या विरोधाभासी जानकारी से भ्रमित हो जाना बहुत आसान है।

AI की मदद करने के लिए, वैज्ञानिक "नॉलेज मैप्स" (जिन्हें ग्राफ कहा जाता है) बना रहे हैं। इन मानचित्रों को एक विशाल सबवे सिस्टम के रूप में सोचें जहाँ हर स्टेशन एक तथ्य है, और ट्रैक उनके बीच के संबंध हैं। विचार यह है कि कागजों के ढेर में खोजने के बजाय, AI सीधे सही स्टेशन तक पहुँचने के लिए सबवे पर चढ़ सकता है और सवारी कर सकता है। हालाँकि, ये मानचित्र बनाना कठिन है। यदि आप पूरे चित्र को देखे बिना टुकड़ों में मानचित्र बनाते हैं, तो आप गलती से गलत स्टेशनों को जोड़ सकते हैं या ऐसे लूप बना सकते हैं जो कहीं नहीं ले जाते। इसके अलावा, यदि मानचित्र बहुत अधिक छोटे, विस्तृत स्टॉप्स से भरा है, तो इसमें नेविगेट करने में बहुत समय लगता है। यह वही समस्या है जिसे यह शोध पत्र संबोधित करता है: एक ऐसा मानचित्र कैसे बनाया जाए जो सटीक भी हो और यात्रा करने में तेज़ भी, खासकर तब जब सुराग शब्दों, चित्रों और चार्टों का एक अराजक मिश्रण हों।

इस पेपर के पीछे के शोधकर्ताओं ने इस मानचित्र बनाने की समस्याओं को ठीक करने के लिए अपने सबवे सिस्टम को बनाने और उस पर यात्रा करने के तरीके को बदलकर समाधान निकाला। उन्होंने महसूस किया कि पिछले तरीके ऐसे थे जैसे एक समय में एक सड़क के कोने को देखकर सबवे मैप बनाना। आप सोच सकते हैं कि दो सड़कें इसलिए जुड़ती हैं क्योंकि वे स्थानीय स्तर पर समान दिखती हैं, लेकिन यदि आप पीछे हटकर पूरे शहर को देखते, तो आप देखते कि वे वास्तव में अलग-अलग मोहल्लों की ओर ले जाती हैं। इस "लोकल-ओनली" (केवल स्थानीय) दृष्टिकोण के कारण AI विरोधाभासी सुरागों से भ्रमित हो जाता था और एक भीड़भाड़ वाले, अव्यवस्थित मानचित्र में भटककर समय बर्बाद करता था।

इसे हल करने के लिए, HVM-GraphRAG एक "होलिस्टिक व्यू" (समग्र दृष्टिकोण) पेश करता है। कल्पना कीजिए कि एक मास्टर आर्किटेक्ट की, जो केवल एक-एक करके ईंटें नहीं बिछाता, बल्कि लगातार पूरे शहर के ब्लूप्रिंट को देखने के लिए पीछे हटता है। एक नया तथ्य मानचित्र में जोड़ने से पहले, यह सिस्टम जाँच करता है: "क्या यह उस चीज़ के साथ फिट बैठता है जो हम पहले से जानते हैं?" यदि इसे दो तथ्य मिलते हैं जो एक-दूसरे का विरोध करते हैं—जैसे एक सुराग कहता है कि एक ट्रेन "सिटी A" जाती है और दूसरा कहता है कि वह "सिटी B" जाती है—तो यह केवल संघर्ष को अनदेखा नहीं करता है। यह एक रेफरी की तरह कार्य करता है, मूल साक्ष्य (तस्वीरों, टेक्स्ट, टेबल्स) को देखता है ताकि यह तय किया जा सके कि कौन सा सुराग असली है और कौन सा गलती है। फिर यह मानचित्र को साफ करता है, गलत कनेक्शनों को हटाता है और केवल विश्वसनीय कनेक्शनों को रखता है।

एक बार जब मानचित्र साफ हो जाता है, तो सिस्टम AI के यात्रा करने के तरीके को बदल देता है। हर एक छोटे स्टेशन पर जाने की कोशिश करने के बजाय (जिसमें बहुत समय लगेगा), AI पहले "प्रमुख हब" या "कॉन्सेप्ट स्टेशन्स" को खोजता है। ये उच्च-स्तरीय विचार हैं जो कई विशिष्ट तथ्यों को एक साथ समूहबद्ध करते हैं। उदाहरण के लिए, किसी विशिष्ट दिन के लिए विशिष्ट ट्रेन शेड्यूल खोजने के बजाय, AI पहले "ट्रेन नेटवर्क" हब को खोजता है। वहां से, यह तेजी से उस विशिष्ट साक्ष्य पर ज़ूम इन कर सकता है जिसकी उसे आवश्यकता है। यह हर ब्लॉक पर रुकने के बजाय सही मोहल्ले तक जाने के लिए एक्सप्रेस ट्रेन लेने जैसा है।

अंत में, जब AI अपने सुराग इकट्ठा करता है, तो वह उन्हें करीने से व्यवस्थित करता है। एक फोटो, एक स्प्रेडशीट और एक पैराग्राफ को एक अव्यवस्थित ढेर में फेंकने के बजाय, यह उन्हें अलग-अलग ढेरों में छाँटता है: "सभी तस्वीरें," "सभी टेबल्स," और "सभी टेक्स्ट।" यह AI को सुरागों की तुलना अधिक आसानी से करने में मदद करता है, ठीक वैसे ही जैसे एक जासूस डेस्क के एक तरफ फोटो और दूसरी तरफ दस्तावेज़ रखता है।

शोधकर्ताओं ने इस नए सिस्टम का परीक्षण तीन अलग-अलग प्रकार के कठिन दस्तावेज़ों पर किया: लंबे उद्योग रिपोर्ट, लेआउट वाले जटिल वेब-शैली के दस्तावेज़, और वैज्ञानिक शोध पत्र। उन्होंने पाया कि उनका "होलिस्टिक व्यू" तरीका एक गेम-चेंजर था। अधिकांश परीक्षणों में, इसने पिछले सर्वोत्तम तरीकों से बेहतर उत्तर दिए। उदाहरण के लिए, वैज्ञानिक पत्रों के एक डेटासेट पर, इसने पुराने ग्राफ-आधारित सिस्टमों की तुलना में उत्तरों की सटीकता में महत्वपूर्ण सुधार किया। शायद इससे भी अधिक प्रभावशाली बात यह है कि इसने यह सब बहुत तेज़ी से किया। "एंटिटी स्ट्रीट्स" के बजाय "कॉन्सेप्ट हब्स" का उपयोग करके, सिस्टम ने बहुत सारा समय और कंप्यूटर पावर बचाई, जिससे यह सिद्ध हुआ कि खजाना खोजने के लिए आपको हर गली में भटकने की ज़रूरत नहीं है; आपको बस एक बेहतर मानचित्र चाहिए।

संक्षेप में, यह पेपर सुझाव देता है कि जटिल दस्तावेज़ों को पढ़ने में AI को स्मार्ट बनाने के लिए, हमें ज्ञान के मानचित्रों को अराजक, टुकड़े-दर-टुकड़े के तरीके से बनाना बंद करना होगा। इसके बजाय, हमें उन्हें "बड़ी तस्वीर" वाली मानसिकता के साथ बनाना चाहिए जो चलते समय संघर्षों को सुलझाती है, और फिर उच्च-स्तरीय शॉर्टकट का उपयोग करके उन मानचित्रों पर यात्रा करनी चाहिए। यह दृष्टिकोण न केवल AI को अधिक सटीक बनाता है; यह इसे तेज़ और अधिक कुशल भी बनाता है, जिससे सूचना का एक भ्रमित करने वाला भूलभुलैया एक स्पष्ट, सुलभ मार्ग में बदल जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →