← नवीनतम पेपर
💻 computer science

Mario: Multimodal Graph Reasoning with Large Language Models

यह शोध पत्र मारियो (Mario) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो क्रॉस-मोडल फीचर रिफाइनमेंट के लिए ग्राफ-कंडीशन्ड विजन-लैंग्वेज मॉडल और इष्टतम मोडैलिटी कॉन्फ़िगरेशन को गतिशील रूप से चुनने के लिए एक मोडैलिटी-एडेप्टिव इंस्ट्रक्शन ट्यूनिंग मैकेनिज्म का उपयोग करके मल्टीमॉडल ग्राफ पर लार्ज लैंग्वेज मॉडल-आधारित तर्क को बढ़ाता है, जिससे नोड क्लासिफिकेशन और लिंक प्रेडिक्शन कार्यों में मौजूदा अत्याधुनिक विधियों से बेहतर प्रदर्शन होता है।

मूल लेखक: Yuanfu Sun, Kang Li, Pengkang Guo, Jiajin Liu, Qiaoyu Tan

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanfu Sun, Kang Li, Pengkang Guo, Jiajin Liu, Qiaoyu Tan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाले शहर में एक बहुत बड़ी गुत्थी सुलझाने की कोशिश कर रहे हैं। आपके पास एक शानदार जासूस है (जिसे Large Language Model या LLM कहा जाता है), जो सुराग पढ़ने और लोगों से बात करने में अविश्वसनीय रूप से स्मार्ट है। हालाँकि, वह शहर Multimodal Graphs से भरा हुआ है: परस्पर जुड़े हुए लोगों (नोड्स) का एक जाल, जहाँ प्रत्येक व्यक्ति के साथ एक फोटो (विजुअल डेटा) और एक डायरी एंट्री (टेक्स्ट डेटा) जुड़ी हुई है।

समस्या क्या है? शहर बहुत अस्त-व्यस्त है।

  1. मेल की कमी (The Mismatch): कभी-कभी किसी व्यक्ति की फोटो एक धूप वाले समुद्र तट (beach) की होती है, लेकिन उसकी डायरी कहती है कि वह एक बरसाती ऑफिस में फंसा हुआ है। फोटो और टेक्स्ट आपस में मेल नहीं खाते।
  2. पसंद (The Preference): कभी-कभी किसी व्यक्ति को समझने के लिए आपको उसकी डायरी पढ़नी पड़ती है, लेकिन दूसरों के लिए फोटो ही पूरी कहानी कह देती है। कुछ लोगों के लिए, आपको दोनों की आवश्यकता होती है। यदि आप जासूस को सभी के लिए एक ही तरीका अपनाने के लिए मजबूर करेंगे, तो वह भ्रमित हो जाएगा।

मिलिए Mario से। मारियो कोई प्लंबर नहीं है; वह एक सुपर-स्मार्ट डिटेक्टिव कोऑर्डिनेटर है जिसे LLM को इन उलझे हुए, परस्पर जुड़े पहेलियों को सुलझाने में मदद करने के लिए डिज़ाइन किया गया है।

यहाँ बताया गया है कि मारियो कैसे काम करता है, जिसे दो सरल चरणों में विभाजित किया गया है:

चरण 1: "ग्रुप फोटो" अलाइनमेंट (मेल की कमी को ठीक करना)

पुराने दिनों में, यदि आप किसी व्यक्ति को समझना चाहते थे, तो आप बस उनकी फोटो देखते और उनकी डायरी पढ़ते थे। लेकिन एक शहर में, लोग एक-दूसरे को प्रभावित करते हैं। यदि आपका पड़ोसी एक शेफ है, तो आप एक फूड क्रिटिक हो सकते हैं।

मारियो का पहला काम एक सोशल मिक्सर (पार्टी होस्ट) की तरह काम करना है।

  • समस्या: फोटो और डायरी एक-दूसरे के विपरीत हो सकते हैं (जैसे, एक कुत्ते की फोटो, लेकिन टेक्स्ट कहता है "मुझे बिल्लियाँ पसंद हैं")।
  • मारियो का समाधान: वह केवल एक व्यक्ति को अलग-थも नहीं देखता। वह उस व्यक्ति और उसके पड़ोसियों को भी देखता है। वह फोटो और टेक्स्ट को यह तय करने में मदद करने के लिए कि वह व्यक्ति वास्तव में कौन है, शहर के कनेक्शनों (ग्राफ) का उपयोग करता है।
  • उपमा (Analogy): कल्पना कीजिए कि आप एक अजनबी की पहचान करने की कोशिश कर रहे हैं। आप उन्हें गिटार पकड़े हुए देखते हैं, लेकिन उनका बायो कहता है "मैं एक बेकर हूँ।" भ्रमित करने वाला है, है ना? लेकिन फिर आप देखते हैं कि उनके पड़ोसी सभी एक बैंड में हैं। मारियो इस संदर्भ का उपयोग करके यह समझ जाता है कि, "आह, फोटो सच है; बायो बस एक मजाक है।" वह फोटो और टेक्स्ट को संरेखित (align) करता है ताकि वे जासूस को सौंपने से पहले एक सुसंगत कहानी बताएं।

चरण 2: "स्मार्ट मेनू" (पसंद को ठीक करना)

अब जब मारियो ने डेटा को साफ कर दिया है, तो उसे इसे जासूस (LLM) को खिलाना होगा।

  • समस्या: अतीत में, शोधकर्ता जासूस को हर मामले के लिए एक ही "मेनू" देते थे। "यहाँ टेक्स्ट है, यहाँ फोटो है, और यहाँ दोनों हैं।" लेकिन कभी-कभी टेक्स्ट बेकार होता है और फोटो एकदम सही होती है। अन्य मामलों में, केवल टेक्स्ट ही मायने रखता है।

  • मारियो का समाधान: मारियो एक स्मार्ट वेटर (जिसे Modality-Adaptive Prompt Router कहा जाता है) पेश करता है।

  • उपमा (Analogy): जासूस को एक शेफ के रूप में सोचें जो विभिन्न सामग्रियों के साथ खाना बना सकता है।

    • एक बेकर नोड के लिए, स्मार्ट वेटर कहता है, "शेफ, फोटो को अनदेखा करें; बस मुझे टेक्स्ट रेसिपी दें।"
    • एक पेंटर नोड के लिए, वेटर कहता है, "शेफ, टेक्स्ट बकवास है; बस पेंटिंग दिखाएं।"
    • एक शेफ नोड के लिए, वेटर कहता है, "मुझे रेसिपी और डिश की फोटो दोनों दें।"

    वेटर विशिष्ट स्थिति (नोड और उसके पड़ोसियों) को देखता है और तुरंत तय करता है कि कौन सा "मेनू" (केवल टेक्स्ट, केवल इमेज, या दोनों) जासूस को समस्या को सबसे अच्छी तरह से हल करने में मदद करेगा।

मारियो बेहतर क्यों है?

अन्य अधिकांश तरीके जासूस को एक ही समय में सब कुछ देखने के लिए मजबूर करते हैं, या वे बस अनुमान लगाते हैं। मारियो अलग है क्योंकि:

  1. वह पहले शोर (noise) को ठीक करता है: वह सुनिश्चित करता है कि फोटो और टेक्स्ट पड़ोस के संदर्भ का उपयोग करके एक-दूसरे से सहमत हों।
  2. वह डिलीवरी को कस्टमाइज़ करता है: वह "एक ही आकार सबके लिए" (one-size-fits-all) वाला दृष्टिकोण नहीं अपनाता है। वह उस जानकारी को तैयार करता है जो वास्तव में उपयोगी है।

परिणाम

जब मारो का परीक्षण वास्तविक दुनिया के डेटा (जैसे अमेज़न प्रोडक्ट रिव्यूज जिनमें फोटो शामिल हैं, या रेडिट पोस्ट जिनमें इमेज शामिल हैं) पर किया गया, तो उसने केवल ठीक-ठाक प्रदर्शन ही नहीं किया; उसने प्रतियोगिता को पछाड़ दिया।

  • जीरो-शॉट सुपरपावर (Zero-Shot Superpower): भले ही मारो को एक प्रकार के शहर (जैसे खिलौने) पर प्रशिक्षित किया गया था और फिर उसे बिना किसी अतिरिक्त प्रशिक्षण के पूरी तरह से नए शहर (जैसे फिल्में) में भेजा गया, फिर भी उसने किसी भी अन्य की तुलना में पहेलियों को बेहतर ढंग से सुलझाया।
  • दक्षता (Efficiency): वह समय बर्बाद नहीं करता है। प्रत्येक मामले के लिए सही "मेनू" चुनकर, वह जासूस को समस्याओं को तेज़ी से और अधिक सटीकता से हल करने में मदद करता है।

संक्षेप में: मारो एक परम अनुवादक और आयोजक है। वह बिखरे हुए, असंबद्ध फोटो और टेक्स्ट को लेता है, अर्थ निकालने के लिए सोशल नेटवर्क का उपयोग करता है, और फिर जासूसी एआई (AI Detective) को एक अनुकूलित सुराग परोसता है, जिससे यह सुनिश्चित होता है कि रहस्य हर बार सुलझ जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →