← नवीनतम पेपर
💬 NLP

Graph Fusion Across Languages using Large Language Models

यह शोध पत्र एक नवीन ढांचे का प्रस्ताव करता है जो ग्राफ ट्रिपलेट्स को प्राकृतिक भाषा अनुक्रमों में लीनियराइज़ करके क्रॉस-लिंगुअल ग्राफ फ्यूजन करने के लिए लार्ज लैंग्वेज मॉडल्स की इन-कॉन्टेक्स्ट रीजनिंग और बहुभाषी क्षमताओं का लाभ उठाता है, जिससे प्रभावी रूप से सिमेंटिक हेटेरोजेनिटी (अर्थ संबंधी विषमता) को हल किया जा सके और हेटेरोजेनियस नॉलेज ग्राफ्स के स्केलेबल एगोमरेशन (समूहन) को सक्षम बनाया जा सके।

मूल लेखक: Kaung Myat Kyaw, Khush Agarwal, Jonathan Chan

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaung Myat Kyaw, Khush Agarwal, Jonathan Chan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दुनिया का सबसे बड़ा, सबसे पूर्ण विश्वकोश (encyclopedia) बनाने की कोशिश कर रहे हैं। लेकिन यहाँ एक पेंच है: आपके पास हजारों अलग-अलग नोटबुक हैं। कुछ अंग्रेजी में लिखी गई हैं, कुछ चीनी में, कुछ फ्रेंच में और कुछ जापानी में।

समस्या क्या है? वे केवल अलग-अलग शब्दों का उपयोग नहीं करते; वे जानकारी को अलग तरह से व्यवस्थित भी करते हैं।

  • अंग्रेजी नोटबुक में, "द एफिल टॉवर" के लिए एक पेज है।
  • फ्रेंच नोटबुक में, "ला टौर एफिल" के लिए एक पेज है।
  • चीनी नोटबुक में, तथ्यों को पूरी तरह से एक अलग श्रेणी के तहत समूहीकृत किया गया है।

यदि आप इन नोटबुक्स को मैन्युअल रूप से जोड़ने की कोशिश करते हैं, तो इसमें एक पूरा जीवन बीत जाएगा। यदि आप पुराने कंप्यूटर प्रोग्रामों का उपयोग करने की कोशिश करते हैं, तो वे अक्सर भ्रमित हो जाते हैं क्योंकि उन्हें शुरू करने के लिए एक "चीट शीट" (पहले से मेल किए गए जोड़ों की एक सूची) की आवश्यकता होती है, और कई भाषाओं के लिए, वह चीट शीट मौजूद नहीं है।

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग करके इसे करने का एक नया, स्मार्ट तरीका पेश करता है—वही AI जो चैटबॉट्स को शक्ति देता है जैसे कि वह चैटबॉट जिससे आप अभी बात कर रहे हैं।

यहाँ उनका समाधान कैसे काम करता है, इसे सरल उपमाओं (analogies) में तोड़कर समझाया गया है:

1. समस्या: डेटा का "टॉवर ऑफ बेबेल"

ज्ञान ग्राफ (Knowledge Graphs) को तथ्यों के विशाल जाल के रूप में सोचें।

  • पुराना तरीका: कल्पना करें कि आप धागों के रंग को देखकर दो जालों को मिलाने की कोशिश कर रहे हैं। यदि अंग्रेजी वेब "राजधानी शहर" के लिए लाल धागे का उपयोग करता है और फ्रेंच वेब नीले का, तो पुराने कंप्यूटर भ्रमित हो जाते हैं। उन्हें शुरू करने से पहले एक इंसान की आवश्यकता होती है जो कहे, "हे, यहाँ लाल का मतलब नीला है।"
  • नई समस्या: क्या होगा यदि आपके पास 10 अलग-अलग वेब (10 भाषाएँ) हों? यदि आप एक साथ सभी को मिलाने की कोशिश करते हैं, तो कंप्यूटर अभिभूत हो जाता है। यह आँखों पर पट्टी बांधकर 10,000 टुकड़ों वाली पहेली सुलझाने जैसा है।

2. समाधान: "यूनिवर्सल ट्रांसलेटर" (The Universal Translator - LLM)

लेखक एक LLM को एक यूनिवर्सल सिमेंटिक ब्रिज के रूप में उपयोग करने का प्रस्ताव देते हैं।

  • जादुई ट्रिक: कोड या गणित का अनुवाद करने के बजाय, वे AI से तथ्यों को एक कहानी के वाक्यों की तरह पढ़ने के लिए कहते हैं।
    • पुराना तरीका: (Entity: Paris, Relation: CapitalOf, Entity: France)
    • नया तरीका: "पेरिस फ्रांस की राजधानी है।"
  • क्योंकि LLMs ने दर्जनों भाषाओं में इंटरनेट पर लगभग सब कुछ पढ़ा है, वे "जानते" हैं कि "पेरिस" और "पेरिस" (फ्रेंच में) एक ही चीज़ हैं, भले ही व्याकरण अलग हो। उन्हें किसी चीट शीट की आवश्यकता नहीं है; वे बस अपने सामान्य ज्ञान का उपयोग करते हैं।

3. रणनीति: "रोलिंग स्नोबॉल" (The Rolling Snowball)

एक साथ 10 ग्राफ को मिलाना बहुत कठिन है। इसलिए, वे सीक्वेंशियल एगमर्वेशन (Sequential Agglomeration) रणनीति का उपयोग करते हैं।

  • एक स्नोबॉल की कल्पना करें: आप एक छोटे स्नोबॉल (ग्राफ 1) से शुरू करते हैं।
  • लुढ़काना: आप उसे बर्फ के मैदान (ग्राफ 2) में लुढ़काते हैं। यह नई बर्फ उठाता है और बढ़ता है।
  • दोहराना: अब आपके पास एक बड़ा स्नोबॉल है। आप इसे ग्राफ 3, फिर ग्राफ 4 के माध्यम से लुढ़काते हैं।
  • यह क्यों मदद करता है: AI को केवल वर्तमान बड़े स्नोबॉल की तुलना अगले छोटे स्नोबॉल से करनी होती है। इसे एक साथ सब कुछ देखने की आवश्यकता नहीं है। यह कंप्यूटर को क्रैश होने (कंप्यूटेशनल विस्फोट) से बचाता है।

4. सुरक्षा जाल: "नेबरहुड वॉच" (The Neighborhood Watch)

LLMs की एक सीमा होती है कि वे एक बार में कितना टेक्स्ट पढ़ सकते हैं (जैसे कि एक छोटी एकाग्रता अवधि)। यदि आप उन्हें पूरा विश्वकोश खिलाते हैं, तो वे शुरुआत भूल जाते हैं।

  • समाधान: लेखक बड़े वेब को छोटे, प्रबंधनीय टुकड़ों में काट देते हैं जिन्हें "बैच" (Batches) कहा जाता है।
  • नियम: वे सुनिश्चित करते हैं कि यदि वे "पेरिस" को देख रहे हैं, तो वे उसी बैच में पेरिस से जुड़े सभी तथ्य (इसके संग्रहालय, इसके मेयर, इसकी जनसंख्या) भी शामिल करें।
  • क्यों? संदर्भ (Context) ही सब कुछ है। यदि AI अकेले "पेरिस" को देखता है, तो वह टेक्सस के पेरिस के बारे में सोच सकता है। लेकिन यदि वह "पेरिस, फ्रांस की राजधानी, लूव्र का घर" देखता है, तो वह जानता है कि वे किस पेरिस की बात कर रहे हैं।

5. परिणाम: एक उच्च-विश्वास मिलान (A High-Confidence Match)

AI एक बहुत ही सावधान लाइब्रेरियन की तरह कार्य करता है।

  • यह अंग्रेजी नोटबुक और फ्रेंच नोटबुक के टुकड़ों को पढ़ता है।
  • यह कहता है, "मुझे 98% यकीन है कि ये दो तथ्य एक ही चीज़ के बारे में हैं।"
  • यदि विश्वास अधिक है (90% से ऊपर), तो यह उन्हें आपस में जोड़ देता है। यदि यह अनिश्चित है, तो गलतियों से बचने के लिए यह उन्हें अलग छोड़ देता है।

उन्होंने क्या पाया?

उन्होंने चीनी, अंग्रेजी, जापानी और फ्रेंच से जुड़े एक विशाल डेटासेट (DBP15K) पर इसका परीक्षण किया।

  • अच्छी खबर: AI अविश्वसनीय रूप से सटीक था। जब इसने कहा कि दो चीजें एक ही हैं, तो यह 88% से 92% बार सही था।
  • बुरी खबर: इसने कुछ चीजें मिस कर दीं (इसने हर एक मैच नहीं खोजा), मुख्य रूप से इसलिए क्योंकि समय और मेमोरी की सीमाओं के कारण यह हर संभावित संयोजन को नहीं पढ़ सका।
  • बड़ी जीत: इसने यह सब बिना किसी मानवीय प्रशिक्षण डेटा के किया। इसे पहले से मेल किए गए जोड़ों की सूची की आवश्यकता नहीं थी। इसने बस अपने स्वयं के ज्ञान का उपयोग किया।

निचोड़ (The Bottom Line)

यह शोध पत्र दिखाता है कि हम अंततः बिना किसी मानव अनुवादक की सेना द्वारा "चीट शीट" बनाए, विभिन्न भाषाओं में दुनिया के ज्ञान को जोड़ना शुरू कर सकते हैं। डेटा को कहानियों की तरह मानकर और AI को एक स्मार्ट, रोलिंग एडिटर के रूप में उपयोग करके, हम एक वास्तव में वैश्विक मस्तिष्क बना सकते हैं जो हमें समझ सके, चाहे हम कोई भी भाषा बोलते हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →