GraphMERT: Efficient and Scalable Distillation of Reliable Knowledge Graphs from Unstructured Data
यह शोध पत्र GraphMERT को प्रस्तुत करता है, जो एक संक्षिप्त, कुशल एनकोडर-ओनली मॉडल है जो असंरचित पाठ से उच्च गुणवत्ता वाले, तथ्यात्मक रूप से सटीक और ऑन्टोलॉजी-संगत ज्ञान ग्राफ़ को आसवन (distill) करके बड़े भाषा मॉडलों की स्केलेबिलिटी और विश्वसनीयता की सीमाओं को दूर करता है, जिससे एक स्केलेबल न्यूरोसिम्बोलिक फ्रेमवर्क स्थापित होता है जो सटीकता और प्रतीकात्मक वैधता दोनों में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप मधुमेह (डायबिटीज) के बारे में चिकित्सा तथ्यों की एक विशाल, सटीक लाइब्रेरी बनाने की कोशिश कर रहे हैं। आप चाहते हैं कि हर किताब (तथ्य) सटीक हो, हर शेल्फ (श्रेणी) सही ढंग से व्यवस्थित हो, और हर उद्धरण (citation) को किसी वास्तविक डॉक्टर के जर्नल तक ट्रैक किया जा सके।
लंबे समय से, हम इसे दो अलग-अलग उपकरणों का उपयोग करके करने की कोशिश कर रहे हैं:
"इंसान जैसा" AI (LLMs): ये उन प्रतिभाशाली, तेज़ बोलने वाले पुस्तकालयाध्यक्षों की तरह हैं जिन्होंने पूरी इंटरनेट को पढ़ लिया है। वे धाराप्रवाह बात कर सकते हैं और जल्दी से उत्तरों का अनुमान लगा सकते हैं। लेकिन उनकी एक बुरी आदत है: वे कभी-कभी भ्रमित (hallucinate) हो जाते हैं। वे आत्मविश्वास के साथ आपसे कह सकते हैं कि "मधुमेह के कारण चंद्रमा नीला हो जाता है" क्योंकि उन्होंने एक बार एक कविता में "मधुमेह" और "नीला" शब्दों को एक साथ देखा था। साथ ही, वे आसानी से यह भी नहीं दिखा सकते कि उन्हें जानकारी कहाँ से मिली, और यदि आप उन्हें कोई तथ्य बदलने के लिए कहते हैं, तो आपको उनके पूरे मस्तिष्क को फिर से प्रशिक्षित (retrain) करना पड़ता है।
"नियम-आधारित" प्रणाली (Symbolic AI): यह एक सख्त पुस्तकालयाध्यक्ष की तरह है जो किताबों को शेल्फ पर तभी रखता है जब वे एक विशिष्ट, पूर्व-लिखित नियम पुस्तिका में फिट बैठती हैं। यह 100% विश्वसनीय और तार्किक है, लेकिन यह अव्यवस्थित, वास्तविक दुनिया की भाषा को समझने में बहुत खराब है। यह अपने आप नई मेडिकल रिसर्च पेपर को पढ़कर तथ्य नहीं निकाल सकता।
समस्या:
मेडिकल नॉलेज ग्राफ (लाइब्रेरी) बनाने के अधिकांश वर्तमान प्रयास केवल "इंसान जैसे" AI को काम करने के लिए कहते हैं। इसका परिणाम एक ऐसी लाइब्रेरी है जो आत्मविश्वास से भरे लेकिन अक्सर गलत तथ्यों, उलझी हुई श्रेणियों और सत्यापन योग्य स्रोतों के बिना भरी होती है। यह रेत की नींव पर गगनचुंबी इमारत बनाने जैसा है।
समाधान: GraphMERT
इस शोध पत्र के लेखक GraphMERT पेश करते हैं, जो एक नया, छोटा और अत्यंत कुशल AI है जिसे शून्य से एक विश्वसनीय लाइब्रेरी बनाने के लिए डिज़ाइन किया गया है।
यह इस सरल उपमा का उपयोग करके काम करता है:
1. "चेन ग्राफ" (ब्लूप्रिंट/खाका)
कल्पना कीजिए कि आप एक पुल बना रहे हैं।
- सड़क (टेक्स्ट): आपके पास कच्चे, अव्यवस्थित सड़क निर्माण सामग्री का ढेर है (असंरचित चिकित्सा पाठ)।
- खंभे (सीड KG): आपके पास विश्वसनीय विशेषज्ञों से प्राप्त ब्लूप्रिंट का एक छोटा, सटीक सेट है ("सीड नॉलेज ग्राफ")।
- पुल (GraphMERT): केवल यह अनुमान लगाने के बजाय कि पुल कहाँ होना चाहिए, GraphMERT कच्चे सड़क निर्माण सामग्री और ब्लूप्रिंट दोनों को एक साथ देखना सीखता है। यह कच्चे टेक्स्ट को ब्लूप्रिंट के सख्त नियमों से जोड़ना सीखता है।
यह एक छात्र को न केवल शब्दकोश रटने के लिए, बल्कि यह समझने के लिए सिखाने जैसा है कि शब्द एक वाक्य में कैसे फिट होते हैं और वे एक विशिष्ट वैज्ञानिक नियम पुस्तिका में कैसे फिट होते हैं।
2. "छोटा लेकिन शक्तिशाली" मॉडल
आज के अधिकांश AI मॉडल विशाल, भूखे राक्षसों की तरह हैं जो टेराबाइट्स डेटा खाते हैं और फिर भी भ्रमित हो जाते हैं। GraphMERT छोटा है (केवल 80 मिलियन पैरामीटर्स, मानक मॉडलों के 32 बिलियन या उससे अधिक की तुलना में)।
- यह क्यों अच्छा है? क्योंकि इसे केवल उच्च गुणवत्ता वाले, सत्यापित मेडिकल पेपर्स पर प्रशिक्षित किया गया है। इसने इंटरनेट फोरम या फर्जी खबरें पढ़ने में समय बर्बाद नहीं किया। यह एक विशेषज्ञ है, सामान्यज्ञ (generalist) नहीं।
- परिणाम: इसे अनुमान लगाने की उतनी आवश्यकता नहीं है क्योंकि इसने उपलब्ध सर्वोत्तम डेटा से सीखा है।
3. "तथ्य-जांच" लूप (Fact-Checking Loop)
जब GraphMERT एक तथ्य (एक "ट्रिपल" जैसे Diabetes -> causes -> Kidney Disease) निकालता है, तो वह इसे केवल बाहर नहीं फेंकता।
- चरण 1: यह टेक्स्ट के आधार पर तथ्य का अनुमान लगाता है।
- चरण 2: यह जाँचता है कि क्या तथ्य "सीड" नियमों (ऑन्टोलॉजी) के अनुसार तर्कसंगत है।
- चरण 3: यह एक सहायक (एक बड़ा AI) का उपयोग केवल इसलिए करता है ताकि वाक्य व्याकरणिक रूप से सही लगे, लेकिन सहायक नए तथ्य नहीं बना सकता। यह केवल उन्हीं टुकड़ों को व्यवस्थित कर सकता है जो GraphMERT ने खोजे हैं।
- चरण 4: यह दोबारा जाँच करता है: "क्या यह तथ्य वास्तव में मूल टेक्स्ट में मौजूद है?" यदि नहीं, तो यह इसे हटा देता है।
परिणाम: दो लाइब्रेरी की कहानी
शोधकर्ताओं ने मधुमेह के डेटा पर मानक "इंसान जैसे" AI (Qwen3-32B) के विरुद्ध अपने सिस्टम का परीक्षण किया।
मानक AI लाइब्रेरी:
- फैक्ट स्कोर: 40.2% (आधे से कम तथ्य वास्तव में सत्य थे)।
- वैलिडिटी स्कोर: 43.0% (कई तथ्य तार्किक रूप से अजीब थे, जैसे यह कहना कि एक बीमारी एक स्थान का "हिस्सा" है)।
- समस्या: यह बहुत अधिक चतुर बनने की कोशिश में नए कनेक्शन बनाता रहा।
GraphMERT लाइब्रेरी:
- फैक्ट स्कोर: 69.8% (लगभग 70% तथ्यों को सत्य के रूप में सत्यापित किया गया)।
- वैलिडिटी स्कोर: 68.7% (तथ्य चिकित्सा नियमों में पूरी तरह फिट बैठते हैं)।
- बोनस: यदि आप खराब तथ्यों को साफ कर देते हैं, तो GraphMERT का स्कोर बढ़कर 76.9% हो जाता है, जबकि मानक AI केवल 55.6% तक ही पहुँच पाता है।
यह क्यों महत्वपूर्ण है
GraphMERT को एक विश्वसनीय, पारदर्शी और संपादन योग्य प्रणाली के रूप में सोचें।
- पारदर्शी: आप हर तथ्य को मेडिकल पेपर के ठीक उसी वाक्य तक ट्रैक कर सकते जहाँ से वह आया है।
- संपादन योग्य: यदि किसी डॉक्टर को कोई गलती मिलती है, तो वे पूरे AI को फिर से प्रशिक्षित किए बिना डेटाबेस में उसे ठीक कर सकते हैं।
- सुरक्षित: क्योंकि यह छोटा है और सत्यापित डेटा पर प्रशिक्षित है, इसकी खतरनाक चिकित्सा सलाह देने की संभावना बहुत कम है।
संक्षेप में:
GraphMERT एक छोटा, विशिष्ट AI है जो अव्यवस्थित मानवीय भाषा और सख्त वैज्ञानिक नियमों के बीच एक सेतु (पुल) के रूप में कार्य करता है। यह सिद्ध करता है कि एक विश्वसनीय ज्ञान आधार बनाने के लिए आपको विशाल, महंगे AI की आवश्यकता नहीं है; आपको बस एक स्मार्ट, केंद्रित दृष्टिकोण की आवश्यकता है जो आकार और गति के बजाय सत्य और संरचना को प्राथमिकता देता है। यह एक अराजक, शोर मचाती भीड़ के जवाब चिल्लाने और एक शांत, विशेषज्ञ पुस्तकालयाध्यक्ष द्वारा आपको एक सही पुस्तक थमाने के बीच का अंतर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।