← नवीनतम पेपर
💻 bioinformatics

KRAKEN: A provenance-tracked knowledge graph for multiomic and wellness research

KRAKEN एक स्केलेबल, प्रोवेनेंस-ट्रैक्ड नॉलेज ग्राफ है जो विविध बायोमेडिकल स्रोतों को एक मॉड्यूलर, 15-मिलियन-नोड सिस्टम में एकीकृत करके मल्टीओमिक और वेलनेस डेटा के कम प्रतिनिधित्व की समस्या का समाधान करता है, जिसमें मानकीकृत सिमेंटिक्स, अंतर्निहित विश्लेषणात्मक उपकरण और मानव एवं एआई-संचालित अनुसंधान दोनों के लिए मल्टी-मोडल इंटरफेस शामिल हैं।

मूल लेखक: Glen, A. K., Witherington, D., Leslie, T., Baumgartner, A., Fernando, A., Vemuri, B., Nahman, O., Glusman, G., Hood, L., Pflieger, L., Rappaport, N.

प्रकाशित 2026-08-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Glen, A. K., Witherington, D., Leslie, T., Baumgartner, A., Fernando, A., Vemuri, B., Nahman, O., Glusman, G., Hood, L., Pflieger, L., Rappaport, N.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

आधुनिक जीव विज्ञान के विशाल परिदृश्य में, वैज्ञानिक लंबे समय से हमारी कोशिकाओं की सूक्ष्म मशीनरी और मानव स्वास्थ्य की व्यापक तस्वीर के बीच के बिंदुओं को जोड़ने का एक तरीका खोजने की कोशिश कर रहे हैं। दशकों से, अनुसंधान मुख्य रूप से इस बात को समझने पर केंद्रित रहा है कि बीमारियाँ कैसे विकसित होती हैं और मौजूदा दवाओं का उपयोग उन्हें लड़ने के लिए कैसे किया जा सकता है। इस दृष्टिकोण ने जैविक संबंधों के शक्तिशाली मानचित्र बनाए हैं, लेकिन ये मानचित्र अक्सर कल्याण (wellness) के शांत, रोजमर्रा के पहलुओं को छोड़ देते हैं। वे अक्सर हमारे चयापचय (metabolism) के विस्तृत रासायनिक हस्ताक्षरों, उन विशिष्ट आनुवंशिक मार्करों को जो हमारे लक्षणों को प्रभावित करते हैं, और उस जटिल डेटा को मिस कर देते हैं जो यह परिभाषित करता है कि हमारी वास्तविक आयु की तुलना में हमारा शरीर कितना पुराना महसूस करता है। इन कल्याण-केंद्रित विवरणों को शामिल करने वाली एक पूर्ण तस्वीर के बिना, यह देखना कठिन बना हुआ है कि हमारी जीव विज्ञान केवल तब नहीं, बल्कि एक स्वस्थ अवस्था में भी कैसे कार्य करती है।

KRAKEN नामक एक नया प्रोजेक्ट बीमारी के अनुसंधान और सामान्य कल्याण के बीच के अंतर को पाटते हुए एक विशाल, परस्पर जुड़े मानचित्र को बनाकर इस अंतर को भरने का लक्ष्य रखता है। इस कार्य के पीछे के शोधकर्ताओं ने महसूस किया कि जबकि मौजूदा मानचित्र उपचार खोजने के लिए उत्कृष्ट थे, वे संपूर्ण व्यक्ति को समझने के लिए अधूरे थे। इसे हल करने के लिए, उन्होंने एक ऐसी प्रणाली बनाई जो कई अलग-अलग स्रोतों से जानकारी एकत्र करती है, जिसमें लिपिड के लिए विशेष डेटाबेस, आनुवंशिक स्कोर और मानकीकृत स्वास्थ्य माप शामिल हैं। यह नया मानचित्र केवल तथ्यों को सूचीबद्ध नहीं करता है; यह उन्हें इस तरह से जोड़ता है जिससे कंप्यूटर हमारे रक्त में मौजूद अणुओं से लेकर हमारे डीएनए में मौजूद आनुवंशिक कोड तक, विभिन्न प्रकार के डेटा के बीच संबंधों का पता लगा सके। परिणाम एक ऐसा उपकरण है जो शोधकर्ताओं और चिकित्सकों को यह देखने में मदद करता है कि स्वास्थ्य और कल्याण के विभिन्न कारक आपस में कैसे संबंधित हैं, जो मानव जीव विज्ञान का एक अधिक समग्र दृष्टिकोण प्रदान करता है जो पहले तक एक एकल, एकीकृत प्रणाली में उपलब्ध नहीं था।

इस उपलब्धि का मूल एक 'नॉलेज ग्राफ' (knowledge graph) है जो विविध जैविक जानकारी के लिए एक केंद्रीय केंद्र के रूप में कार्य करता है। टीम ने कई मौजूदा बड़े नेटवर्क को कल्याण पर केंद्रित विशेष स्रोतों, जैसे कि पॉलीजेनिक स्कोर के कैटलॉग और जैविक आयु के मापों के साथ जोड़ा। इन धागों को एक साथ बुनकर, उन्होंने लगभग 1.5 करोड़ नोड्स (nodes) वाला एक ढांचा तैयार किया, जो व्यक्तिगत सूचना के टुकड़ों का प्रतिनिधित्व करते हैं, और लगभग 11.3 करोड़ किनारों (edges) का निर्माण किया, जो उनके बीच के संबंधों का प्रतिनिधित्व करते हैं। यह नेटवर्क 62 अलग-अलग प्रकार की संस्थाओं (entities) को कवर करता है, जो विशिष्ट रसायनों और जीन से लेकर व्यापक स्वास्थ्य अवधारणाओं तक विस्तृत हैं। यह सुनिश्चित करने के लिए कि यह विशाल संग्रह एक साझा भाषा बोलता है, शोधकर्ताओं ने एक मानक सिमेंटिक मॉडल का उपयोग किया जो नेशनल इंस्टिट्यूट्स ऑफ हेल्थ (NIH) के उन व्यापक प्रयासों के अनुरूप है जो बायोमेडिकल डेटा को साझा करने और समझने में आसान बनाने के लिए किए जा रहे हैं।

यह प्रणाली विशेष रूप से अपनी लचीलापन और दक्षता के कारण उपयोगी है। शोधकर्ताओं ने एक ऐसी निर्माण प्रक्रिया विकसित की है जो मानक कंप्यूटिंग हार्डवेयर पर चलने के लिए पर्याप्त हल्की है, जिसे अपने शिखर पर 48 गीगाबाइट से कम मेमोरी की आवश्यकता होती है। यह डिज़ाइन उपयोगकर्ताओं को पूरे ग्राफ को जल्दी से फिर से बनाने या केवल अपने विशेष रुचि के क्षेत्र से संबंधित डेटा के विशिष्ट हिस्सों को चुनने की अनुमति देता है। चाहे कोई वैज्ञानिक किसी विशिष्ट चयापचय पथ (metabolic pathway) का अध्ययन कर रहा हो या व्यापक कल्याण रुझानों को देख रहा हो, इस प्रणाली को पूरे डेटासेट को संसाधित करने की आवश्यकता के बिना उस डोमेन पर ध्यान केंद्रित करने के लिए अनुकूलित किया जा सकता है। यह मॉड्यूलरिटी सुनिश्चित करती है कि यह उपकरण एक स्थिर, बोझिल संग्रह होने के बजाय शोध के व्यापक प्रश्नों के लिए सुलभ और व्यावहारिक बना रहे।

केवल जानकारी संग्रहीत करने के परे, KRAKEN में उपकरणों का एक समूह शामिल है जो उपयोगकर्ताओं को डेटा का पता लगाने में मदद करने के लिए डिज़ाइन किया गया है। ये उपकरण 'मल्टी-हॉप रीजनिंग' (multi-hop reasoning) के लिए अनुमति देते हैं, जिसका अर्थ है कि प्रणाली दो प्रतीत होने वाले असंबंधित अवधारणाओं के बीच अप्रत्यक्ष संबंधों को खोजने के लिए कनेक्शन की एक श्रृंखला का अनुसरण कर सकती है। उपयोगकर्ता टेक्स्ट, वेक्टर, या दोनों के संयोजन का उपयोग करके खोज (search) कर सकते हैं ताकि ग्राफ के भीतर विशिष्ट संस्थाओं या पैटर्न को पाया जा सके। यह मंच 'एनरिचमेंट विश्लेषण' (enrichment analyses) का समर्थन करता है, जो यह पहचानने में मदद करता है कि क्या डेटा के कुछ समूह संयोग से अधिक बार एक साथ दिखाई देते हैं। ये सभी क्षमताएं एक इंटरैक्टिव वेब इंटरफेस और एक मानक एप्लिकेशन प्रोग्रामिंग इंटरफेस (API) के माध्यम से सुलभ हैं, जिससे डेटा मानव शोधकर्ताओं और स्वचालित प्रणालियों दोनों के लिए उपलब्ध होता है।

परियोजना एक 'मॉडल कॉन्टेक्स्ट प्रोटोकॉल सर्वर' (Model Context Protocol server) भी पेश करती है, जो एक ऐसी विशेषता है जो आर्टिफिशियल इंटेलिजेंस एजेंटों और लार्ज लैंग्वेज मॉडल्स को सीधे ग्राफ के साथ बातचीत करने की अनुमति देती है। यह क्षमता इन उन्नत प्रणालों को संरचित डेटा को उपभोग करने और विशिष्ट डेटासेट पर पुन: प्रशिक्षित होने की आवश्यकता के बिना जटिल प्रश्नों के उत्तर देने या अंतर्दृष्टि उत्पन्न करने के लिए उपयोग करने में सक्षम बनाती है। इस तरह से डेटा को उपलब्ध कराकर, शोधकर्ता नए प्रकार के स्वचालित विश्लेषण के द्वार खोल रहे हैं जो ग्राफ के भीतर मौजूद कल्याण और मल्टीओमिक (multiomic) जानकारी की पूरी गहराई का लाभ उठा सकते हैं। यह संपूर्ण प्रणाली सार्वजनिक रूप से स्वतंत्र रूप से उपलब्ध है, जिससे कोई भी इंटरनेट कनेक्शन के साथ इन संबंधों का पता लगा सकता है और मानव स्वास्थ्य और कल्याण की बढ़ती समझ में योगदान दे सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →