← नवीनतम पेपर
🤖 AI

H2: A Dual Hybrid Semantic Data Lake Architecture for Medical Data Harmonization with Human-In-the-Loop verified, LLM Driven Metadata Annotation System

यह शोध पत्र H2 का प्रस्ताव करता है, जो एक दोहरा हाइब्रिड सिमेंटिक डेटा लेक आर्किटेक्चर है जो विषम चिकित्सा डेटा को सामंजस्यपूर्ण बनाने और मशीन लर्निंग तकनीकों के प्रभावी अनुप्रयोग को सक्षम करने के लिए ह्यूमन-इन-द-लूप, LLM-संचालित मेटाडेटा एनोटेशन का लाभ उठाता है।

मूल लेखक: Ioannis N. Tzortzis, Georgia Kapetadimitri, Agapi Davradou, Nefeli Kousta, Nikolaos Bakalos, Ioannis Rallis, Dimitrios Kalogeras, Nikolaos Doulamis, Anastasios Doulamis

प्रकाशित 2026-08-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ioannis N. Tzortzis, Georgia Kapetadimitri, Agapi Davradou, Nefeli Kousta, Nikolaos Bakalos, Ioannis Rallis, Dimitrios Kalogeras, Nikolaos Doulamis, Anastasios Doulamis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अराजक पुस्तकालय में कदम रख रहे हैं जहाँ किताबें फर्श पर बिखरी हुई हैं, ढेरों में रखी गई हैं, या कागजों के ढेर के नीचे दबी हुई हैं। कुछ किताबें सटीक अंग्रेजी में लिखी गई हैं, कुछ कोड में लिखी गई हैं, और कुछ सिर्फ मानचित्रों की तस्वीरें हैं। यह तब होता है जब अस्पताल और अनुसंधान केंद्र चिकित्सा डेटा एकत्र करते हैं: उनके पास चित्र, टेक्स्ट नोट्स और संख्याएँ होती हैं, लेकिन वे उन्हें अक्सर एक विशाल, अव्यवस्थित "डेटा लेक" (data lake) में संग्रहीत करते हैं। समस्या यह है कि जबकि एक डेटा लेक सब कुछ रखने के लिए तो बेहतरीन है, लेकिन कुछ भी खोजने के लिए बहुत खराब है। यदि आप किताबों को व्यवस्थित नहीं कर सकते, तो आप एक कहानी नहीं लिख सकते, और यदि आप कहानी नहीं लिख सकते, तो आप जानकारी का उपयोग बीमारियों को ठीक करने या स्मार्ट कंप्यूटरों को प्रशिक्षित करने के लिए नहीं कर सकते।

इस गड़बड़ी को ठीक करने के लिए, वैज्ञानिक "नॉलेज ग्राफ" (Knowledge Graph) नामक चीज़ का उपयोग करते हैं। इसे एक विशाल, जादुई वेब की तरह समझें जो बिंदुओं को जोड़ता है। केवल तथ्यों को सूचीबद्ध करने के बजाय, यह उनके बीच रेखाएं खींचता है, जैसे "रोगी A" को "एमआरआई स्कैन B" से और फिर "कैंसर प्रकार C" से जोड़ना। यह कंप्यूटरों को यह समझने में मदद करता है कि चीजें एक-दूसरे से कैसे संबंधित हैं। लेकिन इस वेब को बनाने के लिए आमतौर पर विशेषज्ञों की एक टीम की आवश्यकता होती है जो हर एक फ़ाइल को मैन्युअल रूप से पढ़ती है और रेखाएं खींचती है, जो कि धीमी और महंगी प्रक्रिया है। हाल ही में, हमने "लार्ज लैंग्वेज मॉडल्स" (LLMs) जैसे अति-स्मार्ट कंप्यूटर मस्तिष्क भी ईजाद किए हैं। ये AI विशेषज्ञों की तरह हैं जिन्होंने इंटरनेट पर लगभग सब कुछ पढ़ा है और अनुमान लगा सकते हैं कि चीजों का क्या अर्थ है। मुख्य सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है: क्या हम इन AI मस्तिष्कों का उपयोग अपने अव्यवस्थित चिकित्सा डेटा को स्वचालित रूप से व्यवस्थित करने और हमारे लिए नॉलेज ग्राफ बनाने के लिए कर सकते हैं, बिना कोई गलती किए?

यह शोध पत्र, जिसका शीर्षक "H2: ए ड्यूल हाइब्रिड सिमेंटिक डेटा लेक आर्किटेक्चर" है, ठीक उसी समस्या के समाधान के लिए एक चतुर प्रस्ताव देता है। लेखक, जो ग्रीस की एक टीम है, ने एक ऐसा सिस्टम बनाया है जो एक सुपर-ऑर्गनाइज्ड लाइब्रेरियन की तरह काम करता है जो लाइब्रेरी को व्यवस्थित करने के लिए अपने AI सहायक का उपयोग करता है। वे अपने सिस्टम को "H2" कहते हैं, और यह "ड्यूल हाइब्रिड" दृष्टिकोण का उपयोग करता है। कल्पना कीजिए कि एक पुस्तकालय के पास पुस्तकों को व्यवस्थित करने के दो तरीके हैं: बुनियादी जानकारी (जैसे लेखक का नाम और तारीख) के लिए एक सख्त, कठोर फाइलिंग कैबिनेट और जटिल संबंधों के लिए एक लचीला, जादुय वेब। कठोर हिस्सा यह सुनिश्चित करता है कि कुछ भी खो न जाए, जबकि लचीला हिस्सा AI को डेटा के बीच नए संबंध बनाने की अनुमति देता है।

उनका आविष्कार "ह्यूमन-इन-द-लूप" (HIL) सिस्टम का मूल है। यह कैसे काम करता है: सबसे पहले, सिस्टम एक अव्यवस्थित मेडिकल डेटासेट लेता है और जानकारी का एक बुनियादी ढांचा (skeleton) बनाने के लिए सख्त नियमों का उपयोग करता है। फिर, यह एक AI (LLM) से पूछता है कि डेटा किस प्रकार के चिकित्सा कार्यों के लिए उपयुक्त है—जैसे कि "यह डेटासेट ट्यूमर का पता लगाने के लिए कंप्यूटर को प्रशिक्षित करने के लिए एकदम सही है।" यह सुनिश्चित करने के लिए कि AI केवल मनगढ़ंत बातें न बनाए (एक समस्या जिसे "हैलुसिनेशन" कहा जाता है), एक दूसरा AI एक सख्त सुपरवाइजर के रूप में कार्य करता है, जो पहले AI के काम की जांच करता है। यदि सुपरवाइजर अनिश्चित है, तो एक मानव हस्तक्षेप कर सकता है और दोबारा जांच कर सकता है। यह सुनिश्चित करता है कि अंतिम वेब के संबंध स्मार्ट और सटीक दोनों हों।

इस विचार का परीक्षण करने के लिए कि क्या यह वास्तव में काम करता है, शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने एक बड़ा प्रयोग चलाया। उन्होंने Kaggle नामक एक सार्वजनिक वेबसाइट से 500 वास्तविक मेडिकल डेटासेट और 140 AI मॉडल लिए और विभिन्न AI मस्तिष्कों का उपयोग करके उन्हें लेबल करने की कोशिश की। उन्होंने सात अलग-अलग AI मॉडल का परीक्षण किया, जिनमें छोटे और तेज़ से लेकर बड़े और शक्तिशाली मॉडल शामिल थे। उन्होंने यह मापने के लिए कि प्रत्येक AI डेटा के लिए कितना सही पहचान करने में सक्षम था (एक स्कोर जिसे "रिकॉल" कहा जाता है) और वह इसे कितनी तेज़ी से कर सकता था।

परिणाम बेहद दिलचस्प थे। लेखकों ने पाया कि काम पूरा करने के लिए आपको हमेशा सबसे बड़े, सबसे महंगे AI की आवश्यकता नहीं होती है। वास्तव में, अधिकांश परीक्षणों के लिए, Gemma 3:4B नामक एक छोटा, नया मॉडल सबसे अच्छा प्रदर्शन करता है। यह तेज़ था, कम कंप्यूटर संसाधनों का उपयोग करता था, और डेटा को लेबल करने में बहुत सटीक था। हालाँकि, पेपर नोट करता है कि जटिल टेक्नोलॉजी स्टैक से जुड़े एक विशिष्ट प्रकार के कार्य के लिए, Llama 3.1:8B नामक एक थोड़ा बड़ा मॉडल वास्तव में बेहतर काम करता है। यह सुझाव देता है कि "सबसे अच्छा" AI इस बात पर निर्भर करता है कि आप उससे क्या करवा रहे हैं।

शोध पत्र निष्कर्ष निकालता है कि यह हाइब्रिड सिस्टम एक अव्यवस्थित "डेटा स्वैम्प" (data swamp) को एक स्वच्छ, उपयोगी "डेटा लेक" में बदलने का एक मजबूत तरीका है। सख्त नियमों को स्मार्ट AI और सुरक्षा जांच के साथ जोड़कर, उन्होंने एक ऐसा सिस्टम बनाया है जो चिकित्सा डेटा को स्वचालित रूप से व्यवस्थित कर सकता है। हालांकि लेखक इन सिमुलेशन के आधार पर अपने परिणामों को लेकर आश्वस्त हैं, वे यह भी बताते हैं कि यह एक शुरुआत है। वे सुझाव देते हैं कि भविष्य में, इस सिस्टम का उपयोग लाइब्रेरी को स्वचालित रूप से अपडेट रखने के लिए किया जा सकता है, शायद वास्तव में कठिन कार्यों के लिए बड़े AI मॉडल का उपयोग करके। फिलहाल, उन्होंने दिखाया है कि नियमों और AI के सही मिश्रण के साथ, हम अंततः उस चिकित्सा डेटा के पहाड़ों को समझना शुरू कर सकते हैं जिसे हम एकत्र कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →