RiTeK: A Dataset for Large Language Models Complex Reasoning over Textual Knowledge Graphs in Medicine
यह शोध पत्र RiTeK प्रस्तुत करता है, जो एक व्यापक बेंचमार्क डेटासेट है जिसे डेटा की कमी, टोपोलॉजिकल अभिव्यक्ति और रिट्रीवल प्रदर्शन की वर्तमान सीमाओं को संबोधित करते हुए मेडिकल टेक्स्टुअल नॉलेज ग्राफ्स पर लार्ज लैंग्वेज मॉडल्स की जटिल तर्क क्षमताओं का मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही पेचीदा मेडिकल रहस्य सुलझाने की कोशिश कर रहे हैं। आप सिर्फ यह नहीं पूछ रहे हैं, "सिरदर्द क्या है?" बल्कि आप यह पूछ रहे हैं, "वह कौन सा अंग है, जो माँ और बच्चे के बीच रक्त संचार के लिए जिम्मेदार है, और जब बच्चा संकट में होता है तो उसमें क्या गड़बड़ी होती है, और उससे कौन से विशिष्ट लक्षण पैदा होते हैं?"
इसका उत्तर देने के लिए, एक कंप्यूटर को एक साथ दो काम करने होंगे:
- एक मानचित्र पर नेविगेट करना: इसे चिकित्सा तथ्यों के एक विशाल जाल (नॉलेज ग्राफ) के माध्यम से सही रास्ता खोजने के लिए एक पथ का अनुसरण करना होगा।
- बारीकियों को पढ़ना: इसे उन तथ्यों से जुड़ी विस्तृत विवरणों को पढ़ना होगा ताकि यह सुनिश्चित हो सके कि यह गलत चीज़ का चयन नहीं कर रहा है।
यह पेपर RiTeK पेश करता है, जो एक नया टूल है जिसे यह परीक्षण करने के लिए डिज़ाइन किया गया है कि क्या आर्टिफिशियल इंटेलिजेंस (AI) वास्तव में यह कठिन काम कर सकता है।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर का विवरण दिया गया है:
1. समस्या: "खाली मानचित्र" और "अस्पष्ट प्रश्न"
वर्तमान में, AI मॉडल बातचीत करने में बहुत अच्छे हैं, लेकिन वे जटिल चिकित्सा प्रश्नों के साथ संघर्ष करते हैं जिनमें संरचित डेटा (structured data) में गहराई तक जाने की आवश्यकता होती है।
- पुराना तरीका: मौजूदा डेटासेट एक जासूस को केवल दो या तीन सड़कों वाले मानचित्र देने और फिर उन्हें छिपा हुआ खजाना खोजने के लिए कहने जैसा था। यह बहुत आसान था और वास्तविक जीवन को नहीं दर्शाता था।
- लापता कड़ी: अधिकांश चिकित्सा मानचित्र (नॉलेज ग्राफ) केवल चीजों के नाम (जैसे "हृदय" या "रोग") दिखाते हैं, लेकिन उनमें वह कहानी (उनका क्या कार्य है इसका लिखित विवरण) नहीं होती। यह एक फोन बुक की तरह है जिसमें नाम तो हैं लेकिन पते या विवरण नहीं हैं।
2. समाधान: "RiTeK" का निर्माण (परम प्रशिक्षण मैदान)
लेखकों ने RiTeK नामक एक विशाल नया डेटासेट बनाया है। इसे जटिल चिकित्सा तर्क (reasoning) पर उन्हें प्रशिक्षित करने के लिए डिज़ाइन किया गया एक AI मस्तिष्क के लिए जिम समझें।
- मानचित्र (टेक्स्टुअल नॉलेज ग्राफ): उन्होंने वास्तविक चिकित्सा डेटा का उपयोग करके दो विशाल मानचित्र बनाए। लेकिन पुराने मानचित्रों के विपरीत, यहाँ हर पड़ाव के साथ एक "जीवनी" (biography) जुड़ी हुई है। इसलिए, AI केवल "प्लेसेंटा" (Placenta) नहीं देखता; वह देखता है "प्लेसेंटा: एक अंग जो भ्रूण को गर्भाशय की दीवार से जोड़ता है..."
- प्रश्न (क्वेरीज): उन्होंने केवल साधारण प्रश्न नहीं लिखे। उन्होंने तीन प्रकार के लोगों द्वारा प्रश्न पूछने का अनुकरण (simulate) किया:
- एक मरीज़: "मेरा बच्चा संकट में है, रक्त प्रवाह में क्या समस्या है?"
- एक डॉक्टर: "भ्रुत संकट (fetal distress) में कौन सा ऊतक कार्य बाधित होता है?"
- एक वैज्ञानिक: "Z के संबंध में X और Y के बीच के संबंध का विश्लेषण करें।"
- गुणवत्ता नियंत्रण: इस जिम को जारी करने से पहले, उन्होंने इस काम के लिए वास्तविक चिकित्सा विशेषज्ञों (डॉक्टरों और वैज्ञानिकों) को प्रश्नों को ग्रेड देने के लिए काम पर रखा। उन्होंने यह सुनिश्चित किया कि प्रश्न स्वाभाविक लगें और चिकित्सकीय रूप से सटीक हों, न कि केवल रोबोटिक बकवास।
3. स्ट्रेस टेस्ट: AI को काम पर लगाना
एक बार जब जिम बन गया, तो लेखकों ने 11 अलग-अलग AI रिट्रीवल सिस्टम (जो "एथलीट" हैं) को यह देखने के लिए एक कठोर परीक्षण से गुजारा कि वे इन जटिल प्रश्नों के उत्तर कितनी अच्छी तरह दे सकते हैं।
परिणाम आश्चर्यजनक (और AI के लिए थोड़े डरावने) थे:
- "स्मार्ट" AI (LLMs) भटक गए: यहाँ तक कि सबसे उन्नत AI मॉडल (जैसे GPT-4) भी संघर्ष करते हैं। जब उन्हें चिकित्सा मानचित्र के माध्यम से एक जटिल पथ का अनुसरण करने के लिए कहा गया, तो वे अक्सर भ्रमित हो गए या अपनी ओर से बातें बनाने लगे (hallucinations)।
- "सर्च इंजन" AI भी संघर्ष करता रहा: ग्राफ के माध्यम से खोजने के लिए डिज़ाइन किए गए सिस्टम ने शुद्ध चैटबॉट्स की तुलना में बेहतर प्रदर्शन किया, लेकिन वे फिर भी कठिन प्रश्नों पर चूक गए।
- "हाइब्रिड" दृष्टिकोण जीता (ज्यादातर): सर्वश्रेष्ठ प्रदर्शन करने वाले वे सिस्टम थे जिन्होंने AI के मस्तिष्क को एक संरचित खोज पद्धति के साथ जोड़ा। हालाँकि, विजेताओं ने भी केवल 30-50% उत्तर ही पूरी तरह से सही दिए।
4. निष्कर्ष: हमें बेहतर टूल्स की आवश्यकता है
पेपर यह निष्कर्ष निकालता है कि हालांकि AI स्मार्ट हो रहा है, फिर भी यह जटिल मामलों के लिए एक पूर्ण स्वायत्त चिकित्सा जासूस बनने के लिए तैयार नहीं है।
- उपमा: कल्पना कीजिए कि आप एक GPS को बिना स्ट्रीट साइन वाले शहर में गाड़ी चलाने के लिए कह रहे हैं, जहाँ केवल इमारतों के अस्पष्ट विवरण हैं। GPS सही मोड़ का अनुमान लगा सकता है, लेकिन इसके भटक जाने की संभावना है।
- भविष्य: हमें चिकित्सा डेटा के लिए बेहतर "GPS सिस्टम" बनाने की आवश्यकता है। इन सिस्टमों को डेटा बिंदुओं की "जीवनी" को पढ़ने और साथ ही चिकित्सा संबंधों के जटिल, घुमावदार रास्तों का अनुसरण करने में सक्षम होना चाहिए।
संक्षेप में: RiTeK एक नया, बहुत कठिन परीक्षण है जो साबित करता है कि वर्तमान AI अभी भी जटिल चिकित्सा ज्ञान को समझने में थोड़ा अनाड़ी है। यह भविष्य के चिकित्सा AI से हमारी अपेक्षाओं के लिए एक नया मानक निर्धारित करता है: केवल तथ्य जानना ही नहीं, बल्कि उनके बीच के गहरे, उलझे हुए और विस्तृत संबंधों को समझना।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।