Relation Extraction Capabilities of LLMs on Clinical Text: A Bilingual Evaluation for English and Turkish
यह अध्ययन पहला द्विभाषी अंग्रेजी-तुर्की नैदानिक संबंध निष्कर्षण (clinical relation extraction) डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि प्रॉम्प्टिंग-आधारित लार्ज लैंग्वेज मॉडल्स, विशेष रूप से जब उन्हें एक नवीन रिलेशन-अवेयर रिट्रीवल रणनीति के साथ उन्नत किया जाता है, पारंपरिक फाइन-ट्यून्ड बेसलाइन्स से बेहतर प्रदर्शन करते हैं और अंग्रेजी एवं तुर्की मूल्यांकन के बीच एक प्रदर्शन अंतराल को प्रकट करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक डॉक्टर हैं जो अपने मरीज के मेडिकल चार्ट को पढ़ने की कोशिश कर रहे हैं। चार्ट हाथ से लिखे नोट्स और तकनीकी शब्दों (jargon) का एक बिखरा हुआ ढेर है। आपका लक्ष्य केवल शब्दों को पढ़ना नहीं है; बल्कि उनके बीच के संबंध को जोड़ना है। आपको यह जानना है: क्या यह दवा इस बीमारी को ठीक करती है? क्या इस टेस्ट ने उस बीमारी का पता लगाया? क्या यह बीमारी मरीज की स्थिति को और बिगाड़ रही है?
इस प्रक्रिया को रिलेशन एक्सट्रैक्शन (Relation Extraction) कहा जाता है। यह एक जासूस होने जैसा है जिसे एक कहानी में दो संदिग्धों (entities) के बीच के विशिष्ट संबंध को समझना होता है।
यह शोध पत्र इस बारे में है कि कैसे सुपर-इंटेलिजेंट कंप्यूटर दिमागों (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) को यह जासूसी वाला काम सिखाया जाए, न कि केवल अंग्रेजी में, बल्कि तुर्की (Turkish) भाषा में भी।
यहाँ उनकी कहानी सरल रूप से समझाई गई है:
1. समस्या: "भाषा का अंतर" (The Language Gap)
इन सुपर-स्मार्ट कंप्यूटरों में से अधिकांश को मुख्य रूप से अंग्रेजी पर प्रशिक्षित किया गया है। वे उन प्रतिभाशाली छात्रों की तरह हैं जिन्होंने केवल अंग्रेजी लाइब्रेरी में पढ़ाई की है। यदि आप उनसे तुर्की में कोई मेडिकल रहस्य सुलझाने के लिए कहते हैं, तो वे अक्सर लड़खड़ा जाते हैं क्योंकि तुर्की में बहुत कम "अभ्यास पुस्तकें" (datasets) उपलब्ध हैं।
शोधकर्ताओं ने यह देखना चाहा कि क्या ये कंप्यूटर अंग्रेजी के मेडिकल नोट्स की तरह ही तुर्की के मेडिकल नोट्स को भी संभाल सकते हैं, और क्या वे इसे बिना दोबारा से प्रशिक्षित (retrain) हुए कर सकते हैं (जो कि महंगा और कठिन है)।
2. नया टूल: एक द्विभाषी "अभ्यास पुस्तक"
इसका परीक्षण करने के लिए, टीम ने कुछ ऐसा बनाया जो पहले मौजूद नहीं था: एक समानांतर द्विभाषी डेटासेट (parallel bilingual dataset)।
- स्रोत (The Source): उन्होंने अंग्रेजी मेडिकल नोट्स का एक प्रसिद्ध संग्रह (2010 i2b2/VA dataset) लिया जिसका उपयोग हर कोई अभ्यास के लिए करता है।
- अनुवाद (The Translation): उन्होंने केवल एक रोबोट अनुवादक का उपयोग नहीं किया। उन्होंने वास्तविक चिकित्सा विशेषज्ञों और भाषाविदों से इन नोट्स का सावधानीपूर्वक तुर्की में अनुवाद करवाया, ताकि यह सुनिश्चित हो सके कि चिकित्सा अर्थ पूरी तरह से सटीक रहे।
- परिणाम: अब, उनके पास एक "अभ्यास पुस्तक" थी जहाँ हर अंग्रेजी वाक्य का एक सटीक तुर्की जुड़वां मौजूद था। इसने उन्हें कंप्यूटरों का दोनों भाषाओं में निष्पक्ष परीक्षण करने की अनुमति दी।
3. रणनीति: कंप्यूटर को कैसे सिखाएं
शोधकर्ताओं ने कंप्यूटर को पहेली सुलझाने के लिए दो मुख्य तरीके आज़माए:
तरीका A: "रट्टा मारने" का दृष्टिकोण (Fine-Tuning)
यह एक छात्र को लेने और उसे 1,500 विशिष्ट अभ्यास प्रश्नों को तब तक रटाने जैसा है जब तक कि वह उत्तर याद न कर ले। शोधकर्ताओं ने इसे छोटे, पुराने मॉडल्स (जैसे BERT) के साथ आज़माया।- परिणाम: यह ठीक था, लेकिन छात्र संघर्ष कर रहा था क्योंकि 1,500 प्रश्न सब कुछ पूरी तरह से याद करने के लिए पर्याप्त नहीं थे।
तरीका B: "संकेत" देने का दृष्टिकोण (Prompting)
रटाने के बजाय, यह छात्र को परीक्षा से ठीक पहले कुछ बहुत अच्छे उदाहरण देने और यह कहने जैसा है, "देखो मैंने इन्हें कैसे हल किया, अब तुम कोशिश करो।" इसे इन-कॉन्टेक्स्ट लर्निंग (In-Context Learning) कहा जाता है।- ट्विस्ट: शोधकर्ताओं ने महसूस किया कि आप छात्र को कौन से उदाहरण दिखाते हैं, यह मायने रखता है। यदि आप रैंडम उदाहरण दिखाते हैं, तो छात्र भ्रमित हो जाता है।
- नवाचार (RAR): उन्होंने उदाहरण चुनने का एक नया तरीका विकसित किया जिसे रिलेशन-अवेयर रिट्रीवल (Relation-Aware Retrieval - RAR) कहा जाता है। सतह पर दिखने वाले समानता वाले उदाहरणों को चुनने के बजाय, RAR उन उदाहरणों को चुनता है जिनमें एक ही प्रकार का संबंध होता है।
- उपमा (Analogy): यदि टेस्ट का सवाल "दवा A द्वारा बीमारी B को ठीक करने" के बारे में है, तो RAR एक ऐसा अभ्यास उदाहरण खोजता है जहाँ "दवा C ने बीमारी D को ठीक किया।" यह केवल उस उदाहरण को नहीं चुनता जिसमें दवा का उल्लेख हो; बल्कि यह एक ऐसा उदाहरण चुनता है जो इलाज के तर्क (logic) से मेल खाता हो।
4. परिणाम: कौन जीता?
शोधकर्ताओं ने जेमिनी (Gemini), डीपसीक (DeepSeek) और जीपीटी (GPT) जैसे कई अलग-अलग "सुपर-ब्रेन" (LLMs) का परीक्षण किया।
- "संकेत" वाला दृष्टिकोण जीता: जिन्हें अच्छे उदाहरण दिए गए थे (तरीका B), वे उन कंप्यूटरों की तुलना में बहुत अधिक स्मार्ट थे जिन्होंने रटने की कोशिश की थी (तरीका A)।
- "सबसे अच्छा संकेत" विधि: RAR विधि (सबसे तार्किक उदाहरण चुनना) स्पष्ट विजेता थी। इसने कंप्यूटरों को उच्चतम स्कोर प्राप्त करने में मदद की।
- अंग्रेजी बनाम तुर्की: जैसा कि अपेक्षित था, कंप्यूटर अंग्रेजी (उनकी सबसे अच्छी ज्ञात भाषा) में थोड़े बेहतर थे, लेकिन उन्होंने तुर्की में भी आश्चर्यजनक रूप से अच्छा प्रदर्शन किया।
- चैंपियन: RAR विधि (स्मार्ट उदाहरण चयन) और कंप्यूटर को "चरण-दर-चरण सोचने" (जिसे चेन-ऑफ-थॉट - Chain-of-Thought कहा जाता है) के लिए कहने के संयोजन ने सबसे अच्छे परिणाम दिए।
- अंग्रेजी में, उन्होंने 0.918 का स्कोर प्राप्त किया (लगभग पूर्ण)।
- तुर्की में, उन्होंने 0.888 प्राप्त किया (एक कम-संसाधन वाली भाषा के लिए बहुत प्रभावशाली)।
5. मुख्य निष्कर्ष (The Big Takeaway)
यह शोध पत्र साबित करता है कि कंप्यूटर को स्मार्ट बनाने के लिए आपको हमेशा हजारों उदाहरण रटाने की आवश्यकता नहीं होती है। इसके बजाय, यदि आप इसे उच्च-गुणवत्ता वाले, प्रासंगिक उदाहरण देते हैं (एक अच्छे शिक्षक की तरह) और इसे अपने तर्क को समझाने के लिए कहते हैं, तो यह विभिन्न भाषाओं में जटिल चिकित्सा पहेलियों को बहुत प्रभावी ढंग से हल कर सकता है।
उन्होंने यह भी पाया कि इन मॉडल्स के लिए तुर्की भाषा अंग्रेजी की तुलना में कठिन है। तुर्की एक "एग्लूटिनेटिव" (agglutinative) भाषा है (शब्द कई प्रत्यय जोड़कर बहुत लंबे और जटिल हो जाते हैं), जो कंप्यूटर के लिए संबंधों को पहचानना मुश्किल बना देता है। हालाँकि, नए "स्मार्ट हिंट" तरीके ने इस अंतर को काफी हद तक कम करने में मदद की।
संक्षेप में: एक नया द्विभाषी डेटासेट बनाकर और अभ्यास उदाहरणों को चुनने का एक स्मार्ट तरीका आविष्कार करके, शोधकर्ताओं ने दिखाया कि AI, अंग्रेजी और तुर्की दोनों में एक बेहतरीन मेडिकल जासूस बन सकता है, और इसके लिए भारी मात्रा में नए डेटा की आवश्यकता नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।