FMI@SU ToxHabits: Evaluating LLMs Performance on Toxic Habit Extraction in Spanish Clinical Texts
यह शोध पत्र FMI@SU टीम द्वारा किए गए एक अध्ययन को प्रस्तुत करता है जिसने स्पेनिश क्लिनिकल टेक्स्ट में विषाक्त आदत के उल्लेखों (तंबाकू, अल्कोहल, कैनबिस और ड्रग्स) को निकालने और वर्गीकृत करने के लिए विभिन्न LLM प्रॉम्प्टिंग रणनीतियों का मूल्यांकन किया, जिसमें GPT-4.1 के फ्यू-शॉट प्रॉम्प्टिंग के साथ टेस्ट सेट F1 स्कोर 0.65 प्राप्त किया गया।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास चिकित्सा जर्नल्स (medical journals) का एक विशाल पुस्तकालय है जो स्पेनिश में लिखे गए हैं। इन किताबों के भीतर, डॉक्टर मरीजों के जीवन का वर्णन करते हैं, जिसमें उनकी बुरी आदतों जैसे धूम्रपान, शराब या नशीली दवाओं के संघर्षों का भी उल्लेख होता है। हालाँकि, ये कहानियाँ अव्यवस्थित, असंरचित और जटिल मेडिकल शब्दावली (jargon) में लिखी गई हैं। यह एक ऐसी स्थिति की तरह है जैसे सुइयों को खोजने के लिए घास के ढेर (haystack) में सुई ढूंढना, जहाँ सुइयाँ अलग-अलग सामग्रियों से बनी हैं और घास का ढेर लगातार बदल रहा है।
यह शोध पत्र इस बारे में है कि कैसे शोधकर्ताओं की एक टीम (बुल्गारिया के सोफिया विश्वविद्यालय से) ने उन सुइयों को खोजने में मदद करने के लिए एक "स्मार्ट रोबोट" बनाया। उनका लक्ष्य इस आर्टिफिशियल इंटेलिजेंस (AI) को यह सिखाना था कि स्पेनिश मेडिकल कहानियों को कैसे पढ़ा जाए और स्वचालित रूप से यह उजागर किया जाए कि मरीज ने वास्तव में किस जहरीली आदत (जैसे "धूम्रपान" या "शराब पीना") का उल्लेख किया है और वह किस प्रकार की आदत है।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल भाषा में:
चुनौती: "घास के ढेर में सुई"
शोधकर्ताओं को एक बड़ी समस्या का सामना करना पड़ा: 80% मेडिकल डेटा असंरचित टेक्स्ट (unstructured text) है। कंप्यूटर गणित में बहुत अच्छे होते हैं, लेकिन उन्हें मानवीय भाषा की बारीकियों को समझने में कठिनाई होती है, खासकर जब वह मेडिकल शब्दों के साथ मिश्रित हो। उन्हें चार विशिष्ट "बुरी आदतों" के उल्लेखों को खोजने की आवश्यकता थी:
- तंबाकू (Tobacco)
- शराब (Alcohol)
- कैनबिस/गांजा (Cannabis)
- ड्रग्स (Drugs)
उपकरण: "सुपर-ट्रांसलेटर" (LLMs)
कंप्यूटर को शुरू से सिखाने के बजाय (जो कि एक बच्चे को शब्दकोश का हर एक शब्द दिखाकर पढ़ना सिखाने जैसा है), टीम ने लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग किया। एक LLM को एक सुपर-स्मार्ट, दुनिया घूमने वाले अनुवादक के रूप में सोचें जिसने अब तक लिखी गई लगभग हर चीज़ पढ़ी है।
उन्होंने इस "अनुवादक" से बात करने के विभिन्न तरीकों का परीक्षण किया:
- जीरो-शॉट (Zero-Shot): बिना किसी उदाहरण के बस रोबोट से पूछना, "धूम्रपान के उल्लेख खोजो।" (जैसे किसी पर्यटक से बिना नक्शे के एक विशिष्ट सड़क खोजने के लिए कहना)।
- फ्यू-शॉट (Few-Shot): रोबोट को पहले कुछ उदाहरण देना। "यहाँ धूम्रपान वाला एक वाक्य है। यहाँ एक और है। अब, इस नए वाक्य में धूम्रपान खोजो।" (जैसे किसी पर्यटक को भेजने से पहले उसे उस सड़क की फोटो दिखाना)।
- प्रॉम्प्ट ऑप्टिमाइज़ेशन (Prompt Optimization): निर्देशों को जितना संभव हो सके उतना स्पष्ट बनाने के लिए उनमें बदलाव करना।
जीतने वाली रणनीति: "केवल बताओ मत, दिखाओ भी"
टीम ने पाया कि सबसे अच्छा दृष्टिकोण GPT-4.1 नामक एक विशिष्ट मॉडल का उपयोग करके फ्यू-शॉट प्रॉम्प्टिंग (Few-Shot Prompting) था।
कल्पना कीजिए कि आप मेल छाँटने के लिए एक नया इंटर्न रख रहे हैं।
- यदि आप केवल कहते हैं, "धूम्रपान वाले पत्र छाँटो," तो वे भ्रमित हो सकते हैं।
- लेकिन यदि आप उन्हें धूम्रपान वाले पत्रों के पाँच उदाहरण दिखाते हैं और कहते हैं, "देखो ये कैसे दिखते हैं? अब बाकी को ढूँढो," तो वे बहुत बेहतर काम करते हैं।
टीम ने AI को मेडिकल टेक्स्ट के पाँच उदाहरण दिए जहाँ जहरीली आदतों को हाइलाइट किया गया था। AI ने फिर उन दस्तावेजों को स्कैन करने के लिए उन उदाहरणों का उपयोग एक पैटर्न के रूप में किया।
परिणाम: एक अच्छी शुरुआत, लेकिन पूर्ण नहीं
रोबोट ने काफी अच्छा काम किया! इसने 0.65 का स्कोर प्राप्त किया (एक ऐसे पैमाने पर जहाँ 1.0 पूर्ण है)।
- अच्छी खबर: यह आदत के सामान्य विचार को खोजने में बहुत अच्छा था। यदि टेक्स्ट में लिखा था "उसने रम की एक बोतल पी," तो रोबोट ने "रम की एक बोतल पी" को खोज लिया।
- बुरी खबर: रोबोट कभी-कभी बहुत अधिक हिस्सा पकड़ लेता था। यदि टेक्स्ट में लिखा था "उसने कल रम की एक बोतल पी," तो रोबोट "कल" सहित पूरा वाक्यांश पकड़ सकता था, जबकि डॉक्टर केवल "रम की एक बोतल पी" चाहते थे। यह एक मेटल डिटेक्टर की तरह था जो सिक्के के लिए बीप करता है लेकिन उसके आसपास की मिट्टी के लिए भी बीप करता है।
उन्होंने रोबोट को एक साधारण "डिक्शनरी" (ज्ञात बुरे शब्दों की सूची) के साथ मिलाने की भी कोशिश की। आश्चर्यजनक रूप से, इससे मदद नहीं मिली; इसने रोबोट को और अधिक भ्रमित कर दिया, जैसे एक ही समय में GPS और कागज के नक्शे का उपयोग करने की कोशिश करना जब वे आपस में असहमत हों।
यह क्यों महत्वपूर्ण है
यह एक बड़ी बात है क्योंकि अधिकांश मेडिकल AI टूल्स अंग्रेजी पर प्रशिक्षित होते हैं। इस टीम ने साबित किया कि आप एक नया मॉडल बनाए बिना इन शक्तिशाली AI टूल्स का उपयोग स्पेनिश मेडिकल टेक्स्ट को समझने के लिए कर सकते हैं।
भविष्य: हीरे को तराशना
शोधकर्ता स्वीकार करते हैं कि उनका रोबोट अभी भी पूर्ण नहीं है। यह कभी-कभी अतिरिक्त शब्द (जैसे "नहीं" या "कल") पकड़ लेता है जो अर्थ बदल देते हैं।
- भविष्य की योजना: वे एक "क्लीनअप क्रू" (एक पोस्ट-प्रोसेसिंग चरण) जोड़ना चाहते हैं ताकि रोबोट द्वारा पकड़े गए अतिरिक्त शब्दों को छाँटा जा सके, जिससे परिणाम अधिक सटीक हो सकें।
- एक अन्य विचार: केवल यादृच्छिक (random) उदाहरण दिखाने के बजाय, वे चाहते हैं कि रोबोट को ऐसे उदाहरण दिखाए जाएँ जो वर्तमान वाक्य के सबसे अधिक समान हों (जैसे किसी पर्यटक को उस सड़क की फोटो दिखाना जो बिल्कुल वैसी ही दिखती है जिस पर वह अभी है)।
संक्षेप में
टीम ने एक स्मार्ट सहायक बनाया है जो अस्त-व्यस्त स्पेनिश मेडिकल नोट्स को पढ़ सकता है और ड्रग्स और अल्कोहल संबंधी समस्याओं को हाइलाइट कर सकता है। इसे क्या खोजना है, इसके कुछ उदाहरण दिखाकर, उन्होंने इस सहायक को वह काम करना सिखाया जिसके लिए आमतौर पर मानव विशेषज्ञ की आवश्यकता होती है। हालाँकि यह कभी-कभी बहुत अधिक जानकारी पकड़ लेता है, लेकिन यह उन भाषाओं के लिए एक शक्तिशाली कदम है जो अंग्रेजी नहीं हैं, ताकि डॉक्टरों और शोधकर्ताओं को मरीजों की आदतों को जल्दी समझने में मदद मिल सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।