Leveraging Few-Shot Learning and Large Language Models for Analyzing Blood Pressure Variations Across Biological Sex from Scientific Literature
यह अध्ययन वैज्ञानिक साहित्य से लिंग-विशिष्ट रक्तचाप सांख्यिकी को स्वचालित रूप से निकालने के लिए लार्ज लैंग्वेज मॉडल्स (LLMs) और फ्यू-शॉट लर्निंग का उपयोग करने की व्यवहार्यता का मूल्यांकन करता है, जिसका उद्देश्य वर्तमान जनसांख्यिकीय-अंध मानक नैदानिक मानकों की सीमाओं को संबोधित करना है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप भीड़ के लिए एक आदर्श केक बनाने की कोशिश कर रहे हैं, लेकिन आपकी रेसिपी बुक पचास साल पहले एक बहुत ही विशिष्ट समूह के बेकर्स द्वारा लिखी गई थी, जो केवल उन्हीं लोगों के लिए बेक करते थे जो बिल्कुल उन्हीं की तरह दिखते थे और उन्हीं की तरह रहते थे। आप दूसरों के लिए उस पुरानी रेसिपी का उपयोग करने की कोशिश करते हैं, लेकिन केक कुछ लोगों के लिए बहुत सूखा और दूसरों के लिए बहुत मीठा बन जाता है। यह अनिवार्य रूप से वह समस्या है जिसके साथ हम वर्तमान में रक्तचाप (ब्लड प्रेशर) को मापते हैं। दशकों से, डॉक्टर यह तय करने के लिए कि किसी का हृदय बहुत अधिक तनाव में है या नहीं, संख्याओं के एक ही सेट का उपयोग करते रहे हैं, जो अक्सर इस बात को अनदेखा कर देता है कि एक व्यक्ति की जीव विज्ञान—जैसे कि वह पुरुष है या महिला—का अर्थ यह हो सकता है कि उसे नियमों के एक अलग सेट की आवश्यकता है।
इसे ठीक करने के लिए, वैज्ञानिक एक नए प्रकार के डिजिटल जासूस की ओर मुड़ रहे हैं: लार्ज लैंग्वेज मॉडल्स (LLMs)। इन मॉडल्स को ऐसे सुपर-स्मार्ट रोबोट के रूप में सोचें जिन्होंने इंटरनेट पर लिखी गई लगभग हर चीज़ पढ़ ली है। वे एक ऐसे छात्र की तरह हैं जिसने दुनिया के हर पुस्तकालय को याद कर लिया है और बिना थके दस लाख पन्नों की किताब में से तुरंत एक विशिष्ट तथ्य ढूंढ सकता है। बड़ा सवाल जो शोधकर्ताओं ने पूछना चाहता था वह था: क्या ये AI रोबल्स हजारों पुराने मेडिकल अध्ययनों को पढ़ सकते हैं, पुरुषों और महिलाओं के लिए विशिष्ट रक्तचाप के नंबर ढूंढ सकते हैं, और हमें बता सकते हैं कि क्या पुराना "एक ही आकार सभी के लिए उपयुक्त" (one-size-fits-all) वाला नुस्खा वास्तव में टूटा हुआ है?
महान रक्तचाप खजाने की खोज (The Great Blood Pressure Treasure Hunt)
इस अध्ययन में, शोधकर्ताओं की एक टीम ने इन AI रोबोट्स को परखने का फैसला किया। वे देखना चाहते थे कि क्या ये रोबल्स वैज्ञानिक शोध पत्रों के पहाड़ में से एक बहुत ही विशिष्ट खजाना खोज सकते हैं: औसत रक्तचाप के नंबर और वे नंबर कितना भिन्न होते हैं, जिसे जैविक लिंग (पुरुष बनाम महिला) के आधार पर अलग किया गया हो।
सेटअप: एक डिजिटल गोल्ड रश
शोधकर्ताओं ने डेटा का एक विशाल ढेर लेकर शुरुआत की। उन्होंने पबमेड सेंट्रल (PubMed Central) नामक एक विशाल ऑनलाइन लाइब्रेरी से 5.6 मिलियन से अधिक वैज्ञानिक पांडुलिपियों (manuscripts) को इकट्ठा किया। कल्पना कीजिए कि आप एक शहर के आकार के घास के ढेर में से कुछ विशिष्ट सुइयां खोजने की कोशिश कर रहे हैं। इसे आसान बनाने के लिए, उन्होंने एक विशेष सर्च इंजन बनाया (वैज्ञानिकों के लिए एक सुपर-चार्ज्ड गूगल की तरह) जिसने उन शोध पत्रों को छानकर लगभग 1,13,000 तक सीमित कर दिया जो रक्तचाप के बारे में बात करते थे। फिर, उन्होंने उन शोध पत्रों को छोटे टुकड़ों (अनुच्छेदों) में विभाजित किया और फिर से फिल्टर किया, जिससे अंत में लगभग 50,000 प्रासंगिक अनुच्छेद प्राप्त हुए।
इस विशाल ढेर में से, उन्होंने अपने AI टूल्स का परीक्षण करने के लिए 213 लेखों का एक छोटा, प्रबंधनीय समूह चुना। उन्होंने यहां तक कि मानव विशेषज्ञों से इन लेखों को पढ़ने और उपयोग के लिए सही नंबर लिखने को भी कहा ताकि एक "उत्तर कुंजी" (answer key) तैयार की जा सके।
प्रतियोगिता: तीन अलग-अलग जासूस
शोधकर्ताओं ने यह देखने के लिए तीन अलग-अलग तरीकों के बीच एक दौड़ आयोजित की कि कौन सा तरीका सही नंबरों को सबसे अच्छी तरह से खोज सकता है:
- पुराना स्कूल का नौसिखिया (DANN): यह एक पारंपरिक कंप्यूटर प्रोग्राम है जिसे अनुमान लगाने से पहले कुछ उदाहरण दिखाए जाने की आवश्यकता होती है (जैसे कि "फ्यू-शॉट लर्निंग")। यह एक ऐसे छात्र की तरह है जिसे टेस्ट देने से पहले कुछ फ्लैशकार्ड्स का अध्ययन करना पड़ता है।
- प्रसिद्ध चैटबॉट (GPT-3.5): यह एक प्रसिद्ध AI है जो चैट कर सकता है और कहानियाँ लिख सकता है। शोधकर्ताओं ने इसे बिना किसी विशेष प्रशिक्षण के केवल टेक्स्ट पढ़ने और नंबर खोजने के लिए कहा (इसे "जीरो-शॉट" कहा जाता है)।
- ओपन-सोर्स दिग्गज (LLaMA3): यह एक अन्य शक्तिशाली AI है, जो चैटबॉट के समान है लेकिन एक अलग समूह द्वारा बनाया गया है। चैटबॉट की तरह, इसे भी बिना किसी विशेष प्रशिक्षण के, केवल अपने सामान्य ज्ञान का उपयोग करके काम करने के लिए कहा गया था।
परिणाम: दौड़ किसने जीती?
परिणाम काफी स्पष्ट थे। "पुराना स्कूल का नौसिखिया" (DANN) बुरी तरह संघर्ष कर रहा था। इसने केवल लगभग 30% उत्तर सही दिए। यह एक ऐसे छात्र की तरह था जिसने टेस्ट पर रैंडम अंदाज़े लगाए।
"प्रसिद्ध चैटबॉट" (GPT-3.5) बेहतर था, जिसने लगभग 67% उत्तर सही पाए। यह एक ठोस मध्यम स्तर का प्रदर्शन करने वाला था, लेकिन यह कभी-कभी उन चीजों को भी मिस कर देता था जिन्हें उसे ढूंढ लेना चाहिए था।
विजेता था "ओपन-सोर्स दिग्गज" (LLaMA3)। इसने सटीकता के पैमाने पर प्रभावशाली 0.85 (या 85%) स्कोर किया। यह सबसे विश्वसनीय जासूस था, जिसने उच्च सटीकता के साथ पुरुषों और महिलाओं के लिए सही नंबर खोजे और शायद ही कभी कोई सुराग छोड़ा। शोधकर्ताओं ने पाया कि यह AI इतना सुसंगत था कि कई बार टेस्ट चलाने के बाद भी इसके स्कोर में बहुत अधिक उतार-चढ़ाव नहीं आया।
खजाने में उन्हें क्या मिला?
एक बार जब विजेता AI (LLaMA3) ने सफलतापूर्वक शोध पत्रों से नंबर निकाल लिए, तो शोधकर्ताओं ने पैटर्न देखे। उन्होंने डेटा को विज़ुअलाइज़ करने के लिए रंगीन मानचित्र (जिन्हें हीटमैप और कंटूर प्लॉट कहा जाता है) बनाए। इन मानचित्रों ने दिखाया कि, सामान्य तौर पर, पुरुषों का रक्तचाप महिलाओं की तुलना में अधिक होता है।
यह अपने आप में कोई चौंकाने वाली खोज नहीं है—पिछले अध्ययनों ने इस ओर इशारा किया है—लेकिन दिलचस्प बात यह है कि उन्होंने इसे कैसे पाया। उन्होंने हजारों पेपर पढ़ने के लिए किसी इंसान को नहीं कहा; उन्होंने इस काम को स्वचालित रूप से करने के लिए एक AI का उपयोग किया। यह सुझाव देता है कि हम इन शक्तिशाली रोबोट्स का उपयोग पूरे चिकित्सा साहित्य को स्कैन करने के लिए कर सकते हैं ताकि यह देख सकें कि विभिन्न समूहों के लोग वास्तव में कैसा प्रदर्शन कर रहे हैं, बजाय इसके कि हम पुराने, जेनेरिक नियमों पर निर्भर रहें।
निष्कर्ष (The Bottom Line)
अध्ययन यह निष्कर्ष निकालता है कि ये AI रोबोट्स बड़े लीग के लिए तैयार हैं। वे वैज्ञानिक साहित्य को पढ़ सकते हैं, डेटा को लिंग के आधार पर अलग कर सकते हैं, और हमें रक्तचाप के रुझानों की एक स्पष्ट तस्वीर दे सकते हैं जो केवल अनुमान लगाने या पुराने तरीकों के उपयोग से मिल सकती थी। हालांकि शोधकर्ता स्वीकार करते हैं कि उन्होंने केवल लिंग को देखा और इस विशिष्ट रन में आयु या नस्ल जैसे अन्य कारकों की जांच नहीं की, लेकिन यह तरीका काम करता है। यह अंततः एक ऐसा टूल होने जैसा है जो लाखों अनुबंधों की बारीक लिखावट को पढ़ सकता है ताकि आपको यह बता सके कि नियम सभी के लिए निष्पक्ष हैं या नहीं, न कि केवल उन लोगों के लिए जिनके लिए वे नियम मूल रूप से लिखे गए थे।
पेपर यह सुझाव देता है कि इन टूल्स का उपयोग करके, हम अंततः अधिक व्यक्तिगत, सटीक स्वास्थ्य दिशानिर्देश बना पाएंगे जो वास्तविक लोगों के अनुकूल हों, बजाय इसके कि हर किसी को एक ऐसे बॉक्स में फिट करने की कोशिश की जाए जो उनके लिए पूरी तरह सही नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।