Chest2Vec: A multipurpose text encoder conditioned by instructions for chest radiograph and computed tomography reports
यह शोध पत्र Chest2Vec को प्रस्तुत करता है, जो एक बहुउद्देशीय, निर्देश-आधारित (instruction-conditioned) टेक्स्ट एनकोडर है जो 0.6B और 4B पैरामीटर आकारों में उपलब्ध है और रिट्रीवल, क्लासिफिकेशन और इमेज-टेक्स्ट सुपरविजन जैसे कार्यों के लिए चेस्ट रेडियोग्राफ और सीटी (CT) रिपोर्ट दोनों को प्रभावी ढंग से प्रोसेस करता है, जो मौजूदा मॉडलों की तुलना में सीटी रिपोर्ट पर बेहतर प्रदर्शन प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मेडिकल इमेजिंग की दुनिया में, एक तस्वीर हजार शब्दों के बराबर हो सकती है, लेकिन उन कंप्यूटरों के लिए जो डॉक्टरों को उन तस्वीरों को पढ़ने में मदद करते हैं, शब्द भी उतने ही महत्वपूर्ण होते हैं। जब एक रेडियोलॉजिस्ट चेस्ट एक्स-रे या सीटी स्कैन का परीक्षण करता है, तो वे जो देखते हैं उसका वर्णन करते हुए एक रिपोर्ट लिखते हैं: जैसे कि फेफड़े साफ हैं या नहीं, हृदय के चारों ओर तरल पदार्थ है या नहीं, या कोई हड्डी टूटी हुई है या नहीं। ये रिपोर्ट इस बात का प्राथमिक रिकॉर्ड होती हैं कि छवि क्या दिखाती है, और ये उन आर्टिफिशियल इंटेलिजेंस सिस्टम बनाने की नींव बन गई हैं जो निदान में सहायता कर सकते हैं। कंप्यूटर को इन छवियों को समझने के लिए सिखाने हेतु, इंजीनियरों को उसे पहले रिपोर्ट की भाषा को समझना सिखाना आवश्यक होता है। इसके लिए एक "टेक्स्ट एनकोडर" (text encoder) की आवश्यकता होती है, जो एक विशेष कंप्यूटर प्रोग्राम है जो मानव वाक्यों को एक गणितीय प्रारूप में अनुवादित करता है जिसे मशीन प्रोसेस कर सके। वर्षों से, इन प्रोग्रामों को सामान्य भाषा पर या विशेष रूप से चेस्ट एक्स-रे पर प्रशिक्षित किया गया था, लेकिन वे चेस्ट सीटी स्कैन द्वारा उत्पन्न अधिक जटिल और विस्तृत रिपोर्टों के साथ संघर्ष करते थे, जो शरीर के आंतरिक भाग का बहुत व्यापक दृश्य दिखाते हैं।
शोधकर्ताओं की एक टीम ने अब इस अंतर को भरने के लिए 'चेस्ट2वेक' (Chest2Vec) नामक एक नया टूल बनाया है। यह सिस्टम चेस्ट एक्स-रे और चेस्ट सीटी स्कैन दोनों के टेक्स्ट को समझने के लिए डिज़ाइन किया गया है, जो इन दो अलग-अलग प्रकार के मेडिकल इमेजिंग के लिए एक सार्वभौमिक अनुवादक के रूप में कार्य करता है। शोधकर्ताओं ने इस टूल के दो संस्करण बनाए, एक छोटा और एक बड़ा, और मौजूदा प्रोग्रामों के विरुद्ध इनका परीक्षण किया ताकि यह देखा जा सके कि कौन सा बेहतर तरीके से मेडिकल रिपोर्ट के अर्थ को समझ सकता है। उन्होंने पाया कि उनका नया सिस्टम, विशेष रूप से बड़ा संस्करण, किसी भी अन्य उपलब्ध टूल की तुलना में सीटी स्कैन रिपोर्ट की बारीकियों को समझने में काफी बेहतर था। यह रिपोर्ट में विशिष्ट निष्कर्षों को डॉक्टर के अंतिम निष्कर्ष के साथ सटीक रूप से मिला सकता था, टेक्स्ट में सूक्ष्म त्रुटियों को पकड़ सकता था, और यहाँ तक कि एक सरल निर्देश का पालन करके शरीर के विशिष्ट अंगों, जैसे कि फेफड़ों या हृदय पर अपना ध्यान केंद्रित कर सकता था। यह कार्य बताता है कि केवल उन्हें बड़ा बनाने या सामान्य भाषा कौशल का उपयोग करने के बजाय, कंप्यूटर को विशेष रूप रूप से चेस्ट इमेजिंग की भाषा पर प्रशिक्षित करके, हम मेडिकल निदान के लिए अधिक विश्वसनीय और उपयोगी उपकरण बना सकते हैं।
शोधकर्ताओं के सामने चुनौती यह थी कि चेस्ट सीटी रिपोर्ट में उपयोग की जाने वाली भाषा चेस्ट एक्स-रे में उपयोग की जाने वाली भाषा से भिन्न है। हालांकि दोनों एक ही अंगों का वर्णन करते हैं, लेकिन एक सीटी रिपोर्ट अक्सर लंबी होती है और इसमें उन क्षेत्रों के बारे में विवरण शामिल होता है जिन्हें एक्स-रे नहीं देख सकता, जैसे कि ऊपरी उदर या गर्दन की रक्त वाहिकाएं। मौजूदा कंप्यूटर प्रोग्राम या तो इन मेडिकल विशिष्टताओं को पकड़ने के लिए बहुत सामान्य थे या केवल एक्स-रे की सरल भाषा पर प्रशिक्षित थे। शोधकर्ताओं ने परिकल्पना की कि यदि वे एक कंप्यूटर मॉडल को विशेष रूप से दोनों प्रकार की चेस्ट रिपोर्ट के टेक्स्ट पर प्रशिक्षित करते हैं, तो वह सामान्य भाषा या केवल एक प्रकार के स्कैन पर प्रशिक्षित मॉडल की तुलना में शब्दों के अर्थ को अधिक सटीक रूप से प्रस्तुत करना सीख जाएगा। उन्होंने एक शक्तिशाली बेस मॉडल से शुरुआत की और फिर इसे हजारों वास्तविक मेडिकल रिपोर्टों का उपयोग करके सिखाया, जिसमें टेक्स्ट को उन निर्देशों के साथ जोड़ा गया जो कंप्यूटर को एक कार्य करने के लिए कहते थे, जैसे कि "त्रुटि खोजें" या "निष्कर्षों का सारांश दें।"
अपने निर्माण का परीक्षण करने के लिए, टीम ने चेस्ट2वेक को अस्पतालों के डेटा का उपयोग करके कई कठिन चुनौतियों के माध्यम से परखा जिसे कंप्यूटर ने पहले कभी नहीं देखा था। एक परीक्षण में, उन्होंने सिस्टम से केवल निष्कर्षों की विस्तृत सूची के आधार पर रोगी की स्थिति का सही अंतिम सारांश खोजने के लिए कहा। चेस्ट सीटी रिपोर्ट पर, नए सिस्टम ने लगभग 69 प्रतिशत बार सही सारांश खोजने में सफलता प्राप्त की, जबकि अगला सबसे अच्छा प्रतिस्पर्धी, एक प्रोग्राम जो केवल एक्स-रे के लिए विशेष था, 58 प्रतिशत से कम बार सफल रहा। एक अन्य परीक्षण में, शोधकर्ताओं ने कंप्यूटर से यह पहचानने के लिए कहा कि क्या किसी रिपोर्ट में सूक्ष्म रूप से बदलाव किया गया है ताकि इसमें मेडिकल त्रुटि शामिल की जा सके, जैसे कि एक नेगेटिव फाइंडिंग को पॉजिटिव में बदलना। नए सिस्टम ने 87 प्रतिशत से अधिक बार बिना बदलाव वाले, सही रिपोर्ट की पहचान सफलतापूर्वक की, जो अन्य टूल्स से कहीं बेहतर प्रदर्शन था। इन परिणामों ने दिखाया कि सुधार चेस्ट इमेजिंग टेक्स्ट पर विशिष्ट प्रशिक्षण से आया था, न कि केवल कंप्यूटर मॉडल के आकार से।
शोधकर्ताओं ने यह भी पाया कि सिस्टम को बिना पुन: प्रशिक्षित किए शरीर के विशिष्ट अंगों पर ध्यान केंद्रित करने के लिए निर्देशित किया जा सकता है। केवल कंप्यूटर को दिए जाने वाले निर्देश को बदलकर, वे इसे फेफड़ों, हृदय या हड्डियों के बारे में जानकारी को प्राथमिकता देने के लिए बना सकते थे, जिससे प्रभावी रूप से इसके ध्यान को रुचि के क्षेत्र पर ट्यून किया जा सके। यह लचीलापन मूल्यवान है क्योंकि यह एक एकल कंप्यूटर मॉडल को कई अलग-अलग उद्देश्यों की सेवा करने की अनुमति देता है, जैसे कि विशिष्ट बीमारियों की जांच करना या डॉक्टरों को पिछले समान मामलों को खोजने में मदद करना। इसके अलावा, टीम ने दिखाया कि यह टेक्स्ट एनकोडर इमेज-आधारित एआई के प्रदर्शन में सुधार कर सकता है। जब उन्होंने कंप्यूटर को सीटी स्कैन को "देखना" सिखाने के लिए इस नए टेक्स्ट टूल का उपयोग किया, तो परिणामी इमेज-रिकग्निशन सिस्टम पुराने, कम विशिष्ट टेक्स्ट टूल्स के साथ प्रशिक्षित सिस्टम की तुलना में अधिक सटीक था।
इन सफलताओं के बावजूद, शोधकर्ताओं ने कई सीमाओं की ओर संकेत किया। सीटी स्कैन के लिए प्रशिक्षण डेटा एक एकल सार्वजनिक स्रोत से आया था, जिसका अर्थ है कि सिस्टम हर अस्पताल या देश की रिपोर्टिंग शैलियों के लिए पूरी तरह से अनुकूलित नहीं हो सकता है। इसके अतिरिक्त, सिस्टम का परीक्षण अंग्रेजी भाषा की रिपोर्टों पर किया गया था, और अन्य भाषाओं या विभिन्न चिकित्सा सेटिंग्स में इसके प्रदर्शन के बारे में अभी पता लगाना बाकी है। टीम ने यह भी बताया कि उनके परीक्षण में उपयोग की गई त्रुटियां कंप्यूटर द्वारा बनाई गई थीं न कि वास्तविक दुनिया की रिपोर्टों में स्वाभाविक रूप से होने वाली, जिसका अर्थ है कि वास्तविक जीवन की गलतियों को पकड़ने की सिस्टम की क्षमता अलग हो सकती है। फिर भी, यह अध्ययन इस बात का पुख्ता प्रमाण देता है कि चेस्ट इमेजिंग टेक्स्ट पर एक विशेष, निर्देश-निर्देशित दृष्टिकोण सामान्य तरीकों की तुलना में बेहतर काम करता है। अपने टूल्स और उनके द्वारा बनाए गए स्ट्रक्चर्ड डेटा को जारी करके, शोधकर्ता अन्य वैज्ञानिकों को और भी उन्नत सिस्टम बनाने में सक्षम बनाने की आशा करते हैं जो मेडिकल इमेज की व्याख्या करने के जटिल और महत्वपूर्ण कार्य में सहायता कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।